arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-17 至 2026-04-17 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 17 篇

2311.04799 2026-04-17 cs.CL cs.AI 88%

DA-Cramming: Enhancing Cost-Effective Language Model Pretraining with Dependency Agreement Integration

DA-Cramming:通过依赖协议整合提升高效语言模型预训练

Martin Kuo, Jianyi Zhang, Dongting Li, Yiran Chen

机构 * Center for Computational Evolutionary Intelligence, Duke University(计算进化智能中心,杜克大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DA-Cramming框架,通过整合依赖协议信息提升语言模型预训练效果,采用双阶段流程和四个专用子模型捕捉依赖协议并生成嵌入,实验证明其在多种任务上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12407 2026-04-17 cs.CR cs.CL cs.LG 87%

De-Anonymization at Scale via Tournament-Style Attribution

通过竞赛式归因实现大规模去匿名化

Lirui Zhang, Huishuai Zhang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究利用LLM链接匿名文档与其作者,提出大规模去匿名化方法DAS,通过分组筛选和多数投票提升鲁棒性和精度,实验显示在匿名平台存在现实隐私风险。

Comments 14 pages, ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14616 2026-04-17 cs.CL cs.AI cs.LG 86%

Retrieve, Then Classify: Corpus-Grounded Automation of Clinical Value Set Authoring

检索,然后分类:基于语料库的临床价值集编纂自动化

Sumit Mukherjee, Juan Shu, Nairwita Mazumder, Tate Kernell, Celena Wheeler, Shannon Hastings, Chris Sidey-Gibbons

机构 * Oracle Health Data Intelligence(Oracle健康数据智能)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出RASC方法,通过检索现有价值集生成候选池,再分类筛选代码,提升临床价值集编纂效率,构建首个大规模基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.17591 2026-04-17 cs.CL 85%

Lil-Bevo: Explorations of Strategies for Training Language Models in More Humanlike Ways

Lil-Bevo:探索以更人性化方式训练语言模型的策略

Venkata S Govindarajan, Juan Diego Rodriguez, Kaj Bostrom, Kyle Mahowald

机构 * Department of Linguistics(语言学系) Department of Computer Science(计算机科学系) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本文提出Lil-Bevo,通过音乐数据预训练、短序列先训练及特定token掩码等策略,探索更人性化的语言模型训练方法,但效果仍低于大模型。

Comments Proceedings of the BabyLM Challenge

Journal ref Proceedings of the BabyLM Challenge at the 27th Conference on Computational Natural Language Learning 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05302 2026-04-17 cs.CL 84%

Right at My Level: A Unified Multilingual Framework for Proficiency-Aware Text Simplification

就在我的水平上:一种统一的多语言框架,用于面向能力的文本简化

Jinhong Jeong, Junghun Park, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Re-RIGHT框架,通过强化学习实现无需平行语料的多语言文本简化,提升目标水平的词汇覆盖和语义保持。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14172 2026-04-17 cs.CL cs.AI 79%

Tug-of-War within A Decade: Conflict Resolution in Vulnerability Analysis via Teacher-Guided Retrieval-Augmented Generations

十年内的拔河战:通过教师引导的检索增强生成解决漏洞分析中的冲突

Ziyin Zhou, Jianyi Zhang, Xu ji, Yilong Li, Jiameng Han, Zhangchi Zhao

机构 * Beijing Electronic Science and Technology Institute(北京电子科学技术研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRVA-TGRAG框架,通过改进检索准确性和教师引导的偏好优化,解决CVE检测中的知识冲突问题,提升漏洞检索的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14198 2026-04-17 cs.LG cs.AI cs.CL 78%

MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法

Bingbing Wen, Sirajul Salekin, Feiyang Kang, Bill Howe, Lucy Lu Wang, Javier Movellan, Manjot Bilkhu

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 预训练与数据 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24538 2026-04-17 cs.CL 77%

Dark & Stormy: Modeling Humor in Sentences from the Bulwer-Lytton Fiction Contest

黑暗与暴风雨:从布勒-拉托尔小说竞赛中句子中建模幽默

Venkata S Govindarajan, Laura Biester

机构 * Department of Computer Science, Ithaca College(伊萨卡学院计算机科学系) Department of Computer Science, Middlebury College(梅德福学院计算机科学系)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文通过分析布勒-拉托尔小说竞赛中的新语料库,研究英语中'坏'幽默的特征,发现传统幽默检测模型表现不佳,LLM在生成竞赛风格句子时形式模仿但效果夸大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14459 2026-04-17 cs.CL 70%

Filling in the Mechanisms: How do LMs Learn Filler-Gap Dependencies under Developmental Constraints?

填补机制:语言模型如何在发育约束下学习填充-缺口依赖?

Atrey Desai, Sathvik Nair

机构 * University of Maryland(马里兰大学)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);分类 cs.CL

AI总结 研究通过DAS分析语言模型在不同数据量下的填充-缺口依赖表示,发现有限数据下存在共享但敏感的机制,但语言模型仍需更多数据才能达到人类水平,凸显语言特异性偏见的重要性。

Comments To be published in the 64th Annual Meeting of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15093 2026-04-17 cs.AI cs.CL cs.CV cs.HC 62%

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile: 通过任务和轨迹合成构建开放移动代理

Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

机构 * Nanjing University(南京大学) SenseTime(秒速) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Xi’an Jiaotong University(西安交通大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OpenMobile框架,通过可扩展的任务合成管道和策略切换策略生成高质量任务指令和轨迹,实现移动代理在AndroidWorld等基准测试中取得显著成绩。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15141 2026-04-17 cs.CV 50%

KVNN: Learnable Multi-Kernel Volterra Neural Networks

KVNN:可学习的多核Volterra神经网络

Haoyu Yun, Hamid Krim, Yufang Bao

机构 * Department of Electrical and Computer Engineering, North Carolina State University(电气与计算机工程系,北卡罗来纳州立大学) Department of Mathematics and Computer Science, Fayetteville State University(数学与计算机科学系,法雷维尔州立大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出KVNN,通过可学习的多核表示实现高阶学习,利用不同多项式核组件实现交互阶次自适应参数化,提升模型效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14953 2026-04-17 cs.CV 50%

Prompt-to-Gesture: Measuring the Capabilities of Image-to-Video Deictic Gesture Generation

Prompt-to-Gesture:测量图像到视频指称手势生成的能力

Hassan Ali, Doreen Jirak, Luca Müller, Stefan Wermter

机构 * Knowledge Technology Group, Department of Informatics, University of Hamburg(汉堡大学信息学院知识技术组) Behavioral Lab, Department of Product Development, University of Antwerp(安特卫普大学产品开发学院行为实验室)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出通过提示生成视频来构建逼真指称手势数据集,评估其在下游任务中的有效性,展示了合成手势在视觉质量和多样性上的优势。

Comments Accepted at 2026 International Conference on Automatic Face and Gesture Recognition (FG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17493 2026-04-17 physics.plasm-ph 50%

DustNET: enabling machine learning and AI models of dusty plasmas

DustNET: 使尘埃等离子体的机器学习和人工智能模型成为可能

Zhehui Wang, Justin C. Burton, Niklas Dormagen, Cheng-Ran Du, Yan Feng, John E. Foster, Susan S. Glenn, Max Klein, Christina A. Knapek, Lorin Matthews, André Melzer, Edward Thomas, Chuji Wang, Jalaan Avritte, Shan Chang, Neeraj Chaubey, Pubuduni Ekanayaka, John A. Goree, Truell Hyde, Chen Liang, Zhuang Liu, Zhuang Ma, Ilya Nemenman, Elon Price, A. S. Schmitz, Mike Schwarz, Saikat C. Thakur, M. H. Thoma, Hubertus M. Thomas, L. Wimmer, Wei Yang, Zimu Yang, Xiaoman Zhang

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文探讨了DustNET框架,通过整合实验、模拟和合成数据,利用机器学习和人工智能方法,实现尘埃等离子体的多尺度预测和不确定性量化。

Comments 61 pages, 35 figures, 490+ references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14720 2026-04-17 cs.CV 50%

Data Synthesis Improves 3D Myotube Instance Segmentation

数据合成提升3D肌管实例分割

David Exler, Nils Friederich, Martin Krüger, John Jbeily, Mario Vitacolonna, Rüdiger Rudolf, Ralf Mikut, Markus Reischl

机构 * Institute for Automation and Applied Informatics, Karlsruhe Institute of Technology(自动化与应用信息学院,卡尔斯鲁厄理工学院) Institute of Biological and Chemical Systems, Karlsruhe Institute of Technology(生物与化学系统研究所,卡尔斯鲁厄理工学院) CeMOS Research and Transfer Center, Technische Hochschule Mannheim(CeMOS研究与转移中心,曼海姆技术大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出基于几何驱动的数据合成方法,通过多项式中心线、局部变化半径、分支结构和椭球形端帽等模型生成肌管数据,训练紧凑的3D U-Net模型,在真实数据上达到更高的IPQ指标,验证了生物物理驱动合成在标注稀缺的生物医学领域中的有效性。

Comments 4 pages, 4 figures, submitted to BMT (VDE) 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14360 2026-04-17 cs.CR cs.DC cs.SY eess.SY 50%

Digital Guardians: The Past and The Future of Cyber-Physical Resilience

数字守护者:网络物理系统过去与未来的韧性

Saurabh Bagchi, Hyunseung Kim, Tarek Abdelzaher, Homa Alemzadeh, Somali Chaterji, Glen Chou, Yuying Duan, Fanxin Kong, Michael Lemmon, Yin Li, Mengyu Liu, Wenhao Luo, Meiyi Ma, Sibin Mohan, Ayan Mukhopadhyay, Melkior Ornik, Dimitra Panagou, Kristin Yvonne Rozier, Ivan Ruchkin, Huajie Shao, Sze Zheng Yong, Majid Zamani, Xugui Zhou

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文探讨了网络物理系统韧性的核心挑战与方法,涵盖系统属性、学习赋能系统、主动措施、恢复机制及人类角色,通过智能交通与医疗系统案例,提供复杂环境下的韧性实现路径。

Comments Submitted to ACM CSUR; 32 pages + 10 pages of references

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20424 2026-04-17 cond-mat.mtrl-sci physics.comp-ph 50%

Iterative learning scheme for crystal structure prediction with anharmonic lattice dynamics

基于非谐晶格动力学的迭代学习方案用于晶体结构预测

Hao Gao, Yue-Wen Fang, Ion Errea

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出结合进化算法、原子基础模型和SSCHA的迭代学习框架,用于具有非谐晶格动力学的晶体结构预测,通过减少训练数据需求和提高预测精度,实现高效稳定的相稳定性预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03736 2026-04-17 math.OC cs.DC 50%

Decentralized Nonconvex Optimization under Heavy-Tailed Noise: Normalization and Optimal Convergence

去中心化非凸优化中的重尾噪声:归一化与最优收敛

Shuhua Yu, Dusan Jakovetic, Soummya Kar

专题命中 预训练与数据 :language model(abstract)

AI总结 本文研究了在去中心化设置下,非凸随机优化中的重尾噪声问题,提出GT-NSGDm算法,通过归一化、梯度跟踪和动量技术,实现最优非渐近收敛率。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏