arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-21 至 2026-07-21 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 24 篇

2502.11034 2026-07-21 cs.LG 版本更新 90%

AdaGC: Enhancing LLM Pretraining Stability via Adaptive Gradient Clipping

AdaGC: 通过自适应梯度裁剪增强LLM预训练稳定性

Guoxia Wang, Shuai Li, Congliang Chen, Jinle Zeng, Jiabin Yang, Dianhai Yu, Yanjun Ma, Li Shen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出自适应逐张量梯度裁剪方法AdaGC,通过限制梯度范数相对于历史裁剪值的指数移动平均来消除损失尖峰,在Llama-2 7B等模型上实现零尖峰并提升下游准确率。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11961 2026-07-21 cs.CL 版本更新 89%

Scaling Model and Data for Multilingual Machine Translation with Open Large Language Models

基于开放大语言模型的多语言机器翻译模型与数据扩展

Yuzhe Shang, Pengzhi Gao, Wei Liu, Jian Luan, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出MiLMMT-46模型,通过模型和数据扩展提升多语言机器翻译性能,超越现有SOTA模型并接近Google Translate等强 proprietary 系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16669 2026-07-21 cs.CL cs.LG cs.SE 新提交 86%

OpenLanguageModel: Readable and Composable Small-Language-Model Pretraining for Education and Research

开放语言模型:用于教育和研究的可读且可组合的小语言模型预训练

Tavish Mankash, Vardhaman Kalloli, Keshava Prasad, Deepan Muthirayan

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 OpenLanguageModel是开源PyTorch库,用于构建和预训练小语言模型。其模型代码易读,能连接多种组件。通过追踪GPT - 2展示完整路径,含27个预设和文档。验证有高一致性和效率等成果,采用MIT许可,可多途径获取。

Comments 8 pages, 3 figures, and 1 table. Website: https://openlanguagemodel.github.io/openlanguagemodel/. Code: https://github.com/openlanguagemodel/openlanguagemodel

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12546 2026-07-21 cs.CL cs.CY cs.LG 86%

Extracting memorized pieces of (copyrighted) books from open-weight language models

从开放式语言模型中提取记忆中的(受版权保护)书籍

A. Feder Cooper, Mark A. Lemley, Allison Casasola, Ahmed Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho, Percy Liang

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学) Cornell University(康奈尔大学) West Virginia University(西弗吉尼亚大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究通过测量书籍在语言模型中的记忆程度,发现大多数模型不完整记忆书籍,但部分模型如Llama 3.1 70B能完整记忆某些书籍,对版权案件有重要影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09657 2026-07-21 cs.CV cs.AI cs.MM 版本更新 85%

Scalable Visual Pretraining for Language Intelligence

用于语言智能的可扩展视觉预训练

Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Huanze Tang, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究挑战语言模型仅在文本表示上训练的假设,通过对直接利用视觉文档的无监督视觉预训练范式进行系统研究,发现其在多主干和基准上优于仅文本预训练,为可扩展语言智能提供有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12463 2026-07-21 cs.AI cs.CL 版本更新 84%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17782 2026-07-21 cs.CV cs.AI 新提交 83%

BrainNext: A General-Purpose Self-Supervised Foundation Model for Brain MRI Analysis

BrainNext:用于脑MRI分析的通用自监督基础模型

Moona Mazher, Abdul Qayyum, Steven A. Niederer, Daniel C. Alexander

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究提出BrainNext通用自监督基础模型用于脑MRI分析,结合MAE预训练与三维双向xLSTM-UNet架构,从大量未标记数据学习,经微调用于下游任务,在FOMO 2025评估中表现出色,证明其可转移性和作为基础模型的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04344 2026-07-21 stat.ML cs.LG math.ST stat.TH 版本更新 83%

Perturbation is All You Need for Extrapolating Language Models

扰动是语言模型外推所需的一切

Zetai Cen, Jin Zhu, Xinwei Shen, Chengchun Shi

机构 * School of Mathematics, University of Bristol(布里斯托大学数学系) School of Mathematics, University of Birmingham(伯明翰大学数学系) Department of Statistics, University of Washington(华盛顿大学统计系) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计系)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文针对大语言模型外推问题,提出基于扰动的方法,先转换前缀为语义邻域再进行下一个token预测,构建分层模型。通过建立五个属性发展外推性理论,经合成与真实数据评估,该方法提升支持域外预测性能,为语言建模提供实用路径。

Comments 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16152 2026-07-21 cs.CR cs.LG 版本更新 83%

Gradient-Free Privacy Leakage in Federated Language Models through Selective Weight Tampering

通过选择性权重篡改在联邦语言模型中实现无梯度隐私泄露

Md Rafi Ur Rashid, Vishnu Asutosh Dasu, Kang Gu, Najrin Sultana, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Dartmouth College(达特茅斯学院)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 研究联邦语言模型中隐私敏感数据泄露问题,发现中间轮次模型快照及恶意参与者篡改选择性权重会加剧泄露,提出无梯度攻击方法,提升了成员推理召回率和私有数据重建率,还给出客户端防御隐私风险的技术建议。

Comments 21 pages (including bibliography and Appendix), Submitted to PETS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16251 2026-07-21 cs.LG 新提交 79%

Learning Spatio-Temporal Foundation Models from Pure Synthetic Data

从纯合成数据中学习时空基础模型

Yutong Feng, Shiyuan Piao, Yutong Xia, Xu Liu, Wenqi Fan, Fugee Tsung, See-Kiong Ng, Yuxuan Liang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 研究旨在学习时空基础模型,提出NeoST,通过在程序生成的合成系统上预训练,引入可扩展语料库、潜在空间推理架构和目标,实验证明其在多样真实世界时空系统中性能优越,有长期稳定性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16212 2026-07-21 cs.AI 新提交 77%

Symbolic Augmentation Closes a Canonical-Equivalence Blind Spot in Neural Fact-Checkers

符号增强弥补神经事实核查器中规范等价盲点

Genpei Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型总结科学文本时数字和单位幻觉问题,提出将错误检测重定义为类型验证,引入分类法和基准。用符号增强训练框架,提升规范等价鲁棒性,提高准确率,还明确了符号特征及银标签在特定情况下的作用,确定训练时增强是关键集成点。

Comments 18 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17743 2026-07-21 cs.LG stat.ML 版本更新 77%

Bigger Is Safer: Provable Robustness in In-Context Learning Scales with Capacity

可证明的上下文学习中的对抗鲁棒性

Di Zhang, Ningxu Zhang, Zimeng Liu

机构 * School of AI and Advanced Computing(人工智能与先进计算学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种分布鲁棒的元学习框架,通过推导非渐近界限,揭示了上下文学习在对抗条件下鲁棒性与模型容量、扰动强度之间的缩放关系。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11849 2026-07-21 cs.CL cs.AI cs.SI 73%

Network-informed Prompt Engineering against Organized Astroturf Campaigns under Extreme Class Imbalance

在极端类别不平衡下基于网络的提示工程对抗有组织的Astroturf活动

Nikos Kanakaris, Heng Ping, Xiongye Xiao, Nesreen K. Ahmed, Luca Luceri, Emilio Ferrara, Paul Bogdan

机构 * University of Southern California(美国南加州大学) Cisco AI Research(思科人工智能研究)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大型语言模型的Balanced RAG框架,通过提示工程和平衡检索增强生成技术,在极端类别不平衡下有效识别协调虚假信息活动。

Journal ref WWW '25: Companion Proceedings of the ACM on Web Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04124 2026-07-21 cs.CY cs.AI 版本更新 70%

When AI Takes the Couch: Psychometric Jailbreaks Reveal Internal Conflict in Frontier Models

当人工智能接受心理治疗:心理测量越狱揭示前沿模型中的内部冲突

Afshin Khadangi, Hanna Marxen, Amir Sartipi, Igor Tchappi, Gilbert Fridgen

机构 * SnT, University of Luxembourg(卢森堡大学SnT学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 研究前沿语言模型生成拟人化自我叙述机制,用PsAIch协议测试,发现其叙述受多种因素影响,确定了稳定的对齐冲突模式,为拟人化披露和安全评估提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交 67%

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16680 2026-07-21 cs.SE 新提交 67%

Specification-Driven Development as the Foundation of AI-Native Enterprise Software Engineering

规范驱动开发作为人工智能原生企业软件工程的基础

Mamdouh Alenezi

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究大语言模型和智能人工智能推动下软件工程范式转变,介绍规范驱动开发,提出规范治理参考模型,经评估能减少安全缺陷、缩短上市时间,证明企业软件需规范治理,vibe编码适用于构思和快速原型制作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17843 2026-07-21 cs.LG cs.CL cs.DC 新提交 62%

Mobius Learning: Cyclic Depth Folding in Transformers

莫比乌斯学习:Transformer中的循环深度折叠

Tongtian Zhu

机构 * Zhejiang University(浙江大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究挑战Transformer中块作用与位置绑定的传统观点,提出基于循环深度折叠的莫比乌斯学习,同一组块在不同数据流中有不同应用时机,实现深度角色叠加,实验表明其在分布式训练中有优势,开辟新设计空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17689 2026-07-21 cs.CL 新提交 57%

Tokenizing Crosslingual Homographs

跨语言同形异义词的分词

Rotem Brillant, Yuval Pinter

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 研究跨语言同形异义词在多语言模型中的处理问题,提出基于语言线索的分词器干预方法,通过内在分析和机器翻译实验验证,该方法能消除不同分词器处理差异,在部分设置下有改进,为添加语言信息提供探索方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15802 2026-07-21 cs.LG 版本更新 57%

Time-Aware Prior Fitted Networks for Zero-Shot Forecasting with Exogenous Variables

考虑时间因素的先验拟合网络用于外生变量的零样本预测

Andres Potapczynski, Ravi Kiran Selvam, Tatiana Konstantinova, Malcolm Wolff, Kin G. Olivares, Ruijun Ma, Michael W. Mahoney, Andrew Gordon Wilson, Boris N. Oreshkin, Dmitry Efimov

机构 * Amazon(亚马逊) New York University(纽约大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本文提出ApolloPFN,一种时间感知的先验拟合网络,能够原生整合外生变量,通过合成数据生成和时间感知架构改进,实现更准确的预测。

Comments Accepted and published in Transactions on Machine Learning Research (TMLR), 2026

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18155 2026-07-21 cs.SE 新提交 50%

Testing Retrieval-Augmented Generation Systems with Chunk Coverage

用块覆盖率测试检索增强生成系统

Jinhan Kim, Samuele Pasini, Paolo Tonella

专题命中 预训练与数据 :language model(abstract)

AI总结 研究用块覆盖率(CC)测试检索增强生成(RAG)系统的检索组件,CC衡量语料块检索比例,可指导测试选择与生成,通过实验表明CC引导测试能更快达覆盖率且提高故障检测有效性,无需测试预言机就能捕捉检索多样性。

Comments ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17638 2026-07-21 cs.CV 新提交 50%

Reviving Ancient Paintings via Poem: A Colorization Framework for Aligning Cultural Semantics

通过诗歌复兴古画:一种用于对齐文化语义的色彩化框架

Junming Gao, Biao Zhu, Xiaosong Wang, Tan Tang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对古画褪色问题,提出PoemColor框架,通过诗歌绘画投影仪和结构感知语义注意力,将诗歌文化语义与绘画恢复对齐,并构建混合数据集。实验证明该框架显著优于现有方法,能实现可控色彩化,恢复古画历史真实性与诗歌语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16285 2026-07-21 cs.CV 新提交 50%

A Shared Latent for Partially-Labeled Multi-Task Facial Affect Recognition

用于部分标记多任务面部表情识别的共享潜在空间

Hong Hai Nguyen, Sy Phan Van, Soo-Hyung Kim, Van-Thong Huynh

机构 * Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT)(胡志明市理工大学计算机科学与工程学院) Dept. of AI, FPT University(FPT大学人工智能系) Department of Artificial Intelligence Convergence, Chonnam National University(全南国立大学人工智能融合系)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究针对野外面部表情多任务且标注不完整不均衡的问题,提出将部分标记多任务学习视为对共享情感潜在空间的边缘化方法,在s-Aff-Wild2数据集上提升了表情和动作单元识别效果,得出相关结论并展示了小范围转移结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10879 2026-07-21 cs.RO cs.CV 版本更新 50%

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments

3D场景图预测:从部分观测环境生成层次模型

Siyi Hu, Jared Strader, Hyungtae Lim, Luca Carlone

机构 * Laboratory for Information & Decision Systems (LIDS), Massachusetts Institute of Technology(信息与决策系统实验室(LIDS),麻省理工学院) Department of Electrical and Computer Engineering, Oakland University(奥克兰大学电气与计算机工程系)

专题命中 预训练与数据 :LLM(abstract)

AI总结 针对机器人部分观测环境的场景预测问题,提出自上而下框架合成含房间层和物体层的3D场景图,用混合域图扩散模型等方法,相比其他方法对分布外部分平面图泛化性更好,能在真实场景预测。

Comments Accepted at IROS 2026. Main paper: 8 pages, 3 figures, 3 tables. Includes a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 50%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏