arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137636 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12308 篇

2603.26786 2026-03-31 cs.LG cs.AI 92%

A Step Toward Federated Pretraining of Multimodal Large Language Models

迈向多模态大语言模型联邦预训练的一小步

Baochen Xiong, Yifan Xu, Xiaoshan Yang, Yaguang Song, Yaowei Wang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);LLM(abstract)

AI总结 本文提出Fed-MA任务,通过冻结视觉编码器和LLM,协同训练跨模态投影器,解决参数干扰和梯度震荡问题,提出Fed-CMP框架在联邦预训练中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02632 2026-03-23 cs.LG cs.AI 92%

Performance of Small Language Model Pretraining on FABRIC: An Empirical Study

小型语言模型在FABRIC上的预训练性能:一项实证研究

Praveen Rao

机构 * The University of Missouri(密苏里大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);small language model(title);large language model(abstract)

AI总结 本文研究小型语言模型在FABRIC实验平台上的预训练性能,探讨数据并行、操作符并行及流水线并行等技术对预训练效果的影响,发现Alpa在地理分布GPU上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01091 2026-01-06 cs.CL cs.AI 92%

ks-lit-3m: A 3.1 million word kashmiri text dataset for large language model pretraining

ks-lit-3m:一个310万词的克什米尔语文本数据集用于大语言模型预训练

Haq Nawaz Malik

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出KS-LIT-3M数据集,通过开发InPage到Unicode转换器和严格预处理,解决克什米尔语预训练数据稀缺问题,为自然语言处理研究提供高质量资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00288 2025-09-22 cs.CL cs.AI 92%

Emergent Abilities of Large Language Models under Continued Pretraining for Language Adaptation

Ahmed Elhady, Eneko Agirre, Mikel Artetxe

机构 * HiTZ Center, University of the Basque Country (UPV/EHU)(巴斯克大学希茨中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

Comments Published as a Conference Paper at the main track of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04715 2025-08-20 cs.LG cs.AI 92%

Predictable Scale: Part I, Step Law -- Optimal Hyperparameter Scaling Law in Large Language Model Pretraining

Houyi Li, Wenzhen Zheng, Qiufeng Wang, Hanshan Zhang, Zili Wang, Shijie Xuyang, Yuantao Fan, Zhenyu Ding, Haoying Wang, Ning Ding, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

机构 * Fudan University(复旦大学) Xi’an Jiaotong University(西安交通大学) Megvii Technology(地平线科技)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);LLM(abstract)

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06504 2025-08-12 cs.CL cs.AI 92%

Retrieval augmented generation based dynamic prompting for few-shot biomedical named entity recognition using large language models

Yao Ge, Sudeshna Das, Yuting Guo, Abeed Sarker

机构 * Department of Biomedical Informatics, School of Medicine, Emory University(生物医学信息学系,医学院,埃默里大学) Department of Computer Science, Emory University(计算机科学系,埃默里大学) National Library of Medicine, National Institutes of Health(国家医学图书馆,国立卫生研究院) Department of Biomedical Engineering, Georgia Institute of Technology and Emory University(生物医学工程系,佐治亚理工学院和埃默里大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI

Comments 31 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14917 2025-07-08 cs.CL cs.AI 92%

MASS: Mathematical Data Selection via Skill Graphs for Pretraining Large Language Models

Jiazheng Li, Lu Yu, Qing Cui, Zhiqiang Zhang, Jun Zhou, Yanfang Ye, Chuxu Zhang

机构 * University of Connecticut, USA(美国康涅狄格大学) University of Notre Dame, USA(美国诺丁汉大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12580 2025-03-07 cs.CL cs.LG 92%

Procedural Knowledge in Pretraining Drives Reasoning in Large Language Models

Laura Ruis, Maximilian Mozes, Juhan Bae, Siddhartha Rao Kamalakara, Dwarak Talupuru, Acyr Locatelli, Robert Kirk, Tim Rocktäschel, Edward Grefenstette, Max Bartolo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

Comments Published at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12404 2025-01-15 cs.LG cs.AI 92%

EPIC: Effective Prompting for Imbalanced-Class Data Synthesis in Tabular Data Classification via Large Language Models

Jinhee Kim, Taesung Kim, Jaegul Choo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11537 2024-08-29 cs.CL cs.AI 92%

Deciphering the Impact of Pretraining Data on Large Language Models through Machine Unlearning

Yang Zhao, Li Du, Xiao Ding, Kai Xiong, Zhouhao Sun, Jun Shi, Ting Liu, Bing Qin

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12537 2023-11-22 cs.CL cs.AI 92%

Oasis: Data Curation and Assessment System for Pretraining of Large Language Models

Tong Zhou, Yubo Chen, Pengfei Cao, Kang Liu, Jun Zhao, Shengping Liu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13999 2023-10-25 cs.CL cs.LG 92%

Towards A Unified View of Sparse Feed-Forward Network in Pretraining Large Language Model

Zeyu Leo Liu, Tim Dettmers, Xi Victoria Lin, Veselin Stoyanov, Xian Li

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05146 2023-10-10 cs.AI cs.CL 92%

Large Language Model (LLM) as a System of Multiple Expert Agents: An Approach to solve the Abstraction and Reasoning Corpus (ARC) Challenge

John Chong Min Tan, Mehul Motani

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(title);prompting(abstract)

Comments 6 main pages, 1 page references, 18 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00683 2023-08-02 cs.LG cs.CL cs.SE 92%

CodeBPE: Investigating Subtokenization Options for Large Language Model Pretraining on Source Code

Nadezhda Chirkova, Sergey Troshin

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

Comments Published at ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30661 2026-07-01 cs.CY 新提交 92%

Understanding Censorship in Large Language Models: From Mechanisms to Governance

理解大型语言模型中的审查:从机制到治理

Quanyan Zhu

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文从社会技术视角审视LLM审查,涵盖数据、对齐、政策、推理时审核及法规,分析其表现形式、测量挑战与治理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00357 2026-05-29 cs.DC cs.SY eess.SY 92%

SPARe: Stacked Parallelism with Adaptive Reordering for Fault-Tolerant LLM Pretraining Systems with 100k+ GPUs

SPARe: 面向10万+GPU容错LLM预训练系统的堆叠并行与自适应重排序

Jin Lee, Zhonghao Chen, Xuhang He, Robert Underwood, Bogdan Nicolae, Franck Cappello, Xiaoyi Lu, Sheng Di, Zheng Zhang

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title)

AI总结 针对大规模LLM预训练中故障频繁导致重启开销主导训练时间的问题,提出SPARe框架,通过跨并行组堆叠冗余数据分片并自适应重排序执行顺序,在梯度同步中掩盖节点故障,实现接近传统复制的可用性且计算开销仅2~3倍,在60万GPU规模下训练时间减少40~50%。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18903 2026-05-15 cs.LG cs.AI cs.CL 92%

How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining

学习率衰减如何浪费你在基于课程的学习中的最佳数据

Kairong Luo, Zhenbo Sun, Haodong Wen, Xinyu Shi, Jiarui Cui, Chenyi Dang, Kaifeng Lyu, Wenguang Chen

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文指出学习率衰减与课程式预训练数据排序的不兼容性限制了预训练效果,通过调整衰减策略和模型平均可提升1.64%的基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04481 2025-06-11 cs.CV 92%

CAD-Llama: Leveraging Large Language Models for Computer-Aided Design Parametric 3D Model Generation

Jiahao Li, Weijian Ma, Xueyang Li, Yunzhong Lou, Guichun Zhou, Xiangdong Zhou

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学与技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12327 2024-10-14 cs.LG cs.AI cs.CL 92%

Spectra: Surprising Effectiveness of Pretraining Ternary Language Models at Scale

Ayush Kaushal, Tejas Vaidhya, Arnab Kumar Mondal, Tejas Pandey, Aaryan Bhagat, Irina Rish

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

Comments 42 pages, 21 figures, and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13848 2023-02-01 cs.CL cs.AI cs.LG 92%

Benchmarking Large Language Models for News Summarization

Tianyi Zhang, Faisal Ladhak, Esin Durmus, Percy Liang, Kathleen McKeown, Tatsunori B. Hashimoto

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10917 2026-08-03 cs.AI 版本更新 92%

Role-Agent: Bootstrapping LLM Agents via Dual-Role Evolution

Role-Agent: 通过双角色演化引导LLM智能体

Xucong Wang, Ziyu Ma, Shidong Yang, Tongwen Huang, Pengkun Wang, Yong Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Role-Agent框架,让单个LLM同时作为智能体和环境,通过世界在智能体(WIA)和智能体在世界(AIW)两个组件实现自举协同演化,在多个基准上平均提升超过4%。

Comments 20 pages, including 12 pages of main text and 8 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13332 2026-07-16 cs.LG cs.DC 新提交 92%

Agora: Collective and Permissionless Internet-Scale Pretraining of Large Language Models

Agora:大规模语言模型的集体无许可互联网规模预训练

Gil Avraham, Violetta Shevchenko, Hadi Mohaghegh Dolatabadi, Karol Pajak, James Snewin, Harry Xi, Rodney O'Donnell, Thalaiyasingam Ajanthan, Sameera Ramasinghe, Chamin Hewa Koneputugodage, Shamane Siriwardhana, Alexander Long

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 研究旨在解决大语言模型训练资源受限问题,提出Agora系统,通过互联网级链路的带宽高效流水线并行模型分片与多方容错集体操作相结合,实现集体训练、集体所有模型,首次展示Pluralis - 8B预训练,效率达集中式基线63%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17906 2026-07-14 cs.IR cs.AI 92%

Bayesian Active Learning with Gaussian Processes Guided by LLM Relevance Scoring for Dense Passage Retrieval

基于LLM相关性评分的高斯过程引导的贝叶斯主动学习用于密集段落检索

Junyoung Kim, Anton Korikov, Jiazhou Liang, Justin Cui, Yifan Simon Liu, Qianfeng Wen, Mark Zhao, Scott Sanner

机构 * Sungkyunkwan University(成均馆大学) University of Toronto(多伦多大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BAGEL框架,通过高斯过程引导LLM相关性评分,解决传统方法在语义不同聚类中检索失败和相关性信号传播不足的问题,实验证明其在四个数据集上优于LLM重排序方法。

Comments ACL 2026 Findings

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10271 2026-06-29 cs.CR cs.AI 版本更新 92%

MetaBreak: Jailbreaking Online LLM Services via Special Token Manipulation

MetaBreak: 通过特殊标记操纵越狱在线LLM服务

Wentian Zhu, Zhen Xiang, Wei Niu, Le Guan

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出利用特殊标记构造攻击原语,绕过LLM安全对齐和内容审核,并发现防御困难,实验显示MetaBreak在内容审核下优于现有方法。

Comments Accepted version. Revised to match the version accepted to the 2026 IEEE Symposium on Security and Privacy (SP); added publication information and DOI

Journal ref Proceedings of the 2026 IEEE Symposium on Security and Privacy (SP), pp. 98-117, IEEE Computer Society, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18916 2026-06-25 cs.LG 版本更新 92%

LLM Program Optimization via Retrieval Augmented Search

通过检索增强搜索实现LLM程序优化

Sagnik Anupam, Alexander Shypula, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出检索增强搜索(RAS)方法,利用LLM进行黑盒程序优化,通过检索慢-快程序对引导束搜索,并基于LLM生成的自然语言描述进行上下文检索,显著优于源码检索;同时提出AEGIS方法通过原子编辑提升可解释性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23271 2026-06-23 cs.CL 新提交 92%

Scaling LLM Knowledge Boundaries via Distribution-Optimized Synthesis

通过分布优化合成扩展LLM知识边界

Songze Li, Yarong Lan, Zhongpu Bo, Zhaoyang Wang, Zhiqiang Liu, Yuan Yuan, Chengtao Gan, Menghao Qian, Enpei Niu, Xiaoke Guo, Yuanxiang Liu, Zhaoyan Gong, Xiangjin Hu, Liangyurui Liu, Jingdian Lu, Lei Liang, Jun Zhou, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) ZJU-Ant Group Joint Lab of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出KDoS框架,通过知识密度驱动的三阶段反馈机制优化合成数据的知识分布,显著扩展LLM知识边界,并在多模型和多数据规模上验证了最优分布的稳定性和有效性。

Comments ACL ARR May (EMNLP 2026) Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20574 2026-06-23 cs.NI cs.AI 新提交 92%

LLM-assisted gNB Parameter Configuration for Radio Access Network

LLM辅助的无线接入网gNB参数配置

Yao-Cong Dong, Maria Amparo Canaveras Galdon, Ari Uskudar, Kuntal Chowdhury, Edwin K. P. Chong, Ray-Guang Cheng

机构 * Dept. of Electronic and Computer Engineering, National Taiwan University of Science and Technology, Taiwan(电子与计算机工程系,台湾科技大学) NVIDIA, USA(NVIDIA公司) Colorado State University, USA(科罗拉多州立大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LLM辅助框架,通过合成数据生成和微调,自动从错误日志中生成正确的gNB参数配置,在OAI测试中准确率达92.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01904 2026-06-17 cs.CR cs.AI 版本更新 92%

Combating Data Laundering in LLM Training

对抗LLM训练中的数据清洗

Muxing Li, Zesheng Ye, Sharon Li, Feng Liu

机构 * University of Melbourne(墨尔本大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对数据清洗(通过变换风格隐藏数据来源)导致传统检测失效的问题,提出基于辅助LLM推断变换目标并合成查询的SDR方法,显著增强数据滥用检测能力。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15325 2026-06-16 cs.CL 新提交 92%

Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback

先验优于证据:基于LLM的二语发音反馈中的刻板印象驱动诊断

Rong Wang, Kun Sun

机构 * University of Tuebingen(蒂宾根大学) Tongji University(同济大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究测试了LLM在二语发音反馈中是否基于语音证据而非预训练先验进行诊断,发现评分准确性与推理脱钩,音素级反馈收敛于固定困难音素集,且声学证据仅在直接探测目标维度时改善评分。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13397 2026-06-12 cs.HC cs.AI cs.CY 新提交 92%

Mod-Guide: An LLM-based Content Moderation Feedback System to Address Insensitive Speech toward Indigenous Ethnic and Religious Minority Communities

Mod-Guide:一种基于LLM的内容审核反馈系统,用于解决针对原住民及少数族裔宗教群体的不敏感言论

Dipto Das, Achhiya Sultana, Ankit Singh Chauhan, Saadia Binte Alam, Mohammad Shidujaman, Shion Guha, Sunandan Chakraborty, Syed Ishtiaque Ahmed

机构 * Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) Independent University Bangladesh(孟加拉国独立大学) Indiana University(印第安纳大学) Faculty of Information, University of Toronto(信息学院,多伦多大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究LLM审核系统对孟加拉国印度教和查克玛社区不敏感言论的认知局限,通过共同构建文化语料库和检索增强生成(RAG)方法开发Mod-Guide工具,提升模型对少数群体观点的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏