arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137636 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12308 篇

2509.01440 2025-09-03 cs.LG 92%

Benchmarking Optimizers for Large Language Model Pretraining

Andrei Semenov, Matteo Pagliardini, Martin Jaggi

机构 * EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

Comments 73 pages, 44 figures, 48 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14781 2025-05-22 cs.CL cs.CR 92%

Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method

Weichao Zhang, Ruqing Zhang, Jiafeng Guo, Maarten de Rijke, Yixing Fan, Xueqi Cheng

机构 * CAS Key Lab of Network Data Science and Technology, ICT, CAS, Beijing, China(中国科学院信息科技研究所网络数据科学与技术重点实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学北京校区) Zhongguancun Laboratory, Beijing, China(中关村实验室) University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

Comments Accepted by EMNLP 2024 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10083 2025-05-16 cs.LG 92%

ChronoSteer: Bridging Large Language Model and Time Series Foundation Model via Synthetic Data

Chengsen Wang, Qi Qi, Zhongwen Rao, Lujia Pan, Jingyu Wang, Jianxin Liao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17413 2024-12-24 cs.CL 92%

Scalable Influence and Fact Tracing for Large Language Model Pretraining

Tyler A. Chang, Dheeraj Rajagopal, Tolga Bolukbasi, Lucas Dixon, Ian Tenney

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01154 2024-12-24 cs.IR cs.CL 92%

Unleashing the Power of Large Language Models in Zero-shot Relation Extraction via Self-Prompting

Siyi Liu, Yang Li, Jiang Li, Shan Yang, Yunshi Lan

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments EMNLP 2024 Short

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11813 2024-11-13 cs.CL 92%

How Do Large Language Models Acquire Factual Knowledge During Pretraining?

Hoyeon Chang, Jinho Park, Seonghyeon Ye, Sohee Yang, Youngkyung Seo, Du-Seong Chang, Minjoon Seo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01204 2024-11-07 cs.CL 92%

The Fine Line: Navigating Large Language Model Pretraining with Down-streaming Capability Analysis

Chen Yang, Junzhuo Li, Xinyao Niu, Xinrun Du, Songyang Gao, Haoran Zhang, Zhaoliang Chen, Xingwei Qu, Ruibin Yuan, Yizhi Li, Jiaheng Liu, Stephen W. Huang, Shawn Yue, Ge Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00304 2024-07-18 cs.CL 92%

Skills-in-Context Prompting: Unlocking Compositionality in Large Language Models

Jiaao Chen, Xiaoman Pan, Dian Yu, Kaiqiang Song, Xiaoyang Wang, Dong Yu, Jianshu Chen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27527 2026-06-29 cs.CV cs.AI cs.LG 新提交 92%

Large Language Model Teaches Visual Students: Cross-Modality Transfer of Fine-Grained Conceptual Knowledge

大型语言模型教授视觉学生:细粒度概念知识的跨模态迁移

Thomas Shih-Chao Liang, Zhuoran Yu, Yong Jae Lee

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 提出LaViD框架,利用语言模型生成多选题来蒸馏细粒度视觉概念,无需多模态数据,在多个基准上超越现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15416 2026-04-20 cs.LG cs.AI math.OC 92%

StoSignSGD: Unbiased Structural Stochasticity Fixes SignSGD for Training Large Language Models

StoSignSGD:无偏结构随机性修正SignSGD用于训练大语言模型

Dingzhi Yu, Rui Pan, Yuxing Liu, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 本文提出StoSignSGD算法,通过在sign操作中注入结构随机性,解决SignSGD在非光滑目标下的发散问题,理论和实验均证明其在凸和非凸优化中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02041 2026-03-03 cs.CL cs.AI 92%

EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training

EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力

Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) School of Humanities, Tallinn University(塔林大学人文学院)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(title,abstract);LLM(abstract);large language model(abstract)

AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19082 2026-06-09 cs.AI cs.CL cs.GT cs.LG cs.MA 版本更新 92%

Payoff scaling shapes cooperation in LLM agents across languages

收益规模塑造跨语言LLM代理的合作行为

Trung-Kiet Huynh, Dao-Sy Duy-Minh, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han

机构 * Faculty of Information Technology, University of Science (HCMUS), Ho Chi Minh City, Vietnam(信息技术学院,科学大学(HCMUS),胡志明市,越南) Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT),胡志明市,越南) Vietnam National University – Ho Chi Minh City (VNU-HCM), Ho Chi Minh City, Vietnam(越南国家大学——胡志明市(VNU-HCM),胡志明市,越南) Luxembourg Institute of Science and Technology (LIST), Luxembourg(卢森堡科学与技术研究所(LIST),卢森堡) School of Computing, Engineering and Digital Technologies, Teesside University, Middlesbrough, United Kingdom(计算、工程与数字技术学院,泰赛德大学,米德尔斯布罗,英国)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过监督分类器识别重复囚徒困境中的策略,结合演化博弈论基线,发现随着收益增加,LLM反而更合作,与演化预测相反,表明对齐训练和人类推理模式的影响。

Comments 44 pages, 17 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18777 2026-06-04 cs.LG cs.AI cs.CL cs.IR stat.AP 92%

PRECISE: Reducing the Bias of LLM Evaluations Using Prediction-Powered Ranking Estimation

PRECISE: 使用预测驱动的排名估计减少LLM评估的偏差

Abhishek Divekar, Anirban Majumder

机构 * Primary contributor and corresponding author(主要贡献者及通讯作者)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PRECISE框架,通过结合少量人工标注与LLM判断,利用预测驱动推断(PPI)方法,在低资源下可靠估计搜索、排序和RAG系统的指标,并校正LLM偏差。

Comments Accepted at AAAI 2026 - Innovative Applications of AI (IAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00829 2026-06-02 cs.CL cs.AI cs.LG 92%

Constitutional Black-Box Monitoring for Scheming in LLM Agents

LLM Agent 中阴谋行为的宪法黑盒监控

Simon Storf, Rich Barton-Cooper, James Peters-Gill, Marius Hobbhahn

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究使用基于宪法黑盒的监控器,通过仅观察外部输入和输出检测LLM Agent的阴谋行为,并在合成数据上优化后泛化到更真实环境。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18609 2026-04-23 cs.CL cs.AI cs.LG 92%

Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models

任务分层的知识扩展规律用于训练后量化的大语言模型

Chenxi Zhou, Pengfei Cao, Jiang Li, Bohan Yu, Jinyu Ye, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出任务分层的知识扩展规律,通过统一模型大小、位宽和细粒度因素,验证了293种不同的训练后量化配置,揭示了不同知识能力对精度、规模和校准的敏感性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17849 2025-12-01 cs.DC 92%

Pier: Efficient Large Language Model pretraining with Relaxed Global Communication

Pier:通过放松全局通信实现高效的大型语言模型预训练

Shuyuan Fan, Zhao Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

AI总结 Pier通过放松全局通信,提升大型语言模型预训练的效率,实现训练速度提升和运行时间减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09064 2025-09-12 cs.CV 92%

Enhancing 3D Medical Image Understanding with Pretraining Aided by 2D Multimodal Large Language Models

Qiuhui Chen, Xuancheng Yao, Huping Ye, Yi Hong

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

Comments Accepted by IEEE Journal of Biomedical and Health Informatics (JBHI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18594 2025-05-28 cs.AI cs.CL cs.LG 92%

"Oh LLM, I'm Asking Thee, Please Give Me a Decision Tree": Zero-Shot Decision Tree Induction and Embedding with Large Language Models

Ricardo Knauer, Mario Koddenbrock, Raphael Wallsberger, Nicholas M. Brisson, Georg N. Duda, Deborah Falla, David W. Evans, Erik Rodner

机构 * University of Applied Sciences Berlin(柏林应用科学大学) Charité - Universitätsmedizin Berlin(柏林夏里特医学院) University of Birmingham(伯明翰大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments KDD 2025 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13853 2024-09-24 cs.CL cs.AI cs.CR cs.LG 92%

Unlocking Memorization in Large Language Models with Dynamic Soft Prompting

Zhepeng Wang, Runxue Bao, Yawen Wu, Jackson Taylor, Cao Xiao, Feng Zheng, Weiwen Jiang, Shangqian Gao, Yanfu Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14845 2024-02-26 cs.CL cs.AI cs.LG 92%

Purifying Large Language Models by Ensembling a Small Language Model

Tianlin Li, Qian Liu, Tianyu Pang, Chao Du, Qing Guo, Yang Liu, Min Lin

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16079 2023-11-28 cs.CL cs.AI cs.LG 92%

MEDITRON-70B: Scaling Medical Pretraining for Large Language Models

Zeming Chen, Alejandro Hernández Cano, Angelika Romanou, Antoine Bonnet, Kyle Matoba, Francesco Salvi, Matteo Pagliardini, Simin Fan, Andreas Köpf, Amirkeivan Mohtashami, Alexandre Sallinen, Alireza Sakhaeirad, Vinitra Swamy, Igor Krawczuk, Deniz Bayazit, Axel Marmet, Syrielle Montariol, Mary-Anne Hartley, Martin Jaggi, Antoine Bosselut

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12311 2023-09-22 cs.CV cs.AI cs.CL cs.LG cs.RO 92%

LLM-Grounder: Open-Vocabulary 3D Visual Grounding with Large Language Model as an Agent

Jianing Yang, Xuweiyi Chen, Shengyi Qian, Nikhil Madaan, Madhavan Iyengar, David F. Fouhey, Joyce Chai

专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project website: https://chat-with-nerf.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01006 2026-07-02 cs.CL 新提交 92%

Understanding Large Language Models

理解大型语言模型

Yannik Keller, Thomas Eisenmann

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述大型语言模型(LLM)的机制、涌现能力及与人类认知的关系,通过分析注意力机制、符号推理、心智理论等证据,探讨LLM是否真正理解语言,并反对过度简化的人机认知差异观点。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17542 2026-06-17 cs.CL 新提交 92%

Evaluating Large Language Models Abilities for Addressee, Turn-change, and Next Speaker Prediction in Meetings

评估大型语言模型在会议中的收话人、话轮转换和下一说话人预测能力

Ryo Fukuda, Takatomo Kano, Siddhant Arora, Marc Delcroix, Naohiro Tawara, Atsunori Ogawa, Yuya Chiba, Atsushi Ando, William Chen, Shinji Watanabe

机构 * NTT, Inc., Japan(日本电信电话公司) Language Technologies Institute, Carnegie Mellon University, USA(卡内基梅隆大学语言技术研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 利用大型语言模型(LLMs)研究多模态多人对话中的话轮转换,构建了收话人检测、话轮转换预测和下一说话人预测三个任务的评估框架,实验表明LLMs在下一说话人预测上优于监督模型和人类,但多模态LLM在收话人检测和话轮转换预测上仍低于人类水平。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07001 2026-06-11 cs.DB cs.AI 版本更新 92%

DataEvolver: Automatic Data Preparation for Large Language Models through Multi-Level Self-Evolving

DataEvolver: 通过多级自我进化实现大型语言模型的自动数据准备

Chao Deng, Shaolei Zhang, Ju Fan, Xiaoyong Du

机构 * Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出DataEvolver,首个自我进化的数据准备系统,通过多级机制自动构建管道将原始数据转化为高质量数据,在七个基准上平均提升下游LLM性能10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09825 2026-08-13 cs.LG cs.AI 版本更新 92%

Pretraining large language models with MXFP4 on Native FP4 Hardware

使用MXFP4在原生FP4硬件上预训练大型语言模型

Musa Cim, Sarthak Arora, Poovaiah Palangappa, Miro Hodak, Ravi Dwivedula, Meena Arunachalam, Mahmut Taylan Kandemir

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现FP4训练不稳定主要由梯度路径的结构微缩放误差引起,通过MXFP4量化在Transformer训练中的受控研究,揭示了FP4在Fprop和Dgrad中对收敛影响较小,而Wgrad量化导致收敛退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09161 2026-08-03 cs.LG cs.AI cs.AR 版本更新 92%

Wrong Code, Right Structure: Learning Netlist Representations from Imperfect LLM-Generated RTL

错误代码,正确结构:从不完美的LLM生成RTL学习网表表示

Siyang Cai, Cangyuan Li, Haoyu Gao, Kun Wang, Yinhe Han, Ying Wang

机构 * CICS, Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用不完美的LLM生成RTL进行网表表示学习,通过数据增强和端到端流程,提升电路分析任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01499 2026-05-20 cs.LG cs.AI cs.GT 92%

Beyond Majority Voting: LLM Aggregation by Leveraging Higher-Order Information

超越多数投票:利用高阶信息进行LLM聚合

Rui Ai, Yuqi Pan, David Simchi-Levi, Milind Tambe, Haifeng Xu

机构 * Massachusetts Institute of Technology(麻省理工学院) School of Engineering and Applied Sciences(工程与应用科学学院) Harvard University(哈佛大学) Data Science, The University of Chicago(数据科学,芝加哥大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Optimal Weight和Inverse Surprising Popularity两种算法,通过结合一阶和二阶信息,有效缓解多数投票的局限性,提升多智能体LLM聚合的可靠性。

Comments Accepted into ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08765 2026-05-12 cs.LG cs.AI 92%

Unlearners Can Lie: Evaluating and Improving Honesty in LLM Unlearning

无法学习者可以撒谎:评估和改进LLM去学习中的诚实性

Renjie Gu, Jiazhen Du, Yihua Zhang, Sijia Liu

机构 * Fudan University(复旦大学) Central South University(中南大学) Michigan State University(密歇根州立大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文评估并改进LLM去学习中的诚实性,提出正式定义并引入评估指标,实验显示现有方法无法满足标准,提出ReVa方法提升去学习效果和诚实性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16555 2026-04-21 cs.LG cs.AI cs.CV 92%

LLM as a Tool, Not an Agent: Code-Mined Tree Transformations for Neural Architecture Search

将LLM作为工具而非代理:基于代码挖掘的树变换用于神经架构搜索

Masakazu Yoshimura, Zitang Sun, Yuiko Sakuma, Junji Otsuka, Atsushi Irie, Takeshi Ohashi

机构 * Sony Group Corporation(索尼集团公司)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLMasTool框架,通过树变换实现稳定且开放的模型进化,避免LLM的固有偏差,提升NAS在CIFAR-10、CIFAR-100和ImageNet16-120上的性能。

Comments 72 pages

详情

展开后加载摘要…

URL PDF HTML 收藏