Benchmarking Optimizers for Large Language Model Pretraining
机构 * EPFL(瑞士联邦理工学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
Comments 73 pages, 44 figures, 48 tables
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * EPFL(瑞士联邦理工学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
Comments 73 pages, 44 figures, 48 tables
机构 * CAS Key Lab of Network Data Science and Technology, ICT, CAS, Beijing, China(中国科学院信息科技研究所网络数据科学与技术重点实验室) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学北京校区) ; Zhongguancun Laboratory, Beijing, China(中关村实验室) ; University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
Comments Accepted by EMNLP 2024 main
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(title,abstract);LLM(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)
Comments EMNLP 2024 Short
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
Comments Accepted at NeurIPS 2024
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);pretraining(abstract)
大型语言模型教授视觉学生:细粒度概念知识的跨模态迁移
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)
AI总结 提出LaViD框架,利用语言模型生成多选题来蒸馏细粒度视觉概念,无需多模态数据,在多个基准上超越现有方法。
Comments Accepted by ICML 2026
StoSignSGD:无偏结构随机性修正SignSGD用于训练大语言模型
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract)
AI总结 本文提出StoSignSGD算法,通过在sign操作中注入结构随机性,解决SignSGD在非光滑目标下的发散问题,理论和实验均证明其在凸和非凸优化中的优越性。
EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力
机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) ; Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) ; Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) ; School of Humanities, Tallinn University(塔林大学人文学院)
专题命中 预训练与数据 :pretraining(title,abstract);post-training(title,abstract);LLM(abstract);large language model(abstract)
AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。
收益规模塑造跨语言LLM代理的合作行为
机构 * Faculty of Information Technology, University of Science (HCMUS), Ho Chi Minh City, Vietnam(信息技术学院,科学大学(HCMUS),胡志明市,越南) ; Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT),胡志明市,越南) ; Vietnam National University – Ho Chi Minh City (VNU-HCM), Ho Chi Minh City, Vietnam(越南国家大学——胡志明市(VNU-HCM),胡志明市,越南) ; Luxembourg Institute of Science and Technology (LIST), Luxembourg(卢森堡科学与技术研究所(LIST),卢森堡) ; School of Computing, Engineering and Digital Technologies, Teesside University, Middlesbrough, United Kingdom(计算、工程与数字技术学院,泰赛德大学,米德尔斯布罗,英国)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过监督分类器识别重复囚徒困境中的策略,结合演化博弈论基线,发现随着收益增加,LLM反而更合作,与演化预测相反,表明对齐训练和人类推理模式的影响。
Comments 44 pages, 17 figures, 4 tables
PRECISE: 使用预测驱动的排名估计减少LLM评估的偏差
机构 * Primary contributor and corresponding author(主要贡献者及通讯作者)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PRECISE框架,通过结合少量人工标注与LLM判断,利用预测驱动推断(PPI)方法,在低资源下可靠估计搜索、排序和RAG系统的指标,并校正LLM偏差。
Comments Accepted at AAAI 2026 - Innovative Applications of AI (IAAI-26)
LLM Agent 中阴谋行为的宪法黑盒监控
机构 * University of Cambridge(剑桥大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究使用基于宪法黑盒的监控器,通过仅观察外部输入和输出检测LLM Agent的阴谋行为,并在合成数据上优化后泛化到更真实环境。
Comments Accepted at ICML 2026. Camera-ready version
任务分层的知识扩展规律用于训练后量化的大语言模型
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) ; The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出任务分层的知识扩展规律,通过统一模型大小、位宽和细粒度因素,验证了293种不同的训练后量化配置,揭示了不同知识能力对精度、规模和校准的敏感性。
Comments Accepted to Findings of ACL 2026
Pier:通过放松全局通信实现高效的大型语言模型预训练
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
AI总结 Pier通过放松全局通信,提升大型语言模型预训练的效率,实现训练速度提升和运行时间减少。
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
Comments Accepted by IEEE Journal of Biomedical and Health Informatics (JBHI)
机构 * University of Applied Sciences Berlin(柏林应用科学大学) ; Charité - Universitätsmedizin Berlin(柏林夏里特医学院) ; University of Birmingham(伯明翰大学)
专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments KDD 2025 Research Track
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 预训练与数据 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Project website: https://chat-with-nerf.github.io/
理解大型语言模型
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文综述大型语言模型(LLM)的机制、涌现能力及与人类认知的关系,通过分析注意力机制、符号推理、心智理论等证据,探讨LLM是否真正理解语言,并反对过度简化的人机认知差异观点。
Comments 25 pages, 1 figure
评估大型语言模型在会议中的收话人、话轮转换和下一说话人预测能力
机构 * NTT, Inc., Japan(日本电信电话公司) ; Language Technologies Institute, Carnegie Mellon University, USA(卡内基梅隆大学语言技术研究所)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 利用大型语言模型(LLMs)研究多模态多人对话中的话轮转换,构建了收话人检测、话轮转换预测和下一说话人预测三个任务的评估框架,实验表明LLMs在下一说话人预测上优于监督模型和人类,但多模态LLM在收话人检测和话轮转换预测上仍低于人类水平。
Comments Accepted to INTERSPEECH 2026
DataEvolver: 通过多级自我进化实现大型语言模型的自动数据准备
机构 * Renmin University of China(中国人民大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出DataEvolver,首个自我进化的数据准备系统,通过多级机制自动构建管道将原始数据转化为高质量数据,在七个基准上平均提升下游LLM性能10%。
使用MXFP4在原生FP4硬件上预训练大型语言模型
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Advanced Micro Devices, Inc.(先进微器件公司)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究发现FP4训练不稳定主要由梯度路径的结构微缩放误差引起,通过MXFP4量化在Transformer训练中的受控研究,揭示了FP4在Fprop和Dgrad中对收敛影响较小,而Wgrad量化导致收敛退化。
错误代码,正确结构:从不完美的LLM生成RTL学习网表表示
机构 * CICS, Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出利用不完美的LLM生成RTL进行网表表示学习,通过数据增强和端到端流程,提升电路分析任务的性能。
超越多数投票:利用高阶信息进行LLM聚合
机构 * Massachusetts Institute of Technology(麻省理工学院) ; School of Engineering and Applied Sciences(工程与应用科学学院) ; Harvard University(哈佛大学) ; Data Science, The University of Chicago(数据科学,芝加哥大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Optimal Weight和Inverse Surprising Popularity两种算法,通过结合一阶和二阶信息,有效缓解多数投票的局限性,提升多智能体LLM聚合的可靠性。
Comments Accepted into ICML 2026
无法学习者可以撒谎:评估和改进LLM去学习中的诚实性
机构 * Fudan University(复旦大学) ; Central South University(中南大学) ; Michigan State University(密歇根州立大学)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文评估并改进LLM去学习中的诚实性,提出正式定义并引入评估指标,实验显示现有方法无法满足标准,提出ReVa方法提升去学习效果和诚实性。
Comments Accepted by ACL 2026
将LLM作为工具而非代理:基于代码挖掘的树变换用于神经架构搜索
机构 * Sony Group Corporation(索尼集团公司)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LLMasTool框架,通过树变换实现稳定且开放的模型进化,避免LLM的固有偏差,提升NAS在CIFAR-10、CIFAR-100和ImageNet16-120上的性能。
Comments 72 pages