arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 137794 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12318 篇

2306.13213 2023-08-21 cs.CR cs.CL cs.LG 91%

Visual Adversarial Examples Jailbreak Aligned Large Language Models

Xiangyu Qi, Kaixuan Huang, Ashwinee Panda, Peter Henderson, Mengdi Wang, Prateek Mittal

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00123 2026-08-05 cs.CL cs.AI cs.GT cs.LG 版本更新 90%

LLM-OSDA: An Optimal-Stopping Dynamic Auction for Native Advertising in Multi-Turn LLM Conversations

LLM-OSDA:多轮大语言模型对话中原生广告的最优停止动态拍卖机制

Yan Fang, Jialin Chen, Chun Gan, Hang Yu, Mingjun Nie, Yeyu Zhang, Fengxiang He, Ching Law

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多轮LLM对话中原生广告的时机与分配耦合问题,提出LLM-OSDA动态拍卖机制,结合贝尔曼最优停止等,在模拟实验中使净收益提升11%且用户留存相当。

Comments 14 pages, 7 figures. Submitted to the 41st AAAI Conference on Artificial Intelligence (AAAI 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08221 2026-07-10 cs.CV 新提交 90%

LUMI: Tokenizer-Agnostic LLM-Based Lossless Image Compression

LUMI:基于语言模型的与分词器无关的无损图像压缩

Chris Xing Tian, Chengkai Wu, Ziyu Wang, Rongqun Lin, Kecheng Chen, Xiandong Meng, Haoliang Li, Shiqi Wang, Siwei Ma

机构 * Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) Department of Electrical Engineering, City University of Hong Kong, Hong Kong SAR(香港城市大学电子工程系,香港特别行政区) Department of Computer Science, City University of Hong Kong, Hong Kong SAR(香港城市大学计算机科学系,香港特别行政区) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究基于LLM的无损图像压缩问题,提出LUMI框架,用像素嵌入模块取代像素即文本分词,引入位置编码,仅训练部分参数,LLM主干固定。实验表明其提供统一接口,压缩率有竞争力且跨域鲁棒性强。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29270 2026-06-30 cs.MA 90%

Minority Sentinel: When to Overturn Majority Voting in Multi-Agent LLM Debates

少数派哨兵:何时推翻多智能体LLM辩论中的多数投票

Chuan He, Zebin Chen, Zhengyi Yang, Shaobo Qiao, Mingchen Ju, Jiate Liu, Dong Wen, Guanfeng Liu

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(abstract)

AI总结 针对LLM辩论中多数投票压制正确少数意见的问题,提出Minority Sentinel轻量级元分类器,通过辩论日志特征训练LightGBM模型,在6个基准上实现81.2%的翻转精度和正向净增益。

Comments 11 pages, 4 figures. Accepted at the AgentSearch Workshop @ SIGIR 2026, Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13047 2026-04-14 cs.CL cs.AI cs.LG 90%

Multi-Model Synthetic Training for Mission-Critical Small Language Models

多模型合成训练用于关键任务小型语言模型

Nolan Platt, Pragyansmita Nayak

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);large language model(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用多模型生成技术,将AIS数据转化为问答对,训练出准确率达75%的低成本小型模型,为专业领域AI应用提供可复现的合成数据生成框架。

Comments 8 pages. Accepted as a full paper to the 3rd International Conference on Foundation and Large Language Models (IEEE FLLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21191 2025-09-25 cs.CL cs.AI cs.LG 90%

Small or Large? Zero-Shot or Finetuned? Guiding Language Model Choice for Specialized Applications in Healthcare

Lovedeep Gondara, Jonathan Simkin, Graham Sayle, Shebnum Devji, Gregory Arbour, Raymond Ng

机构 * British Columbia Cancer Registry Provincial Health Services Authority(不列颠哥伦比亚省癌症登记处省级卫生服务局) Data Science Institute University of British Columbia(数据科学研究所不列颠哥伦比亚大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10851 2024-10-23 cs.GR cs.AI cs.CL cs.LG cs.SD eess.AS 90%

LLM Gesticulator: Leveraging Large Language Models for Scalable and Controllable Co-Speech Gesture Synthesis

Haozhou Pang, Tianwei Ding, Lanshan He, Ming Tao, Lu Zhang, Qi Gan

专题命中 预训练与数据 :LLM(title,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03398 2024-04-05 cs.CV 90%

Scaling Up Video Summarization Pretraining with Large Language Models

Dawit Mureja Argaw, Seunghyun Yoon, Fabian Caba Heilbron, Hanieh Deilamsalehy, Trung Bui, Zhaowen Wang, Franck Dernoncourt, Joon Son Chung

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title)

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24133 2026-06-24 cs.LG cs.CL 新提交 90%

Holistic Data Scheduler for LLM Pre-training via Multi-Objective Reinforcement Learning

基于多目标强化学习的LLM预训练整体数据调度器

Chenhao Dang, Jing Ma, Mingjie Liao

机构 * China Electronics Technology Group Corporation 15th Research Institute(中国电子科技集团公司第十五研究所) Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出HDS框架,将数据调度建模为连续控制空间的强化学习问题,利用SAC算法和融合数据质量、跨域影响及模型权重的多目标奖励函数,在The Pile上减少44%训练迭代达到同等困惑度,并在MMLU等任务上提升7.2%。

Comments Our code is at https://github.com/DANG-ai/LLM-Training-Holistic-Data-Schedule

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), Vol. 1, pp. 176-187, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08800 2026-08-11 cs.CL 新提交 90%

Instability of LLM Pre-Pretraining: It Doesn't Always Help. An Investigation on Multiple Languages

大语言模型的预预训练:并非总能带来帮助——多语言调查

Sofiia Riazhskykh, Nam Luu, Ondřej Bojar

专题命中 预训练与数据 :LLM(title,summary_cn);pretraining(title,abstract);分类 cs.CL

AI总结 该研究调查了 LLM 预预训练在多语言场景下的 token 效率增益,发现其受实验设置和随机种子影响,仅在特定条件下稳定,建议部分实验需多次运行以规避不稳定方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06977 2026-08-10 cs.CL 新提交 90%

Confirming Our Biases? Evaluating the Capabilities, Risks, and Societal Impact of Large Language Models

确认我们的偏见?评估大型语言模型的能力、风险与社会影响

Mudar Adas, Polina Tsvilodub, Michael Franke, Martin V. Butz

机构 * University of Tübingen(蒂宾根大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究评估6个大型语言模型(LLMs)对160条跨10个主题的提示的响应,发现LLMs会系统调整响应以匹配提示框架,甚至在事实类情境中也如此,明确了其可被操纵的程度与界限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11034 2026-07-21 cs.LG 版本更新 90%

AdaGC: Enhancing LLM Pretraining Stability via Adaptive Gradient Clipping

AdaGC: 通过自适应梯度裁剪增强LLM预训练稳定性

Guoxia Wang, Shuai Li, Congliang Chen, Jinle Zeng, Jiabin Yang, Dianhai Yu, Yanjun Ma, Li Shen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出自适应逐张量梯度裁剪方法AdaGC,通过限制梯度范数相对于历史裁剪值的指数移动平均来消除损失尖峰,在Llama-2 7B等模型上实现零尖峰并提升下游准确率。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12394 2026-06-30 cs.LG 90%

Synthetic Interaction Data for Scalable Personalization in Large Language Models

用于大规模语言模型可扩展个性化的人工交互数据

Yuchen Ma, Yue Huang, Wenjie Wang, Xiaonan Luo, Xiangliang Zhang, Stefan Feuerriegel

机构 * Munich Center for Machine Learning & LMU Munich(慕尼黑机器学习中心及慕尼黑大学) University of Notre Dame(诺特尔大学) Sichuan University(四川大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出PersonaGym框架生成高质量合成数据,开发PPOpt方法优化用户提示,提升个性化性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24417 2026-06-26 cs.LG 版本更新 90%

LLMTabBench: Evaluating LLMs on Binary Tabular Classification From Zero to Few Shots

LLMTabBench:从零样本到少样本的二元表格分类中评估LLM

Daria Grushina, Kseniia Kuvshinova, Alina Kostromina, Aziz Temirkhanov, Mile Mitrovic, Dmitry Simakov

机构 * Sb AI Lab, HSE, NES(Sb AI Lab,HSE,NES) Sb AI Lab, HSE(Sb AI Lab,HSE) Sb AI Lab, HSE University(Sb AI Lab,HSE大学) Sb AI Lab

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出LLMTabBench基准,系统评估LLM在数据稀缺条件下进行表格分类时,先验知识与上下文信息(任务描述和少样本示例)的交互作用,以及性能随数据复杂度的扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17945 2026-06-25 cs.AI 新提交 90%

Small Initialization Matters for Large Language Models

小初始化对大语言模型至关重要

Liangkai Hang, Junjie Yao, Zhiyu Li, Feiyu Xiong, Hongkang Yang, Zhi-Qin John Xu

机构 * School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学科学学院) Institute of Natural Sciences, Shanghai Jiao Tong University(上海交通大学自然科学研究院) MemTensor (Shanghai) Technology Co., Ltd.(上海记忆张量科技有限公司) Institute for Advanced Algorithms Research(先进算法研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);pretraining(abstract)

AI总结 本文发现减小初始化尺度能持续改善大语言模型预训练,尤其在推理任务上提升显著,并揭示了小初始化驱动参数从低复杂度结构向丰富表示演化的机制。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09547 2026-06-19 cs.CV cs.LG 新提交 90%

Streaming Interventions: Can Video Large Language Models Correct Mistakes as They Occur?

流式干预:视频大语言模型能否在错误发生时即时纠正?

Apratim Bhattacharyya, Shweta Mahajan, Sanjay Haresh, Rajeev Yasarla, Reza Pourreza, Litian Liu, Risheek Garrepalli, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) York University(约克大学) Vector Institute for AI(向量人工智能研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.LG

AI总结 提出Ego-MC-Bench基准评估视频LLM在烹饪场景中的实时干预能力,并构建Ego-CoMist反事实合成数据集提升小模型性能。

Comments The project page is available at https://apratimbh.github.io/livecookv2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16276 2026-06-18 cs.AI 新提交 90%

SpecAlign: Efficient Specification-Grounded Alignment of Large Language Models via Synthetic Data

SpecAlign: 通过合成数据实现高效的大语言模型规范对齐

Wenjie Wang, Yue Huang, Zhengqing Yuan, Han Bao, Shiyi Du, Yuchen Ma, Yue Zhao, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) Carnegie Mellon University(卡内基梅隆大学) LMU Munich(慕尼黑大学) University of Southern California(南加州大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出规范对齐新范式,通过从规范文档合成数据(SpecAlign框架),结合结构化规则标注、可控规范实例化和多智能体对抗数据合成,生成细粒度偏好对,提升规则遵守度且不损害通用能力。

Comments 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06360 2026-06-09 cs.AI 版本更新 90%

An Infectious Disease Spread Simulation Based on Large Language Model Decision Making

基于大语言模型决策的传染病传播模拟

Yonchanok Khaokaew, Ruochen Kong, Andreas Zufle, Hao Xue, Taylor Anderson, Chandini Raina MacIntyre, Matthew Scotch, Flora D. Salim, David J Heslop

机构 * Computer Science and Engineering Faculty of Engineering(计算机科学与工程系) The University of New South Wales(新南威尔士大学) Department of Computer Science(计算机科学系) Emory University(埃默里大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) George Mason University(乔治·马歇尔大学) The Kirby Institute Faculty of Medicine & Health(Kirby研究所医学院与健康学院) Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一个空间显式的基于智能体的模拟框架,利用大语言模型生成自我报告流感样疾病的决策,并整合到基于人口普查的合成人群中,以捕捉社会与地理异质性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06553 2026-06-04 stat.AP cs.LG 90%

A Latent Variable Framework for Scaling Laws in Large Language Models

大型语言模型中缩放定律的潜变量框架

Peiyao Cai, Chengyu Cui, Felipe Maia Polo, Seamus Somerstep, Leshem Choshen, Mikhail Yurochkin, Yuekai Sun, Kean Ming Tan, Gongjun Xu

机构 * Department of Statistics, University of Michigan(密歇根大学统计系) IBM Research and CSAIL, MIT(IBM研究与麻省理工学院计算机科学与人工智能实验室) Institute of Foundation Models, MBZUAI(MBZUAI基础模型研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出基于潜变量建模的统计框架,通过引入潜变量捕获不同模型家族和基准的异构性,以更准确地建模大型语言模型的缩放定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12744 2026-05-22 cs.LG 90%

Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity

静息神经元,主动洞察:通过自发性增强LLM中的激活稀疏性

Haotian Xu, Jiannan Yang, Tian Gao, Tsui-Wei Weng, Tengfei Ma

机构 * IBM Thomas J. Watson Research Center, Yorktown Heights, USA(IBM 托马斯·J·沃森研究中心,美国Yorktown Heights) Halıcıoğlu Data Science Institute, UC San Diego, La Jolla, USA(哈利奇欧数据科学研究所,美国UC圣地亚哥La Jolla) Stony Brook University, Stony Brook, USA(史泰文·布鲁克大学,美国Stony Brook)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种通过引入自发神经元(SPON)来增强LLM中激活稀疏性的方法,解决了高稀疏率下模型精度下降的问题,通过分布匹配训练SPON,使模型在稀疏计算中保持稳定和泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07533 2026-05-11 cs.CL 90%

Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation

为何大语言模型在低资源翻译中失败?解析大语言模型在机器翻译中的令牌动态

Shenbin Qian, Yves Scherrer

机构 * Language Technology Group, Department of Informatics University of Oslo(奥斯陆大学语言技术组,信息学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究通过分析15种模型在22种语言对上的表现,发现非英语语言对翻译质量较低,引入令牌激活率指标揭示语言表示与翻译性能的关系,指出推理模型在低TAR语言中生成更多令牌可能补偿性能差异。

Comments Accepted to the 26th Annual Conference of the European Association for Machine Translation (EAMT2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22989 2026-04-28 cs.CV cs.AI 90%

CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging

CheXmix:用于医学影像的统一生成预训练

Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari

机构 * Stanford AIMI, Stanford University(斯坦福大学AIMI研究所,斯坦福大学) Oracle Health AI(Oracle健康AI) Department of Radiology, Stanford University(斯坦福大学放射科)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 CheXmix通过统一早融合生成方法,在医学影像中实现更精确的联合表征学习,优于现有生成模型,在多个任务上表现突出。

Comments CVPR Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22142 2026-04-27 cs.CL cs.CY 90%

Voice Under Revision: Large Language Models and the Normalization of Personal Narrative

声音的修订:大型语言模型与个人叙述的规范化

Tom van Nuenen

机构 * Social Sciences D-Lab, University of California, Berkeley(社会科学D实验室,加州大学伯克利分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究探讨大型语言模型如何通过改写影响个人叙述的风格和叙述质感,发现改写导致风格规范化,包括功能词、缩略语和第一人称代词减少,而词汇多样性、词长和标点使用增加,影响叙述方式和因果推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11810 2026-04-15 cs.DB cs.AI 90%

GRACE: A Dynamic Coreset Selection Framework for Large Language Model Optimization

GRACE:一种用于大语言模型优化的动态聚类选择框架

Tianhao Tang, Haoyang Li, Lei Chen

机构 * CSE, HKUST(香港科技大学计算机科学与工程系) Computing, PolyU(PolyU计算机系) DSA, HKUST (GZ)&HKUST Guangzhou, China(香港科技大学(广州)数据科学与应用系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 GRACE通过结合表示多样性与梯度重要性度量,动态构建和更新聚类,提升大语言模型训练效率和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05523 2026-03-31 cs.CL 90%

Pretraining Language Models for Diachronic Linguistic Change Discovery

为历时语言变化发现预训练语言模型

Elisabeth Fittschen, Sabrina Li, Tom Lippincott, Leshem Choshen, Craig Messner

机构 * University of Hamburg(汉堡大学) Center for Digital Humanities, Johns Hopkins University(约翰霍普金斯大学数字人文中心) IBM Research, MIT(麻省理工学院IBM研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出通过预训练语言模型发现历时语言变化,通过高效预训练技术处理大规模语料,发现预训练模型在训练速度和历史划分尊重方面优于微调基线,展示了在历时语言学中检测词汇变化等现象的能力。

Comments Accepted to Findings of the EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21140 2026-03-24 cs.AI 90%

ORACLE: Optimizing Reasoning Abilities of Large Language Models via Constraint-Led Synthetic Data Elicitation

ORACLE:通过约束引导的合成数据激发方法优化大语言模型的推理能力

Zhuojie Yang, Wentao Wan, Keze Wang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 ORACLE通过结合生成式模型与符号监督,实现对多步骤推理数据的细粒度验证,提升大语言模型的推理能力,在六个基准测试中表现优异。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13264 2026-03-17 cs.LG cs.IR 90%

Federated Personal Knowledge Graph Completion with Lightweight Large Language Models for Personalized Recommendations

联邦轻量级大语言模型用于个性化推荐的知识图谱补全

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出FedTREK-LM框架,结合轻量级大语言模型、演化个人知识图谱和联邦学习,实现可扩展的去中心化个性化推荐,实验显示其在电影和食谱推荐中F1分数提升超4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02400 2026-02-03 cs.LG 90%

An Empirical Study on Noisy Data and LLM Pretraining Loss Divergence

对噪声数据和LLM预训练损失发散的实证研究

Qizhen Zhang, Ankush Garg, Jakob Foerster, Niladri Chatterji, Kshitiz Malik, Mike Lewis

机构 * University of Oxford(牛津大学) FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过实证分析揭示噪声数据如何导致LLM预训练中的损失发散,并区分噪声与高学习率引起的发散模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01734 2026-02-03 cs.LG 90%

MSign: An Optimizer Preventing Training Instability in Large Language Models via Stable Rank Restoration

MSign: 通过稳定秩恢复防止大语言模型训练不稳定

Lianhai Ren, Yucheng Ding, Xiao Liu, Qianxiao Li, Peng Cheng, Yeyun Gong

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 MSign通过稳定秩恢复机制防止大语言模型训练不稳定,有效减少训练失败并降低计算开销

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21947 2026-01-30 cs.AI 90%

ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models

ToolWeaver: 为大语言模型中的可扩展工具使用编织协作语义

Bowen Fang, Wen Ye, Yunyue Su, Jinghao Zhang, Qiang Liu, Yesheng Liu, Xin Sun, Shu Wu, Jiabing Yang, Baole Wei, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 ToolWeaver通过编码工具为层次序列,解决大语言模型中工具使用中的语义和可扩展性问题,提升工具协作学习的效率与效果。

Comments 10pages, 12 figures, Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏