arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-21 至 2026-07-21 共收录 181 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2502.11034 2026-07-21 cs.LG 版本更新 90%

AdaGC: Enhancing LLM Pretraining Stability via Adaptive Gradient Clipping

AdaGC: 通过自适应梯度裁剪增强LLM预训练稳定性

Guoxia Wang, Shuai Li, Congliang Chen, Jinle Zeng, Jiabin Yang, Dianhai Yu, Yanjun Ma, Li Shen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 提出自适应逐张量梯度裁剪方法AdaGC,通过限制梯度范数相对于历史裁剪值的指数移动平均来消除损失尖峰,在Llama-2 7B等模型上实现零尖峰并提升下游准确率。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11961 2026-07-21 cs.CL 版本更新 89%

Scaling Model and Data for Multilingual Machine Translation with Open Large Language Models

基于开放大语言模型的多语言机器翻译模型与数据扩展

Yuzhe Shang, Pengzhi Gao, Wei Liu, Jian Luan, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) MiLM Plus, Xiaomi Inc., Beijing, China(小米公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出MiLMMT-46模型,通过模型和数据扩展提升多语言机器翻译性能,超越现有SOTA模型并接近Google Translate等强 proprietary 系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09657 2026-07-21 cs.CV cs.AI cs.MM 版本更新 85%

Scalable Visual Pretraining for Language Intelligence

用于语言智能的可扩展视觉预训练

Yiming Zhang, Zhonghan Zhao, Wenwei Zhang, Haiteng Zhao, Tianyang Lin, Huanze Tang, Yunhua Zhou, Demin Song, Kuikun Liu, Haochen Ye, Haian Huang, Yuzhe Gu, Haijun Lv, Qipeng Guo, Bin Liu, Gaoang Wang, Kai Chen

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究挑战语言模型仅在文本表示上训练的假设,通过对直接利用视觉文档的无监督视觉预训练范式进行系统研究,发现其在多主干和基准上优于仅文本预训练,为可扩展语言智能提供有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12463 2026-07-21 cs.AI cs.CL 版本更新 84%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04344 2026-07-21 stat.ML cs.LG math.ST stat.TH 版本更新 83%

Perturbation is All You Need for Extrapolating Language Models

扰动是语言模型外推所需的一切

Zetai Cen, Jin Zhu, Xinwei Shen, Chengchun Shi

机构 * School of Mathematics, University of Bristol(布里斯托大学数学系) School of Mathematics, University of Birmingham(伯明翰大学数学系) Department of Statistics, University of Washington(华盛顿大学统计系) Department of Statistics, London School of Economics and Political Science(伦敦政治经济学院统计系)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文针对大语言模型外推问题,提出基于扰动的方法,先转换前缀为语义邻域再进行下一个token预测,构建分层模型。通过建立五个属性发展外推性理论,经合成与真实数据评估,该方法提升支持域外预测性能,为语言建模提供实用路径。

Comments 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16152 2026-07-21 cs.CR cs.LG 版本更新 83%

Gradient-Free Privacy Leakage in Federated Language Models through Selective Weight Tampering

通过选择性权重篡改在联邦语言模型中实现无梯度隐私泄露

Md Rafi Ur Rashid, Vishnu Asutosh Dasu, Kang Gu, Najrin Sultana, Shagufta Mehnaz

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Dartmouth College(达特茅斯学院)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 研究联邦语言模型中隐私敏感数据泄露问题,发现中间轮次模型快照及恶意参与者篡改选择性权重会加剧泄露,提出无梯度攻击方法,提升了成员推理召回率和私有数据重建率,还给出客户端防御隐私风险的技术建议。

Comments 21 pages (including bibliography and Appendix), Submitted to PETS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17743 2026-07-21 cs.LG stat.ML 版本更新 77%

Bigger Is Safer: Provable Robustness in In-Context Learning Scales with Capacity

可证明的上下文学习中的对抗鲁棒性

Di Zhang, Ningxu Zhang, Zimeng Liu

机构 * School of AI and Advanced Computing(人工智能与先进计算学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种分布鲁棒的元学习框架,通过推导非渐近界限,揭示了上下文学习在对抗条件下鲁棒性与模型容量、扰动强度之间的缩放关系。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04124 2026-07-21 cs.CY cs.AI 版本更新 70%

When AI Takes the Couch: Psychometric Jailbreaks Reveal Internal Conflict in Frontier Models

当人工智能接受心理治疗:心理测量越狱揭示前沿模型中的内部冲突

Afshin Khadangi, Hanna Marxen, Amir Sartipi, Igor Tchappi, Gilbert Fridgen

机构 * SnT, University of Luxembourg(卢森堡大学SnT学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 研究前沿语言模型生成拟人化自我叙述机制,用PsAIch协议测试,发现其叙述受多种因素影响,确定了稳定的对齐冲突模式,为拟人化披露和安全评估提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15802 2026-07-21 cs.LG 版本更新 57%

Time-Aware Prior Fitted Networks for Zero-Shot Forecasting with Exogenous Variables

考虑时间因素的先验拟合网络用于外生变量的零样本预测

Andres Potapczynski, Ravi Kiran Selvam, Tatiana Konstantinova, Malcolm Wolff, Kin G. Olivares, Ruijun Ma, Michael W. Mahoney, Andrew Gordon Wilson, Boris N. Oreshkin, Dmitry Efimov

机构 * Amazon(亚马逊) New York University(纽约大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本文提出ApolloPFN,一种时间感知的先验拟合网络,能够原生整合外生变量,通过合成数据生成和时间感知架构改进,实现更准确的预测。

Comments Accepted and published in Transactions on Machine Learning Research (TMLR), 2026

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10879 2026-07-21 cs.RO cs.CV 版本更新 50%

3D Scene Graph Prediction: Generating Hierarchical Models from Partially Observed Environments

3D场景图预测:从部分观测环境生成层次模型

Siyi Hu, Jared Strader, Hyungtae Lim, Luca Carlone

机构 * Laboratory for Information & Decision Systems (LIDS), Massachusetts Institute of Technology(信息与决策系统实验室(LIDS),麻省理工学院) Department of Electrical and Computer Engineering, Oakland University(奥克兰大学电气与计算机工程系)

专题命中 预训练与数据 :LLM(abstract)

AI总结 针对机器人部分观测环境的场景预测问题,提出自上而下框架合成含房间层和物体层的3D场景图,用混合域图扩散模型等方法,相比其他方法对分布外部分平面图泛化性更好,能在真实场景预测。

Comments Accepted at IROS 2026. Main paper: 8 pages, 3 figures, 3 tables. Includes a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 50%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 15 篇

2511.07457 2026-07-21 cs.CL cs.AI 版本更新 91%

GRIP: In-Parameter Graph Reasoning through Fine-Tuning Large Language Models

GRIP:通过微调大语言模型进行参数内图推理

Jiarui Feng, Donghong Cai, Yixin Chen, Muhan Zhang

机构 * Washington University in Saint Louis(华盛顿大学圣路易斯分校) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 研究如何让大语言模型适应结构数据,提出GRIP方法,通过微调任务将图关系知识内化到模型参数,存储于轻量级LoRA模块,实验表明该方法在处理大图时优于基线,处理小图时以低推理成本达可比性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21492 2026-07-21 cs.LG cs.AI cs.CL 版本更新 91%

GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning

GradAlign: 用于大语言模型强化学习的梯度对齐数据选择

Ningyuan Yang, Weihua Du, Weiwei Sun, Sean Welleck, Yiming Yang

机构 * Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(交叉信息学院(IIIS)、清华大学) Language Technologies Institute (LTI), Carnegie Mellon University(语言技术研究所(LTI)、卡内基梅隆大学)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 GradAlign通过梯度对齐数据选择方法提升大语言模型强化学习的训练稳定性与性能。

Comments 20 pages. Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13753 2026-07-21 cs.CL 版本更新 90%

Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape CoT Calibration

训练后转移置信度:对自训练微调、强化学习和在线策略蒸馏如何塑造思维链前、中、后校准的三阶段分析

Shuhao Li, Guodong Du, Anhao Zhao, Wanyu Lin, Tianyu Yuan, Xiaoyu Shen

机构 * Eastern Institute of Technology(东理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 指令微调 :post-training(title,abstract);SFT(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大型语言模型训练后方法在推理中重塑置信度的情况,提出三阶段校准框架,发现不同方法在不同阶段的置信度特点,基于此提出位置感知置信策略PosConf,提升了强化学习答案聚合及在线策略蒸馏早期停止效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16991 2026-07-21 cs.LG cs.AI 版本更新 88%

Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models

稀疏感知低秩表示用于大型语言模型高效微调

Longteng Zhang, Sen Wu, Shuai Hou, Zhengyu Qing, Zhuo Zheng, Danning Ke, Qihong Lin, Qiang Wang, Shaohuai Shi, Xiaowen Chu

专题命中 指令微调 :language model(title,abstract);large language model(title);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 SALR 通过结合低秩适应与稀疏剪枝,实现大型语言模型的高效微调,达到 50% 稀疏度并提升推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16461 2026-07-21 cs.CV 版本更新 88%

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10848 2026-07-21 cs.CL 版本更新 86%

Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning

Psyche-R1:通过统一的同理心、专业知识和推理实现可靠的心理语言模型

Chongyuan Dai, Jinpeng Hu, Hongchang Shi, Zhuo Li, Dan Guo, Xun Yang, Meng Wang

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究旨在将大语言模型应用于心理领域,提出Psyche-R1模型。通过设计数据合成管道生成大量心理问题及对话,采用混合训练策略,经实验验证该模型在多个心理基准测试中有效,7B的Psyche-R1能取得与671B的DeepSeek-R1相当的结果。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07559 2026-07-21 cs.CL cs.AI quant-ph 版本更新 84%

Phantom Transitions in Language Model Fine-Tuning: A Density-Matrix Analysis

语言模型微调中的幻影相变

Vaibhav Prakash, Jayasri Dontabhaktuni

机构 * Mahindra University(马恒达大学)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究语言模型微调时,正确补全被近义词竞争而失败的现象,通过序参量分解信号与背景拖拽,发现两种失败模式,并揭示相变为幻影,源于softmax读出而非几何相变。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13314 2026-07-21 cs.LG cs.AI econ.EM 版本更新 81%

Tabular Foundation Models for Discrete Choice Estimation

用于离散选择估计的表格基础模型

Liu Liu, Dan Zhang

机构 * Leeds School of Business, University of Colorado Boulder(科罗拉多大学博尔德分校利兹商学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究离散选择估计中表格基础模型的应用,提出编码选择集依赖性和个体异质性的重新表述方法,在酸奶扫描仪面板数据上评估,该方法在预测准确性和速度上优于分层贝叶斯估计,为基础模型应用于消费者选择问题提供原则性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18082 2026-07-21 cs.CL cs.HC 版本更新 79%

Octo-planner: On-device Language Model for Planner-Action Agents

Octo-planner:用于规划-行动智能体的设备端语言模型

Wei Chen, Zhiyuan Li, Zhen Guo, Yikang Shen

机构 * Nexa AI & Stanford(Nexa AI 与 斯坦福大学) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI 实验室)

专题命中 指令微调 :language model(title);LLM(abstract);分类 cs.CL

AI总结 研究如何让人工智能智能体有效规划行动,提出设备端规划-行动框架,分离规划与行动执行组件,用模型微调优化性能,多LoRA训练方法应对多域规划挑战,在域内测试成功率达97%,并开源模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00454 2026-07-21 cs.LG cs.AI 版本更新 79%

Rooted Absorbed Prefix Trajectory Balance with Submodular Replay for GFlowNet Training

基于子模重放的根吸收前缀轨迹平衡用于GFlowNet训练

Xi Wang, Wenbo Lu, Shengjie Wang

机构 * Courant Institute School of Mathematics, Computing, and Data Science, New York University(纽约大学Courant研究所数学、计算与数据科学学院) Courant Institute School of Mathematics, Computing(纽约大学Courant研究所数学、计算与数据科学学院) Data Science, New York University(纽约大学数据科学学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对GFlowNet的模式坍塌问题,提出RapTB目标函数(通过根锚定子轨迹监督和吸收后缀备份提供密集前缀学习信号)和SubM子模重放策略(促进高奖励和多样性),在分子生成等任务中提升优化性能和多样性。

Journal ref Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08015 2026-07-21 cs.RO 版本更新 67%

Q-VGM: Q-Value-Gradient Matching for Off-Policy Reinforcement Learning of Flow-Matching VLA

Q-VGM: 基于Q引导的值梯度匹配的流匹配VLA策略

Ziqian Wang, Yitian Liu, Xingjian Mao, Minqian Wang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出Q-VGM离线强化学习方法,通过将值梯度转化为去噪时间上的值梯度场,避免反向传播去噪链,高效微调流匹配VLA策略,在LIBERO等任务上显著提升成功率。

Comments 13 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07691 2026-07-21 cs.CL cs.LG 版本更新 62%

Breaking the Block: Preserving Data Continuity to Train Superior SAEs for Instruct Models

打破模块限制:保留数据连续性以训练用于指令模型的卓越稀疏自编码器

Jiaming Li, Haoran Ye, Yukun Chen, Xinyue Li, Lei Zhang, Hamid Alinejad-Rokny, Jimmy Chih-Hsien Peng, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(中国科学院深圳先进技术研究所) University of Chinese Academy of Sciences, China(中国科学院大学) National University of Singapore, Singapore(新加坡国立大学) The University of New South Wales, Australia(新南威尔士大学) Shenzhen University of Advanced Technology, China(深圳先进技术大学)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究针对现有SAEs训练方法在指令模型中因注意力泄漏引入梯度噪声问题,提出FAST顺序训练范式,通过与数据分布和激活模式对齐,提升重建保真度和特征可解释性,实验显示该方法效果显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14409 2026-07-21 cs.RO cs.AI 版本更新 57%

Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack

Hy-Embodied-0.5-VLA:从视觉-语言-动作模型到真实世界机器人学习栈

He Zhang, Lingzhu Xiang, Haitao Lin, Zeyu Huang, Minghui Wang, Dingyan Zhong, Yubo Dong, Yihao Wu, Yongming Rao, Dongsheng Zhang, Wanjia He, Ling Chen, Kai Huang, Jiahao Chen, Sichang Su, Xumin Yu, Ziyi Wang, Chengwei Zhu, Xiao Teng, Yuchun Guo, Yufeng Zhang, Yuandong Liu, Rui Wang, Zisheng Lu, Han Hu, Zhengyou Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 指令微调 :post-training(abstract);分类 cs.AI

AI总结 提出端到端机器人学习栈HyVLA-0.5,涵盖数据收集、模型设计、预训练与微调、RL后训练及真实部署,各组件协同工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21632 2026-07-21 cond-mat.mtrl-sci physics.chem-ph 版本更新 50%

Fine-Tuning a Universal Machine-Learned Interatomic Potential for Oxygen Plasma Interactions with WS$_2$

微调通用机器学习原子间势用于氧等离子体与WS$_2$的相互作用

Jaehong Kwon, David B. Graves

专题命中 指令微调 :foundation model(abstract)

AI总结 通过迭代微调预训练的通用机器学习原子间势(UMA模型),结合SOAP和FPS采样、DFT标注,实现了对氧等离子体与WS$_2$相互作用的准确模拟,能量和力MAE分别降至4.5×10^{-3}eV/原子和0.076eV/Å。

Comments 29 pages, 9 figures in the main text, 7 figures in appendix section, and 2 supplementary videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17576 2026-07-21 cs.CV 版本更新 50%

LoGSAM: Parameter-Efficient Cross-Modal Grounding for MRI Segmentation

LoGSAM: 用于MRI分割的参数高效跨模态接地

Mohammad Robaitul Islam Bhuiyan, Sheethal Bhat, Melika Qahqaie, Andreas Maier, Tri-Thien Nguyen, Paula Andrea Pérez-Toro, Tomás Arias-Vergara

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität, Erlangen, Germany(德国埃朗根-纽伦堡大学模式识别实验室) Siemens Healthineers, Erlangen, Germany(德国埃朗根西门子医疗)

专题命中 指令微调 :foundation model(abstract)

AI总结 LoGSAM通过将放射科医生的语音转录为文本提示,利用预训练基础模型实现MRI肿瘤的高效分割,采用LoRA微调提升领域适应性,达到80.32%的Dice分数。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 5 篇

2606.06547 2026-07-21 cs.LG cs.AI 版本更新 92%

FAIR-Calib: Frontier-Aware Instability-Reweighted Calibration for Post-Training Quantization of Diffusion Large Language Models

FAIR-Calib:面向扩散大语言模型训练后量化的前沿感知不稳定重加权校准

Haoyu Huang, Linlin Yang, Sheng Xu, Boyu Liu, Guodong Guo, Zhongqian Fu, Hang Zhou, Baochang Zhang

机构 * FAIR

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 针对扩散大语言模型训练后量化中前沿决策易翻转并永久锁定放大的问题,提出两阶段PTQ框架FAIR-Calib,通过前沿命中与掩码阶段可靠性估计位置先验,并利用重加权隐状态MSE校准优先保护脆弱前沿状态,理论证明其作为输出KL散度代理,实验显著优于基线。

Comments Accepted as a poster at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09796 2026-07-21 cs.LG 版本更新 89%

Metadata-Free Meta-Reweighted Direct Preference Optimization under Noisy Preference Labels

噪声偏好标签下无元数据的元重加权直接偏好优化

Hua Qu, Yifan Li, Xiaodong Yuan

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对DPO性能依赖偏好数据质量问题,提出双层优化框架、无任务元知识驱动方法及结合中心差分近似与LoRA微调的可扩展训练方案,经实验验证该方法能在不同噪声率下提升训练性能。

Comments 36 pages, including appendices. Revised version with updated theoretical analysis, supplementary material, figures and improved table formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02522 2026-07-21 cs.CL cs.LG 版本更新 79%

Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR

通过监督学习框架实现隐式Actor-Critic耦合的RLVR方法

Jiaming Li, Longze Chen, Ze Gong, Yukun Chen, Lu Wang, Wanwei He, Run Luo, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 PACS通过监督学习框架实现隐式Actor-Critic耦合,提升RLVR中奖励信号的稳定性与训练效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16051 2026-07-21 cs.CL cs.AI 版本更新 62%

Loop the Loopies!

循环循环者!

Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。

详情

展开后加载摘要…

URL PDF HTML 收藏