arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-20 至 2026-08-20 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 12 篇

2608.19072 2026-08-20 cs.AI cs.CL cs.LG 新提交 91%

What is Missing from AI Post-Training AI: An Empirical Analysis

AI后训练AI缺失了什么?一项实证分析

Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Renmin University of China(中国人民大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证分析发现,LLM智能体后训练时存在策略锁定问题,其缺失的是执行过程中自发重新评估训练策略的机制,而非经验、指导或推理计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01499 2026-08-20 cs.LG 版本更新 91%

Matching Accuracy, Different Geometry: Evolution Strategies vs GRPO in LLM Post-Training

匹配精度,不同几何:进化策略与GRPO在LLM后训练中的比较

William Hoy, Binxu Wang, Xu Pan

机构 * University of Miami(迈阿密大学) Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Harvard University(哈佛大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(title);分类 cs.LG;language model(comments)

AI总结 本文比较了进化策略(ES)与组相对策略优化(GRPO)在单任务和连续学习设置中的表现,发现ES在单任务精度上可与GRPO匹配,但两者在参数空间更新上存在显著差异,且ES在弱信息方向上能积累较大偏移,同时保持任务性能。

Comments Accepted to Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19893 2026-08-20 cs.CL 版本更新 85%

Future Policy Approximation for Offline Reinforcement Learning in LLM Reasoning

为离线强化学习未来政策近似改进数学推理

Minjae Oh, Yunho Choi, Dongmin Choi, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出未来政策近似方法,通过估计未来策略来优化离线强化学习中的梯度更新,提升长周期推理任务的稳定性与准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18531 2026-08-20 cs.AI cs.LG 新提交 82%

Pairwise Ranking Outperforms Single-Action RL for Offline Explanation Selection: A Practical Lesson

离线解释选择中, pairwise 排序优于单动作强化学习:一个实践经验

Tanay Chowdhury, Saeideh Shahrokh Esfahani

机构 * Amazon(亚马逊公司)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对工业可解释推荐系统的高成本问题,提出将 LLM 解释生成与选择分离的方案,发现 pairwise 排序方法在离线解释选择中优于单动作强化学习,且构建成本低、延迟小。

Comments This is an extended version of a 3-page paper accepted to the RecSys 2026 Research and Practice Notes track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16804 2026-08-20 cs.LG cs.AI 版本更新 81%

AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems

AutoOR: 一种可扩展的后训练语言模型用于自动形式化运筹学问题

Sumeet Ramesh Motwani, Chuan Du, Aleksander Petrov, Christopher Davis, Philip Torr, Antonio Papania-Davis, Weishi Yan

机构 * The Moonshot Factory(谷歌登月工厂) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 AutoOR通过合成数据生成与强化学习管道,训练语言模型自动形式化运筹学问题,实现线性、混合整数和非线性优化问题的高效解决,取得六个经典运筹学基准测试的领先或竞争性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19182 2026-08-20 cs.RO cs.AI 新提交 79%

ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning

ADEPT:通过强化学习利用预训练和后训练提升灵巧性

Jayjun Lee, Jessica Yin, Asif Rana, Nicholas Blauch, Sam Mady, Mohak Bhardwaj, Nima Fazeli, Nathan Ratliff, Karl Van Wyk, Ankur Handa

机构 * NVIDIA Corporation(英伟达公司) University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 该研究提出ADEPT强化学习框架,通过预训练和后训练实现高自由度机器人的可仿真到现实迁移的灵巧性,在两款机器人本体上完成长程任务,达到人类水平灵巧速度。

Comments Project page: this https URL (https://adept-dexterity.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18093 2026-08-20 cs.CL cs.AI cs.CR 新提交 79%

Abliteration Mitigation via Refusal Aliases

通过拒绝别名缓解删除(Abliteration)攻击

Nathan Truong

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的删除(Abliteration)攻击,提出AMRA权重编辑防御方法,在Llama-3-8B和Gemma-2-9B上有效提升删除后的拒绝能力,同时控制了性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18881 2026-08-20 cs.CV 新提交 75%

Falcon Perception-HD: High Density Perception via Reinforcement Learning

Falcon Perception-HD:基于强化学习的高密度感知

Sofian Chaybouti, Yasser Dahou, Ngoc Dung Huynh, Reda Alami, Hilde Kuehne

机构 * Tübingen AI Center(蒂宾根人工智能中心) University of Tübingen(蒂宾根大学) MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室) Technology Innovation Institute(技术创新研究院)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 该研究针对开放词汇自回归感知模型的目标错位问题,基于Falcon Perception设计RL框架,采用GRPO优化,在指代表达分割任务上提升了极密集场景性能,减少冗余需求并保留物体存在性知识。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18931 2026-08-20 cs.CL cs.AI 新提交 62%

Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck

野外测试时缩放:为何利用而非探索是瓶颈

Davide Romano, Kanak Raj, Jerrod Parker, Daniele Giofrè

机构 * Thomson Reuters(汤姆森路透)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过首个计算归一化对比发现,测试时缩放(TTS)中从候选池选择的利用环节是瓶颈,跨候选合成(Fusion)仅恢复约40%可用质量,探索缩放有效但利用失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18351 2026-08-20 cs.CR cs.AI cs.LG eess.SY 新提交 62%

Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents

面向可执行终端与MCP智能体的任务条件最小权限学习

Alexander Tu, Michael Tu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出任务条件最小权限学习框架,通过后训练优化4B参数模型的权限选择,使智能体超额权限错误率大幅降低,安全成功率显著提升,可作为工具使用智能体的额外控制层。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18237 2026-08-20 stat.ML cs.LG math.OC 新提交 57%

Sobolev Regularized Score Difference Estimation in Diffusion Models

扩散模型中的Sobolev正则化得分差估计

Chenghan Xie, Jose Blanchet, Renyuan Xu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 本文针对扩散模型得分差估计存在的统计一致性或可扩展性问题,提出Sobolev正则化的一致可扩展估计器,在小样本场景稳定性提升,真实任务性能优于非正则化方法。

Comments Accpeted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18607 2026-08-20 cs.CV 新提交 50%

VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

VA-Judger:用于联合视频-音频生成的人类偏好反馈奖励建模

Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

机构 * Shanghai Innovation Institution(上海创新研究院) Fudan University(复旦大学) Yinwang Intelligent Technology Co., Ltd(音网智能科技有限公司)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本研究针对联合视频-音频生成的奖励信号问题,构建了VAPref-10K数据集与VA-Judger-Bench基准,提出思维链全奖励模型VA-Judger,其在预测人类偏好及提升生成质量上均优于基线方法。

Comments 19 pages, 7 figures, 8 tables. Code: this https URL (https://github.com/ShareLab-SII/VA-Judger)

详情

展开后加载摘要…

URL PDF HTML 收藏