arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2608.02139 2026-08-05 cs.CL cs.AI cs.LG 版本更新 90%

Self-Improving Large Language Models via Progressive Experience Evolution

基于渐进式经验演化的自我改进大语言模型

Shijie Ren, Xiting Wang, Meng Li, Yujie Guo, Yunhang Yao, Ziheng Peng, Xunlong Wang, Yuetan Chen, Haoyang Zhou, Yunlong Liang, Fandong Meng

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出统一后训练框架SPEE,通过显式经验演化与隐式策略优化结合,在五种数学推理基准上提升了大语言模型的自我改进能力,优于现有基线方法。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03952 2026-08-05 cs.AI 新提交 89%

TACT: Taxonomy-Aligned Post-Training for Pedagogically Adaptive English Tutoring

TACT:面向教学自适应英语辅导的分类对齐后训练

Dongjie Yang, Siyan Lin, Leixian Shen, Rui Sheng, Huamin Qu, Zixin Chen

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出基于人类研究的TACT框架,构建含双分类体系的数据集后,通过特定训练得到TACTutor,在自研基准及盲法研究中表现优于基线,为自适应ESL辅导器开发提供开放基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02951 2026-08-05 cs.LG cs.AI 新提交 87%

SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling

SP3O:无需奖励建模的分段偏好强化学习

Evan Assmus, Qining Zhang, Lei Ying

机构 * University of Michigan(密歇根大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25077 2026-08-05 cs.AI 版本更新 84%

Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

在弱到强对齐中评估风险:从偏差-方差视角出发

Hamid Osooli, Kareema Batool, Rick Gentry, Tiasa Singha Roy, Ashwin Gupta, Anirudha Ramesh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) InstaDeep New York University(纽约大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03204 2026-08-05 cs.CL cs.AI 新提交 84%

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

Tianbao Jiang, Weicong Ni, Gerard de Melo, Linlin Wang

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对现有视觉语言模型测试时对齐方法资源密集、训练与推理分布不匹配的问题,提出轨迹引导结构化采样的测试时对齐方法,在多模态推理数据集上提升准确率且推理开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21273 2026-08-05 cs.LG 版本更新 79%

The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works

奖励通道中的暗室:密集预测奖励使GRPO训练的大语言模型智能体崩溃——以及实际有效的方法

Yu Wang

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.LG

AI总结 研究发现密集预测奖励在GRPO训练下会使大语言模型智能体崩溃,通过单因素消融定位原因,提出方差分布标准,还通过受控信号传递矩阵对比奖励通道和辅助损失通道,表明奖励通道至多中性,辅助损失通道有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26457 2026-08-05 cs.LG 版本更新 77%

DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning

DHRCL:使用密集分层奖励与课程学习训练代码大语言模型

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 该研究提出DHRCL框架,通过分层奖励与自动阶段课程学习训练代码大语言模型,经多模型规模实验验证其优势稳定,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03119 2026-08-05 cs.AI 新提交 70%

Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR

请勿偷看答案:用于无标签RLVR的结果掩码组相对策略优化

Yongshi Ye, Liang Zhang, Yidong Chen, Xiaodong Shi, Biao Fu

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对无标签RLVR中模型易强化答案标记的问题,提出OM-GRPO框架,解耦奖励估计与策略优化,结合对比增强奖励,在多推理基准及测试时训练场景中性能优于现有方法。

Comments 25 pages, 16 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00482 2026-08-05 cs.CL 版本更新 57%

Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking

知止:用于减少过度思考的片段级信用分配

Chia-Hsuan Lee, Sihui Dai, Mingyang Zhou, Isha Slavin, Hsuan Su, Shi-Xiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 提出DASH方法,通过将推理轨迹中的最终答案候选与真实值比较,实现片段级信用分配,减少推理语言模型过度思考行为,在AIME25上准确率达50.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏