arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-09 至 2026-07-09 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 12 篇

2607.07693 2026-07-09 cs.LG cs.AI cs.CV 新提交 84%

Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF

用于样本高效扩散强化学习从人类反馈中学习的选择性时间步加权和基于优势的重放

Eric Zhu, Abhinav Shrivastava, Soumik Mukhopadhyay

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI、cs.LG

AI总结 研究如何提高扩散模型中强化学习从人类反馈的效率,提出选择性时间步加权和基于优势的重放两种互补策略,通过强调信息丰富的时间步和轨迹优化,提升反馈效率,样本效率比基线提高6倍。

Comments 19 pages, 18 figures, 4 tables. Submission under review. A shorter, non-archival 4-page abstract version of this work was accepted to CVPR 2026 Workshops (GCV, CVEU)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07646 2026-07-09 cs.AI cs.CL 新提交 84%

RL Post-Training Builds Compositional Reasoning Strategies

强化学习后训练构建组合推理策略

Azwar Abdulsalam, Nishil Patel, Andrew Saxe

专题命中 后训练与偏好优化 :post-training(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究强化学习后训练能否组合原始技能成高级策略,通过在可观察环境实验发现,强化学习能解决预训练模型难题,通过分阶段组合机制重组能力,组合过程可复用巩固,与拒绝微调关键差异在选择性,预训练消融表明其对组合策略出现有影响。

Comments 8 pages, 6 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01043 2026-07-09 cs.SE 版本更新 83%

DPO-F+: Aligning Code Repair Feedback with Developers' Preferences

DPO-F+:使代码修复反馈与开发者偏好对齐

Zihan Fang, Yifan Zhang, Yueke Zhang, Kevin Leach, Yu Huang

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究针对大语言模型在代码修复中开发者难解读输出的问题,提出DPO-f+框架,通过定义指标、构建数据集、微调模型及评估反馈质量,提升反馈准确性与对齐度,增强了代码理解和人机协作。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07178 2026-07-09 cs.LG cs.AI 新提交 82%

Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning

多任务智能强化学习的熵步长策略优化

Zetian Hu, Shunyu Liu, Junjie Zhang, Yongcheng Jing, Ting-En Lin, Yongbin Li, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science, Nanyang Technological University(生成式人工智能实验室,南洋理工大学计算与数据科学学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究多任务智能强化学习中任务间探索-利用步长不匹配问题,提出熵步长策略优化(EPPO),核心是任务级动态裁剪机制,实验证明EPPO在多任务智能基准上结果优于同类方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07508 2026-07-09 cs.LG cs.AI 新提交 79%

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

用于智能强化学习的单步异步优化

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02712 2026-07-09 cs.LG cs.CL 版本更新 79%

Towards Understanding Steering Strength

理解引导强度

Magamed Taimeskhanov, Samuel Vaiter, Damien Garreau

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练后控制中引导强度问题,提出对其首次理论分析,刻画其对相关量的影响并推导规律,揭示非单调效应,还通过11个语言模型实验验证了理论预测。

Comments Accepted for publication at ICML 2026 (50 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21476 2026-07-09 cs.CL 版本更新 77%

Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs

思维种子:在语言模型中利用历史多样性进行位置感知强化学习

Lei Yang, Wei Bi, Chenxi Sun, Renren Jin, Deyi Xiong

机构 * TJUNLP Lab, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院 TJUNLP 实验室)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究语言模型在线强化学习问题,提出思维种子这一令牌级混合策略框架,利用模型历史检查点作离线前缀,通过令牌级重要性比率有效利用历史多样性,实验表明其性能优于标准在线训练和现有离线扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07554 2026-07-09 quant-ph 新提交 75%

RubriQ: Rubric-Guided Group Relative Policy Optimization for Constraint-Aware Quantum Circuit Synthesis

RubriQ:用于约束感知量子电路合成的基于规则的组相对策略优化

Ziqing Guo, Ziwen Pan

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对量子电路合成瓶颈,RubriQ框架将其作为大语言模型代码生成任务,用组相对策略优化,以程序化规则为奖励函数,集成CUDA-Q模拟,在基准任务和量子处理器上表现出色,建立高性能计算驱动管道大规模生成容错电路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23190 2026-07-09 eess.AS cs.SD 新提交 75%

FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech

FlowTTS-GRPO:基于流匹配的文本转语音的多目标奖励优化的在线强化学习

Haoxu Wang, Biao Tian, Weiqin Li, Xiang Lv, Han Zhao, Xiangang Li

机构 * Tongyi Lab, Alibaba Group, China(通义实验室,阿里巴巴集团,中国)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出FlowTTS-GRPO在线强化学习框架,通过将ODE轨迹转换为SDE路径,直接微调流匹配模型,并采用加权奖励组合、省略无分类器引导等优化,在CosyVoice 3.0和F5-TTS上提升了说话人相似度和感知质量。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06987 2026-07-09 cs.LG 新提交 70%

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

UP:用于打破探索-稳定性困境的无界正不对称优化

Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

机构 * ByteDance Seed(字节跳动种子) Michigan State University(密歇根州立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06609 2026-07-09 cs.LG cs.AI 新提交 62%

D2PO: Optimizing Diffusion Samplers via Dynamic Preference

D2PO:通过动态偏好优化扩散采样器

Jinkyu Kim, Jinyoung Choi, Bohyung Han

机构 * Seoul National University(首尔国立大学) Ulsan National Institute of Science and Technology(蔚山国立科学技术院)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究针对现有框架局限,提出D2PO框架优化扩散采样策略。核心方法是将其转化为基于偏好的对齐问题,利用DPO框架并建模为能量模型,引入新能量公式和动态偏好。主要贡献是使采样器与感知质量更忠实对齐,性能优于传统调度器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23615 2026-07-09 cs.CV 版本更新 50%

HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework

无需标注的高分辨率大多模态模型视觉推理技术

Jiacheng Yang, Anqi Chen, Yunkai Dang, Qi Fan, Cong Wang, Wenbin Li, Feng Miao, Yang Gao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Institute of Brain-inspired Intelligence(脑启发式智能研究院) Shenzhen Research Institute of Nanjing University(南京大学深圳研究院)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 HART通过闭环框架和AP-GRPO方法,实现无需外部标注的高分辨率视觉推理,提升多模态模型在高分辨率任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏