arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 26 篇

2605.05415 2026-05-08 cs.LG cs.AI cs.CR 91%

Information Theoretic Adversarial Training of Large Language Models

信息论视角下的大语言模型对抗训练

Yiwei Zhang, Jeremiah Birrell, Reza Ebrahimi, Rouzbeh Behnia, Jason Pacheco, Elisa Bertino

机构 * Purdue University(普渡大学) Texas State University(德克萨斯州立大学) University of South Florida(佛罗里达州立大学) University of Arizona(亚利桑那大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);preference optimization(abstract)

AI总结 本文提出WARDEN框架,通过信息论方法动态调整对抗示例权重,提升大语言模型的鲁棒性,减少攻击成功率且保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20051 2026-05-08 cs.CL cs.LG 91%

Bootstrapping Post-training Signals for Open-ended Tasks via Rubric-based Self-play on Pre-training Text

通过基于评分标准的自我博弈提升开放式任务的后训练信号

Chengyu Huang, Sheng-Yen Chou, Zhengxin Zhang, Claire Cardie

机构 * Department of Computer Science, Cornell University(康奈尔大学计算机科学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出POP框架,利用预训练语料生成评分标准,用于自我博弈训练LLM,提升其在医疗问答、创意写作等开放式任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06721 2026-05-08 cs.AI cs.CL cs.HC 89%

ProAgent: Harnessing On-Demand Sensory Contexts for Proactive LLM Agent Systems in the Wild

ProAgent:利用按需感官上下文实现野外的前瞻性LLM代理系统

Bufang Yang, Lilin Xu, Liekang Zeng, Yunqi Guo, Siyang Jiang, Wenrui Lu, Kaiwei Liu, Yixuan Li, Xiaofan Jiang, Guoliang Xing, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ProAgent通过整合低成本上下文线索与按需丰富感知,实现连续感知用户环境,利用上下文感知的前瞻性推理器推断用户需求,提升预测准确性与降低误检率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06036 2026-05-08 cs.LG cs.AI 88%

Optimal Transport for LLM Reward Modeling from Noisy Preference

基于噪声偏好的LLM奖励建模中的最优传输

Licheng Pan, Haochen Yang, Haoxuan Li, Yunsheng Lu, Yongqi Tong, Yinuo Wang, Shijian Wang, Zhixuan Chu, Lei Shen, Yuan Lu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 后训练与偏好优化 :LLM(title,title_cn);RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出SelectiveRM框架,利用最优传输对噪声偏好进行去噪,通过联合一致性差异对齐模型预测分布与偏好数据,并引入质量放松机制以排除矛盾样本,提升奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15395 2026-05-08 cs.CL cs.AI cs.HC 88%

Beyond Fixed Psychological Personas: State Beats Trait, but Language Models are State-Blind

超越固定心理人格:状态胜过特质,但语言模型是状态盲的

Tamunotonye Harry, Ivoline Ngong, Chima Nweke, Yuanyuan Feng, Joseph Near

机构 * University of Vermont(佛蒙特大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract,abstract_cn);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过Chameleon数据集发现语言模型对状态盲,而奖励模型对用户状态反应不一致,推动情感计算和个性化对话研究。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06111 2026-05-08 cs.SE cs.AI 86%

Schedule-and-Calibrate: Utility-Guided Multi-Task Reinforcement Learning for Code LLMs

调度与校准:面向代码LLM的实用导向多任务强化学习

Yujia Chen, Yang Ye, Xiao Chu, Yuchi Ma, Cuiyun Gao

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出ASTOR框架,通过任务实用性驱动的协调机制,提升多任务强化学习在代码LLM中的效果,实验显示其在多个编码任务中优于专用专家和基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21877 2026-05-08 cs.LG cs.AI 85%

P^2O: Joint Policy and Prompt Optimization

P²O:联合策略和提示优化

Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术协调中心)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出P²O方法,通过交替更新连续策略与离散提示,解决RLVR在难样本上的优势崩溃问题,提升模型泛化能力并提升性能9.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06070 2026-05-08 cs.CV 85%

Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models

竞技场作为离线奖励:用于扩散模型的高效细粒度偏好优化

Zhikai Li, Yue Zhao, Edward Zhongwei Zhang, Xuewen Liu, Jing Zhang, Qingyi Gu, Zhen Dong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn)

AI总结 本文提出ArenaPO,利用竞技场评分作为离线奖励,实现高效细粒度优化,无需奖励模型。通过构建能力分布模型,基于截断正态分布估计质量差距,提升扩散模型的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06049 2026-05-08 cs.CV 82%

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

融合你的方式:通过直接偏好优化对齐图像融合与异质需求

Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract)

AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06650 2026-05-08 cs.CL 81%

Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients

超越负回滚:仅正回滚的策略优化

Mingwei Xu, Hao Fang

机构 * University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出POPO框架,通过仅使用在线正回滚进行学习,避免负回滚,并通过siamese网络和相似性惩罚提升稳定性,实验证明其在数学基准测试中性能优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06078 2026-05-08 cs.CL cs.AI 81%

Milestone-Guided Policy Learning for Long-Horizon Language Agents

为长周期语言代理设计的里程碑引导策略学习

Zixuan Wang, Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BEACON框架,通过任务的组合结构实现精准信用分配,提升长周期语言代理的训练效果,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08539 2026-05-08 cs.LG cs.AI cs.IT math.IT math.OC stat.ML 79%

On the optimization dynamics of RLVR: Gradient gap and step size thresholds

关于RLVR优化动态:梯度间隙和步长阈值

Joe Suk, Yaqi Duan

机构 * New York University(纽约大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析RLVR训练过程,提出梯度间隙概念,揭示收敛依赖于更新方向与梯度间隙的对齐,并推导出步长阈值,解释了实践中长度归一化提升稳定性及固定学习率下成功率无法达到100%的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08403 2026-05-08 cs.AI 77%

Owen-Shapley Policy Optimization: A Principled RL Algorithm for Generative Search LLMs

Owen-Shapley策略优化:一种为生成搜索语言模型设计的原理性强化学习算法

Abhijnan Nath, Alireza Bagheri Garakani, Tianchen Zhou, Fan Yang, Yan Gao, Nikhil Krishnaswamy

机构 * Amazon Science(亚马逊科学) Situated Grounding and Natural Language (SIGNAL) Lab, Colorado State University(情境 grounding 和自然语言(SIGNAL)实验室,科罗拉多州立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出Owen-Shapley策略优化算法,通过基于令牌边际贡献的序列优势再分配,解决生成搜索语言模型中因稀疏序列奖励导致的信用分配问题,实验表明其在Amazon ESCI和H&M Fashion数据集上表现优异。

Comments Added additional experiments, computational analysis and further revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06642 2026-05-08 cs.CL cs.AI 73%

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction

StraTA: 通过战略轨迹抽象激励代理强化学习

Xiangyuan Xue, Yifan Zhou, Zidong Wang, Shengji Tang, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Georgia(佐治亚大学) University of Oxford(牛津大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出StraTA框架,通过引入显式的轨迹级策略提升代理强化学习的样本效率和最终性能,实验显示其在ALFWorld、WebShop和SciWorld上均优于基线模型。

Comments 26 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05965 2026-05-08 cs.LG cs.AI 73%

Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR

超越均匀信用分配:用于RLVR的选区资格痕迹

Chaoli Mou, Zhan Zhuang, Xinning Chen, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出选区资格痕迹(S-trace),通过稀疏资格痕迹机制减少方差,实现细粒度信用分配,实验显示其在Qwen3系列模型上表现优于GRPO,且具备更高的样本和令牌效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20670 2026-05-08 cs.CL cs.AI 73%

CAMEL: Confidence-Gated Reflection for Reward Modeling

CAMEL:基于置信度的反思机制用于奖励建模

Zirui Zhu, Hailun Xu, Yang Luo, Yong Liu, Kanchan Sarkar, Kun Xu, Yang You

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CAMEL通过置信度门控机制实现轻量级偏好决策,并选择性地对低置信度实例进行反思,采用反事实前缀增强的强化学习训练,提升了奖励建模的准确性和效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01203 2026-05-08 cs.AI cs.CL 73%

GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models

GR-Ben:一种通用推理基准,用于评估过程奖励模型

Zhouhao Sun, Xuan Zhang, Xiao Ding, Bibo Cai, Li Du, Kai Xiong, Xinran Dai, Fei Zhang, weidi tang, Zhiyuan Kan, Yang Zhao, Bing Qin, Ting Liu

机构 * Research Center for Social Computing(社会计算研究中心) Interactive Robotics, Harbin Institute of Technology, China(交互机器人学,哈尔滨工业大学,中国) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GR-Ben旨在评估过程奖励模型在科学和逻辑两大领域及九个子领域的误差检测能力,揭示现有模型在非数学领域和计算错误检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06200 2026-05-08 cs.CL 70%

A$^2$TGPO: Agentic Turn-Group Policy Optimization with Adaptive Turn-level Clipping

A$^2$TGPO: 基于自适应回合裁剪的代理回合策略优化

Dingwei Chen, Zefang Zong, Zhipeng Ma, Leo Luo, Yang Li, Chengming Li, Peng Chen, Jie Jiang

机构 * Tencent Inc(腾讯公司) The Chinese University of Hong Kong(香港中文大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出A$^2$TGPO,通过自适应回合裁剪和改进的归一化与累积方法,解决强化学习中代理大语言模型的回合级信用分配问题,提升多轮交互中单个工具调用的评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05781 2026-05-08 cs.CV cs.AI 70%

Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

通过理解监督引导统一多模态模型的视觉生成

Zeyu Liu, Zanlin Ni, Yang Yue, Cheng Da, Huan Yang, Di Zhang, Kun Gai, Gao Huang

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手技术团队)

专题命中 后训练与偏好优化 :post-training(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出UNO框架,通过将理解作为监督信号引导生成,提升多模态模型在图像生成与编辑中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05742 2026-05-08 cs.LG 70%

Weak-to-Strong Generalization is Nearly Inevitable (in Linear Models)

弱到强的泛化几乎是不可避免的(在线性模型中)

Scott Geng, Dutch Hansen, Jerry Li

机构 * University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 研究显示在线性逻辑回归中,在轻微的数据分布假设下,弱到强泛化现象几乎不可避免,挑战了传统理论中关于模型容量不匹配是关键机制的观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19417 2026-05-08 cs.HC 67%

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

MER 2026:从判别性情感识别到生成性情感理解

Zheng Lian, Xiaojiang Peng, Kele Xu, Ziyu Jia, Xinyi Che, Zebang Cheng, Fei Ma, Laizhong Cui, Yazhou Zhang, Xin Liu, Liang Yang, Jia Li, Fan Zhang, Liumeng Xue, Erik Cambria, Guoying Zhao, Bjorn W. Schuller, Jianhua Tao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 MER2026延续系列挑战趋势,包含四个赛道,聚焦双人交互、细粒度识别、偏好预测和生理信号情感识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00699 2026-05-08 cs.CR 67%

STARE: Step-wise Temporal Alignment and Red-teaming Engine for Multi-modal Toxicity Attack

STARE:分步时间对齐与红队引擎用于多模态毒性攻击

Xutao Mao, Liangjie Zhao, Tao Liu, Xiang Zheng, Hongying Zan, Cong Wang

专题命中 后训练与偏好优化 :language model(abstract,abstract_cn)

AI总结 STARE通过分步时间对齐和红队引擎,提升多模态毒性攻击的成功率,揭示优化诱导的相位对齐现象,为安全机制提供理论基础。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15646 2026-05-08 cs.LG cs.AI cs.CL 67%

Alternating Reinforcement Learning with Contextual Rubric Rewards: Beyond the Scalarization Strategy

基于情境评分奖励的交替强化学习:超越标量化策略

Guangchen Lan, Lian Xiong, Xin Zhou, Hejie Cui, Yuwei Zhang, Mao Li, Zhenyu Shi, Besnik Fetahu, Lihong Li, Xian Li

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ARL-RR框架,通过逐个优化语义评分元类别,避免固定标量化,提升模型性能与训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05802 2026-05-08 cs.LG 57%

Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL

选择性回放:多样本代理强化学习中的中程轨迹终止

Zhiyuan Zhai, Xin Wang

机构 * Fudan University(复旦大学)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 本文提出一种中程轨迹终止方法,通过在轨迹中途检测行动序列的编辑距离来提前停止无方差组,从而减少计算开销并提升测试任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20825 2026-05-08 cs.CL 57%

Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation

强化信息量优化用于长文本检索增强生成

Yuhao Wang, Ruiyang Ren, Yucheng Wang, Wayne Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学公安学院人工智能学院) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.CL

AI总结 本文提出RioRAG框架,通过 nugget-centric 验证实现可验证的信息量优化,提升长文本检索增强生成的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07069 2026-05-08 cs.RO cs.SY eess.SY 50%

Optimal Gait Control for a Tendon-driven Soft Quadruped Robot by Model-based Reinforcement Learning

基于模型强化学习的腱驱动软四足机器人类最优步态控制

Xuezhi Niu, Kaige Tan, Lei Feng

机构 * Department of Engineering Design, KTH Royal Institute of Technology, Stockholm 10044, Sweden(工程设计系,皇家理工学院,斯德哥尔摩)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出一种基于模型强化学习的软四足机器人最优步态控制方法,通过多阶段方法提升步态控制器性能,实现快速稳定运动。

详情

展开后加载摘要…

URL PDF HTML 收藏