arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 257 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 257 篇

2510.24636 2026-07-02 cs.CL 版本更新 81%

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

OpenReward: 通过强化学习学习奖励长形式智能体任务

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

机构 * Leiden University(莱顿大学) Shandong University(山东大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01682 2026-07-01 cs.CL 版本更新 81%

The Bidirectional Process Reward Model

双向过程奖励模型

Lingyin Zhang, Jun Gao, Xiaoxue Ren, Ziqiang Cao

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Biomedical Basic Research Center of Jiangsu, Soochow University(苏州大学江苏省生物医学基础研究中心) School of Software Technology, Zhejiang University(浙江大学软件学院) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出双向过程奖励模型(BiPRM),通过并行左右评估流和门控机制融合分数,仅增加0.3%参数和5%延迟,在推理质量上平均提升10.6%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13154 2026-06-23 cs.CL 版本更新 81%

The Alignment Veto: How Safety Training Suppresses Cultural Knowledge in LLMs

对齐否决:安全训练如何压制LLM中的文化知识

Pardis Sadat Zahraei, Gokhan Tur, Dilek Hakkani-Tür, Ehsaneddin Asgari

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)

专题命中 后训练与偏好优化 :LLM(title_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究对齐训练与语言模型编码的文化价值观冲突时的内部机制,发现模型内部logit分布仍反映人类调查数据,但输出被压制,称为“对齐否决”,并区分了压制失败与表征偏差失败,揭示了安全税在国家间的不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06957 2026-08-13 stat.ML cs.AI cs.LG 版本更新 81%

Post-Training with Policy Gradients: Optimality and the Base Model Barrier

训练后使用策略梯度:最优性和基础模型障碍

Alireza Mousavi-Hosseini, Murat A. Erdogdu

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了训练后使用策略梯度方法在序列预测中的最优性和基础模型限制,提出通过过程奖励模型克服支持范围障碍,并展示了自适应学习率的SGD和PG在统计学习和在线学习中的有效性。

Comments 39 pages, 2 figures. Published at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05659 2026-07-07 cs.CV cs.AI cs.LG 版本更新 81%

When Rubrics Fail: Error Enumeration as Reward in Reference-Free RL Post-Training for Virtual Try-On

当评分标准失效时:在无参考RL后训练中通过错误枚举作为奖励

Wisdom Ikezogwo, Mehmet Saygin Seyfioglu, Ranjay Krishna, Karim Bouyarmane

机构 * University of Washington, Seattle, USA(华盛顿大学(西雅图)) Amazon, Seattle, USA(亚马逊(西雅图)) Allen Institute for AI(艾伦人工智能研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出隐式错误计数方法,用于解决无参考答案的RL后训练问题,通过计算错误而非正确来生成可靠奖励,在虚拟试穿任务中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02451 2026-06-23 cs.LG cs.AI 版本更新 81%

Active Causal Experimentalist (ACE): Learning Intervention Strategies via Direct Preference Optimization

主动因果实验者 (ACE): 通过直接偏好优化学习干预策略

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学波德分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ACE框架,将实验设计建模为顺序策略,利用直接偏好优化从干预对比较中学习,在合成、物理和经济数据上以等干预预算取得70-71%的提升,并自主发现碰撞机制需集中干预父变量的理论策略。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 81%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10968 2026-06-11 cs.LG cs.AI 版本更新 81%

Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning

超越大语言模型强化学习中的统一令牌级信任区域

Renjie Mao, Xiangxin Zhou, Lvfang Tao, Yixin Ding, Yu Shi, Yongguang Lin, Yuheng Wu, Honglin Zhu, Qian Qiu, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 针对PPO风格信任区域在自回归生成中的位置无关问题,提出CPPO方法,通过位置加权阈值和累积前缀预算动态调整令牌级约束,提升训练稳定性和推理准确性。

Comments Project Page: https://hunyuan-cppo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20978 2026-06-09 eess.AS cs.AI cs.LG 版本更新 81%

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model

GenTSE: 通过粗到细的生成语言模型增强目标说话人提取

Haoyang Li, Xuyi Zhuang, Azmat Adnan, Ye Ni, Wei Rao, Shreyas Gopal, Eng Siong Chng, Boon Siew Han, Yuanjin Zheng

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Southeast University, China(东南大学,中国) Schaeffler Hub for Advanced REsearch (SHARE) at Nanyang Technological University, Singapore(南洋理工大学Schaeffler先进研究 hub(SHARE),新加坡)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出GenTSE,一种两阶段解码器仅生成语言模型,先预测粗语义标记再生成细声学标记,结合冻结语言模型条件训练和直接偏好优化,在Libri2Mix上超越先前基于语言模型的系统。

Comments Accepted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17461 2026-07-01 cs.CV 版本更新 80%

AR-CoPO: Align Autoregressive Video Generation with Contrastive Policy Optimization

AR-CoPO: 利用对比策略优化对齐自回归视频生成

Dailan He, Guanlin Feng, Xingtong Ge, Yi Zhang, Bingqi Ma, Guanglu Song, Yu Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多媒体实验室) Vivix Group Limited(Vivix集团有限公司) HKUST(香港科技大学) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(InnoHK下的CPII)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract)

AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07855 2026-06-23 cs.LG cs.AI cs.CL 版本更新 80%

DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)

DPO 解绑:你的训练算法在人类选择理论中实际上是解耦的(且其损失函数的凸性并非必需)

Wenxuan Zhou, Shujian Zhang, Brice Magdalou, John Lambert, Ehsan Amid, Richard Nock, Andrew Hard

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Work done while at Google DeepMind(在谷歌深Mind的工作) CEE-M, Univ Montpellier, CNRS, INRAE, Institut Agro(CEE-M,蒙彼利埃大学,CNRS,INRAE,农业研究所)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示了DPO与人类选择理论的深层联系,证明其损失函数凸性并非必需,并扩展了非凸损失、任意人类选择模型嵌入等新特性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21273 2026-08-05 cs.LG 版本更新 79%

The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and The Channel, Not the Content, Decides What Works

奖励通道中的暗室:密集预测奖励使GRPO训练的大语言模型智能体崩溃——以及实际有效的方法

Yu Wang

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.LG

AI总结 研究发现密集预测奖励在GRPO训练下会使大语言模型智能体崩溃,通过单因素消融定位原因,提出方差分布标准,还通过受控信号传递矩阵对比奖励通道和辅助损失通道,表明奖励通道至多中性,辅助损失通道有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18046 2026-07-31 cs.CV cs.AI 版本更新 79%

Enhancing Scene Transition Awareness in Video Generation via Post-Training

通过后训练增强视频生成中的场景转换意识

Hanwen Shen, Jiajie Lu, Yupeng Cao, Xiaonan Yang

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出TAV数据集,通过后训练提升视频生成中场景转换的理解能力,改善多场景生成效果并保持图像质量。

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (2025) 706-721

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12691 2026-06-23 cs.RO cs.AI 版本更新 79%

ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training

ALOE: 面向视觉-语言-动作模型后训练的动作级离策略评估

Rushuai Yang, Hecheng Wang, Zhichao Wu, Chiming Liu, Xiaohan Yan, Xuan Du, Shuoyu Yue, Chuheng Zhang, Yunlong Wang, Yongcheng Liu, Lizhe Qi, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Nanjing University(南京大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 提出ALOE框架,通过离策略评估直接估计当前策略的价值,结合分块时序差分和保守值聚合,改善稀疏奖励下的信用分配,在四项真实世界操作任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11702 2026-06-10 cs.LG stat.ML 版本更新 79%

Post-Training Augmentation Invariance

训练后增强不变性

Keenan Eikenberry, Lizuo Liu, Yoonsang Lee

机构 * Department of Mathematics, Dartmouth College(达特茅斯学院数学系)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 提出训练后增强不变性框架,通过轻量级MLP适配器网络在预训练模型潜空间上实现近似不变性,无需微调且保持原始特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15740 2026-08-17 cs.CV cs.AI cs.LG cs.MM 版本更新 79%

Debiasing Text-to-Image Evaluation via Implicit Cultural Alignment Reward Modeling

通过隐式文化对齐奖励建模消除文本到图像评估中的偏差

Bo-An Chang, Yu-Chih Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。

Comments 16 pages, 2 figures, ECCV 2026 Workshop FAILED

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05466 2026-08-14 cs.AI cs.LG 版本更新 79%

Recursive Synthesis for Long-Horizon Terminal Tasks

长视界终端任务的递归合成

Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) University of Georgia(佐治亚大学) University of Maryland, College Park(马里兰大学帕克分校) University of Pennsylvania(宾夕法尼亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07343 2026-07-31 cs.CL cs.LG 版本更新 79%

Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

个性化奖励基准:评估与人类对齐的个性化

Qiyao Ma, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出个性化奖励基准,用于评估奖励模型对个性化偏好的建模能力,发现现有模型在个性化任务中表现不佳,且该基准在下游任务中具有更高的预测相关性。

Comments Accepted to COLM 2026. Dataset: https://huggingface.co/datasets/QiyaoMa/Personalized-RewardBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07884 2026-07-29 cs.CL cs.AI 版本更新 79%

Contrastive Weak-to-strong Generalization

对比性弱到强泛化

Houcheng Jiang, Junfeng Fang, Jiaxin Wu, Tianyu Zhang, Chen Gao, Xiang Wang, Xiangnan He, Yang Deng

机构 * ustc(中国科学技术大学) nus(新加坡国立大学) zgc(中关村学院) smu(新加坡管理学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对弱到强泛化中弱模型输出噪声和偏差问题,利用隐式奖励与对比解码的联系,提出ConG框架,通过对比解码生成高质量样本,实现可靠能力转移等,经实证验证其有效性和通用性,推动了弱到强泛化及通向通用人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02522 2026-07-21 cs.CL cs.LG 版本更新 79%

Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR

通过监督学习框架实现隐式Actor-Critic耦合的RLVR方法

Jiaming Li, Longze Chen, Ze Gong, Yukun Chen, Lu Wang, Wanwei He, Run Luo, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 PACS通过监督学习框架实现隐式Actor-Critic耦合,提升RLVR中奖励信号的稳定性与训练效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13162 2026-07-20 cs.CL cs.AI 版本更新 79%

What Models Express, Suppress, and Resist: Auditing Open-Weight LLMs with Persona Vectors

模型表达、抑制和抗拒的内容:使用角色向量审计开放权重语言模型

Winston Zeng, Ali Emami, Jinho D. Choi

机构 * Emory University(埃默里大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究通过大规模系统应用角色向量审计开放权重语言模型,编制特征清单并标记其性质,发现模型默认行为特点,引导在默认外特征效果好,且角色向量可探测行为组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00319 2026-07-20 cs.AI cs.LG 版本更新 79%

RL-Struct: A Lightweight Reinforcement Learning Framework for Reliable Structured Output in LLMs

RL-Struct:用于大语言模型中可靠结构化输出的轻量级强化学习框架

Ruike Hu, Shulei Wu

机构 * School of Information Science and Technology(信息科学与技术学院) Hainan Normal University(海南师范大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型输出与结构化需求的差距问题,提出RL-Struct轻量级框架,运用GRPO及分层奖励函数,消除评论家网络,减少显存。在复杂JSON任务中表现出色,实现高准确率和有效性,还呈现新兴课程学习过程,模型可公开获取。

Comments Withdrawn by the authors due to substantial errors in the references, terminology, and experimental reporting, which affect the reliability and reproducibility of the manuscript. The authors are conducting a comprehensive re-evaluation and do not consider the current version suitable for citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02712 2026-07-09 cs.LG cs.CL 版本更新 79%

Towards Understanding Steering Strength

理解引导强度

Magamed Taimeskhanov, Samuel Vaiter, Damien Garreau

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练后控制中引导强度问题,提出对其首次理论分析,刻画其对相关量的影响并推导规律,揭示非单调效应,还通过11个语言模型实验验证了理论预测。

Comments Accepted for publication at ICML 2026 (50 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02427 2026-06-16 cs.AI cs.LG 版本更新 79%

The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling

模型知晓,解码器发现:未来价值引导的粒子力量采样

Tu Nguyen, Matthieu Zimmer, Rasul Tutunov, Xiaotong Ji, Haitham Bou Ammar

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Huawei Noah’s Ark Lab(华为诺亚实验室) UCL Centre for Artificial Intelligence(伦敦大学学院人工智能中心)

专题命中 后训练与偏好优化 :LLM(summary_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APPS算法,通过块状粒子方法高效定位LLM的多步解,提升推理准确率与运行效率,减少对训练数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12784 2026-08-04 cs.DC 版本更新 78%

StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training

通过受滞约束的回放协调实现高效的异步RL后训练

Haoyang Li, Sheng Lin, Fangcheng Fu, Yuming Zhou, Xiaodong Ji, Yanfeng Zhao, Lefeng Wang, Jie Jiang, Bin Cui

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 StaleFlow通过受滞约束的回放协调,解决RL后训练中数据滞留与偏斜问题,提升系统吞吐量。

Comments SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 78%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23426 2026-07-03 cs.CV 版本更新 78%

Direct Diffusion Score Preference Optimization via Stepwise Contrastive Policy-Pair Supervision

直接扩散分数偏好优化:通过逐步对比策略对监督

Dohyun Kim, Seungwoo Lyu, Seung Wook Kim, Paul Hongsuck Seo

机构 * Dept. of CSE, Korea University(韩国大学计算机科学与工程系) NVIDIA

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 提出DDSPO方法,通过对比策略对直接监督反向去噪步骤,无需奖励建模或人工标注,在文本-图像对齐和美学质量任务上优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-17 cs.AI 版本更新 77%

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09887 2026-08-12 cs.CL 版本更新 77%

Overconfident and Blind to Details: Fixing Prompt Insensitivity with Abductive Preference Learning

过度自信且忽视细节:通过归纳偏好学习修复提示不敏感

Yijin Ni, Simon Yu, Peng Qi

机构 * Georgia Institute of Technology(佐治亚理工学院) Northeastern University(东北大学) Uniphore(Uniphore公司)

专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出归纳偏好学习方法,通过优化归纳策略提升模型对罕见提示的敏感度,显著提高在VLMBias和Inverse-IFEval基准测试中的性能。

Comments 26 pages, 15 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26457 2026-08-05 cs.LG 版本更新 77%

DHRCL:Training Code LLMs with Dense Hierarchical Rewards and Curriculum Learning

DHRCL:使用密集分层奖励与课程学习训练代码大语言模型

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 该研究提出DHRCL框架,通过分层奖励与自动阶段课程学习训练代码大语言模型,经多模型规模实验验证其优势稳定,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏