arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 32 篇

2509.04784 2026-03-03 cs.CL cs.AI 92%

Post-training Large Language Models for Diverse High-Quality Responses

在训练后为大型语言模型生成多样化高质量响应

Yilei Chen, Souradip Chakraborty, Lorenz Wolf, Yannis Paschalidis, Aldo Pacchiano

机构 * Boston University(波士顿大学) University of Maryland, College Park(马里兰大学学院公园分校) University College London(伦敦大学学院) Boston University Broad Institute of MIT and Harvard(MIT和哈佛大学波士顿大学Broad研究所)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DQO方法,通过确定性点过程优化大型语言模型的质量和语义多样性,提升输出多样性而不影响性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21500 2026-03-03 cs.LG cs.AI 91%

Chasing the Tail: Effective Rubric-based Reward Modeling for Large Language Model Post-Training

追逐尾部:基于评分标准的奖励建模以实现大语言模型的后训练效果

Junkai Zhang, Zihao Wang, Lin Gui, Swarnashree Mysore Sathyendra, Jaehwan Jeong, Victor Veitch, Wei Wang, Yunzhong He, Bing Liu, Lifeng Jin

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Scale AI, Inc.(Scale AI 公司) University of Chicago(芝加哥大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(title);language model(title);LLM(abstract)

AI总结 本文提出基于评分标准的奖励建模方法,通过关注高奖励区域以缓解大语言模型强化微调中的奖励过度优化问题,并实现有效的后训练改进。

Comments In ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00724 2026-03-03 cs.CL 89%

RLAR: An Agentic Reward System for Multi-task Reinforcement Learning on Large Language Models

RLAR:一种用于大型语言模型多任务强化学习的代理奖励系统

Andrew Zhuoer Feng, Cunxiang Wang, Bosi Wen, Yidong Wang, Yu Luo, Hongning Wang, Minlie Huang

机构 * Tsinghua Univeristy(清华大学) Peking University(北京大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 RLAR通过动态生成奖励函数提升大型语言模型在多任务强化学习中的性能和泛化能力。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01293 2026-03-03 cs.LG cs.AI stat.ML 89%

Theoretical Perspectives on Data Quality and Synergistic Effects in Pre- and Post-Training Reasoning Models

数据质量和协同效应在预训练和后训练推理模型中的理论视角

Adel Javanmard, Baharan Mirzasoleiman, Vahab Mirrokni

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过理论分析揭示了预训练和后训练模型中数据质量与协同效应的关键机制,发现平衡预训练数据能激活潜在能力,SFT在挑战性小样本上表现最佳,而RL在大规模非困难数据上更有效。

Comments 35 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10985 2026-03-03 cs.CL cs.AI 89%

When Data is the Algorithm: A Systematic Study and Curation of Preference Optimization Datasets

当数据成为算法:对偏好优化数据集的系统研究与整理

Aladin Djuhera, Farhan Ahmed, Swanand Ravindra Kadhe, Syed Zawad, Heiko Ludwig, Holger Boche

机构 * Technical University Munich(慕尼黑技术大学) IBM Research(IBM研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文系统研究并整理了多个开源DPO数据集,提出UltraMix混合数据集,通过Magpie框架进行精细标注,揭示偏好质量差异,并在关键基准上超越最佳单个数据集性能。

Journal ref The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03253 2026-03-03 cs.LG cs.AI 88%

Solving the Granularity Mismatch: Hierarchical Preference Learning for Long-Horizon LLM Agents

解决粒度不匹配问题:用于长周期LLM代理的层次化偏好学习

Heyang Gao, Zexu Sun, Erxue Min, Hengyi Cai, Shuaiqiang Wang, Dawei Yin, Xu Chen

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(人工智能与数字经济广东实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Baidu Inc.(百度公司)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出层次化偏好学习方法,通过双层课程引导解决LLM代理长周期任务中的粒度不匹配问题,提升多粒度偏好优化能力。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02045 2026-03-03 cs.LG 87%

Expanding LLM Agent Boundaries with Strategy-Guided Exploration

通过策略引导探索扩展LLM代理边界

Andrew Szot, Michael Kirchhof, Omar Attia, Alexander Toshev

机构 * Apple(苹果公司)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SGE通过引导策略探索提升LLM代理的学习效率和性能,使其能解决基础模型无法处理的任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07638 2026-03-03 cs.LG 87%

Data Selection for LLM Alignment Using Fine-Grained Preferences

利用细粒度偏好进行LLM对齐的数据选择

Jia Zhang, Yao Liu, Chen-Xi Zhang, Yi Liu, Yi-Xuan Jin, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Algorithm Tech, Taobao & Tmall Group of Alibaba(阿里巴巴集团算法技术部) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出了一种基于细粒度偏好的数据选择方法,通过优化偏好分歧来提升LLM对齐效果,实验表明在少量数据下也能实现显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19653 2026-03-03 cs.AI 87%

Token-Importance Guided Direct Preference Optimization

基于令牌重要性的直接偏好优化

Ning Yang, Hai Lin, Yibo Liu, Baoliang Tian, Guoqing Liu, Haijun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动) Microsoft Research AI4Science(微软研究院AI4Science) University of Science and Technology Beijing(北京科技大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出TI-DPO方法,通过混合加权机制和三元组损失实现细粒度语义控制,提升模型对偏好响应的准确性和生成多样性。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20838 2026-03-03 cs.LG cs.AI cs.CL cs.CY 87%

Reward Models Inherit Value Biases from Pretraining

奖励模型继承预训练中的价值偏见

Brian Christian, Jessica A. F. Thompson, Elle Michelle Yang, Vincent Adam, Hannah Rose Kirk, Christopher Summerfield, Tsvetomira Dumbalska

机构 * Department of Experimental Psychology, University of Oxford(心理学系,牛津大学) Department of Computer Science, University of Oxford(计算机科学系,牛津大学) AI/ML Research Group, Universitat Pompeu Fabra(人工智能/机器学习研究组,庞培法华大学) Oxford Internet Institute, University of Oxford(牛津互联网研究所,牛津大学)

专题命中 后训练与偏好优化 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究发现奖励模型继承预训练模型的价值偏见,影响其对代理和共融的偏好,揭示了预训练阶段对安全和对齐的重要性。

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19807 2026-03-03 cs.CL cs.AI cs.LG 87%

Scaf-GRPO: Scaffolded Group Relative Policy Optimization for Enhancing LLM Reasoning

Scaf-GRPO:基于 scaffolding 的组相对策略优化以增强大语言模型推理能力

Xichen Zhang, Sitong Wu, Yinghao Zhu, Haoru Tan, Shaozuo Yu, Ziyi He, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Scaf-GRPO通过渐进式训练框架,在模型学习停滞时提供分层提示,有效提升大语言模型的数学推理能力。

Comments Code: https://github.com/JIA-Lab-research/Scaf-GRPO Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13575 2026-03-03 cs.CL cs.AI 86%

Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment

Elo-Evolve:一种用于语言模型对齐的共进化框架

Jing Zhao, Ting Zhen, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang, Beijing, China(北京中关村)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 Elo-Evolve通过动态多代理竞争和自适应对手选择,提升大型语言模型对齐的稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05534 2026-03-03 cs.CL 85%

Revisiting Self-Play Preference Optimization: On the Role of Prompt Difficulty

重新审视自我对弈偏好优化:关于提示难度的作用

Yao Xiao, Jung-jae Kim, Roy Ka-wei Lee, Lidong Bing

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了提示难度对自我对弈偏好优化的影响,发现困难提示会降低性能,而简单提示更有效,提出通过训练少量简单提示来提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18991 2026-03-03 cs.CL cs.AI cs.LG 85%

Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment

逆强化学习与动态奖励缩放用于大语言模型对齐

Ruoxi Cheng, Haoxuan Ma, Weixin Wang, Ranjie Duan, Jiexi Liu, Xiaoshuang Jia, Simeng Qin, Xiaochun Cao, Yang Liu, Xiaojun Jia

机构 * Beijing Electronic Science and Technology Institute(北京电子科技学院) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) Duke University(杜克大学) BraneMatrix AI Renmin University of China(中国人民大学) Northeast University(东北大学) Nanyang Technological University(南洋理工大学) Zhejiang Lab(浙江实验室) Sun Yat-sen University(中山大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DR-IRL通过动态奖励缩放和逆强化学习提升大语言模型的安全对齐性能,有效解决数据不平衡和静态奖励模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05619 2026-03-03 cs.AI cs.LG 84%

Beyond RLHF and NLHF: Population-Proportional Alignment under an Axiomatic Framework

超越RLHF和NLHF:在公理框架下的人口比例对齐

Kihyun Kim, Jiawei Zhang, Asuman Ozdaglar, Pablo A. Parrilo

机构 * MIT LIDS(麻省理工学院LIDS) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :RLHF(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于公理框架的人口比例对齐方法,通过社会选择理论解决传统偏好学习中的偏差和操纵问题,并在推荐任务和语言模型对齐中验证了其有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00526 2026-03-03 cs.CV 82%

Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

Mesh-Pro: 异步优势引导的排名偏好优化用于艺术家风格的四边形网格生成

Zhen Zhou, Jian Liu, Biwen Lei, Jing Xu, Haohan Weng, Yiling Zhu, Zhuo Chen, Junfeng Fan, Yunkai Ma, Dazhao Du, Song Guo, Fengshui Jing, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文元) Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);post-training(abstract)

AI总结 Mesh-Pro通过异步优势引导的排名偏好优化提升3D网格生成的训练效率和生成质量,引入了新的标记化和奖励机制,实现了艺术家风格网格的先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15498 2026-03-03 cs.CL cs.AI cs.LG 80%

SPARE: Single-Pass Annotation with Reference-Guided Evaluation for Automatic Process Supervision and Reward Modelling

SPARE:基于参考引导评估的单次标注用于自动过程监督与奖励建模

Md Imbesat Hassan Rizvi, Xiaodan Zhu, Iryna Gurevych

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SPARE通过单次生成与参考引导评估,实现高效过程标注,提升LLM多步推理中的奖励建模与微调效果。

Comments Accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01051 2026-03-03 cs.LG cs.AI cs.CL 80%

GEM: A Gym for Agentic LLMs

GEM:代理大语言模型的训练环境

Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Yee Whye Teh, Wee Sun Lee, Min Lin

机构 * Sea AI Lab(海智实验室) NUS(国立大学新加坡) Oxford(牛津大学) SMU(南卫理安大学) Stanford(斯坦福大学) Northeastern(东北大学) OpenRLHF(开放强化学习基金会) ROLL RL2 absolute AI(绝对人工智能)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GEM是一个为代理LLM设计的开源训练环境,提供标准化接口、多样化环境和基准测试功能,用于促进基于经验的学习和强化学习算法的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24203 2026-03-03 cs.LG cs.AI cs.CL 80%

Group-Relative REINFORCE Is Secretly an Off-Policy Algorithm: Demystifying Some Myths About GRPO and Its Friends

组相对REINFORCE实际上是秘密的非策略算法:解开GRPO及其朋友的一些神话

Chaorui Yao, Yanxi Chen, Yuchang Sun, Yushuo Chen, Wenhao Zhang, Xuchen Pan, Yaliang Li, Bolin Ding

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文揭示组相对REINFORCE本质上是非策略算法,通过理论分析和实验验证,解开了GRPO及相关算法的一些神话,为LLMs的非策略强化学习提供了新的设计思路。

Comments Accepted to ICLR 2026. arXiv v2 update: add references and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23239 2026-03-03 cs.AI cs.CY 77%

Agency and Architectural Limits: Why Optimization-Based Systems Cannot Be Norm-Responsive

代理与架构限制:为何基于优化的系统无法回应规范

Radha Sarma

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文指出基于优化的系统无法回应规范,提出真正的代理性需要不可比较的边界和否定性回应机制,揭示了优化与规范治理的不兼容性及由此引发的收敛危机。

Comments About 10,600 words in all (includes ~1000 words of literature and ~2400 words of Appendices). Under journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08630 2026-03-03 cs.CL 77%

ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection

ExPO-HM:为仇恨表情包检测学习解释-然后检测

Jingbiao Mei, Mingsheng Sun, Jinghong Chen, Pengda Qin, Yuhong Li, Da Chen, Bill Byrne

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Xiaohongshu Inc.(小红书公司) University of Bath(巴斯大学) Tencent Company, China(腾讯公司) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :post-training(abstract);SFT(abstract);prompting(abstract);分类 cs.CL

AI总结 ExPO-HM通过结合SFT预热、GRPO与课程学习及CDE,提升仇恨表情包检测的解释性和准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19733 2026-03-03 cs.CL 77%

Breaking Barriers: Do Reinforcement Post Training Gains Transfer To Unseen Domains?

打破壁垒:强化学习后训练的增益是否能转移到未见领域?

Chuxuan Hu, Yuxuan Zhu, Antony Kellermann, Caleb Biddulph, Suppakit Waiwitlikhit, Jason Benn, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究探讨了强化学习后训练在不同领域中的泛化能力,发现其增益在不同推理模式的领域中不一致。

Comments ICLR 2026; 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19362 2026-03-03 cs.LG 77%

LLMs Can Learn to Reason Via Off-Policy RL

大语言模型可通过非策略强化学习进行推理

Daniel Ritter, Owen Oertell, Bradley Guo, Jonathan Chang, Kianté Brantley, Wen Sun

机构 * Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出OAPL算法,通过接受非策略性解决LLM强化学习中的策略滞后问题,在竞赛数学和编码任务中表现优异,训练效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02245 2026-03-03 cs.LG cs.AI cs.CL 75%

ExGRPO: Learning to Reason from Experience

ExGRPO:从经验中学习推理

Runzhe Zhan, Yafu Li, Zhi Wang, Xiaoye Qu, Dongrui Liu, Jing Shao, Derek F. Wong, Yu Cheng

机构 * University of Macau(澳门大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ExGRPO通过组织和优先处理有价值的经验,提升大语言模型的推理性能并稳定训练过程。

Comments ICLR 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17616 2026-03-03 cs.LG cs.AI 73%

Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs

稳定异步性:用于大语言模型的方差控制的非策略强化学习

Luke J. Huang, Zhuoyang Zhang, Qinghao Hu, Shang Yang, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 VCPO通过动态调整学习率和最小方差基线,提升大语言模型异步训练的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01409 2026-03-03 cs.AI cs.LG cs.SE 73%

MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning

MIST-RL:基于突变的增量测试套件生成 via 强化学习

Sicheng Zhu, Jiajun Wang, Jiawei Ai, Xin Li

机构 * Fudan University, Shanghai, China(复旦大学) University of Science and Technology of China(中国科学技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MIST-RL通过强化学习优化测试生成,提升突变得分并减少测试用例数量,改进代码验证效果。

Comments Preprint. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01509 2026-03-03 cs.CV cs.AI 70%

Retrieval, Refinement, and Ranking for Text-to-Video Generation via Prompt Optimization and Test-Time Scaling

通过提示优化和测试时扩展实现文本到视频生成的检索、细化与排序

Zillur Rahman, Alex Sheng, Cristian Meo

机构 * Algoverse AI

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出3R框架,通过提示优化和测试时扩展提升文本到视频生成的准确性与效率。

Comments 2026 ICLR TTU Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01106 2026-03-03 cs.AI 70%

DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage

DIVA-GRPO:通过难度自适应变体优势增强多模态推理

Haowen Gao, Zhenyu Zhang, Liang Pang, Fangda Guo, Hongjian Dou, Guannan Lv, Shaoguo Liu, Tingting Gao, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Kuaishou Technology, Beijing, China(快手科技,北京,中国)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DIVA-GRPO通过难度自适应变体优势方法提升多模态推理能力,解决GRPO在困难问题上的奖励稀疏性和优势消失问题,提升训练稳定性与推理性能。

Comments Accepted to ICLR 2026. Code and models are available at https://github.com/Siaaaaaa1/DIVA-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24302 2026-03-03 cs.CL 70%

Lookahead Tree-Based Rollouts for Enhanced Trajectory-Level Exploration in Reinforcement Learning with Verifiable Rewards

基于前瞻树的rollouts用于增强强化学习中轨迹层面的探索

Shangyu Xing, Siyuan Wang, Chenyuan Yang, Xinyu Dai, Xiang Ren

机构 * Nanjing University(南京大学) University of Southern California(南加州大学) Fudan University(复旦大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 基于前瞻树的rollouts通过促进轨迹多样性提升强化学习中策略学习效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00159 2026-03-03 cs.CV cs.AI cs.MM cs.SD 70%

FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation

FlowPortrait:基于强化学习的音频驱动肖像视频生成

Weiting Tan, Andy T. Liu, Ming Tu, Xinghua Qu, Philipp Koehn, Lu Lu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FlowPortrait通过强化学习框架结合多模态模型和人类对齐评估系统,提升音频驱动肖像视频生成的质量和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏