Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
解耦推理与置信度:在可验证奖励的强化学习中恢复校准
Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun
机构
*
Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)
;
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)
;
National Computer Network Emergency Response Technical Team/Coordination Center of China, Beijing, China(中国国家计算机网络应急技术配合中心)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
IRPO: Boosting Image Restoration via Post-training GRPO
IRPO:通过后训练GRPO提升图像恢复
Haoxuan Xu, Yi Liu, Tianfu Li, Ruolin Shen, Boyuan Jiang, Jinlong Peng, Donghao Luo, Xiaobin Hu, Shuicheng Yan, Haoang Li
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Tsinghua University(清华大学)
;
Technical University of Munich(慕尼黑技术大学)
;
Zhejiang University(浙江大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Fudan University(复旦大学)
;
National University of Singapore(新加坡国立大学)
OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning
OGER:一种用于混合强化学习的鲁棒离线引导探索奖励
Xinyu Ma, Mingzhou Xu, Xuebo Liu, Chang Jin, Qiang Wang, Derek F. Wong, Min Zhang
机构
*
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)
;
Hithink RoyalFlush Information Network, Hangzhou, China(杭州Hithink RoyalFlush信息网络)
;
Computer and Information Science, University of Macau, Macau, China(澳门大学计算机与信息科学学院)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization
情感音乐推荐:基于展开世界模型的离线偏好优化
Audrey Chan, Aaron Labbé, Jacob Lavoie, Jordan Bannister, Arsène Fansi Tchango, Guillaume Lajoie, Laurent Charlin
机构
*
LUCID Inc. Toronto Canada
;
LUCID Inc. Montr\' e al Canada
;
Mila --- Qu\' e bec AI Institute Montr\' e al Canada
;
LUCID Inc.
;
Mila --- Qu\' e bec AI Institute
SaFeR-Steer: Evolving Multi-Turn MLLMs via Synthetic Bootstrapping and Feedback Dynamics
SaFeR-Steer:通过合成引导和反馈动力学进化多轮多模态大语言模型
Haolong Hu, Hanyu Li, Tiancheng He, Huahui Yi, An Zhang, Qiankun Li, Kun Wang, Yang Liu, Zhigang Zeng
机构
*
Huazhong University of Science and Technology(华中科技大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
West China Biomedical Big Data Center, Sichuan University(四川大学西部生物医学大数据中心)
;
School of Public Policy and Administration, Chongqing University(重庆大学公共政策与管理学院)
;
Nanyang Technological University(南洋理工大学)
Compositional Text-to-Image Generation Via Region-aware Bimodal Direct Preference Optimization
基于区域感知双模态直接偏好优化的组合式文本到图像生成
Zhuohan Liu, Wujian Peng, Yitong Chen, Zuxuan Wu
机构
*
Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院)
;
Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)