Improving Generalization Robustness of Multimodal RLVR
提升多模态RLVR的泛化鲁棒性
Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You
机构
*
National University of Singapore(新加坡国立大学)
;
DAMO Academy Alibaba Group(阿里巴巴达摩院)
;
Hupan Lab(湖畔实验室)
;
Zhejiang University(浙江大学)
;
University of California Berkeley(加州大学伯克利分校)
;
Rochester Institute of Technology(罗切斯特理工学院)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Renmin University of China(中国人民大学)
;
Hong Kong University of Science and Technology(香港科技大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
Positive Alignment: Artificial Intelligence for Human Flourishing
积极对齐:人工智能促进人类繁荣
Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser, Roma Patel, Michael Levin, Arun Rao
机构
*
Department of Psychiatry, University of Oxford(牛津大学精神病学系)
;
Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院)
;
Google DeepMind(谷歌DeepMind)
;
LIFE
;
OpenAI
;
Anthropic
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Aily Labs(Aily实验室)
;
Stanford University(斯坦福大学)
;
Tufts University(塔夫茨大学)
;
Positive AI Labs(积极AI实验室)
;
Department of Informatics, University of Sussex(Sussex大学信息学系)
;
Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)
CommentsProceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)
Journal refTransactions on Machine Learning Research, Vol. 2026, June 2026
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
基于重新定义的逐步优势的自引导过程奖励优化用于过程强化学习
Wu Fei, Shuxian Liang, Yibo Yang, Yang Lin, Jing Tang, Lei Chen, Xiansheng Hua, Hao Kong
机构
*
Terminus Group(Terminus集团)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG