机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Tsinghua University(清华大学)
;
The Hong Kong Polytechnic University(香港理工大学)
Wasserstein Distributionally Robust Regret Optimization for Reinforcement Learning from Human Feedback
Wasserstein分布鲁棒遗憾优化用于人类反馈的强化学习
Yikai Wang, Shang Liu, Jose Blanchet
机构
*
Department of Statistics and Operations Research, University of North Carolina(统计与运筹学系,北卡罗来纳大学)
;
Imperial Business School, Imperial College London(帝国理工学院伦敦商学院)
;
Department of Management Science and Engineering, Stanford University(管理科学与工程系,斯坦福大学)
专题命中
后训练与偏好优化
:RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)
Parameter Exploration for RLVR via Variational Learning
基于变分学习的RLVR参数探索
Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych
机构
*
INSAIT, Sofia University “St. Kliment Ohridski”(INSAIT,圣克莱门特奥赫里德斯基索非亚大学)
;
National Research Center for Applied Cybersecurity ATHENE(ATHENE国家应用网络安全研究中心)
Improving Generalization Robustness of Multimodal RLVR
提升多模态RLVR的泛化鲁棒性
Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You
机构
*
National University of Singapore(新加坡国立大学)
;
DAMO Academy Alibaba Group(阿里巴巴达摩院)
;
Hupan Lab(湖畔实验室)
;
Zhejiang University(浙江大学)
;
University of California Berkeley(加州大学伯克利分校)
;
Rochester Institute of Technology(罗切斯特理工学院)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Renmin University of China(中国人民大学)
;
Hong Kong University of Science and Technology(香港科技大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang
机构
*
Peking University(北京大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
;
University of Science and Technology of China(中国科学技术大学)
;
Southeast University(东南大学)
;
Southern University of Science and Technology(南方科技大学)
;
Beijing University of Aeronautics and Astronautics(北京航空航天大学)
;
Beijing Language and Culture University(北京语言大学)
;
Sichuan University(四川大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
Pave-GRPO: Beyond Instantaneous Guidance through Principled Average Velocity Decomposition
Pave-GRPO:通过原则性平均速度分解超越瞬时引导
Pengyang Ling, Jiazi Bu, Yujie Zhou, Yibin Wang, Zhenyu Hu, Zihan Zhang, Yi Jin, Huaian Chen, Yuhang Zang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Fudan University(复旦大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Beihang University(北京航空航天大学)
;
Shanghai AI Laboratory(上海人工智能实验室)