机构
*
University of Southern California(南加州大学)
;
Iowa State University(爱荷华州立大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
UT Austin(德克萨斯大学奥斯汀分校)
;
Independent Researcher(独立研究员)
;
University of Notre Dame(圣母大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Baseline-Free Policy Optimization for Neural Combinatorial Optimization
无基线的神经组合优化策略优化
Carlos S. Sepúlveda, Gonzalo A. Ruz
机构
*
Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院)
;
Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局)
;
Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS))
;
Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang
机构
*
Peking University(北京大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
;
University of Science and Technology of China(中国科学技术大学)
;
Southeast University(东南大学)
;
Southern University of Science and Technology(南方科技大学)
;
Beijing University of Aeronautics and Astronautics(北京航空航天大学)
;
Beijing Language and Culture University(北京语言大学)
;
Sichuan University(四川大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li
机构
*
Imperial College London(帝国理工学院)
;
University College London(伦敦大学学院)
;
SambaNova(桑巴诺瓦公司)
;
KAUST(阿卜杜拉国王科技大学)
;
Stanford University(斯坦福大学)
;
University of Oxford(牛津大学)
;
University of Waterloo(滑铁卢大学)
;
RadixArk(基数方舟公司)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI
Learning More from Less: Reinforcement Learning from Hindsight
从更少中学习更多:事后诸葛亮式强化学习
Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong
机构
*
Massachusetts Institute of Technology(麻省理工学院)
;
MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室)
;
Stanford University(斯坦福大学)
;
University of California, San Diego(加利福尼亚大学圣地亚哥分校)