TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang
机构
*
Peking University(北京大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
;
University of Science and Technology of China(中国科学技术大学)
;
Southeast University(东南大学)
;
Southern University of Science and Technology(南方科技大学)
;
Beijing University of Aeronautics and Astronautics(北京航空航天大学)
;
Beijing Language and Culture University(北京语言大学)
;
Sichuan University(四川大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
SciForma: Structure-Faithful Generation of Scientific Diagrams
SciForma:科学图表的结构忠实生成
Yuxuan Luo, Peng Zhang, Xinjie Zhang, Xun Guo, Zhouhui Lian, Yan Lu
机构
*
Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)
;
State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)
;
Microsoft Research Asia(微软亚洲研究院)
From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents
从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试
Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu
机构
*
National University of Singapore(新加坡国立大学)
;
University of Toronto(多伦多大学)
;
University of Minnesota Twin Cities(明尼苏达大学双城分校)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
University of Oxford(牛津大学)