Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun
机构
*
Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术协调中心)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of California, Berkeley(加州大学伯克利分校)
;
University of California, Santa Barbara(加州大学圣巴巴拉分校)
机构
*
School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)
;
Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部)
;
Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)
StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction
StraTA: 通过战略轨迹抽象激励代理强化学习
Xiangyuan Xue, Yifan Zhou, Zidong Wang, Shengji Tang, Philip Torr, Wanli Ouyang, Lei Bai, Zhenfei Yin
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
University of Georgia(佐治亚大学)
;
University of Oxford(牛津大学)
;
Shenzhen Loop Area Institute(深圳河套学院)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
GR-Ben:一种通用推理基准,用于评估过程奖励模型
Zhouhao Sun, Xuan Zhang, Xiao Ding, Bibo Cai, Li Du, Kai Xiong, Xinran Dai, Fei Zhang, weidi tang, Zhiyuan Kan, Yang Zhao, Bing Qin, Ting Liu
机构
*
Research Center for Social Computing(社会计算研究中心)
;
Interactive Robotics, Harbin Institute of Technology, China(交互机器人学,哈尔滨工业大学,中国)
;
Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI