From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation
从被动观察者到主动批评者:强化学习激发机器人操作的过程推理
Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao Mu
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Northeastern University(东北大学)
;
Xiamen University Malaysia(厦门大学马来西亚分校)
;
The University of Hong Kong(香港大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Xspark AI
机构
*
School of Data Science, Fudan University(复旦大学数据科学学院)
;
Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能研究所)
;
College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)
;
Ant Group(蚂蚁集团)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
CommentsWe propose SCOUT, a detector allocation framework that predicts each detector's accuracy and latency on a given input before running it, letting operators control the safety-utility trade-off with a single threshold and route to an LLM judge only when needed
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute)
;
School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Key Laboratory of Target Cognition and Application Technology (TCAT)(目标认知与应用技术重点实验室)
CoEvoSkills: Self-Evolving Agent Skills via Co-Evolutionary Verification
CoEvoSkills: 通过共进化验证实现自进化代理技能
Hanrong Zhang, Shicheng Fan, Henry Peng Zou, Yankai Chen, Zhenting Wang, Jiayu Zhou, Chengze Li, Wei-Chieh Huang, Yifei Yao, Kening Zheng, Xue, Liu, Xiaoxiao Li, Philip S. Yu
机构
*
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
;
MBZUAI(穆罕默德·本·扎耶德人工智能大学)
;
McGill University(麦吉尔大学)
;
Columbia University(哥伦比亚大学)
;
Zhejiang University(浙江大学)
;
University of British Columbia(不列颠哥伦比亚大学)