机构
*
Shanghai Jiao Tong University(上海交通大学)
;
S-Lab, Nanyang Technological University(新加坡南洋理工大学S-Lab实验室)
;
University of Science and Technology of China(中国科学技术大学)
;
Fudan University(复旦大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Adobe Research(奥多比研究院)
;
The Chinese University of Hong Kong(香港中文大学)
;
CPII under InnoHK(InnoHK下属CPII机构)
机构
*
Huawei(华为)
;
University of Science and Technology of China(中国科学技术大学)
;
Zhejiang University(浙江大学)
;
Tsinghua University(清华大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))
REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation
REOPD:面向在线策略蒸馏的可靠性自适应奖励外推
Yang Sun, Lichao Ma, Houyuan Qin, Yuxin Liu, Hanyang Lu, Yao Zhu, Pinlong Cai, Guohang Yan
机构
*
Peking University(北京大学)
;
Southwest Jiaotong University(西南交通大学)
;
University of Science and Technology of China(中国科学技术大学)
;
School of Computer Science and Technology,University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)
;
University of Electronic Science and Technology of China(电子科技大学)
;
School of Automation Engineering,University of Electronic Science and Technology of China(电子科技大学自动化工程学院)
;
Renmin University of China(中国人民大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Autonomous Driving, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室自动驾驶研究中心)
机构
*
Fuzhou University(福州大学)
;
Chinese Academy of Sciences(中国科学院)
;
Peking University(北京大学)
;
Alibaba Group(阿里巴巴集团)
;
University of Science and Technology of China(中国科学技术大学)
;
Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司)
;
Baidu(百度)
;
Wuhan University(武汉大学)
Ziheng Peng, Huiqi Deng, Haoran Jing, Xuankun Rong, Jiahui Han, Xiting Wang, Na Zou, Xia Hu
机构
*
Renmin University of China(中国人民大学)
;
Xi’an Jiaotong University(西安交通大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Wuhan University(武汉大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)