When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff
当强化学习在监督微调后失效:恢复模型可塑性以实现稳健的SFT到RL交接
Runze Liu, Jiashun Liu, Xu Wan, Yuqian Fu, Ling Pan
机构
*
Hong Kong University of Science and Technology(香港科技大学)
;
Zhejiang University(浙江大学)
;
State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,CASIA)
机构
*
Institute of High Performance Computing (IHPC), A*STAR, Singapore(新加坡科技研究局高性能计算研究所)
;
The Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学道路与交通工程教育部重点实验室)
;
Meituan Inc., Shenzhen, China(美团(深圳))
;
Centre for Frontier AI Research (CFAR), A*STAR, Singapore(新加坡科技研究局前沿人工智能研究中心)
;
Nankai University(南开大学)
;
School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
LaGO: Latent Action Guidance for Online Reinforcement Learning
LaGO:面向在线强化学习的潜在动作引导
Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong Wu
机构
*
Siebel School of Computing(计算科学系)
;
Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校,美国)
;
Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾)
;
Institute of Information Science, Academia Sinica, Taiwan(信息科学研究所, Academia Sinica,台湾)
HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents
HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法
Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang
机构
*
North China Institute of Computer System Engineering(华北计算机系统工程研究所)
;
University of Science and Technology of China(中国科学技术大学)
;
China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)
Temporal Logic Guided Universal Task Representations for Reinforcement Learning
用于强化学习的时序逻辑引导通用任务表示
Hao Zhang, Zhangli Zhou, Zhen Kan
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)
;
Chinese Academy of Sciences(中国科学院)
机构
*
School of Computing, Queen’s University(女王大学计算学院)
;
IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)
;
University of Chicago(芝加哥大学)
;
Tensormesh Inc.(Tensormesh公司)
FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making
FZ-VLM:用于肺结节特征表征与临床决策的两阶段Florence-Zephyr视觉语言模型框架
Pramit Dutta, Jenita Manokaran, Richa Mittal, Ryan Appleby, Eranga Ukwatta
机构
*
College of Engineering, University of Guelph(圭尔夫大学工程学院)
;
Holland Bloorview Kids Rehabilitation Hospital(霍兰德布鲁尔维尤儿童康复医院)
;
Guelph General Hospital(圭尔夫综合医院)
;
Ontario Veterinary College, University of Guelph(圭尔夫大学安大略兽医学院)