Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization
Active-GRPO:用于分子优化的自适应模仿与自我改进推理
Xuefeng Liu, Mingxuan Cao, Qinan Huang, Thomas Brettin, Rick Stevens, Le Cong
机构
*
School of Medicine, Stanford University(斯坦福大学医学院)
;
Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)
;
Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院)
;
Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)
;
Argonne National Laboratory(阿贡国家实验室)
专题命中
后训练与偏好优化
:SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Learning to Watch: Active Video Anomaly Understanding via Interleaved Policy Optimization
学习观察:通过交错策略优化的主动视频异常理解
Mengjingcheng Mo, Jiaxu Leng, Xinbo Gao
机构
*
School of Computer Science and Technology, Chongqing University of Posts and Telecommunications, Chongqing, China(重庆邮电大学计算机科学与技术学院)
;
School of Computer Science(计算机科学学院)
;
Chongqing College of Artificial Intelligence, Chongqing, China(重庆人工智能学院)