QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization
QLPO:用于长度感知策略优化的象限加权采样
Siwei Chen, Siqi Chen, Xupeng Miao, Bin Cui
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University(北京大学软硬件协同人工智能系统北京市重点实验室)
;
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
;
Institute of Computational Social Science, Peking University (Qingdao)(北京大学(青岛)计算社会科学研究院)
Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning
基于重新定义的逐步优势的自引导过程奖励优化用于过程强化学习
Wu Fei, Shuxian Liang, Yibo Yang, Yang Lin, Jing Tang, Lei Chen, Xiansheng Hua, Hao Kong
机构
*
Terminus Group(Terminus集团)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学)
MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph
MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架
Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song
机构
*
Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Kyoto University(京都大学)
;
Tsinghua University(清华大学)
;
East China Normal University(华东师范大学)
;
Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心)
;
Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院)
;
GenBio AI