QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization
QLPO:用于长度感知策略优化的象限加权采样
Siwei Chen, Siqi Chen, Xupeng Miao, Bin Cui
机构
*
School of Computer Science, Peking University(北京大学计算机科学学院)
;
Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University(北京大学软硬件协同人工智能系统北京市重点实验室)
;
Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
;
Institute of Computational Social Science, Peking University (Qingdao)(北京大学(青岛)计算社会科学研究院)
机构
*
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室)
;
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院)
;
Tsinghua University(清华大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
机构
*
Zhipu AI, Beijing, China(智谱AI,北京,中国)
;
Tsinghua University, Beijing, China(清华大学,北京,中国)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)
MedKGent: A Large Language Model Agent Framework for Constructing Temporally Evolving Medical Knowledge Graph
MedKGent:用于构建随时间演变的医学知识图谱的大语言模型智能体框架
Duzhen Zhang, Zixiao Wang, Zhong-Zhi Li, Yahan Yu, Shuncheng Jia, Jiahua Dong, Haotian Xu, Xing Wu, Yingying Zhang, Tielin Zhang, Jie Yang, Xiuying Chen, Le Song
机构
*
Mohamed bin Zayed University of Artificial Intelligence(莫扎德大学人工智能学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Kyoto University(京都大学)
;
Tsinghua University(清华大学)
;
East China Normal University(华东师范大学)
;
Center for Excellence in Brain Science and Intelligence Technology(脑科学与智能技术卓越中心)
;
Brigham and Women’s Hospital, Harvard Medical School(哈佛医学院布里特妇女医院)
;
GenBio AI