机构
*
Key Lab of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院)
;
State Key Lab of AI Safety(人工智能安全国家重点实验室)
;
University of Chinese Academy of Sciences, CAS(中国科学院大学)
;
Zhejiang University(浙江大学)
专题命中
后训练与偏好优化
:large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments19 pages, 3 figures. Accepted by ACL 2025 (main)
PolyFact: Comparing Consistency-Driven Post-training Methods for Cross-Lingual Factual Recall
通过一致性驱动的强化学习改进跨语言事实回忆
Jonathan von Rad, Louis Arts, George Burgess, Eleftheria Kolokytha, Harry O'Donnell, Ektor Oikonomidis Doumpas, Eduardo Sanchez, Yao Lu, Pontus Stenetorp
机构
*
University College London(伦敦大学学院)
;
Centre for Artificial Intelligence(人工智能中心)
专题命中
后训练与偏好优化
:post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励
Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao
机构
*
Duke University(杜克大学)
;
Adobe Inc.(奥多比公司)
;
Oregon State University(俄勒冈州立大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
National University of Singapore(新加坡国立大学)
;
Amazon(亚马逊)
专题命中
后训练与偏好优化
:LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
Commentsv2: added sycophancy related work; Section 4 positioned against concurrent Bradley-Terry amplification results (Shapira et al. 2026); minor revisions
机构
*
State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
;
School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)