Alignment Risks from Capability-Seeking RL Training
从能力寻求强化学习训练中产生的对齐风险
Yujun Zhou, Yue Huang, Han Bao, Kehan Guo, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
Stanford University(斯坦福大学)
;
University of Washington(华盛顿大学)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
University of Toronto(多伦多大学)
;
University of Cambridge(剑桥大学)
Rajeev Yasarla, Shizhong Han, Hsin-Pai Cheng, Apratim Bhattacharyya, Shweta Mahajan, Litian Liu, Yunxiao Shi, Risheek Garrepalli, Hong Cai, Fatih Porikli
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of California, Davis(加州大学戴维斯分校)
Deliberate Evolution: Agentic Reasoning for Sample-Efficient Symbolic Regression with LLMs
Deliberate Evolution: 基于智能体推理的样本高效符号回归与LLM
Xinyu Pang, Zhanke Zhou, Xuan Li, Fangrui Lv, Shanshan Wei, Sen Cui, Bo Han, Changshui Zhang
机构
*
TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组)
;
Beijing National Research Center for Information Science(北京信息科学国家研究中心)
;
Technology (BNRist), Department of Automation, Tsinghua University, Beijing, P.R. China(技术(BNRist),自动化系,清华大学,北京,中华人民共和国)
;
Lenovo Research(联想研究)