机构
*
Department of Computer Science, Rice University, Houston, USA(莱斯大学计算机科学系,美国休斯顿)
;
Department of Computer Science, University of North Carolina at Charlotte, Charlotte, USA(北卡罗来纳大学夏洛特分校计算机科学系,美国夏洛特)
;
Department of Computer Science, Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学计算机科学系,美国巴尔的摩)
;
Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)
Expressive Power of Implicit Models: Rich Equilibria and Test-Time Scaling
隐式模型的表达能力:丰富的均衡与测试时扩展
Jialin Liu, Lisang Ding, Stanley Osher, Wotao Yin
机构
*
University of Central Florida(中佛罗里达大学)
;
University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
;
Decision Intelligence Lab, DAMO Academy, Alibaba US(达摩院决策智能实验室,阿里巴巴美国)
R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning
R1-Code-Interpreter: LLMs通过监督学习和多阶段强化学习进行代码推理
Yongchao Chen, Yueying Liu, Junwei Zhou, Yilun Hao, Jingquan Wang, Yang Zhang, Na Li, Chuchu Fan
机构
*
MIT / Harvard(麻省理工学院/哈佛大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of Michigan(密歇根大学)
;
MIT(麻省理工学院)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
;
Harvard(哈佛大学)
Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards
通过参数空间噪声学习探索:深入研究可验证奖励的强化学习
Bizhe Bai, Xinyue Wang, Peng Ye, Tao Chen
机构
*
Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
;
College of Future Information Technology, Fudan University, Shanghai, China(未来信息科技学院,复旦大学)
;
Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)
;
The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)
Recycling Failures: Salvaging Exploration in RLVR via Fine-Grained Off-Policy Guidance
回收失败:通过细粒度反策略指导在RLVR中恢复探索
Yanwei Ren, Haotian Zhang, Likang Xiao, Xikai Zhang, Jiaxing Huang, Jiayan Qiu, Baosheng Yu, Quan Chen, Liu Liu
机构
*
School of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能学院)
;
Hangzhou International Innovation Institute, Beihang University, Hangzhou, China(北京航空航天大学杭州国际创新研究院)
;
University of Leicester, Leicester, United Kingdom(莱斯特大学)
;
Nanyang Technological University, Singapore(南洋理工大学)
;
The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学)
Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training
为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰
Anas Barakat, Souradip Chakraborty, Khushbu Pahwa, Amrit Singh Bedi
机构
*
Singapore University of Technology and Design(新加坡科技设计大学)
;
University of Maryland, College Park(马里兰大学学院公园分校)
;
University of Central Florida(佛罗里达中央大学)