Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning
超越轨迹模仿:策略引导的策略优化用于大语言模型推理
Tianyuan Shi, Canbin Huang, Bei Li, Xin Chen, Xiaojun Quan, Jingang Wang, Qifan Wang
机构
*
School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院)
;
Meituan, Inc., China(美团)
;
Shenzhen Loop Area Institute, China(深圳环区研究所)
;
Meta AI, USA(Meta AI)
What are Key Factors for Updates in RL for LLM Reasoning?
RL提升LLM推理能力的关键更新因素是什么?
Peidong Wang, Demi Wang, Xufang Luo, Jiahang Xu, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li
机构
*
School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
;
Microsoft Research(微软研究院)
;
Carnegie Mellon University(卡内基梅隆大学)
Seeing Before Reasoning: Decoupling Perception and Reasoning for Shortcut-Resilient Multimodal On-Policy Self-Distillation
先看后思:解耦感知与推理以实现抗捷径的多模态在策略自蒸馏
Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi Han
机构
*
State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(机器人与智能系统国家重点实验室,沈阳自动化研究所,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
ARMOR-MAD: Adaptive Routing for Heterogeneous Multi-Agent Debate in Large Language Model Reasoning
ARMOR-MAD:大语言模型推理中异构多智能体辩论的自适应路由
Fuqiang Niu, Bowen Zhang
机构
*
School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院)
;
School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)
机构
*
University of Georgia(佐治亚大学)
;
Tencent AI Lab(腾讯AI实验室)
;
The Education University of Hong Kong(香港教育大学)
;
The Hong Kong Polytechnic University(香港理工大学)
PAEC: Position-Aware Entropy Calibration for LLM Reasoning in RLVR
PAEC:面向RLVR中LLM推理的位置感知熵校准
Shumeng Yang, Yisu Liu, Jiayi Zheng, Zhaohui Yang, Linjing Li
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)
Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing
通过局部分支路由实现高效且可训练的语言模型测试时扩展
Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang
机构
*
Northwestern University(西北大学)
;
Rutgers University(罗格斯大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
LMSYS Org(LMSYS组织)
;
Tilde Research(Tilde研究)
;
University of California, Santa Barbara(加州大学圣塔芭芭拉分校)
;
University of Toronto(多伦多大学)
;
University of British Columbia(不列颠哥伦比亚大学)
;
University of California, San Diego(加州大学圣迭戈分校)