机构
*
Tencent AI Seattle Lab(腾讯AI西雅图实验室)
;
Washington University in St. Louis(华盛顿大学圣路易斯分校)
;
University of Maryland, College Park(马里兰大学科廷分校)
;
The University of Texas at Dallas(德克萨斯大学达拉斯分校)
What Makes Low-Bit Quantization-Aware Training Work for Reasoning LLMs? A Systematic Study
是什么使低比特量化感知训练在推理大语言模型中有效?一项系统研究
Keyu Lv, Manyi Zhang, Xiaobo Xia, Jingchen Ni, Shannan Yan, Xianzhi Yu, Lu Hou, Chun Yuan, Haoli Bai
机构
*
Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Huawei Technologies(华为技术有限公司)
;
National University of Singapore(新加坡国立大学)
C$^2$GSPG: Confidence-calibrated Group Sequence Policy Gradient towards Self-aware Reasoning
C$^2$GSPG:基于置信度校准的群体序列策略梯度方法,用于自感知推理
Haotian Liu, Shuo Wang, Hongteng Xu
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高陵人工智能学院)
;
Tsinghua University(清华大学)
;
Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室)
;
Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索工程研究中心)
Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
套利:通过优势感知投机实现高效推理
Monishwaran Maheswaran, Rishabh Tiwari, Yuezhou Hu, Kerem Dilmen, Coleman Hooper, Haocheng Xi, Nicholas Lee, Mehrdad Farajtabar, Michael W. Mahoney, Kurt Keutzer, Amir Gholami
An Investigation of Robustness of LLMs in Mathematical Reasoning: Benchmarking with Mathematically-Equivalent Transformation of Advanced Mathematical Problems
对LLMs在数学推理中鲁棒性的调查:通过高级数学问题的数学等价转换进行基准测试
Yuren Hao, Xiang Wan, ChengXiang Zhai
机构
*
Department of Computer Science University of Illinois Urbana–Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)
;
Department of Computer Science Stanford University(计算机科学系斯坦福大学)
机构
*
Department of Electrical & Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)
;
AI Lab, Princeton University(普林斯顿大学人工智能实验室)
;
Department of Computer Science & Engineering, University of Michigan(密歇根大学计算机科学与工程系)
机构
*
Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)
;
College of AI, Tsinghua University(清华大学人工智能学院)
;
Shanghai Qi Zhi Institute(上海启智研究所)
;
State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室)
FlowRL: Matching Reward Distributions for LLM Reasoning
Xuekai Zhu, Daixuan Cheng, Dinghuai Zhang, Hengli Li, Kaiyan Zhang, Che Jiang, Youbang Sun, Ermo Hua, Yuxin Zuo, Xingtai Lv, Qizheng Zhang, Lin Chen, Fanghao Shao, Bo Xue, Yunchong Song, Zhenjie Yang, Ganqu Cui, Ning Ding, Jianfeng Gao, Xiaodong Liu, Bowen Zhou, Hongyuan Mei, Zhouhan Lin
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Microsoft Research(微软研究院)
;
Tsinghua University(清华大学)
;
Peking University(北京大学)
;
Renmin University of China(中国人民大学)
;
Stanford University(斯坦福大学)
;
Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)
Comments24 pages, 3 figures, 13 tables. The paper is accepted at AACL-IJCNLP 2025 (main track), and the latest version adds modifications in camera-ready