Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training
隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)
Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang
机构
*
College of Software, Nankai University(南开大学软件学院)
;
Zhongguancun Academy(中关村学院)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
East China Normal University(华东师范大学)
;
Zhejiang University(浙江大学)
;
Beijing Institute of Technology(北京理工大学)
Scheduling Your LLM Reinforcement Learning with Reasoning Trees
用推理树调度你的LLM强化学习
Hong Wang, Zhezheng Hao, Jian Luo, Chenxing Wei, Yao Shu, Lei Liu, Qiang Lin, Hande Dong, Jiawei Chen
机构
*
Cranberry-Lemon University(Cranberry-Lemon 大学)
;
University of the Witwatersrand(独立研究者)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
机构
*
Shanghai University of Finance and Economics(上海金融学院)
;
Ant Group(蚂蚁集团)
;
Southern University of Science and Technology(南方科技大学)
;
MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究教育部重点实验室)
Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms
解构大语言模型中的数学推理:对内部机制的调查
Tanja Baeumel, Josef van Genabith, Simon Ostermann
机构
*
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
;
Saarland University(萨尔兰大学)
;
Center for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)
Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards
用评分奖励模型治愈大语言模型数学推理中的奇迹步骤
Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He
机构
*
School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳))
;
UC Berkeley(加州大学伯克利分校)
;
Zhejiang University(浙江大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Renmin University of China(中国人民大学)
;
Xiaohongshu Inc.(小红书公司)
Document-Level Numerical Reasoning across Single and Multiple Tables in Financial Reports
跨单表和多表的财务报告中数字推理
Yi-Cheng Wang, Wei-An Wang, Chu-Song Chen
机构
*
Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学资讯工程学系)
;
FinTech Center, National Taiwan University(国立台湾大学金融科技中心)
BioAlchemy: Distilling Biological Literature into Reasoning-Ready Reinforcement Learning Training Data
生物炼金术:将生物文献提炼为可用于强化学习训练的数据
Brian Hsu, Ozan Gökdemir, Carlo Siebenschuh, Bruce Parrello, Neil Getty, Thomas S. Brettin, Rick L. Stevens, Ian T. Foster, Nicholas Chia, Arvind Ramanathan
机构
*
University of Chicago(芝加哥大学)
;
Argonne National Laboratory(阿贡国家实验室)