Sharpness-Guided Group Relative Policy Optimization via Probability Shaping
通过概率塑造的锐度引导组相对策略优化
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出GRPO-SG,通过降低可能引起过大梯度的token权重,提升RLVR的泛化能力,实验显示在数学推理、逻辑谜题和工具增强问答中表现更优。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
通过概率塑造的锐度引导组相对策略优化
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出GRPO-SG,通过降低可能引起过大梯度的token权重,提升RLVR的泛化能力,实验显示在数学推理、逻辑谜题和工具增强问答中表现更优。
迈向顺序公平性:通过双组优势优化缓解大语言模型的顺序敏感性
机构 * School of Software and Microelectronics, Peking University(软件与微电子学院,北京大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出双组优势优化(DGAO),通过平衡组内准确性优势和组间稳定性优势,缓解LLM的顺序敏感性,提升模型在RAG、数学推理和分类任务中的性能。
概率校准是语言模型中的可训练能力
机构 * Chandar Research Lab(昌达尔研究实验室) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; LAMA-WeST Lab(LAMA-WeST实验室) ; Polytechnique Montréal(蒙特利尔理工学院) ; Université de Montréal(蒙特利尔大学) ; Independent researcher(独立研究者)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文研究通过微调提升语言模型的概率校准能力,发现两种微调方法在不同任务中表现各异,硬目标方法在结构化数值采样更优,软目标方法在广泛随机生成任务中表现更好。
EVOCHAMBER:在个体、团队和种群层面进行多智能体系统的测试时间共进化
机构 * Oregon State University(俄勒冈州立大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Johnson & Johnson(强生公司) ; Pennsylvania State University(宾夕法尼亚州立大学) ; AG2AI, Inc.(AG2AI公司)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 EVOCHAMBER通过在多智能体系统中实现测试时间共进化,解决了传统方法在跨智能体学习和专业化保留上的不足,通过协作梦境协议和群体生命周期操作,在不同任务流上实现了显著的性能提升。
LLMs改进LLMs:测试时扩展的代理发现
机构 * UMD(马里兰大学) ; UVA(弗吉尼亚大学) ; WUSTL(华盛顿大学) ; UNC(北卡罗来纳大学) ; Google(谷歌) ; Meta
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出AutoTTS框架,通过环境驱动的方法自动发现测试时扩展策略,提升大语言模型性能,实验表明其在数学推理基准上的准确率与成本平衡优于人工设计基线。
Comments 25 pages
MoshiRAG: 异步知识检索用于全双工语音语言模型
机构 * Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥))
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出MoshiRAG,通过异步框架结合紧凑接口与选择性检索,提升全双工语音模型的事实性,同时保持交互性。
Comments Accepted to ICML 2026
GIFT: 用于扩散语言模型的引导重要性感知微调
机构 * Institute for Interdisciplinary Information Sciences(交叉信息科学研究院)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出GIFT方法,通过根据熵分配不同重要性权重来优化扩散语言模型的微调,从而在多个基准测试中优于标准SFT。
Comments preprint
MAGE:多智能体自进化与共进化知识图谱
机构 * University of New South Wales(新南威尔士大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 MAGE通过共进化知识图谱实现多智能体自进化,利用冻结弱骨干模型与任务级搜索带宽及技能级路由带宽协同更新,提升冻结学习者在多个领域任务中的表现。
Comments 25 pages, 3 figures
f-GRPO 与 beyond:基于发散性的强化学习算法用于通用大语言模型对齐
机构 * Department of Statistics, Purdue University(普渡大学统计学系) ; Department of Statistics, Michigan State University(密歇根州立大学统计学系)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出f-GRPO和f-HAL算法,通过发散性估计提升大语言模型对齐效果,在数学推理任务中改进GRPO并缓解奖励黑客问题。
Re²Math:研究级数学中的定理检索基准测试
机构 * Fudan University(复旦大学) ; Fudan University Shanghai Innovation Institute(复旦大学上海创新研究院) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 Re²Math基准测试旨在评估从部分数学证明中检索工具的能力,通过构建包含层级上下文和可选泄漏控制锚点提示的实例,评估系统在检索文献支持的数学工具时的准确性与适用性。
CoDistill-GRPO:一种高效的群体相对策略优化共蒸馏方法
机构 * University of Michigan, Ann Arbor(密歇根大学,安阿伯分校) ; Google Research(谷歌研究院) ; Google DeepMind(谷歌DeepMind)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出CoDistill-GRPO,通过同时训练大模型和小模型,利用精心设计的GRPO目标提升小模型性能,减少计算开销,在数学基准上显著优于标准GRPO。
中期使用自生成数据提升语言模型中的强化学习
机构 * Arizona State University(亚利桑那州立大学) ; Google Cloud AI Research(谷歌云人工智能研究) ; Google DeepMind(谷歌DeepMind)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文研究在强化学习前使用多样化的自生成数据提升语言模型的强化学习效果,通过自生成数据训练后,模型在数学推理等任务中表现更优。
CoCoDA:用于工具增强代理的共进化组合DAG
机构 * Emory University(埃默里大学) ; Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 CoCoDA通过共进化规划器和工具库,利用组合代码DAG结构提升工具库检索效率和规划效果,实现在数学推理和代码任务中的性能提升。
直接对齐算法之间的差异变得模糊
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文系统比较了直接对齐算法,发现排名目标是影响对齐质量的主要因素,而特定的标量分数次之。
NSMQ谜题:一个科学和数学谜题的基准,用于评估大型语言模型
机构 * ETH Zurich(苏黎世联邦理工学院) ; Charité - Universitätsmedizin Berlin(柏林夏里特医学院) ; Kwame AI Inc.(夸梅人工智能公司) ; Ashesi University(阿什西大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出NSMQ谜题基准,基于加纳国家科学与数学竞赛的谜题,评估大型语言模型的科学和数学推理能力,发现即使是最先进的模型也难以应对。
Comments 15 pages. Accepted at the 27th International Conference on Artificial Intelligence in Education
BoHA:基于块状哈达玛积的参数高效微调
机构 * Department of Computer Science(计算机科学系)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 BoHA通过块状哈达玛积适配在参数受限下提升模型微调性能,保留初始任务表现,优于LoRA并在连续学习中表现优异。
超越负回滚:仅正回滚的策略优化
机构 * University of Washington(华盛顿大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出POPO框架,通过仅使用在线正回滚进行学习,避免负回滚,并通过siamese网络和相似性惩罚提升稳定性,实验证明其在数学基准测试中性能优于GRPO。
EternalMath: 一个与人类发现同步演化的前沿数学基准
机构 * School of Mathematics, Renmin University of China(中国人民大学数学学院) ; Tencent(腾讯)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出一个自动化数学推理评估框架,通过将最新数学文献转化为可执行任务,构建可扩展的EternalMath基准,揭示LLM在前沿数学上的性能差距。
基于连续思维的马尔可夫链深度思考
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) ; Department of Statistics, University of Oxford(牛津大学统计系) ; Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) ; Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出MarCos模型,通过连续表示实现多步推理,提升数学任务处理速度,实现并行思维。
在整合前解耦:测试时合成SFT和RLVR任务向量
机构 * Department of Systems Engineering and Engineering Management, Chinese University of Hong Kong, Hong Kong, China(系统工程与工程管理系,香港中文大学,香港,中国) ; Department of Computer Science, Hong Kong Baptist University, Hong Kong, China(计算机科学系,香港 Baptist 大学,香港,中国) ; DAMO Academy, Alibaba Group, Hangzhou, China(达摩院,阿里巴巴集团,杭州,中国) ; Hupan Lab, Hangzhou, China(虎派实验室,杭州,中国)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出DoTS框架,通过测试时任务向量运算解耦SFT和RLVR,减少干扰并提升性能,实验表明其在多个数学推理基准上表现优异。
TUR-DPO:基于拓扑和不确定性的直接偏好优化
机构 * Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(人工智能与创新中心,乌尔米耶大学,伊拉克) ; Department of Computer Engineering, University of Kurdistan, Iran(计算机工程系,乌尔米耶大学,伊朗) ; Centre for Artificial Intelligence Research and Optimisation, Torrens University Australia, Brisbane, Australia(人工智能研究与优化中心,塔伦斯大学澳大利亚,布里斯班,澳大利亚) ; Research and Innovation Center, Obuda University, Budapest 1034, Hungary(研究与创新中心,奥布达大学,布达佩斯1034,匈牙利) ; Center for Machine Vision and Signal Analysis (CMVS), University of Oulu, Finland(机器视觉与信号分析中心(CMVS),奥卢大学,芬兰)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 TUR-DPO通过引入轻量级推理拓扑和结合语义忠实度、效用和拓扑质量,提升偏好对齐的稳定性与鲁棒性,同时保持训练简洁性和无需在线回滚。
Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)
将确定性结构编译进SLM以获取优势
机构 * School of Science and Technology(科学与技术学系) ; Kwansei Gakuin University(冈山学院大学) ; School of Engineering & Computer Science(工程与计算机科学学系) ; Victoria University of Wellington(惠灵顿维多利亚大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出SGDe框架,通过编译代理工作流为离散执行计划,提升SLM在推理和数据主权方面的性能。
将拼图碎片放在关键位置:一种用于强化学习的问题增强框架
机构 * Tsinghua University(清华大学) ; Fudan University(复旦大学) ; Peking University(北京大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出PieceHint框架,通过战略性提供关键推理步骤,解决强化学习中训练易问题过拟合和训练难问题奖励稀疏的问题,实验表明其在数学推理基准上性能优异且保持pass@k多样性。
分布对齐博弈用于答案级微调
机构 * Google Research(谷歌研究) ; Microsoft Research(微软研究)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。
探索剪枝的极限:任务特定神经元、模型崩溃与任务特定大语言模型中的恢复
机构 * BRAC University(布拉格大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 研究通过系统剪枝实验揭示任务特定语言模型中神经元的专有性,发现任务特定神经元对性能至关重要,剪枝策略影响模型鲁棒性和恢复能力。
PAINT:部分解适应插值训练用于自蒸馏推理器
机构 * Tsinghua University(清华大学) ; Beihang University(北航)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 PAINT通过部分解适应插值训练,在自蒸馏推理器中提升大语言模型的推理能力,优于现有基线方法。
学生指导教师:通过频谱正交探索实现弱到强推断
机构 * Baidu Inc.(百度公司) ; Nanyang Technological University(南洋理工大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出Spectral Orthogonal Exploration框架,通过正交探针引入语义异质性推理信号,提升数学推理任务的准确率和采样效率。
Comments Accepted to ACL 2026 Main Conference
异质自适应策略优化:针对每个token的性质进行定制化优化
机构 * Peking University Shanghai AI Laboratory(北京大学上海人工智能实验室) ; Beihang University(北京航空航天大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Peking University Zhongguancun Academy, 5 Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京大学中关村学院,5北京软件硬件协同人工智能系统重点实验室)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 本文提出HAPO算法,通过熵度量异质性指导优化,实现细粒度调节。算法包含四个核心组件,通过token级处理提升LLM在数学推理、代码和逻辑任务中的性能。
从洞察到行动:一种新的框架,用于基于可解释性指导的数据选择在大语言模型中
机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室,中国) ; Alibaba Group, China(阿里巴巴集团,中国)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出IGDS框架,通过内部任务特征识别和选择共振数据来提升大语言模型性能,实验显示在数学推理任务中数据效率提升显著。
从原型到课堂:面向量子教育的智能辅导系统
机构 * Center for Real-Time Computing(实时计算中心) ; Computer Science Department(计算机科学系) ; Old Dominion University(旧 Dominion 大学) ; Physics Departments(物理系)
专题命中 数学推理 :planning(abstract);分类 cs.AI
AI总结 本文提出ITAS系统,通过多智能体架构和课程设计解决量子教育中的可靠性问题,验证系统在真实课堂中的可行性及教学分析能力。
Comments 10 pages, 6 figures, 1 table. Submitted to IEEE QCE 2026. Companion papers (in preparation): ITAS architecture and latency analysis