Statistical Early Stopping for Reasoning Models
统计早停法用于推理模型
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
统计早停法用于推理模型
专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。
学习随推理展开:用于高效强化学习的渐进式展开分配
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。
熵梯度反转:迈向大型推理模型的内部机制
机构 * National University of Singapore(新加坡国立大学) ; Renmin University of China(中国人民大学) ; Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文发现大型推理模型中令牌熵与logit梯度之间的稳健负相关(熵梯度反转),并提出相关性正则化组策略优化(CorR-PO)将其嵌入强化学习奖励正则化,从而提升推理性能。
Comments 15 pages, 5 figures, 8 tables
小型模型是GRPO中策略级多样性的自然探索者
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。
数学教育数字影子:促进与LLMs学习的工具:数学表现、焦虑与自信在模拟学生和AI中的表现
机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)
专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MEDS数据集,通过28000个模拟角色评估LLMs在数学教育中的表现,结合心理和社会人口数据及数学任务,探讨自我效能、数学焦虑和认知网络科学。
用于SeePhys Pro的多智能体辩论与视觉信息提取:ICML 2026 AI4Math赛道3挑战赛的第一名技术报告
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 针对回答含图像的大学物理问题的SeePhys Pro任务,提出两阶段框架,包括视觉信息提取和多智能体辩论推理阶段,提高了准确率,在挑战赛中获第一名,分析得出编排收益及图形辅助价值与问题图像占比相关的结论。