arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-15 至 2026-07-15 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2602.02244 2026-07-15 cs.LG cs.CL 版本更新 81%

Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models

在学习中保持好奇心:通过自适应自蒸馏实现熵保持的监督微调以提升大推理模型

Hao Wang, Hao Gu, Hongming Piao, Kaixiong Gong, Yuxiao Ye, Xiangyu Yue, Sirui Han, Yike Guo, Dapeng Wu

机构 * City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 CurioSFT通过自适应自蒸馏和熵引导温度选择,提升大推理模型的探索能力,在监督微调和强化学习阶段均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00492 2026-07-15 cs.AI 版本更新 57%

Rethinking Reward Models for Multi-Domain Test-Time Scaling

重新思考多领域测试时扩展的奖励模型

Dong Bok Lee, Seanie Lee, Sangwoo Park, Minki Kang, Jinheon Baek, Dongki Kim, Dominik Wagner, Jiongdao Jin, Heejun Lee, Tobias Bocklet, Jinyu Wang, Jingjing Fu, Sung Ju Hwang, Jiang Bian, Lei Song

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) TH Nürnberg

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 研究多领域测试时扩展的奖励模型,对四种奖励模型变体进行统一评估,发现dORM与dPRM相当,gPRM无竞争力,gORM最稳健,挑战细粒度监督更好的假设,支持生成式结果验证并公开代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18030 2026-07-15 cs.HC 版本更新 50%

ParaTutor: Coordinating Parent and Child Math Tutoring through Role Separated LLM Scaffolding

ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导

Lan Luo, Anqi Wang, Muzhi Zhou, Junhua Zhu, Jie Cai, Ao Yu, Hui Pan

专题命中 数学推理 :reasoning(abstract)

AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏