arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3894 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 275 篇

2607.05992 2026-07-08 cs.CL cs.AI 新提交 81%

PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

PluraMath:将数学推理评估扩展到资源丰富语言之外

Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) Applied AI Institute(应用人工智能研究所) Charles University(查尔斯大学) Nazarbayev University(纳扎尔拜大学) Inria(法国国家信息与自动化研究所) Indian Institute of Technology, Kharagpur (IIT Kharagpur)(印度Kharagpur理工学院) German University of Digital Science(德国数字科学大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对数学推理评估基准偏向高资源语言的问题,引入PluraMath,将其扩展到18种资源不足语言,通过人工策划构建数据集,对27个推理LLMs进行基准测试,分析性能差距,开源相关内容以推动多语言基准开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05861 2026-07-08 cs.CL cs.LG 新提交 81%

Mitigating Factual Hallucination in Large Reasoning Models via Mixed-Mode Advantage Regularization

通过混合模式优势正则化减轻大型推理模型中的事实幻觉

Kaishen Wang, Tong Zheng, Xuehao Cui, Ruibo Chen, Tianyi Xiong, Heng Huang

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,College Park)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究大型推理模型在面向事实问答中存在思维诱导幻觉的问题,提出MARGO框架,通过构建混合模式展开组评估思维价值,抑制幻觉思维,实验证明该方法在提升事实可靠性的同时保留了推理能力。

Comments 19 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25524 2026-06-26 cs.AI cs.CL 新提交 81%

Cliff Tokens: Identifying Single-Token Failure Triggers in LLM Mathematical Reasoning

Cliff Tokens: 识别大语言模型数学推理中的单Token失败触发点

Jaeyong Ko, Pilsung Kang, Yukyung Lee

机构 * Seoul National University(首尔大学) Boston University(波士顿大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出“悬崖token”概念,通过自适应阈值和单侧双比例z检验识别导致推理失败的单个token,删除并重采样可恢复pass@64至1.0,并基于贪心选择和token熵建立分类法,通过Cliff-DPO优化提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22716 2026-06-23 cs.AI cs.CL 新提交 81%

Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards

超越惩罚错误:通过自适应仅正确奖励稳定大型推理模型的效率训练

Jungseob Lee, Seungyoon Lee, Seongtae Hong, Minhyuk Kim, Chanjun Park, Heuiseok Lim

机构 * Korea University(高丽大学) Soongsil University(崇实大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对GRPO中长度惩罚导致奖励崩溃的问题,提出ACOER方法,通过仅对正确回答给予简洁奖励并动态调整预算,在数学推理任务中准确率提升且生成token减少超60%。

Comments 13 pages, 3 figures, 7 tables. Code: https://github.com/js-lee-AI/ACOER

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16934 2026-06-16 cs.CL cs.LG 新提交 81%

Exploring Extrinsic and Intrinsic Properties for Effective Reasoning with Code Interpreter

探索代码解释器有效推理的外在属性与内在属性

Patomporn Payoungkhamdee, Napat Laosaengpha, Jenta Wonglertsakul, Pittawat Taveekitworachai, Pume Tuchinda, Panjapong Poobanchuen, Ekapol Chuangsuwanich, Can Udomcharoenchaikit, Samuel Cahyawijaya, Peerat Limkonchotiwat, Sarana Nutanong

机构 * Vidyasirimedhi Institute of Science and Technology(维达亚希米科技学院) Kasetsart University(科琼大学) SCB 10X King Mongkut’s University of Technology Thonburi(朱拉隆功技术大学泰竹分校) Department of Computer Engineering Chulalongkorn Univesity(朱拉隆功大学计算机工程系) Cohere AI Singapore(AI新加坡)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文从外在属性(关键token)和内在属性(代码特定认知行为)两个角度研究代码解释器推理,发现强模型更频繁出现关键token和验证、回溯等行为,并利用这些属性在推理和训练中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16316 2026-06-16 cs.IR cs.AI cs.LG 新提交 81%

RL-Index: Reinforcement Learning for Retrieval Index Reasoning

RL-Index:用于检索索引推理的强化学习

Yongjia Lei, Nedim Lipka, Zhisheng Qi, Utkarsh Sahu, Koustava Goswami, Franck Dernoncourt, Ryan A. Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) Adobe Research(Adobe研究)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出RL-Index框架,将检索索引推理转化为强化学习问题,通过LLM生成理由增强文档,使用GRPO优化,提升检索和问答性能并降低在线延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15576 2026-06-16 cs.LG cs.AI 新提交 81%

Localizing Credit at the Divergence: Path-Conditioned Self-Distillation for LLM Reasoning

在分歧处定位信用:路径条件自蒸馏用于LLM推理

Yu Li, Shu Hong, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Hindsight Self-Distillation (HSD)方法,通过将教师模型条件于当前训练组中的成功同伴轨迹,在失败与成功轨迹的分歧处提供密集信用信号,提升LLM在数学和代码推理任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15080 2026-06-16 cs.CL cs.AI 新提交 81%

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

AdaMame: 一种自适应多语言推理的训练方案

Dayeon Ki, Kevin Duh, Marine Carpuat

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多语言推理中的语言崩溃问题,提出两阶段训练方案AdaMame,通过SFT建立多语言能力,再以自适应GRPO优化推理语言对齐,在准确率、语言保真度和令牌效率上达到帕累托最优。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10254 2026-06-10 cs.AI cs.CL 新提交 81%

RealMath-Eval: Why SOTA Judges Struggle with Real Human Reasoning

RealMath-Eval:为何SOTA裁判难以应对真实人类推理

Yiteng Mao, Kenan Xu, Yijia Lyu, Wenhao Li, Jianlong Chen, Xiangfeng Wang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) East China Normal University(华东师范大学) New York University(纽约大学) Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出RealMath-Eval基准,评估LLM裁判对真实学生数学解答的评分能力,发现与人类评分存在高均方误差,而合成数据上表现更好,揭示评估差距源于人类错误空间的多样性和高信息熵。

Comments Code available at https://github.com/RicharMd/RealMath-Eval , Data available at https://huggingface.co/datasets/RicharMd/RealMath-Eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09873 2026-06-10 cs.LG cs.AI 新提交 81%

Rotate2Think: Geometric Priming via Orthogonal Rotation to Improve Language Model Reasoning

Rotate2Think:通过正交旋转进行几何提示以提升语言模型推理能力

Aditya Sharma, Christopher J. Pal, Amal Zouaq

机构 * Polytechnique Montréal(蒙特利尔综合理工学院) Mila - Quebec AI Institute(Mila-魁北克人工智能研究所) LAMA-WeST Lab(LAMA-WeST实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 发现推理模型的输入嵌入与思考嵌入存在高锥度且方向非共线,提出无训练方法Rotate2Think,通过正交Procrustes分析估计旋转并注入合成思考向量,在30/32配置中提升数学、科学和代码任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07006 2026-06-08 cs.LG cs.CL 新提交 81%

RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning

RASFT: 用于推理的滚动自适应监督微调

Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) New Jersey Institute of Technology(新泽西理工学院) Institute of Computing Technology, CAS(中国科学院计算技术研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出RASFT框架,通过基于策略rollout的问题级可解性校准专家监督,在模型困难时加强指导、表现可靠时放松模仿并纳入自生成轨迹,同时使用裁剪逆比约束策略漂移,在多个推理基准上优于SFT和RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06920 2026-06-08 cs.LG cs.AI 新提交 81%

The Fine-Tuning Trap: Evaluating Negative Transfer and the Role of PEFT in Sub-1B Mathematical Reasoning

微调陷阱:评估负迁移及PEFT在亚十亿参数数学推理中的作用

Rahul Nair, Chun Tao

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究评估了五种亚十亿参数模型在数学推理任务中的微调策略,发现全量微调对小于3亿参数的模型造成负迁移,而参数高效微调(PEFT)是稳定性要求。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08889 2026-08-11 cs.AI 新提交 79%

LLM Reasoning for Subjective Tasks: Failure Modes, Mitigation, and Dynamic Reasoning Routing

用于主观任务的大语言模型推理:失败模式、缓解措施与动态推理路由

Juncheng Dong, Ding Tong, Ishan Gupta, Yuyan Wang

机构 * Duke University(杜克大学) Netflix(网飞公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对主观任务中LLM推理的失败模式,提出带条件长度惩罚的后训练算法缓解推理崩溃,还发现推理风格不匹配是主观验证误差主因,给出算法补丁与架构蓝图。

Comments 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06347 2026-08-07 cs.CL 新提交 79%

RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer

RP-OPSD:基于推理枢轴引导的多语言推理迁移在线策略自蒸馏

Xinye Wang, Junxiao Liu, Shujian Huang

机构 * Nanjing University(南京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对多语言推理迁移中现有在线策略自蒸馏未优先考虑关键推理信号的问题,提出 RP-OPSD 方法,利用教师视图分布偏移引导特权蒸馏,在 17 种语言的数学推理基准上优于基线,提升了多语言推理能力。

Comments 16 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05541 2026-08-07 cs.AI 新提交 79%

Hyper-ES: Effective Evolution Strategies for LLM Reasoning via Descent Direction Merging

Hyper-ES:通过下降方向合并实现LLM推理的有效进化策略

Yu Gu, Zhi Zheng, Yunpeng Ba, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang

机构 * Southern University of Science and Technology(南方科技大学) National University of Singapore(新加坡国立大学) Nanjing University(南京大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Hyper-ES框架,通过梯度微调获取下降方向张成子空间,再用CMA-ES优化DARE-TIES合并系数,在数学推理任务上性能优于GRPO-LoRA,梯度更新量减少10%。

Comments 19 pages, 4 figures, 14 tables. Code: https://github.com/kuangrepi/Hyper-ES

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02149 2026-08-04 cs.AI 新提交 79%

Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning

超越均值:面向大语言模型推理的多时刻策略优化

Yijun Zhang, Yule Xie, Jiaxin Ding, Xin Ding, Fan Xu, Haoxiang Zhang, Luoyi Fu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对大语言模型推理提出多时刻策略优化(MMPO)框架,联合最小化失败概率分布的多个矩,在五个数学推理基准上优于基线方法,为策略优化目标设计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02026 2026-08-04 cs.AI 新提交 79%

HPFA: Hypergraph-Based Paired Failure Attribution for LLM Reasoning

HPFA:基于超图的大语言模型推理配对失败归因

Runchuan Zhu, Hongbin Lai, Bowen Jiang, Junrui Zhang, Zhangheng LI, Ostap Kilbasovych, Junyuan Hong

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对LLM推理的失败归因缺陷,提出HPFA框架,通过超图配对分析高效定位根本原因,提升归因准确率与效率,训练的归因器可改善推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01631 2026-08-04 cs.CL 新提交 79%

Does Accuracy Equal Evidence? Reasoning Faithfulness under KV Cache Compression

准确率等同于证据吗?KV缓存压缩下的推理忠实性

Mengting Ai, Jingrui He, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对大型推理模型,发现KV缓存压缩中存在答案-证据差距,即令牌驱逐类方法可保留高准确率却大幅降低推理忠实性,而量化方法受影响更小,表明失效源于推理轨迹部分丢失。

Comments https://github.com/famous-blue-raincoat/Safe_KV_Compress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01593 2026-08-04 cs.AI 新提交 79%

Latent Thought Credit: Multi-Answer Credit Assignment for Latent Reasoning

潜思维信用:面向潜推理的多答案信用分配

Xuyang Zhao, Liting Zhang, Zichen Xu, Yong Chen, Wenjia Zeng, Shiwan Zhao, Qicheng Li

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究针对潜推理的信用分配难题,提出LTC分层框架,结合多答案估计与GRPO在线策略训练,在数学推理等任务上取得最优平均准确率,可降低奖励估计误差并缓解思维级信用问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00605 2026-08-04 cs.AI 新提交 79%

Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs

逃离置信陷阱:扩散大语言模型数学推理的进化解码

Zhenhong Sun, Hanqing Zhao, Yatao Bian, Rongcheng Tu, Liuyue Xie, Xu Zhang, Jue Wang, Davide Modolo, Daoyi Dong, Dacheng Tao

机构 * Australian National University(澳大利亚国立大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊) University of Technology Sydney(悉尼科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29549 2026-08-03 cs.AI 新提交 79%

AMTFV: Agentic Mathematical Tool-Flow Verification for LLM Self-Correction

AMTFV:面向LLM自校正的智能体数学工具流验证

Rui Zou, Yutao Zhu, Mengqi Wei, Ji-Rong Wen

专题命中 数学推理 :self-correction(title);reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLM数学答案验证难题,提出AMTFV方法,通过MTF接口解耦验证建模与执行,在5个数学推理数据集上较基线提升最高8.3个百分点,验证复杂度越高增益越显著。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28449 2026-07-31 cs.CL 新提交 79%

Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models

Lightning OPD 2.0:缓解大型推理模型跨教师在线策略蒸馏中的风格偏差

Yecheng Wu, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 Lightning OPD 2.0通过交叉拟合风格残差化缓解大型推理模型跨教师在线策略蒸馏的风格偏差,在数学推理与代码生成基准中优于原方法,实现了跨教师设置下的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27484 2026-07-31 cs.AI cs.MA 新提交 79%

Skill Use or Skill Theater? Evaluating the Reasoning Backroom in Skill-Augmented Language Agents

技能使用还是技能表演?评估技能增强型语言智能体中的推理后台

Jinwei Hu, Yi Qi, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对技能增强型语言智能体,提出BACKTRACE评估框架及BACKROOMBench测试平台,发现其存在推理后台现象,即技能使用声明与实际决策影响存在系统性差距,需通过干预进行审计。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20520 2026-07-24 cs.AI cs.HC cs.PL 新提交 79%

Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving

数学问题解决中大型语言模型在可执行推理约束下的表示鲁棒性

Sagnik Nath, Edith Aurora Graf, Liang Zhang, Diego Zapata-Rivera

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大型语言模型在数学问题解决中表示鲁棒性,通过改变问题表面表示评估五个模型,发现其对表示敏感,代码增强未统一提升鲁棒性,揭示了正确性等方面新权衡,强调表示应作为接口设计变量。

Comments presented at the 28th International Conference on Human-Computer Interaction (2026), Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19962 2026-07-23 cs.AI 新提交 79%

EvoThink: Evolving Thinking in Large Reasoning Models via Self-Pruning and Aha-Moment Preference Optimization

EvoThink:通过自剪枝和顿悟时刻偏好优化在大型推理模型中进化思维

Xinbang Dai, Zheyu Xin, Huikang Hu, Lin Ren, Rihui Jin, Guohui Xiao, Guilin Qi, Kuicai Dong, Zhaocheng Du, Yuyang Zhang

机构 * Southeast University(东南大学) Noah’s Ark Lab(诺亚方舟实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大型推理模型过度思考问题,提出EvoThink框架,含自剪枝训练和顿悟时刻偏好优化两个关键组件,能减少冗余验证、探索新推理路径,经评估可提高推理效率与能力。

Comments 9 pages, 7 figures, accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18979 2026-07-22 cs.AI 新提交 79%

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因

Wentao Zhang, Haoyu Zhang, Xinke Jiang, Yuxuan Cheng, Yuhan Pan, Miao Li, Zhipeng Qiao, Tao Feng, Zhen Tao, Dengji Zhao

机构 * ShanghaiTech University(上海科技大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。

Comments 19 pages, 4 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18915 2026-07-22 cs.CL 新提交 79%

Reasoning Error from Known Fact: Step-Level Self-Consistency Group Relative Policy Optimization for LLM

已知事实导致的推理错误:针对大语言模型的步骤级自一致性组相对策略优化

Xiaomeng Hu, Jiaqi Hu, Hao Chen, Qi Zhang, Zhanming Shen, Wentao Ye, Junbo Zhao

机构 * Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 针对大语言模型推理中因上下文干扰产生事实错误的问题,提出步骤级自一致性组相对策略优化(SSC - GRPO),通过计算自一致性分数分配步骤级奖励,在数学推理基准和幻觉排行榜上取得领先,为检测和减轻幻觉提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18266 2026-07-22 cs.AI 新提交 79%

Structured Synthetic Reasoning Data for Arithmetic Fine-Tuning of Small Language Models

用于小型语言模型算术微调的结构化合成推理数据

Jake O'Grady, Effirul Ramlan

机构 * University of Galway(戈尔韦大学) School of Computer Science(计算机科学学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究小型语言模型多步算术推理困难问题,通过生成结构化合成推理数据并结合LoRA在消费硬件上微调Qwen3模型,提高了模型在GSM8K等基准测试上的准确率和迁移效果,证明低成本合成数据设计可改善小型语言模型算术适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14709 2026-07-17 cs.CL 新提交 79%

Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text

用于混合表格和文本的金融推理的黄金引导式程序蒸馏

Yun Dong, Erica Zhao, Elana Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究针对混合表格和文本数据的金融推理问题,基于程序蒸馏开发方法,利用黄金推导指导程序合成,经执行验证转移可靠数值推理,引入迭代恢复阶段,实验表明该框架能有效训练小模型进行可靠数值推理。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07391 2026-07-09 cs.AI 新提交 79%

MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning

MIRA-Math:最小信息请求与数学推理基准测试

Charbel Al Bateh, Samer Saab

机构 * Lebanese American University(黎巴嫩美国大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 介绍MIRA-Math基准测试,用于解决特定数学问题,求解器需按预算请求缺失信息并整合到答案,包含多类实例,实验表明请求成功率和答案准确率可分离,还发布相关工具支持可重复评估。

详情

展开后加载摘要…

URL PDF HTML 收藏