arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3894 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 275 篇

2607.22629 2026-07-28 cs.AI cs.CL 新提交 84%

Masked Distillation: Internalizing the Chain-of-Thought in Language Models

掩码蒸馏:将思维链内化到语言模型中

Durgesh Kalwar, Vardhan Palod, Subbarao Kambhampati

机构 * SCAI, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 数学推理 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究能否将大型推理模型中间步骤计算内化到语言模型参数中,提出掩码蒸馏框架,在自我蒸馏和双模型设置中实例化,并改变中间令牌支架长度,通过实验在GSM8K和Countdown推理领域进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23181 2026-06-23 cs.AI cs.CL 新提交 84%

DART: Draft-Agreement Routing for Training-Free Adaptive Thinking Budgets in Hybrid Reasoning Models

DART: 用于混合推理模型中免训练自适应思考预算的草案一致路由

Jungseob Lee, Seongtae Hong, Seungjun Lee, Jaehyung Seo, Junyoung Son, Sugyeong Eo, Chanjun Park, Hyeongju Park, Hyeonseok Moon, Heuiseok Lim

机构 * Korea University(高丽大学) dot(42dot) Konkuk University(建国大学) Yonsei University(延世大学) Soongsil University(崇实大学) Kumoh National Institute of Technology(金乌国立技术学院)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出免训练路由框架DART,通过采样两个廉价无思考草案,当草案一致时直接回答,不一致时根据草案熵预测思考预算,在保持或提升准确率的同时大幅减少思考令牌使用。

Comments 15 pages, 4 figures, 16 tables. Code: https://github.com/js-lee-AI/DART

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13125 2026-06-12 cs.LG cs.AI 新提交 84%

Select and Improve: Understanding the Mechanics of Post-Training for Reasoning

选择与改进:理解推理后训练的机制

Akshay Krishnamurthy, Audrey Huang, Nived Rajaraman

机构 * Microsoft Research NYC(微软研究院纽约) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过控制实验揭示强化学习后训练通过策略选择和策略改进两种机制提升推理能力,并指出SFT数据和RL数据的不同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07410 2026-06-08 cs.LG cs.AI 新提交 84%

A Comprehensive Anatomy of Human and DeepSeek-R1 LLM Mathematical Reasoning

人类与DeepSeek-R1大语言模型数学推理的全面解剖

Yuxiang Chen, Jun Wang

机构 * UCL Centre for Artificial Intelligence(伦敦大学人工智能中心)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 通过AIME 2025所有30道题目的10247个推理步骤注释,发现DeepSeek-R1存在拓扑模仿(表面模仿推理而非真正推理),但成功轨迹中分支与回溯的稳定使用以及反射在演绎推理中的有效放置是真正推理的信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10928 2026-08-12 cs.AI 新提交 83%

ThinkRetrieve: Retrieval-Augmented Reasoning Traces for Test-Time Scaling

ThinkRetrieve:用于测试时缩放的检索增强推理轨迹

Vaibhav Singh, Soumya Suvra Ghosal, Sarvesh Gharat, Soumyabrata Pal, Ramasuri Narayanam, Dinesh Manocha

机构 * IIT Bombay(印度理工学院孟买分校) University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(奥多比研究院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对大型推理模型测试时缩放的负面效果,提出ThinkRetrieve框架,通过每步动态检索已解决示例注入推理轨迹,在四个数据集上对五个模型实现最高60%的相对准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01922 2026-08-04 cs.CL 新提交 83%

TRAM: Enhancing Multimodal Reasoning with Trajectory-Derived Auxiliary Memory

TRAM:利用轨迹衍生辅助记忆增强多模态推理

Kang Liu, Zijing Wang, Yongkang Liu, Mengjie Zhao, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TRAM是一种无需训练的多模态推理增强方法,通过轨迹衍生辅助记忆整合推理信息,在4种MLRM变体的8个基准测试中提升了多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22002 2026-07-27 cs.AI 新提交 83%

Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

学习随推理展开:用于高效强化学习的渐进式展开分配

Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25568 2026-06-25 cs.CL 新提交 83%

Riazi-8B: An Urdu Large Language Model for Mathematical Reasoning

Riazi-8B:用于数学推理的乌尔都语大语言模型

Azher Ali, Ibtsam Haider, Raja Khurram Shahzad, Seemab Latif, Mehwish Fatima

机构 * School of Electrical Engineering and Computer Science (SEECS)(电气工程与计算机科学学院) National University of Sciences and Technology (NUST)(国家科学与技术大学) Department of Communication, Quality Management and Information Systems(通信、质量管理与信息系统系) Mid Sweden University(中瑞典大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对乌尔都语数学推理资源匮乏的问题,提出Riazi-8B模型,通过乌尔都语维基百科继续预训练和GSM8K链式思维数据微调,在MGSM-乌尔都语基准上显著提升答案正确性和推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22798 2026-06-23 cs.CL 新提交 83%

Does the Same Token Mean the Same State? MoE Routing as Signal for Reasoning Control

相同的 Token 是否意味着相同的状态?MoE 路由作为推理控制的信号

Kang Chen, Minshen Yu, Junjie Nian, Yaoning Wang, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 研究发现稀疏 MoE 语言模型中相同 token 的路由状态因上下文而异,基于此提出 RAD 方法,通过路由一致性选择输出,无需解析答案字符串,在数学、GPQA 和代码任务上表现与多数投票相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18624 2026-06-18 cs.CL 新提交 83%

PragReST: Self-Reinforcing Counterfactual Reasoning for Pragmatic Language Understanding

PragReST:用于语用语言理解的自我强化反事实推理

Jihyung Park, Minchao Huang, Leqi Liu, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL

AI总结 提出PragReST框架,通过自监督构建语用问答数据、生成反事实推理轨迹,结合监督微调和强化学习提升大语言模型的语用推理能力,在四个基准上显著优于基线模型。

Comments First two authors contributed equally. Code and models: https://github.com/jihyung803/PragReST

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16010 2026-06-16 cs.IR cs.AI 新提交 83%

Theorem-Grounded Execution Ontologies for Interpretable Machine Reasoning

定理驱动的可执行本体用于可解释机器推理

Raghu Anantharangachar

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出TGEO框架,将推理建模为可执行状态转换过程,通过定理族识别、本体绑定、语义对象发现等步骤生成可解释推理图,实现可验证、可重放的AI推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12689 2026-06-12 cs.CL 新提交 83%

Observable Patterns Are Not Explanations: A Causal-Geometric Analysis of Latent Reasoning Models

可观察模式并非解释:潜在推理模型的因果几何分析

Darpan Aswal, Thomas Palmeira Ferraz, Yongxin Zhou, Maxime Peyrard

机构 * Université Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,格勒诺布尔国立理工学院,信息学实验室) Université Paris-Saclay(巴黎-萨克雷大学) NAVER LABS Europe(NAVER欧洲实验室)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过对照实验和因果干预发现,潜在推理模型中的可观察模式(如BFS前沿)在控制组中也出现且不总是因果影响行为,提出潜在思维的使用是分级的,其因果效应集中在低秩方向,几何结构随行为影响增强而更有序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03068 2026-08-05 cs.CL cs.AI cs.LG 新提交 82%

CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning

CVPO:通过值方差自适应与动态课程学习增强大语言模型的强化学习推理能力

Ziqi Jia, Yalu Ouyang, Bo Pang, Panpan Li, Hangfei Xu, Shengzhao Wen, Shiyong Li, Yanpeng Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM强化学习推理中反馈精度不足与问题难度漂移问题,提出CVPO方法,通过值方差自适应与动态课程学习优化,在数学任务上性能优于VAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18438 2026-07-22 cs.CL cs.AI cs.LG 新提交 82%

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench:评估大语言模型在多领域推理链上的表现

Liam Swayne

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Relay-Bench是用于评估大语言模型在多领域推理链能力的基准测试,测试集含复合问题,涵盖多领域,模型使用无限制,鼓励利用工具,领先模型GPT-5.5(xHigh)得分43.3%,问题由两到十三个子问题组成,无需多模态输入输出。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18006 2026-07-21 cs.LG cs.AI cs.CL cs.MA 新提交 82%

MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习

Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对紧凑模型训练成本高问题,提出MADA-RL框架,将其分为生成器和评论家角色,用辩论感知信号训练,通过LoRA微调少量参数。核心是反事实评论家优势,提高了模型准确率,在数学推理基准测试中有显著效果。

Comments 20 pages, 3 figures, 9 tables, 2 algorithms, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10114 2026-07-14 cs.CL cs.AI cs.LG 新提交 82%

Cost of Reasoning in non-English Languages: A Case Study on Japanese

非英语语言的推理成本:以日语为例

Yuu Jinnai

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究训练日语推理模型的可行性,开发Qwen - 3 - Swallow - 8B的日语推理变体并用GRPO训练,在多基准测试中发现推理语言控制可行,但性能与英语推理基线相当,在日本文化基准上表现不如基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09052 2026-07-01 cs.LG cs.AI cs.CL cs.GT stat.ML 新提交 82%

INFUSER: Influence-Guided Self-Evolution Improves Reasoning

INFUSER: 影响力引导的自我进化提升推理能力

Siyu Chen, Miao Lu, Beining Wu, Heejune Sheen, Fengzhuo Zhang, Shuangning Li, Zhiyuan Li, Jose Blanchet, Tianhao Wang, Zhuoran Yang

机构 * Yale University(耶鲁大学) Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) University of California, San Diego(圣地亚哥大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出INFUSER框架,通过生成器与求解器的协同进化,利用影响力分数和DuGRPO优化,从文档池中自适应生成训练数据,显著提升模型推理性能。

Comments 67 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20624 2026-06-23 cs.AI cs.CL cs.LG stat.ML 新提交 82%

In LLM Reasoning, there is Irrationality on top of Value Misalignment

在LLM推理中,价值对齐之上存在非理性

Kejiang Qian, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出理性价值风险概念,形式化LLM在推理中即使价值对齐也可能无法最大化对齐价值的问题,并通过实验验证该风险普遍存在且无法被对齐消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09380 2026-06-09 cs.LG cs.AI cs.CL 新提交 82%

Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short

推理竞技场:当可验证奖励不足时的轨迹锦标赛

Han Zhou, Adam X. Yang, Laurence Aitchison, Anna Korhonen, Albert Q. Jiang

机构 * University of Cambridge(剑桥大学) Mistral AI

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出推理竞技场框架,通过轨迹锦标赛将无梯度信号的非多样奖励组转化为相对奖励信号,结合Bradley-Terry模型高效整合强化学习,在数学和编码基准上平均提升7.6%,加速训练27%-41%。

Comments 9 pages, 6 figures, 2 tables (17 pages including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08815 2026-06-09 cs.AI cs.CL cs.LG 新提交 82%

Momentum for Reasoning: Dense Intrinsic Signals in Policy Optimization

推理的动量:策略优化中的密集内在信号

Hao Chen, Zhanming Shen, Liyao Li, Yanyu Chen, Xuhang Zhu, Xiaomeng Hu, Qi Zhang, Ru Peng, Xiaoyu Shen, Haobo Wang, Junbo Zhao

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Eastern Institute of Technology(东方理工学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对GRPO在长链推理中因二元奖励导致的零优势崩溃和幻觉确定性失败模式,提出ISPO方法,通过内在信号密集化奖励,在三个基模型和五个数学推理基准上持续优于基线。

Comments 14 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11207 2026-07-14 cs.CL cs.AI 新提交 82%

ProgramTab: Boosting Table Reasoning of LLMs via Programmatic Paradigm

ProgramTab:通过编程范式提升大语言模型的表格推理能力

Pei Guo, Enjie Liu, Yunzhi Tan, Mochi Gao, Jianxin Zhang, Ruichao Zhong, Juntao Li, Bo Hu, Zang Li

机构 * Big Data and AI Platform Department, Tencent(腾讯大数据与人工智能平台部) Institute of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的表格推理问题,提出ProgramTab框架,指导LLMs用Python代码预处理表格数据并进行关键内容提取,实验证明该框架能有效处理表格推理任务,性能优于基于LLM的基线。

Comments Large Language Models, Table Reasoning, In-context Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09128 2026-08-11 cs.CL cs.AI cs.MA 新提交 81%

Social Gym and SPaRTan: Benchmarking and Improving LLM Social Reasoning via Multi-Agent Game Tournaments

Social Gym与SPaRTan:通过多智能体游戏锦标赛对LLM社会推理进行基准测试与改进

Keyu He, Xuhui Zhou, Maarten Sap

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究推出Social Gym多智能体社会游戏环境与SPaRTan自博弈反思迁移方法,前者可客观基准测试LLM社会推理,后者可提升GPT-5-mini的弱角色表现,为改进LLM社会推理提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05168 2026-08-07 cs.AI cs.CL 新提交 81%

Woodpecker Distillation: Weak Models Diagnose Reasoning Bugs in Strong Models

啄木鸟蒸馏:弱模型诊断强模型中的推理错误

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Woodpecker Distillation框架,通过弱模型的局部干预对比学习,修复强模型的推理错误,在数学推理基准上提升了强模型性能且优于直接模仿基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05139 2026-08-06 cs.CL cs.LG 新提交 81%

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning

面向技能原生的大语言模型:用于基准测试和训练长程推理的技能熵

Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) University of Toronto(多伦多大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) University of Oxford(牛津大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对现有基准无法评估LLM跨技能长程推理能力的问题,提出Skill Entropy(技能熵)并构建Skill²-Bench基准,还开发Skill-Entropy RL训练框架,显著提升了Qwen3模型在该基准上的表现。

Comments https://github.com/Gen-Verse/Skill-Entropy-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01014 2026-08-04 cs.CL cs.AI 新提交 81%

Cloud-ScPO: Hidden-State Geometry for Semi-Supervised Preference Optimization in LLM Reasoning

Cloud-ScPO:面向大语言模型推理的半监督偏好优化的隐状态几何

Yuzhou Liu, Xiyang Hu

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Cloud-ScPO框架,利用少量标注集构建参考云,结合拓扑引导的偏好挖掘与自一致性,在GSM8K等数据集上较ScPO提升LLM数学推理性能。

Comments 14 pages, 2 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27631 2026-07-31 cs.AI cs.CL 新提交 81%

ReDiPPO: Reference-Guided Value Calibration and Discrepancy-Aware Token Reweighting for Mathematical Reasoning

ReDiPPO:用于数学推理的参考引导值校准与差异感知标记重加权

Zhenrong Zhang, Fei Wu, Jun Du, Jianshu Zhang, Si Wei

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对数学推理中PPO的标记级信用分配难题,ReDiPPO引入参考引导评判器并通过值估计差异重加权标记优势,提升值估计精度且优于PPO、DAPO等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26119 2026-07-30 cs.AI cs.CL 新提交 81%

Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

探究推理性能的起源:强化学习(RL)与监督微调(SFT)模型在数学问题求解中的表征质量

Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit, Kevin Zhu, Aishwarya Balwani

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究探究RL与SFT微调模型数学推理性能差异的机制,发现RL模型的表征更具线性可分性、深层重要性更高,其token分配变异性或反映在线策略推理的分布。

Comments Second Workshop on XAI4Science, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20448 2026-07-24 cs.CL cs.LG 新提交 81%

Domyn-Small: A European 10B Reasoning Language Model

Domyn-Small:一个欧洲的100亿参数推理语言模型

Simone Angarano, Francesco Bertolotti, Federico D'Ambrosio, Michele Resta, Alessandro Rognoni, Nicolò Ruggeri, Dario Salvati, Andrea Valenti, Alberto Veneri, Martin Cimmino

机构 * CINECA(意大利国家计算应用研究所)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 介绍了基于9万亿令牌多语言数据预训练的100亿参数推理语言模型Domyn-Small,经持续预训练、监督微调、强化学习等训练后管道,实现双模式推理,在与对等模型对比中平衡了准确性与效率,还发布了相关权重及开源框架。

Comments 27 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18199 2026-07-21 cs.CL cs.LG 新提交 81%

PPL-Factory: Task-Aware and Budget-Aware Data Selection from Language Modeling to Reasoning

PPL-Factory:从语言建模到推理的任务感知和预算感知数据选择

Hang Zhang, Warren J. Gross

机构 * McGill University(麦吉尔大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究如何从语言建模到推理进行任务和预算感知的数据选择,提出PPL-Factory框架,结合任务感知困惑度得分与数据预算感知标准,实验表明该框架在GSM8K等任务上仅用少量训练集就能超越其他方法,有效提升微调效率。

Comments 13 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06855 2026-07-09 cs.LG cs.CL 新提交 81%

Geometric Self-Distillation for Reasoning Generalization

用于推理泛化的几何自蒸馏

Josip Jukić, Ivan Titov

机构 * ILLC, University of Amsterdam(阿姆斯特丹大学伊利沙伯格学院) ILCC, University of Edinburgh(爱丁堡大学伊利沙伯格中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型特权上下文自蒸馏中监督难以信赖、导致分布外推理能力下降的问题,提出几何自蒸馏目标GeoSD,通过Hellinger损失和近端项对抗漂移,提升了模型分布外推理准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏