arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-17 至 2026-07-17 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 8 篇

2512.14332 2026-07-17 cs.CL cs.AI 版本更新 81%

Step-Tagging: Toward controlling the generation of Language Reasoning Models through step monitoring

步骤标记:通过步骤监控控制语言推理模型的生成

Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(都柏林信任学院) ADAPT Research Centre(ADAPT研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对语言推理模型效率低、过度生成推理步骤的问题,提出步骤标记框架,引入ReasonType分类法,可在线监控特定步骤计数以产生早期停止标准,经实验在保持准确性时减少令牌数,为控制模型生成及研究其行为提供新途径和工具。

Comments ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14709 2026-07-17 cs.CL 新提交 79%

Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text

用于混合表格和文本的金融推理的黄金引导式程序蒸馏

Yun Dong, Erica Zhao, Elana Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究针对混合表格和文本数据的金融推理问题,基于程序蒸馏开发方法,利用黄金推导指导程序合成,经执行验证转移可靠数值推理,引入迭代恢复阶段,实验表明该框架能有效训练小模型进行可靠数值推理。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15200 2026-07-17 cs.CL cs.AI cs.LG 新提交 67%

Mask-Aware Policy Gradients for Diffusion Language Models

用于扩散语言模型的掩码感知策略梯度

Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对强化学习扩展到MDLMs的难题,将MDLM生成形式化为两阶段动作MDP,使策略梯度分解为令牌项和掩码项,结合优化这两项在数学推理和编码基准测试中取得了最优成绩。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14506 2026-07-17 cs.LG cs.AI 新提交 62%

Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习的非空泛化界限

Yuxuan Zhu, Rohan Alur, Daniel Kang

机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) MIT(麻省理工学院) Bridgewater AIA Labs(布里奇沃特人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对具有可验证奖励的强化学习在十亿参数规模下泛化性差的问题,通过将PAC-贝叶斯压缩界限与Gumbel-max重参数化技巧结合,并提出渐进式RLVR框架,在多领域建立非空泛化界限,性能优于基础模型且接近微调模型。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14105 2026-07-17 cs.CL cs.AI 新提交 62%

Automatically Evolving Prompt Guidelines for Task-Specific Optimization

自动演化特定任务优化的提示指南

Cedric Richter, Salah Ghamizi, Mike Papadakis

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型提示指南优化问题,提出AGOPS方法,利用现有任务示例隐含信息,通过优化方案自动演化特定任务指南,提升下游任务性能,弥补提示不明确导致的性能损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14628 2026-07-17 cs.CL cs.CR 新提交 57%

Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection

路由上限与领域无关:代码安全漏洞检测中的结构先验注入

Manuel Israel Cázares

机构 * Bytepro AI(字节专业人工智能公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 研究在代码安全漏洞检测中测试路由器假设是否跨领域,通过重现SAIR设计评估三个大语言模型。结果表明结构先验能提升语义漏洞召回率,零样本性能随语义复杂度下降,备忘单在真实数据上效果不佳,迭代重新校准也有问题,证实了SAIR的跨分布权衡及路由器假设的跨领域性。

Comments 12 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14522 2026-07-17 cs.LG 新提交 57%

A Continuous-Time Reinforcement Learning Framework for Fine-Tuning Discrete Diffusion Models

用于微调离散扩散模型的连续时间强化学习框架

Zikun Zhang, Jiayuan Sheng, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 该研究提出连续时间强化学习框架,推导策略梯度方法得到PPO和GRPO的连续时间变体。以此开发框架微调离散扩散模型,无需奖励信号可微,能纳入中间奖励或优势信号,还为MDM提供统一视角,用轨迹子采样技术降低计算成本,在相关任务中验证了方法有效性。

Comments 36 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14008 2026-07-17 cs.CV 版本更新 50%

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract)

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏