arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-10 至 2026-03-10 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 13 篇

2603.08369 2026-03-10 cs.AI 88%

M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering

M$^3$-ACE: 通过多智能体上下文工程校正多模态数学推理中的视觉感知

Peijin Xie, Zhen Xu, Bingquan Liu, Baoxun Wang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI

AI总结 M3-ACE 通过多智能体上下文工程校正多模态数学推理中的视觉感知问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05592 2026-03-10 cs.CL 85%

MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy

MathSmith: 通过强化策略生成合成问题以实现极难的数学推理

Shaoxiong Zhan, Yanlin Lai, Ziyu Lu, Dahua Lin, Ziqing Yang, Fei Tan

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 MathSmith通过生成合成问题提升LLM的数学推理能力,采用强化学习优化问题难度和推理复杂性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06619 2026-03-10 cs.LG cs.AI 79%

Not all tokens are needed(NAT): token efficient reinforcement learning

并非所有标记都必要(NAT):标记效率强化学习

Hejian Sang, Yuanda Xu, Zhengze Zhou, Ran He, Zhipeng Wang

机构 * LinkedIn Corporation(LinkedIn公司)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 NAT通过局部标记采样提升RL效率,使用50%标记实现与完整标记相同性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18582 2026-03-10 cs.CL cs.LG 73%

Exploring Embedding Priors in Prompt-Tuning for Improved Interpretability and Control

探索提示调优中嵌入先验以提升可解释性和可控性

Sergey Sedov, Sumanth Bharadwaj Hachalli Karanam, Venu Gopal Kadamba

机构 * New York University(纽约大学)

专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了提示调优中嵌入坍缩现象对模型性能的影响,提出嵌入先验以提升可解释性和可控性,并发现不同激活区域的嵌入能有效提升任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07835 2026-03-10 cs.CR cs.AI cs.CL 73%

DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation

DistillGuard: 评估对抗大语言模型知识蒸馏的防御措施

Bo Jiang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 DistillGuard通过系统评估发现,现有输出层面防御措施在对抗大语言模型知识蒸馏时效果有限,尤其在数学推理任务中表现突出,揭示了防御措施的依赖性和任务特定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11662 2026-03-10 cs.AI cs.CL cs.LG cs.MA cs.RO 67%

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差

Moises Andrade, Joonhyuk Cha, Brandon Ho, Vriksha Srihari, Karmesh Yadav, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。

Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03524 2026-03-10 cs.LG cs.AI 62%

Test-Time Meta-Adaptation with Self-Synthesis

测试时元适应与自合成

Zeyneb N. Kaya, Nick Rui

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MASS通过自动生成问题特定的合成训练数据,实现大语言模型在测试时的自我适应与优化,提升下游任务性能。

Comments 5 pages, 2 figures, 1 table. Accepted to AI with Recursive Self-Improvement (RSI) Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09486 2026-03-10 cs.CL cs.AI 62%

Listen to the Layers: Mitigating Hallucinations with Inter-Layer Disagreement

倾听各层:通过层间分歧缓解幻觉

Koduvayur Subbalakshmi, Sabbir Hossain Ujjal, Venkata Krishna Teja Mangichetty, Nastaran Jamalipour Soofi

机构 * Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CoCoA通过监听模型内部层间分歧信号,有效缓解大语言模型的幻觉问题,提升推理时的事实准确性。

Comments Preprint, 26 pages, 15 tables, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 62%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08068 2026-03-10 cs.AI 57%

In-Context Reinforcement Learning for Tool Use in Large Language Models

上下文强化学习用于大型语言模型中的工具使用

Yaoqi Ye, Yiran Zhao, Keyu Duan, Zeyu Zheng, Kenji Kawaguchi, Cihang Xie, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) Salesforce AI Research(Salesforce AI研究) University of California Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ICRL框架,通过强化学习无需微调即可实现大型语言模型的工具使用能力,实验显示其在推理和工具任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07972 2026-03-10 cs.AI 57%

Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning

适应性协作与人类:多智能体大语言模型的元认知策略优化与持续学习

Wei Yang, Defu Cao, Jiacheng Pang, Muyan Weng, Yan Liu

机构 * University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 HILA框架通过元认知策略优化与持续学习,实现多智能体与人类的协同协作,提升复杂任务处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08477 2026-03-10 eess.SY cs.SY 50%

Behavioral Generative Agents for Power Dispatch and Auction

行为生成代理在电力调度和拍卖中的应用

Shaoze Li, Justin S. Kim, Cong Chen

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出利用生成代理在电力调度和拍卖中模拟人类决策,通过上下文学习模块提升LLM的决策灵活性和经济理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16670 2026-03-10 cs.CV 50%

Learning to Think Fast and Slow for Visual Language Models

学习快速与缓慢思考以提升视觉语言模型

Chenyu Lin, Cheng Chi, Jinlin Wu, Sharon Li, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, CAS(中国科学院自动化研究所) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(abstract)

AI总结 DualMindVLM通过双模式思考机制提升视觉语言模型的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏