arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-10 至 2026-03-10 共收录 196 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 13 篇

2603.08369 2026-03-10 cs.AI 88%

M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering

M$^3$-ACE: 通过多智能体上下文工程校正多模态数学推理中的视觉感知

Peijin Xie, Zhen Xu, Bingquan Liu, Baoxun Wang

专题命中 数学推理 :reasoning(title,abstract);math reasoning(title,abstract);分类 cs.AI

AI总结 M3-ACE 通过多智能体上下文工程校正多模态数学推理中的视觉感知问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05592 2026-03-10 cs.CL 85%

MathSmith: Towards Extremely Hard Mathematical Reasoning by Forging Synthetic Problems with a Reinforced Policy

MathSmith: 通过强化策略生成合成问题以实现极难的数学推理

Shaoxiong Zhan, Yanlin Lai, Ziyu Lu, Dahua Lin, Ziqing Yang, Fei Tan

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 MathSmith通过生成合成问题提升LLM的数学推理能力,采用强化学习优化问题难度和推理复杂性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06619 2026-03-10 cs.LG cs.AI 79%

Not all tokens are needed(NAT): token efficient reinforcement learning

并非所有标记都必要(NAT):标记效率强化学习

Hejian Sang, Yuanda Xu, Zhengze Zhou, Ran He, Zhipeng Wang

机构 * LinkedIn Corporation(LinkedIn公司)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 NAT通过局部标记采样提升RL效率,使用50%标记实现与完整标记相同性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18582 2026-03-10 cs.CL cs.LG 73%

Exploring Embedding Priors in Prompt-Tuning for Improved Interpretability and Control

探索提示调优中嵌入先验以提升可解释性和可控性

Sergey Sedov, Sumanth Bharadwaj Hachalli Karanam, Venu Gopal Kadamba

机构 * New York University(纽约大学)

专题命中 数学推理 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了提示调优中嵌入坍缩现象对模型性能的影响,提出嵌入先验以提升可解释性和可控性,并发现不同激活区域的嵌入能有效提升任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07835 2026-03-10 cs.CR cs.AI cs.CL 73%

DistillGuard: Evaluating Defenses Against LLM Knowledge Distillation

DistillGuard: 评估对抗大语言模型知识蒸馏的防御措施

Bo Jiang

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 DistillGuard通过系统评估发现,现有输出层面防御措施在对抗大语言模型知识蒸馏时效果有限,尤其在数学推理任务中表现突出,揭示了防御措施的依赖性和任务特定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11662 2026-03-10 cs.AI cs.CL cs.LG cs.MA cs.RO 67%

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差

Moises Andrade, Joonhyuk Cha, Brandon Ho, Vriksha Srihari, Karmesh Yadav, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。

Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03524 2026-03-10 cs.LG cs.AI 62%

Test-Time Meta-Adaptation with Self-Synthesis

测试时元适应与自合成

Zeyneb N. Kaya, Nick Rui

机构 * Stanford University(斯坦福大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MASS通过自动生成问题特定的合成训练数据,实现大语言模型在测试时的自我适应与优化,提升下游任务性能。

Comments 5 pages, 2 figures, 1 table. Accepted to AI with Recursive Self-Improvement (RSI) Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09486 2026-03-10 cs.CL cs.AI 62%

Listen to the Layers: Mitigating Hallucinations with Inter-Layer Disagreement

倾听各层:通过层间分歧缓解幻觉

Koduvayur Subbalakshmi, Sabbir Hossain Ujjal, Venkata Krishna Teja Mangichetty, Nastaran Jamalipour Soofi

机构 * Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CoCoA通过监听模型内部层间分歧信号,有效缓解大语言模型的幻觉问题,提升推理时的事实准确性。

Comments Preprint, 26 pages, 15 tables, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06958 2026-03-10 cs.LG cs.CL 62%

Chart-RL: Generalized Chart Comprehension via Reinforcement Learning with Verifiable Rewards

Chart-RL: 通过可验证奖励的强化学习实现通用图表理解

Xin Zhang, Xingyu Li, Rongguang Wang, Ruizhong Miao, Zheng Wang, Dan Roth, Chenyang Li

机构 * Oracle AI

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Chart-RL通过可验证奖励的强化学习提升图表理解能力,在多个基准测试中超越监督微调,展现强大的泛化和迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08068 2026-03-10 cs.AI 57%

In-Context Reinforcement Learning for Tool Use in Large Language Models

上下文强化学习用于大型语言模型中的工具使用

Yaoqi Ye, Yiran Zhao, Keyu Duan, Zeyu Zheng, Kenji Kawaguchi, Cihang Xie, Michael Qizhe Shieh

机构 * National University of Singapore(新加坡国立大学) Salesforce AI Research(Salesforce AI研究) University of California Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ICRL框架,通过强化学习无需微调即可实现大型语言模型的工具使用能力,实验显示其在推理和工具任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07972 2026-03-10 cs.AI 57%

Adaptive Collaboration with Humans: Metacognitive Policy Optimization for Multi-Agent LLMs with Continual Learning

适应性协作与人类:多智能体大语言模型的元认知策略优化与持续学习

Wei Yang, Defu Cao, Jiacheng Pang, Muyan Weng, Yan Liu

机构 * University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 HILA框架通过元认知策略优化与持续学习,实现多智能体与人类的协同协作,提升复杂任务处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08477 2026-03-10 eess.SY cs.SY 50%

Behavioral Generative Agents for Power Dispatch and Auction

行为生成代理在电力调度和拍卖中的应用

Shaoze Li, Justin S. Kim, Cong Chen

专题命中 数学推理 :reasoning(abstract)

AI总结 本文提出利用生成代理在电力调度和拍卖中模拟人类决策,通过上下文学习模块提升LLM的决策灵活性和经济理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16670 2026-03-10 cs.CV 50%

Learning to Think Fast and Slow for Visual Language Models

学习快速与缓慢思考以提升视觉语言模型

Chenyu Lin, Cheng Chi, Jinlin Wu, Sharon Li, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, CAS(中国科学院自动化研究所) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 数学推理 :reasoning(abstract)

AI总结 DualMindVLM通过双模式思考机制提升视觉语言模型的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 3 篇

2511.02872 2026-03-10 cs.LG cs.AI cs.FL cs.LO 62%

FATE: A Formal Benchmark Series for Frontier Algebra of Multiple Difficulty Levels

FATE:面向多难度层级的前沿代数形式化基准系列

Jiedong Jiang, Wanyi He, Yuefeng Wang, Guoxiong Gao, Yongle Hu, Jingting Wang, Nailin Guan, Peihao Wu, Chunbo Dai, Liang Xiao, Bin Dong

机构 * Westlake Institute for Advanced Study, Westlake University(西拉丘学院先进研究院,西拉丘大学) Peking University(北京大学) New Cornerstone Science Laboratory, School of Mathematical Sciences, Peking University(新基石科学实验室,北京大学数学科学学院) Center for Machine Learning Research, Peking University(机器学习研究中心,北京大学) Center for Intelligent Computing, Great Bay Institute for Advanced Study, Great Bay University(智能计算中心,大湾先进研究院,大湾大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FATE是一个面向多难度层级的前沿代数形式化基准系列,旨在评估和推动高级数学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06974 2026-03-10 cs.CL cs.AI cs.LO 62%

Elenchus: Generating Knowledge Bases from Prover-Skeptic Dialogues

Elenchus:从证人-怀疑者对话生成知识库

Bradley P. Allen

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Elenchus通过证人-怀疑者对话与LLM交互,利用非单调多后件逻辑显式化知识库构建,实现从对话到形式推理的端到端整合。

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06737 2026-03-10 cs.LO cs.AI cs.SC 57%

Agent Hunt: Bounty Based Collaborative Autoformalization With LLM Agents

Agent Hunt: 基于奖金的协作自动形式化与LLM代理

Chad E. Brown, Cezary Kaliszyk, Josef Urban

专题命中 代码与定理证明 :planning(abstract);分类 cs.AI

AI总结 基于奖金的协作自动形式化方法,利用LLM代理在交互式定理证明环境中进行去中心化证明搜索与理论构建。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 12 篇

2603.04663 2026-03-10 cs.LG cs.AI cs.CE 84%

Neuro-Symbolic Financial Reasoning via Deterministic Fact Ledgers and Adversarial Low-Latency Hallucination Detector

通过确定性事实账本和对抗性低延迟幻觉检测器实现神经符号金融推理

Pedram Agand

机构 * FactAI Lab(FactAI实验室)

专题命中 逻辑推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VeNRA,通过确定性事实账本和对抗性检测器实现零幻觉金融推理,结合确定性执行和高效检测机制,显著降低幻觉率并提升推理可靠性。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06923 2026-03-10 cs.CL 79%

Reforming the Mechanism: Editing Reasoning Patterns in LLMs with Circuit Reshaping

机制改革:通过电路重塑编辑大语言模型的推理模式

Zhenyu Lei, Qiong Wu, Jianxiong Dong, Yinhan He, Emily Dodwell, Yushun Dong, Jundong Li

机构 * University of Virginia(弗吉尼亚大学) AT&T Chief Data Office(AT&T首席数据办公室) Florida State University(佛罗里达州立大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL

AI总结 REdit通过电路重塑技术改进大语言模型的推理能力,解决通用性与局部性的权衡问题,提升推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06617 2026-03-10 cs.LG cs.AI 73%

Evo: Autoregressive-Diffusion Large Language Models with Evolving Balance

Evo:具有进化平衡的自回归-扩散大语言模型

Junde Wu, Minhao Hu, Jiayuan Zhu, Yuyuan Liu, Tianyi Zhang, Kang Li, Jingkun Chen, Jiazhen Pan, Min Xu, Yueming Jin

机构 * University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Technical University of Munich(慕尼黑技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Evo通过进化平衡机制,结合自回归和扩散模型,实现高效且高质量的语言生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07375 2026-03-10 eess.SY cs.SY 67%

Multi-Agentic AI for Conflict-Aware rApp Policy Orchestration in Open RAN

多智能体AI用于冲突感知的rApp策略编排在开放RAN中

Haiyuan Li, Yulei Wu, Dimitra Simeonidou

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 本文提出多智能体AI框架,用于实现开放RAN中冲突感知的rApp策略自动生成与编排,实验表明其在部署准确性和推理成本上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00296 2026-03-10 cs.RO cs.AI cs.CV cs.LG 62%

From Pixels to Predicates: Learning Symbolic World Models via Pretrained Vision-Language Models

从像素到谓词:通过预训练视觉-语言模型学习符号世界模型

Ashay Athalye, Nishanth Kumar, Tom Silver, Yichao Liang, Jiuguang Wang, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学) University of Cambridge(剑桥大学) RAI Institute(RAI研究院)

专题命中 逻辑推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 通过预训练视觉-语言模型学习符号世界模型,以实现复杂机器人领域中长周期决策制定的零样本泛化。

Comments A version of this paper appears in the official proceedings of RA-L, Volume 11, Issue 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00312 2026-03-10 cs.AI cs.LG 62%

How Well Do Multimodal Models Reason on ECG Signals?

多模态模型在心电图信号上的推理能力如何?

Maxwell A. Xu, Harish Haresamudram, Catherine W. Liu, Patrick Langer, Jathurshan Pradeepkumar, Wanting Mao, Sunita J. Ferns, Aradhana Verma, Jimeng Sun, Paul Schmiedmayer, Xin Liu, Daniel McDuff, Emily B. Fox, James M. Rehg

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Rush University(拉什大学) ETH Zurich(苏黎世联邦理工学院) St. Christopher's Hospital for Children(圣克里斯opher儿童医院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Google Inc(谷歌公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估多模态模型在ECG信号上推理能力的框架,通过感知和演绎两个方面验证模型的逻辑和模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07329 2026-03-10 cs.AI cs.CL cs.CY 62%

The Third Ambition: Artificial Intelligence and the Science of Human Behavior

第三项雄心:人工智能与人类行为的科学

W. Russell Neuman, Chad Coleman

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大型语言模型作为研究人类行为、文化及道德推理的科学工具,探讨其在社会科学中的应用与方法论创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06590 2026-03-10 cs.CL cs.AI 62%

ARC-AGI-2 Technical Report

ARC-AGI-2技术报告

Wallyson Lemes de Oliveira, Mekhron Bobokhonov, Matteo Caorsi, Aldo Podestà, Gabriele Beltramo, Luca Crosato, Matteo Bonotto, Federica Cecchetto, Hadrien Espic, Dan Titus Salajan, Stefan Taga, Luca Pana, Joe Carthy

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于变压器的ARC求解系统,结合神经推理、结构感知先验和在线任务适应,通过多视角推理提升模型一般化能力,显著超越现有基线和神经求解器。

Comments 59 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10480 2026-03-10 cs.CL 57%

Neuro-Symbolic Synergy for Interactive World Modeling

神经符号协同用于交互世界建模

Hongyu Zhao, Siyu Zhou, Haolin Yang, Zengyi Qin, Tianyi Zhou

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 NeSyS通过结合LLMs的概率语义先验与可执行符号规则,实现交互世界建模的表达力与鲁棒性,提升预测准确性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01488 2026-03-10 cs.AI 57%

LLM-assisted Semantic Option Discovery for Facilitating Adaptive Deep Reinforcement Learning

基于大语言模型的语义选项发现用于促进自适应深度强化学习

Chang Yao, Jinghui Qin, Kebing Jin, Hankz Hankui Zhuo

专题命中 逻辑推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的闭环框架,通过语义驱动技能重用和实时约束监控,提升深度强化学习在数据效率、约束合规性和跨任务迁移能力方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08633 2026-03-10 eess.SY cs.SY 50%

Reachability-based Temporal Logic Verification for Reliable LLM-guided Human-Autonomy Teaming

基于可达性的时序逻辑验证用于可靠的大语言模型引导的人-自主系统协同

Joonwon Choi, Kartik Anand Pant, Karthik Nune, Inseok Hwang

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出基于可达性的时序逻辑验证框架,利用LLM将自然语言指令转换为STL规范,通过可行性过滤器确保任务规划的安全性和信息反馈的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18606 2026-03-10 cs.RO cs.CV 50%

OVerSeeC: Open-Vocabulary Costmap Generation from Satellite Images and Natural Language

OVerSeeC: 从卫星图像和自然语言生成开放词汇成本图

Rwik Rana, Jesse Quattrociocchi, Dongmyeong Lee, Christian Ellis, Amanda Adkins, Adam Uccello, Garrett Warnell, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 逻辑推理 :planning(abstract)

AI总结 OVerSeeC通过模块化基础模型实现从卫星图像和自然语言生成开放词汇成本图,支持任务自适应的全球规划。

Comments Website : https://amrl.cs.utexas.edu/overseec/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 39 篇

2603.07148 2026-03-10 cs.LG 89%

Agentic Planning with Reasoning for Image Styling via Offline RL

基于推理的图像风格化代理规划 via 离线强化学习

Subhojyoti Mukherjee, Stefano Petrangeli, Branislav Kveton, Trung Bui, Franck Dernoncourt, Arko Mukherjee

机构 * Adobe Research(Adobe研究)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。

Comments 85 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07901 2026-03-10 cs.RO cs.LG 88%

NaviDriveVLM: Decoupling High-Level Reasoning and Motion Planning for Autonomous Driving

NaviDriveVLM:解耦高层推理与运动规划用于自动驾驶

Ximeng Tao, Pardis Taghavi, Dimitar Filev, Reza Langari, Gaurav Pandey

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX 77843, USA(杰米·沃克’66机械工程系,德克萨斯A&M大学,学院站,TX 77843,美国) The Department of Engineering Technology and Industrial Distribution Texas A&M University, College Station, TX 77843, USA(工程技术与工业分配系,德克萨斯A&M大学,学院站,TX 77843,美国)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.LG

AI总结 NaviDriveVLM通过解耦高层推理与运动规划,提升自动驾驶中的推理能力与效率

详情

展开后加载摘要…

URL PDF HTML 收藏