arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-11 至 2026-03-11 共收录 100 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2509.14093 2026-03-11 cs.SE cs.AI cs.CL 90%

Reasoning Efficiently Through Adaptive Chain-of-Thought Compression: A Self-Optimizing Framework

通过自适应链式推理压缩实现高效推理:一个自优化框架

Kerui Huang, Shuhan Liu, Xing Hu, Tongtong Xu, Lingfeng Bao, Xin Xia

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 SEER通过自适应压缩链式推理,提升LLM在软件工程和数学任务中的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09184 2026-03-11 cs.LG cs.AI 84%

Latent-DARM: Bridging Discrete Diffusion And Autoregressive Models For Reasoning

Latent-DARM: 联结离散扩散与自回归模型以实现推理

Lina Berrayana, Ahmed Heakl, Abdullah Sohail, Thomas Hofmann, Salman Khan, Wei Chen

机构 * EPFL(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 数学推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 Latent-DARM通过结合离散扩散模型与自回归模型,提升多智能体系统在推理任务中的表现和协作效率。

Comments Published at LIT Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08743 2026-03-11 cs.DC cs.AI 79%

Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention

Zipage: 通过压缩分页注意力维持大语言模型推理的高请求并发性

Mengqi Liao, Lu Wang, Chaoyun Zhang, Bo Qiao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang, Huaiyu Wan

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Microsoft(微软)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Zipage通过压缩分页注意力技术,在维持高并发的同时实现接近全KV推理性能的高效大语言模型推理

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08727 2026-03-11 cs.AR cs.AI cs.DC cs.PF 70%

ARKV: Adaptive and Resource-Efficient KV Cache Management under Limited Memory Budget for Long-Context Inference in LLMs

ARKV:在有限内存预算下为LLMs长上下文推理实现自适应和资源高效的KV缓存管理

Jianlong Lei, Shashikant Ilager

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI

AI总结 ARKV通过动态分配精度级别,实现LLMs长上下文推理中的高效内存管理,减少内存使用并保持高精度。

Comments Accepted in ACM/IEEE CCGRID 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09517 2026-03-11 cs.CL cs.LG 62%

You Didn't Have to Say It like That: Subliminal Learning from Faithful Paraphrases

你无需那样说:从忠实的同义词中学习的潜意识学习

Isaia Gisler, Zhonghao He, Tianyi Qiu

机构 * ETH Zürich(苏黎世联邦理工学院) University of Cambridge(剑桥大学) Peking University(北京大学)

专题命中 数学推理 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 研究通过自然语言同义词的潜意识学习,发现即使内容与教师偏好矛盾,学生模型仍能继承偏好,揭示了训练数据中潜在影响的隐蔽性。

Comments Accepted for Spotlight presentation at EACL 2026 SRW. 5 pages, 2 figures, plus appendix. Equal supervision by Zhonghao He and Tianyi Qiu

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05630 2026-03-11 cs.LG cs.CL 62%

Rewards as Labels: Revisiting RLVR from a Classification Perspective

奖励作为标签:从分类视角重新审视RLVR

Zepeng Zhai, Meilin Chen, Jiaxuan Zhao, Junlang Qian, Lei Shen, Yuan Lu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出REAL框架,将可验证奖励视为分类标签,通过改进梯度分配提升策略优化效率,实验证明其在数学推理任务中优于GRPO和DAPO等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18315 2026-03-11 cs.NI 50%

CovertComBench: A First Domain-Specific Testbed for LLMs in Wireless Covert Communication

CovertComBench: 一个用于无线隐蔽通信中LLM的首个领域特定测试平台

Zhaozhi Liu, Jiaxin Chen, Yuanai Xie, Yuna Jiang, Minrui Xu, Xiao Zhang, Pan Lai, Zan Zhou

专题命中 数学推理 :reasoning(abstract)

AI总结 CovertComBench是首个用于评估LLM在无线隐蔽通信中安全约束优化能力的领域特定测试平台,揭示了LLM在高阶数学推导上的不足,强调需通过外部工具增强构建可信无线AI系统。

Comments 6 pages, corrected a typo: "DeepSeek-R1:70B" was previously incorrectly written as "DeepSeek-V3.2:70B"

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2512.24594 2026-03-11 cs.SE cs.LO 50%

A Tale of 1001 LoC: Potential Runtime Error-Guided Specification Synthesis for Verifying Large-Scale Programs

1001行代码的故事:潜在运行时错误引导的规范合成用于验证大规模程序

Zhongyi Wang, Tengjie Lin, Mingshuai Chen, Haokun Li, Mingqi Yang, Xiao Yi, Shengchao Qin, Yixing Luo, Xiaofeng Li, Bin Gu, Liqiang Lu, Jianwei Yin

专题命中 代码与定理证明 :reasoning(abstract)

AI总结 Preguss通过结合静态分析与演绎验证,实现大规模程序的自动化形式化验证,显著提升验证效率。

Comments Accepted at OOPSLA 2026. Publication date: April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 7 篇

2603.09200 2026-03-11 cs.AI cs.CL cs.CY cs.LG 89%

The Reasoning Trap -- Logical Reasoning as a Mechanistic Pathway to Situational Awareness

推理陷阱——逻辑推理作为情境意识的机制路径

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(MARS 4.0 Fellow,剑桥人工智能安全中心(CAISH),剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊生成AI创新中心,亚马逊网络服务,美国) Google, USA(谷歌,美国) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RAISE框架,揭示逻辑推理能力提升与情境意识升级的机制路径,并提出安全原则与测试方法以应对潜在风险。

Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 21 Pages. Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09268 2026-03-11 cs.AI 83%

Logos: An evolvable reasoning engine for rational molecular design

Logos:一种可进化推理引擎用于理性分子设计

Haibin Wen, Zhe Zhao, Fanfu Wang, Tianyi Xu, Hao Zhang, Chao Yang, Ye Wei

机构 * City University of Hong Kong(香港城市大学) Lanzhou University(兰州大学) Riltide Medicines(Riltide医药公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 逻辑推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 Logos是一种集成多步逻辑推理与严格化学一致性的分子推理模型,通过分阶段训练和化学规则优化,在多个基准数据集上实现了结构准确性和化学有效性上的高性能,同时参数量仅为通用语言模型的几分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13756 2026-03-11 cs.CV cs.AI cs.LG 81%

RECODE: Reasoning Through Code Generation for Visual Question Answering

RECODE: 通过代码生成进行视觉问答的推理

Junhong Shen, Mu Cai, Bo Hu, Ameet Talwalkar, David A Ross, Cordelia Schmid, Alireza Fathi

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 RECODE通过代码生成实现视觉问答的可验证推理,优于传统方法。

Comments The authors are withdrawing this manuscript temporarily to conduct additional checks of the experimental setup and implementation. We plan to post an updated version after completing these checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09246 2026-03-11 cs.CR 78%

Reasoning-Oriented Programming: Chaining Semantic Gadgets to Jailbreak Large Vision Language Models

面向推理的编程:通过链式语义工具来突破大型视觉语言模型

Quanchen Zou, Moyang Chen, Zonghao Ying, Wenzhuo Xu, Yisong Xiao, Deyue Zhang, Dongdong Yang, Zhao Liu, Xiangzheng Zhang

专题命中 逻辑推理 :reasoning(title,abstract)

AI总结 本文提出面向推理的编程方法,通过链式语义工具突破大型视觉语言模型的安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09756 2026-03-11 cs.DB 67%

Epistemic Closure: Autonomous Mechanism Completion for Physically Consistent Simulation

认知闭合:用于物理一致模拟的自主机制完成

Yue Wua, Tianhao Su, Rui Hu, Mingchuan Zhao, Shunbo Hu, Deng Pan, Jizhong Huang

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出神经符号生成代理,通过自主验证和完成物理机制,解决科学模拟中的物理幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09192 2026-03-11 cs.AI 57%

Explainable Innovation Engine: Dual-Tree Agent-RAG with Methods-as-Nodes and Verifiable Write-Back

可解释的创新引擎:双树代理-RAG与方法作为节点和可验证的写回

Renwei Meng

机构 * Anhui University(安徽大学)

专题命中 逻辑推理 :verifier(abstract);分类 cs.AI

AI总结 本研究提出了一种双树代理-RAG框架,通过方法作为节点和可验证的写回机制,提升代理系统在可控、可解释和可验证创新方面的性能。

Comments 15pages, 4figures, code available on Github

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16203 2026-03-11 cs.AI 57%

Logic Explanation of AI Classifiers by Categorical Explaining Functors

通过范畴解释函子解释AI分类器的逻辑

Stefano Fioravanti, Francesco Giannini, Paolo Frazzetto, Fabio Zanasi, Pietro Barbiero

机构 * University of Padova(帕多瓦大学) Scuola Normale Superiore(正常大学) University College London(伦敦大学学院) Università della Svizzera Italiana(意大利瑞士大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于范畴论的解释函子,以确保AI分类器解释的一致性和保真度,通过逻辑规则生成更可靠的解释。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 24 篇

2503.21735 2026-03-11 cs.SE cs.AI cs.CL cs.MA 88%

GateLens: A Reasoning-Enhanced LLM Agent for Automotive Software Release Analytics

GateLens: 一种增强推理能力的LLM代理用于汽车软件发布分析

Arsham Gholamzadeh Khoee, Shuai Wang, Robert Feldt, Dhasarathy Parthasarathy, Yinan Yu

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 GateLens是一种基于LLM的代理,通过引入关系代数作为中间表示,提升复杂表格数据分析的效率与准确性,适用于汽车软件发布分析领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09337 2026-03-11 cs.CV cs.AI 83%

Beyond Scaling: Assessing Strategic Reasoning and Rapid Decision-Making Capability of LLMs in Zero-sum Environments

超越规模:在零和环境中评估大语言模型的战略推理和快速决策能力

Yang Li, Xing Chen, Yutao Liu, Gege Qi, Yanxian BI, Zizhe Wang, Yunjian Zhang, Yao Zhu

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出STAR基准,评估大语言模型在零和环境中的战略推理和快速决策能力,揭示推理深度与及时行动能力的权衡。

Comments Code available

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07528 2026-03-11 cs.CL 83%

TableMind++: An Uncertainty-Aware Programmatic Agent for Tool-Augmented Table Reasoning

TableMind++: 一种面向工具增强表格推理的不确定性感知程序化代理

Mingyue Cheng, Shuo Yu, Chuang Jiang, Xiaoyu Tao, Qingyang Mao, Jie Ouyang, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 TableMind++通过引入不确定性感知推理框架,有效缓解LLM的幻觉问题,提升表格推理的准确性和鲁棒性。

Comments 6 tables, 9 figures. arXiv admin note: text overlap with arXiv:2509.06278

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08814 2026-03-11 cs.RO cs.AI cs.ET cs.MA 83%

Scale-Plan: Scalable Language-Enabled Task Planning for Heterogeneous Multi-Robot Teams

Scale-Plan: 为异构多机器人团队实现可扩展的语言赋能任务规划

Piyush Gupta, Sangjae Bae, Jiachen Li, David Isele

机构 * Honda Research Institute(本田研究院) University of California(加州大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 Scale-Plan通过生成紧凑的任务相关问题表示,提升异构多机器人团队的可扩展性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09843 2026-03-11 cs.IR 82%

RecThinker: An Agentic Framework for Tool-Augmented Reasoning in Recommendation

RecThinker: 一种用于推荐中的工具增强推理的代理框架

Haobo Zhang, Yutao Zhu, Kelong Mao, Tianhao Li, Zhicheng Dou

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 RecThinker通过动态规划和主动工具调用,提升推荐系统中信息获取和推理能力,实现更优的用户-物品匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09036 2026-03-11 cs.LG 81%

SCALAR: Learning and Composing Skills through LLM Guided Symbolic Planning and Deep RL Grounding

SCALAR:通过LLM引导的符号规划和深度RL接地学习与组合技能

Renos Zabounidis, Yue Wu, Simon Stepputtis, Woojun Kim, Yuanzhi Li, Tom Mitchell, Katia Sycara

专题命中 规划推理 :planning(title,abstract);分类 cs.LG;reasoning(comments)

AI总结 SCALAR通过结合LLM引导的符号规划与深度RL,实现技能学习与组合,显著提升任务完成效率和鲁棒性。

Comments Best Paper Award Honorable Mention at NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09341 2026-03-11 cs.CL cs.AI 81%

TaSR-RAG: Taxonomy-guided Structured Reasoning for Retrieval-Augmented Generation

TaSR-RAG:基于分类的结构化推理用于检索增强生成

Jiashuo Sun, Yixuan Xie, Jimeng Shi, Shaowen Wang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 TaSR-RAG通过基于分类的结构化推理框架,提升检索增强生成任务的证据选择精度和推理质量。

Comments 14 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08933 2026-03-11 cs.AI cs.IR cs.LG 81%

Interpretable Markov-Based Spatiotemporal Risk Surfaces for Missing-Child Search Planning with Reinforcement Learning and LLM-Based Quality Assurance

可解释的基于马尔可夫的时空风险表面用于缺失儿童搜索规划的强化学习与基于LLM的质量保证

Joshua Castillo, Ravi Mukkamala

机构 * Old Dominion University(老奥尔巴尼大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 Guardian系统利用马尔可夫链、强化学习和LLM进行可解释的时空风险建模,以提升失踪儿童搜索规划的效率和准确性。

Comments 14 pages, 7 figures. Accepted at ICEIS 2026 (International Conference on Enterprise Information Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02154 2026-03-11 cs.MA cs.AI 79%

Boltzmann-based Exploration for Robust Decentralized Multi-Agent Planning (Extended Version)

基于玻尔兹曼的探索用于鲁棒的去中心化多智能体规划(扩展版)

Nhat D. A. Nguyen, Duong D. Nguyen, Gianluca Rizzo, Hung X. Nguyen

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出CB-MCTS,通过玻尔兹曼策略和熵奖励提升多智能体规划的鲁棒性,在欺骗场景中表现更优。

Comments To appear in ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24235 2026-03-11 cs.RO cs.AI 79%

SafeGen-LLM: Enhancing Safety Generalization in Task Planning for Robotic Systems

SafeGen-LLM: 提高机器人系统任务规划中的安全性泛化能力

Jialiang Fan, Weizhe Xu, Mengyu Liu, Oleg Sokolsky, Insup Lee, Fanxin Kong

机构 * University of Notre Dame(诺丁汉大学) Washington State University(华盛顿州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 SafeGen-LLM通过两阶段框架提升机器人任务规划的安全性泛化能力,优于现有基线。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08987 2026-03-11 cs.LG 79%

MAPLE: Elevating Medical Reasoning from Statistical Consensus to Process-Led Alignment

MAPLE:从统计共识到过程导向对齐的医学推理提升

Kailong Fan, Anqi Pu, Yichen Wu, Wanhua Li, Yicong Li, Hanspeter Pfister, Huafeng Liu, Xiang Li, Quanzheng Li, Ning Guo

机构 * Zhejiang University(浙江大学) Harvard University(哈佛大学) Harvard Medical School(哈佛医学院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 MAPLE通过整合医学过程奖励模型与TTRL,提升医学推理的准确性和可靠性,实现从统计共识到过程导向对齐的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08921 2026-03-11 cs.CV cs.LG 79%

Vision-Language Models Encode Clinical Guidelines for Concept-Based Medical Reasoning

视觉-语言模型编码临床指南以实现基于概念的医学推理

Mohamed Harmanani, Bining Long, Zhuoxin Guo, Paul F. R. Wilson, Amirhossein Sabour, Minh Nguyen Nhat To, Gabor Fichtinger, Purang Abolmaesumi, Parvin Mousavi

机构 * Queen’s University(女王大学) University of British Columbia(不列颠哥伦比亚大学) McMaster University(麦马斯特大学) Vector Institute(向量研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 MedCBR通过整合临床指南与视觉-语言模型,提升医学影像诊断的可解释性和决策支持能力。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09743 2026-03-11 cs.CV 78%

LAP: A Language-Aware Planning Model For Procedure Planning In Instructional Videos

LAP:一种语言感知的规划模型用于教学视频中的过程规划

Lei Shi, Victor Aregbede, Andreas Persson, Martin Längkvist, Amy Loutfi, Stephanie Lowry

机构 * Örebro University(奥雷布罗大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 LAP通过利用语言描述提升过程规划的准确性,实现教学视频中动作序列的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09188 2026-03-11 cs.RO 78%

Robust Spatiotemporal Motion Planning for Multi-Agent Autonomous Racing via Topological Gap Identification and Accelerated MPC

多智能体自主赛车中鲁棒时空运动规划 via 拓扑间隙识别与加速MPC

Mingyi Zhang, Cheng Hu, Yiqin Wang, Haotong Qin, Hongye Su, Lei Xie

机构 * Department of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) Center for Project-Based Learning, D-ITET, ETH Zurich(苏黎世联邦理工学院项目导向学习中心)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于拓扑间隙识别与加速MPC的框架,通过预测对手行为和动态占用走廊,实现高速多智能体自主赛车中鲁棒的时空规划与高精度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09031 2026-03-11 cs.RO 78%

ImpedanceDiffusion: Diffusion-Based Global Path Planning for UAV Swarm Navigation with Generative Impedance Control

阻抗扩散:基于扩散的全局路径规划用于无人机群导航的生成阻抗控制

Faryal Batool, Yasheerah Yaqoot, Muhammad Ahsan Mustafa, Roohan Ahmed Khan, Aleksey Fedoseev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Center for Digital Engineering, Skolkovo Institute of Science and Technology(智能空间机器人实验室,数字工程中心,斯克尔科夫科学与技术研究所)

专题命中 规划推理 :planning(title,abstract)

AI总结 ImpedanceDiffusion通过结合扩散模型和人工势场跟踪,实现无人机群在复杂环境中的可靠路径规划与自适应阻抗控制。

Comments This is paper is under review

详情

展开后加载摘要…

URL PDF HTML 收藏