arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 216 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 13 篇

2603.13612 2026-03-17 cs.AI 74%

LLM Routing as Reasoning: A MaxSAT View

LLM路由作为推理:一种MaxSAT视角

Son Nguyen, Xinyuan Liu, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 本文提出基于约束的LLM路由方法,将其建模为加权MaxSAT问题,通过自然语言反馈生成硬约束和软约束,实验证明语言反馈能产生近可行推荐集,揭示了语言条件下的结构化约束优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12932 2026-03-17 cs.CL 70%

DS$^2$-Instruct: Domain-Specific Data Synthesis for Large Language Models Instruction Tuning

DS$^2$-Instruct: 领域特定数据合成用于大语言模型指令微调

Ruiyao Xu, Noelle I. Samia, Han Liu

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 DS$^2$-Instruct通过零样本方法生成领域特定指令数据集,结合任务关键词和布卢姆分类法不同认知层次,提升模型在数学、金融等七个领域性能。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14935 2026-03-17 cs.CV 67%

Video-CoE: Reinforcing Video Event Prediction via Chain of Events

Video-CoE:通过事件链强化视频事件预测

Qile Su, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里妈妈,阿里巴巴集团)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract)

AI总结 本文提出Video-CoE方法,通过构建时间事件链提升视频事件预测的准确性,实验表明其优于现有主流大语言模型。

Comments 21 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14221 2026-03-17 cs.RO cs.AI cs.LG 62%

A Real-Time Neuro-Symbolic Ethical Governor for Safe Decision Control in Autonomous Robotic Manipulation

面向自主机器人操作的安全决策控制实时神经符号伦理控制器

Aueaphum Aueawatthanaphisut, Kuepon Aueawatthanaphisut

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种实时神经符号伦理控制器,通过整合伦理推理与风险评估机制,提升自主机器人操作中的安全决策能力,实验验证了其在不同人类接近度和操作风险下的有效性。

Comments 6 pages, 6 figures, 5 equations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13258 2026-03-17 cs.LG cs.AI cs.SE 62%

Your Code Agent Can Grow Alongside You with Structured Memory

你的代码代理可以与你一同成长,借助结构化记忆

Yi-Xuan Deng, Xiaoqin Liu, Yi Zhang, Guo-Wei Yang, Shuojin Yang

机构 * Tsinghua University(清华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。

Comments Code Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15087 2026-03-17 cs.SE 50%

Beyond Monolithic Models: Symbolic Seams for Composable Neuro-Symbolic Architectures

超越单体模型:符号缝合用于可组合的神经符号架构

Nicolas Schuler, Vincenzo Scotti, Raffaela Mirandola

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出符号缝合概念,旨在通过可组合的神经符号架构提升AI系统的可扩展性和透明性,结合数据驱动的适应性与显式约束的可验证性。

Comments Submitted to New and Emerging Ideas (NEMI) track at ICSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05065 2026-03-17 cs.CR 50%

Personalizing Agent Privacy Decisions via Logical Entailment

通过逻辑蕴含个性化代理隐私决策

James Flemings, Ren Yi, Octavian Suciu, Kassem Fawaz, Murali Annavaram, Marco Gruteser

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出ARIEL框架,结合LLM与规则逻辑,实现结构化个性化隐私决策,实验显示其在适当判断的F1误差率上降低40.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13723 2026-03-17 cs.SE 50%

Do AI Agents Really Improve Code Readability?

AI代理真的能提高代码可读性吗?

Kyogo Horikawa, Kosei Horikawa, Yutaro Kashiwa, Hidetake Uwano, Hajimu Iida

专题命中 逻辑推理 :planning(abstract)

AI总结 研究探讨AI代理重构对代码可读性的影响,通过分析403个提交发现,AI主要改进逻辑复杂度和文档,但导致传统质量指标下降。

Comments 5 pages

Journal ref 23rd International Conference on Mining Software Repositories (MSR '26) , 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13333 2026-03-17 cs.RO 50%

STL-SVPIO: Signal Temporal Logic guided Stein Variational Path Integral Optimization

STL-SVPIO:信号时序逻辑引导的Stein变分路径积分优化

Hongrui Zheng, Zirui Zang, Ahmad Amine, Cristian Ioan Vasile, Rahul Mangharam

机构 * Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系) Mechanical Engineering and Mechanics Department, Lehigh University(莱特大学机械工程与力学系)

专题命中 逻辑推理 :planning(abstract)

AI总结 本文提出STL-SVPIO方法,通过将信号时序逻辑转化为可微的奖励塑造机制,解决复杂STL约束下的长周期连续控制轨迹合成问题,提升鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划推理 48 篇

2603.14786 2026-03-17 cs.RO 88%

CORAL: COntextual Reasoning And Local Planning in A Hierarchical VLM Framework for Underwater Monitoring

CORAL:在分层视觉语言框架中实现上下文推理与局部规划用于水下监测

Zhenqi Wu, Yuanjie Lu, Xuesu Xiao, Xiaomin Lin

专题命中 规划推理 :reasoning(title,abstract);planning(title);self-correction(abstract)

AI总结 CORAL框架通过分离高层语义推理与底层反应控制,提升水下监测的覆盖率和安全性,减少碰撞并降低对VLM的调用次数。

Comments Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25548 2026-03-17 cs.RO 88%

Using VLM Reasoning to Constrain Task and Motion Planning

利用视觉语言模型推理来约束任务和运动规划

Muyang Yan, Miras Mengdibayev, Ardon Floros, Weihang Guo, Lydia E. Kavraki, Zachary Kingston

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Computer Science, Rice University(莱斯大学计算机科学系) Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。

Comments 9 pages, 7 figures, 1 table. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15364 2026-03-17 cs.AI cs.CL 84%

CRASH: Cognitive Reasoning Agent for Safety Hazards in Autonomous Driving

CRASH:面向自动驾驶安全隐患的认知推理代理

Erick Silva, Rehana Yasmin, Ali Shoker

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹科技大学)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRASH,一种基于大语言模型的自动驾驶安全隐患分析工具,通过自动化处理事故报告,识别事故原因并评估自动驾驶系统对事故的影响,验证其在事故分析中的有效性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14458 2026-03-17 cs.CL cs.AI cs.IR 84%

Distilling Reasoning Without Knowledge: A Framework for Reliable LLMs

提炼知识而不依赖知识:一种可靠大语言模型的框架

Auksarapak Kietkajornrit, Jad Tarifi, Nima Asgharbeygi

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种模块化框架,通过显式分离规划与事实检索及回答合成,提升大语言模型在需要最新或冲突信息时的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13594 2026-03-17 cs.AI cs.LG 84%

EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings

EnterpriseOps-Gym:面向企业场景的状态ful代理规划与工具使用的环境与评估

Shiva Krishna Reddy Malay, Shravan Nayak, Jishnu Sethumadhavan Nair, Sagar Davasam, Aman Tiwari, Sathwik Tejaswi Madhusudhan, Sridhar Krishna Nemala, Srinivas Sunkara, Sai Rajeswar

机构 * ServiceNow Research(ServiceNow研究院)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EnterpriseOps-Gym基准,用于评估企业环境中代理的规划能力。通过164个数据库表和512个功能工具模拟真实工作摩擦,评估14种前沿模型,发现状态-of-the-art模型在战略推理上存在显著不足,且代理常无法拒绝不可行任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20722 2026-03-17 cs.AI 83%

Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning

缓冲区很重要:在大语言模型推理中释放离策略强化学习的潜力

Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出BAPO框架,通过动态选择训练批次和保证策略改进下限,提升大语言模型训练效率,实验显示在数学、规划和视觉推理任务中平均提升12.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13433 2026-03-17 cs.RO cs.AI 83%

Spatially Grounded Long-Horizon Task Planning in the Wild

在真实环境中进行具有长时域的任务规划

Sehun Jung, HyunJee Song, Dong-Hee Kim, Reuben Tan, Jianfeng Gao, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于空间的规划任务,引入了GroundedPlanBench基准,评估机器人在真实环境中的长时域动作规划能力,并通过V2GP框架提升空间接地规划性能。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13230 2026-03-17 cs.CL 83%

Slang Context-based Inference Enhancement via Greedy Search-Guided Chain-of-Thought Prompting

基于贪心搜索的链式推理提示的俚语推理增强

Jinghan Cao, Qingyang Ren, Xiangyun Chen, Xinjin Li, Haoxiang Gao, Yu Zhao

专题命中 规划推理 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文提出一种基于贪心搜索的链式推理框架,通过改进小语言模型的推理能力,提升俚语解释的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14393 2026-03-17 cs.RO 82%

From Scanning Guidelines to Action: A Robotic Ultrasound Agent with LLM-Based Reasoning

从扫描指南到行动:基于LLM的机器人超声代理

Yuan Bi, Yiping Zhou, Pei Liu, Feng Li, Zhongliang Jiang, Nassir Navab

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出一种基于LLM的自主机器人超声扫描框架,通过动态调用软件工具实现自主扫描,提升适应性和透明度。

Comments Code: https://github.com/yuan-12138/RUSSAgent; Video: https://youtu.be/pfMOc4e2IGA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26255 2026-03-17 cs.AI cs.CV cs.LG cs.RO 81%

ExoPredicator: Learning Abstract Models of Dynamic Worlds for Robot Planning

ExoPredicator:为机器人规划学习动态世界的抽象模型

Yichao Liang, Dat Nguyen, Cambridge Yang, Tianyang Li, Joshua B. Tenenbaum, Carl Edward Rasmussen, Adrian Weller, Zenna Tavares, Tom Silver, Kevin Ellis

专题命中 规划推理 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ExoPredicator框架,通过联合学习符号状态表示和因果过程,解决长周期具身规划中的外源性过程建模问题,实现对复杂任务的泛化能力。

Comments ICLR 2026. The last two authors contributed equally in co-advising

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13287 2026-03-17 cs.LG cs.AI 81%

From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code

从随机答案到可验证推理:利用LLM生成代码的可解释决策

Anirudh Jaidev Mahesh, Ben Griffin, Fuat Alican, Joseph Ternasky, Zakari Salifu, Kelvin Amoaba, Yagiz Ihlamur, Aaron Ontoyin Yin, Aikins Laryea, Afriyie Samuel, Yigit Ihlamur

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Oxford(牛津大学) Vela Research(Vela研究公司) Amazon(亚马逊)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出将LLM视为代码生成器而非实例评估器,通过生成可执行决策逻辑提升决策可解释性与可重复性,在创业资本创始人筛选中实现更高精度与可验证性。

Comments 12 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05586 2026-03-17 cs.RO cs.AI 80%

Interpretable Responsibility Sharing as a Heuristic for Task and Motion Planning

可解释的责任共享作为任务与运动规划的启发式方法

Arda Sarp Yenicesu, Sepehr Nourmohammadi, Berk Cicek, Ozgur S. Oguz

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出了一种名为可解释责任共享(IRS)的新型启发式方法,用于提升家用机器人任务与运动规划的效率,通过利用人类构建的环境和固有偏见,结合辅助物体简化任务执行。

Comments Accepted for the Special Issue "Planning and Learning for Autonomous Robotics" in Robotics and Autonomous Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14006 2026-03-17 cs.CL 79%

Beyond Explicit Edges: Robust Reasoning over Noisy and Sparse Knowledge Graphs

超越显式边:在噪声和稀疏知识图谱上的鲁棒推理

Hang Gao, Dimitris N. Metaxas

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出INSES框架,通过LLM引导导航和嵌入相似性扩展,提升噪声和稀疏知识图谱的推理能力,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13676 2026-03-17 cs.AI 79%

TheraAgent: Multi-Agent Framework with Self-Evolving Memory and Evidence-Calibrated Reasoning for PET Theranostics

TheraAgent:具有自我进化记忆和证据校准推理的多智能体框架用于PET治疗诊断

Zhihao Chen, Jiahui Wang, Yizhou Chen, Xiaozhong Ji, Xiaobin Hu, Jimin Hong, Wolfram Andreas Bosbach, Axel Rominger, Ali Afshar-Oromieh, Hongming Shan, Kuangyu Shi

机构 * Fudan University(复旦大学) University of Bern(伯尔尼大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 TheraAgent通过自我进化记忆和证据校准推理,解决PET治疗诊断中数据稀缺、信息异构和证据推理的问题,实现75.7%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13245 2026-03-17 cs.AI 79%

Automating Document Intelligence in Statutory City Planning

在法定城市规划中自动化文档智能

Lars Malmqvist, Robin Barber

机构 * Research and Implementation(研究与实施)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出一种集成AI系统,通过自动化识别和脱敏个人信息、提取元数据及分析建筑图纸,减轻规划官员处理大量文档的负担,降低合规风险。

Comments Accepted for presentation at Computing Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13243 2026-03-17 cs.AI 79%

Think First, Diffuse Fast: Improving Diffusion Language Model Reasoning via Autoregressive Plan Conditioning

先思后推:通过自回归计划条件改进扩散语言模型推理

Earl J St Sauver

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出计划条件方法,通过在扩散模型提示前添加自回归生成的计划,提升多步推理能力,实验表明在GSM8K和HumanEval上分别提升11.6和12.8个百分点,证明了协调问题假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05530 2026-03-17 cs.RO cs.CV 78%

ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation

ProFocus:面向视觉-语言导航的前瞻性感知与聚焦推理

Wei Xue, Mingcheng Li, Xuecheng Wu, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 规划推理 :reasoning(title,abstract)

AI总结 ProFocus通过大语言模型与视觉-语言模型的协作,实现前瞻性感知和聚焦推理,提升视觉-语言导航任务的效率与准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08955 2026-03-17 cs.CL cs.AI cs.LG 75%

Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models

想象后再计划:基于世界模型的自适应前瞻学习 agent 学习框架

Youwei Liu, Jian Wang, Hanlin Wang, Beichen Guo, Wenjie Li

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Imagine-then-Plan框架,通过自适应前瞻机制提升agent在复杂任务中的推理能力,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13295 2026-03-17 cs.LG cs.AI 73%

ICPRL: Acquiring Physical Intuition from Interactive Control

ICPRL: 从交互控制中获取物理直觉

Xinrun Xu, Pi Bu, Ye Wang, Börje F. Karlsson, Ziming Wang, Tengtao Song, Qi Zhu, Jun Song, Shuo Zhang, Zhiming Ding, Bo Zheng

机构 * Institute of Software, Chinese Academy of Science(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) RUC(中国人民大学) PUC-Rio(里约热内卢联邦大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 ICPRL通过多轮组相对策略优化,使VLM在动态物理环境中获取物理直觉并适应策略,其世界模型预测潜在动作结果,提升物理谜题解决能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11052 2026-03-17 cs.DB cs.AI cs.CL cs.HC cs.IR 73%

GraphSeek: Next-Generation Graph Analytics with LLMs

GraphSeek: 基于LLM的下一代图分析

Maciej Besta, Łukasz Jarmocik, Orest Hrycyna, Shachar Klaiman, Konrad Mączka, Robert Gerstenberger, Jürgen Müller, Piotr Nyczyk, Hubert Niewiadomski, Torsten Hoefler

机构 * ETH Zurich(苏黎世联邦理工学院) IDEAS Research Institute(IDEAS研究机构) Cledar(Cledar公司) NCBJ Warszawa(华沙国家生物中心) BASF SE(巴斯夫股份有限公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraphSeek框架,通过语义目录实现复杂多查询分析,提升图数据处理效率与效果,实现LLM推理与数据库级执行的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14799 2026-03-17 cs.LG cs.AI cs.CL 67%

Universe Routing: Why Self-Evolving Agents Need Epistemic Control

宇宙路由:为何自我进化智能体需要认知控制

Zhaohui Geoffrey Wang

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出宇宙路由问题,探讨智能体在不同信念空间中选择推理框架的挑战,发现硬路由到异构求解器在准确性和效率上优于软MoE,并展示语义推理优于表面推理,模块化认知架构更适应终身学习。

Comments 10 pages. Accepted at the LLA Workshop at ICLR 2026 (camera-ready version)

详情

展开后加载摘要…

URL PDF HTML 收藏