arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-14 至 2026-05-14 共收录 30 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 30 篇

2510.08992 2026-05-14 cs.LG 90%

Constraints-of-Thought: A Framework for Constrained Reasoning in Language-Model-Guided Search

思维约束:一种在语言模型引导搜索中进行约束推理的框架

Kamel Alrashedy, Vriksha Srihari, Zulfiqar Zaidi, Ridam Srivastava, Pradyumna Tambwekar, Matthew Gombolay

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出Const-o-T框架,通过约束推理提升语言模型在多步骤任务中的规划效率和决策可靠性,适用于风险游戏、CAD代码生成和算术推理等复杂领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03167 2026-05-14 cs.CL cs.AI cs.LG 87%

Where Do Reasoning Models Refuse?

推理模型拒绝发生在何处?

Kureha Yamaguchi, Benjamin Etheridge, Andy Arditi

机构 * The Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学) Northeastern University(东北大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨推理模型在生成响应前拒绝决策的位置,发现推理链中的初始句子对拒绝决定有显著影响,并通过激活方向分析揭示了拒绝机制。

Comments v1 accepted to the ICML 2025 Workshop on Reliable and Responsible Foundation Models (R2FM). 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09505 2026-05-14 cs.AI 83%

EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild

EpiGraph:构建证据密集型癫痫推理的通用专家

Yuyang Dai, Zheng Chen, Jathurshan Pradeepkumar, Yasuko Matsubara, Jimeng Sun, Yasushi Sakurai, Yushun Dong

机构 * Florida State University(佛罗里达州立大学) The University of Osaka(大阪大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 EpiGraph通过整合癫痫领域异构知识图谱,提升证据驱动的临床推理能力,在药基因组学任务中提升30-41%,为神经科应用提供实用评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
1307.7494 2026-05-14 cs.AI cs.LO cs.RO 83%

ReAct! An Interactive Tool for Hybrid Planning in Robotics

ReAct! 一种用于机器人混合规划的交互工具

Zeynep Dogmus, Esra Erdem, Volkan Patoglu

机构 * Sabancı University(Sabanci大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 ReAct! 提供了一种交互式工具,使机器人研究人员能够在无需了解底层形式化细节的情况下,通过高级推理解决复杂规划问题,适用于服务机器人和认知工厂等动态领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26839 2026-05-14 cs.LG cs.CV 83%

From Pixels to BFS: High Maze Accuracy Does Not Imply Visual Planning

从像素到BFS:高迷宫精度并不意味着视觉规划

Alberto G. Rodriguez Salgado

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 本文通过MazeBench基准测试,揭示了多模态模型在视觉空间任务中依赖于文本网格转换和逐步路径枚举,而非真正的规划,高精度并不等同于人类空间理解。

Comments 15 pages, 10 figures. Code and mazes available at https://github.com/alrod97/LLMs_mazes

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11556 2026-05-14 cs.CL cs.AI cs.MA 81%

Systematic Failures in Collective Reasoning under Distributed Information in Multi-Agent LLMs

多智能体大语言模型中分布式信息下的集体推理系统性失效

Yuxuan Li, Aoi Naito, Hirokazu Shirado

机构 * School of Computer Science, Carnegie Mellon University, Pittsburgh, USA(计算机科学学院,卡内基梅隆大学,匹兹堡,美国) School of Environment and Society, Institute of Science Tokyo, Tokyo, Japan(环境与社会学院,东京科学研究所,东京,日本)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现多智能体大语言模型在分布式信息下仅能获得30.1%的准确率,而单智能体在完整信息下可达80.7%。系统性失效源于智能体无法识别和应对潜在的信息不对称,导致关键分布式事实未被探索。通过轻量级结构化通信协议可显著提升集体推理能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13534 2026-05-14 cs.AI 79%

Scaling Retrieval-Augmented Reasoning with Parallel Search and Explicit Merging

通过并行搜索和显式合并扩展检索增强推理

Jiabei Liu, Wenyu Mao, Junfei Tan, Chunxu Shen, Lingling Yi, Jiancan Wu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) WeChat Technical Architecture Department, Tecent Inc.(腾讯公司微信技术架构部门)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MultiSearch框架,通过多查询检索和显式信息融合提升检索增强推理效果,实验表明其在问答任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13481 2026-05-14 cs.CL 79%

PersonalAI 2.0: Enhancing knowledge graph traversal/retrieval with planning mechanism for Personalized LLM Agents

PersonalAI 2.0:通过规划机制增强知识图谱遍历/检索以实现个性化大语言模型代理

Mikhail Menschikov, Matvey Iskornev, Alexander Kharitonov, Alina Bogdanova, Mikhail Belkin, Ekaterina Lisitsyna, Artyom Sosedka, Victoria Dochkina, Ruslan Kostoev, Ilia Perepechkin, Evgeny Burnaev

机构 * Huawei, Moscow, Russia(华为,莫斯科,俄罗斯)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.CL

AI总结 PersonalAI 2.0通过动态多阶段查询流程提升知识图谱遍历与检索能力,结合实体提取和生成线索查询,提升回答准确性,优于现有方法,且在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13037 2026-05-14 cs.AI 79%

MAP: A Map-then-Act Paradigm for Long-Horizon Interactive Agent Reasoning

MAP:一种用于长周期交互代理推理的先映射再行动范式

Yuxin Liu, Ziang Ye, Yueqing Sun, Mingye Zhu, Jinwei Xiao, Zhuowen Han, Qi GU, Xunliang Cai, Lei Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团) Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tianjin University(天津大学)

专题命中 规划推理 :reasoning(title);planning(abstract);分类 cs.AI

AI总结 本文提出MAP范式,通过先构建环境认知再执行任务,解决交互代理中环境感知延迟问题,实验显示在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20383 2026-05-14 eess.SY cs.SY 78%

Accelerating Time-Optimal Trajectory Planning for Connected and Automated Vehicles with Graph Neural Networks

利用图神经网络加速连接和自动化车辆的时间最优轨迹规划

Viet-Anh Le, Andreas A. Malikopoulos

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出基于学习的框架,利用图神经网络加速连接和自动化车辆的时间和能量最优轨迹规划,通过实时重规划提升性能,采用GINEConv网络学习离线数据以加速计算,减少计算时间并保持控制性能。

Comments final IFAC WC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13134 2026-05-14 eess.SY cs.SY 78%

Security-Aware Planning and Control of Multi-Agent Systems with LTL Tasks

具有LTL任务的多智能体系统的安全意识规划与控制

Georgios Mitsos, Dimos V. Dimarogonas, Siyuan Liu

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出了一种安全构造的多智能体系统规划与控制框架,通过LTL规范保护敏感信息免受部分观察的被动入侵者侵害,确保任务执行的保密性。

Comments 8 pages, 2 figures; This paper has been accepted at the IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12618 2026-05-14 cs.CY 78%

Career Mobility of Planning Alumni in the United States: Evidence from Professional Profile Data using Large Language Models

美国规划校友职业流动性研究:基于专业资料数据和大语言模型的证据

Yan Wang, Su Jeong Jo

专题命中 规划推理 :planning(title,abstract)

AI总结 研究利用大语言模型分析13万余名美国规划校友的职业流动性,发现采用多部门经验或行业转换路径的校友流动性更高,软技能和地理流动性是晋升关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13335 2026-05-14 cs.AI cs.CV 74%

Ego2World: Compiling Egocentric Cooking Videos into Executable Worlds for Belief-State Planning

Ego2World:将第一人称视角烹饪视频编译为可执行世界以支持信念状态规划

Qinchuan Cheng, Zhantao Gong, Pengzhan Sun, Angela Yao, Xulei Yang, Shijie Li

机构 * Xi’an Jiaotong University(西安交通大学) Nankai University(南开大学) National University of Singapore(新加坡国立大学) A*STAR

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 本文提出Ego2World基准,通过编译第一人称视角烹饪视频为可执行符号世界,支持信念状态规划。实验表明,信念维护对任务完成至关重要。

Comments Project page: https://sj-li.com/PROJ/Ego2World/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13185 2026-05-14 cs.FL cs.MA 71%

Decoupled Planning for Multiple Omega-Regular Objectives

多重ω-regular目标的解耦规划

Guy Avni, Thomas A. Henzinger, Kaushik Mallik, Suman Sadhukhan, K. S. Thejaswini

专题命中 规划推理 :planning(title)

AI总结 本文提出了解耦框架,通过独立代理选择局部策略并由调度器动态组合,解决图上满足多个ω-regular目标的路径生成问题,探讨了调度器协调对正确性的必要性及安全目标的同步协议。

Comments 33 pages, 6 figures. Extended version of the paper accepted at CAV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12916 2026-05-14 cs.MA cs.LG 70%

SHM-Agents: A Generalist-Specialist Integrated Agent System for Structural Health Monitoring

SHM-Agents:一种用于结构健康监测的通用-专家集成代理系统

Yuequan Bao, Xing Li, Huabin Sun, Dawei Liu, Yuxuan Tian, Haiyang Hu

机构 * Key Lab of Smart Prevention and Mitigation of Civil Engineering Disasters of the Ministry of Industry and Information Technology, Harbin Institute of Technology, Harbin(工业和信息化部智能防灾减灾重点实验室,哈尔滨工业大学,哈尔滨) Key Lab of Structures Dynamic Behavior and Control of the Ministry of Education, Harbin Institute of Technology, Harbin(教育部结构动态行为与控制重点实验室,哈尔滨工业大学,哈尔滨) School of Civil Engineering, Harbin Institute of Technology, Harbin(哈尔滨工业大学土木工程学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出SHM-Agents,结合大语言模型的推理能力与专用算法的问题解决能力,实现结构健康监测任务的端到端执行,提升部署效率与系统扩展性。

Comments 19 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12755 2026-05-14 cs.AI 70%

State-Centric Decision Process

以状态为中心的决策过程

Sungheon Jeong, Ryozo Masukawa, Sanggeon Yun, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出SDP框架,通过让智能体逐步构建缺失的状态空间和转换规则,解决语言环境缺乏运行时结构的问题,并在多个基准测试中取得最佳无训练结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06869 2026-05-14 cs.AI 70%

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

Agentick: 一个统一的连续决策制定代理基准测试

Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13821 2026-05-14 cs.AI cs.LG 62%

Harnessing Agentic Evolution

利用代理进化

Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepWisdom Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AEvo框架,通过统一接口整合程序和代理进化,提升长周期搜索性能,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12674 2026-05-14 cs.AI cs.LG cs.RO 62%

Revealing Interpretable Failure Modes of VLMs

揭示视觉语言模型的可解释性故障模式

Isha Chaudhary, Vedaant V Jain, Kavya Sachdeva, Sayan Ranu, Gagandeep Singh

机构 * UIUC(伊利诺伊大学香槟分校) Kumo AI IIT Delhi(德里印度理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出REVELIO框架,通过系统性探索揭示VLMs在自动驾驶和室内机器人领域中的可解释性故障模式,发现模型在空间定位和安全威胁识别上的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13782 2026-05-14 cs.RO cs.AI 57%

LMPath: Language-Mediated Priors and Path Generation for Aerial Exploration

LMPath:基于语言引导的先验与路径生成用于航空探索

Jonathan A. Diller, Fernando Cladera, Camillo J. Taylor, Vijay Kumar

机构 * GRASP Laboratory(GRASP实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出LMPath,通过结合语言模型和视觉模型,生成基于语义的航空探索路径,提升大规模环境中的搜索效率。

Comments Poster at 2026 AI-Driven Safe Aerial Robotics Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13470 2026-05-14 cs.LG 57%

Twincher: Bijective Representation Learning for Robust Inversion of Continuous Systems

Twincher: 基于双射表示学习的连续系统鲁棒反演

Arkady Gonoskov

机构 * Department of Physics, University of Gothenburg(哥德堡大学物理系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出Twincher架构,通过结构化微分同胚变换和对抗训练策略,实现对连续前向过程的鲁棒反演,提升机器人、视觉和物理AI中的数据效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13391 2026-05-14 cs.AI 57%

RS-Claw: Progressive Active Tool Exploration via Hierarchical Skill Trees for Remote Sensing Agents

RS-Claw:通过分层技能树实现渐进式主动工具探索的遥感代理

Liangtian Liu, Zeyuan Wang, Ziyu Li, Kai Ouyang, Zichao Tang, Chengfu Liu, Haifeng Li, Hanwen Yu, Wentao Yang, Cheng Yang, Dongyang Hou

机构 * School of Geosciences and Info-Physics, Central South University(地质科学与信息物理学院,中南大学) School of Resources and Environment, University of Electronic Science and Technology of China(资源与环境学院,电子科技大学) School of Earth Sciences and Spatial Information Engineering, Hunan University of Science and Technology(地球科学与空间信息工程学院,湖南科技大学) Sanya Institute of Hunan University of Science and Technology(海南科技大学三亚研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RS-Claw,通过分层技能树实现主动探索,解决遥感代理工具选择中的被动机制问题,提升长周期推理中的工具命中率和上下文空间效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13052 2026-05-14 cs.IR cs.CL 57%

RAG-Enhanced Large Language Models for Dynamic Content Expiration Prediction in Web Search

增强型大型语言模型用于网络搜索中动态内容过期预测

Tingyu Chen, Wenkai Zhang, Li Gao, Lixin Su, Ge Chen, Dawei Yin, Daiting Shi

机构 * Baidu Inc.(百度公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于大型语言模型的查询感知动态内容过期预测框架,通过提取细粒度时间上下文和利用LLM推断查询特定的有效性范围,提升搜索结果的新鲜度和用户体验。

Comments Accepted at SIGIR 2026. Final version: https://doi.org/10.1145/3805712.3808457

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12682 2026-05-14 cs.AI 57%

Learning Transferable Latent User Preferences for Human-Aligned Decision Making

学习可迁移的潜在用户偏好以实现人类对齐的决策制定

Alina Hyk, Sandhya Saisubramanian

机构 * Oregon State University(俄勒冈州立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CLIPR框架,通过少量对话输入学习可迁移的自然语言规则,以提升决策与人类偏好的对齐度并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17031 2026-05-14 cs.LG cs.CV cs.CY 57%

Energy Scaling Laws for Diffusion Models: Quantifying Compute in Image Generation

扩散模型的能量缩放规律:量化图像生成中的计算需求

Aniketh Iyengar, Jiaqi Han, Boris Ruf, Vincent Grari, Marcin Detyniecki, Stefano Ermon

机构 * Stanford University(斯坦福大学) AXA AI Research(AXA人工智能研究)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于计算复杂度(FLOPs)的扩散模型GPU能耗预测方法,通过分解推理过程中的文本编码、去噪和解码步骤,验证去噪操作主导能耗,并在四种先进模型和三种GPU架构上验证了预测准确性与跨架构泛化能力。

Comments Accepted at ACM Conference on Fairness, Accountability, and Transparency (FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12571 2026-05-14 cs.CV cs.AI 57%

VideoSEAL: Mitigating Evidence Misalignment in Agentic Long Video Understanding by Decoupling Answer Authority

VideoSEAL: 通过解耦答案权威性来缓解代理长视频理解中的证据错位

Chenhao Qiu, Yechao Zhang, Xin Luo, Shien Song, Xusheng Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出VideoSEAL框架,通过解耦规划与答案权威性,解决长视频理解中证据错位问题,提升回答准确性和证据对齐度,实验结果显示在多个基准上表现优异。

Comments Accepted to ICML 2026. 33 pages, 13 figures. Code and models are available at https://github.com/Echochef/VideoSEAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13762 2026-05-14 cs.MA 50%

EconAI: Dynamic Persona Evolution and Memory-Aware Agents in Evolving Economic Environments

EconAI:动态身份演变与记忆感知代理在演变经济环境中的应用

Annie Liu, Zane Cao, Lang Chen, Zongxin Xu, Zigan Wang

专题命中 规划推理 :planning(abstract)

AI总结 本文提出EconAI框架,通过经济情绪指数、记忆加权和动态决策机制,提升经济模拟的适应性和真实性,实现宏观与微观经济环境的统一模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13716 2026-05-14 cs.SE cs.MA 50%

SkillOps: Managing LLM Agent Skill Libraries as Self-Maintaining Software Ecosystems

SkillOps:将LLM代理技能库视为自维护的软件生态系统进行管理

Hongji Pu, Xinyuan Song, Liang Zhao

专题命中 规划推理 :planning(abstract)

AI总结 SkillOps通过自维护软件生态系统方法管理LLM代理技能库,解决技能库中的技术债务问题,提升技能检索、组合和执行效率,实验表明其在ALFWorld上任务成功率高达79.5%。

Comments 23 pages, 9 figures. Submitted to NeurIPS 2026. Code is available at https://github.com/Hik289/SkillOps.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13035 2026-05-14 cs.MA 50%

Conveyor Parcel Routing with Order-Contiguous Arrivals

带订单连续到达的传送带包裹路由

Takuro Kato, Keisuke Okumura

专题命中 规划推理 :planning(abstract)

AI总结 本文提出DOPP算法,解决带订单连续到达的在线多智能体路径寻找问题,通过三层结构高效生成可行路径,验证了算法在不同传送带布局中的实用性和高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12923 2026-05-14 cs.CY 50%

MIRACLE_Multi-Agent Intelligent Regulation to Advance Collaborative Learning Environment

MIRACLE:多智能体智能调节以推进协作学习环境

Shuang Li, Haiyang Xin, Yimeng Sun, Qiannan Niu, Lingyun Huang, Gaowei Chen, Ching Sing Chai

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出MIRACLE系统,通过整合元认知调节和主动提供情感支持,提升学生协作学习中的社会共享调节能力,实验证明其在规划、监控和反思阶段的显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏