arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-08 至 2026-07-08 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 23 篇

2607.05775 2026-07-08 cs.AI 新提交 88%

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

超越排行榜:大语言模型智能体中工具使用、规划和推理失败的综合分析

Wael Albayaydh, Rui Zhao, Ivan Flechais

机构 * University of Oxford(牛津大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 本文综合多篇论文形成大语言模型智能体局限性交叉分类法,识别出六个失败集群,通过迭代分组得出分类法,发现失败与任务长度非线性相关,单个子任务性能不能保证端到端成功,额外脚手架效果不佳,同时在部分任务上有进展。

Comments 16 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05772 2026-07-08 cs.SE 新提交 85%

Detecting Vulnerability-Inducing Commits via Multi-Stage Reasoning with LLM-Based Agents

通过基于大语言模型的智能体进行多阶段推理来检测导致漏洞的提交

Liyou Chen, Hailong Sun, Xiang Gao, Yue Pan

专题命中 规划推理 :reasoning(title,abstract);CoT(abstract,abstract_cn)

AI总结 研究旨在检测导致漏洞的提交,提出基于大语言模型的多智能体框架VIC - RAGENT,利用多个专业智能体提供互补视角,通过多阶段推理过程完善候选漏洞,实验表明其性能优于基线,为VIC检测提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06018 2026-07-08 cs.RO 新提交 82%

RoboTALES: Learning Reasoning-Guided Robot Policies via Task-Aligned Simulated Futures

RoboTALES:通过任务对齐的模拟未来学习推理引导的机器人策略

Hanan Gani, Tejal Kulkarni, Madhoolika Chodavarapu, Nicklas Hansen, Manmohan Chandraker

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 针对预训练视频生成模型用于机器人策略规划的局限,提出RoboTALES框架,通过基于分层语言模型的规划器和基于视觉语言模型的评论家两大创新,学习任务对齐的模拟未来以训练机器人策略,在多样操纵任务中表现优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06326 2026-07-08 cs.AI 新提交 79%

DT-Guard: Intent-Driven Reasoning-Active Training for Reasoning-Free LLM Safety Guardrail

DT-Guard:用于无推理语言模型安全护栏的意图驱动推理主动训练

He Liu, Changtao Miao, Xinjie Yang, Tianle Song, Yin Wu, Junchi Chen, Bintao He, Xinyuan Zhang, Bo Zhang, Shi Yan, Wei Lu, Wei Wang, Danyang Xu, Jiansheng Cai, Zhe Li

机构 * Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究为开放世界应用的语言模型设计安全护栏的问题,提出基于推理主动训练、无推理推理范式的DT-Guard模型,通过构建意图驱动数据集等方法提升性能,实验证明其在安全基准测试中表现优异,能有效将推理监督内化到低延迟安全判别中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06501 2026-07-08 cs.RO 新提交 78%

Hypothesis-driven Model Expansion under Uncertainty for Open-World Robot Planning

不确定性下用于开放世界机器人规划的假设驱动模型扩展

Anxing Xiao, Hanbo Zhang, Tianrun Hu, David Hsu

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Smart Systems Institute, National University of Singapore(新加坡国立大学智能系统研究所)

专题命中 规划推理 :planning(title,abstract)

AI总结 针对开放世界机器人规划中传统方法失效的问题,提出假设驱动模型扩展框架,利用基础模型生成假设,结合自动规划与验证反馈进行迭代优化,实现自主知识扩展,推动家用服务机器人实际部署。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05511 2026-07-08 cs.CV 新提交 78%

Light-Omni: Reflex over Reasoning in Agentic Video Understanding with Long-Term Memory

Light-Omni:基于长期记忆的智能视频理解中的反射优于推理

Chang Nie, Jiaju Wei, Junlan Feng, Chaoyou Fu, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 研究针对智能视频理解中先进智能体依赖迭代推理成本高的问题,提出Light-Omni框架,通过双重上下文状态实现反射式轻量级视频理解,经实验验证其有效性,性能优于M3-Agent且能增强现有MLLMs。

Comments Project Page: https://clare-nie.github.io/Light-Omni

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20182 2026-07-08 cs.RO cs.MA 版本更新 78%

IndoorR2X: Indoor Robot-to-Everything Coordination with LLM-Driven Planning

IndoorR2X: 基于大语言模型的室内机器人与万物协调

Fan Yang, Soumya Teotia, Shaunak A. Mehta, Prajit KrisshnaKumar, Quanting Xie, Jun Liu, Yueqi Song, Wenkai Li, Atsunori Moteki, Kanji Uchino, Yonatan Bisk

机构 * Fujitsu Research(富士通研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(title,abstract)

AI总结 IndoorR2X通过整合移动机器人和静态物联网设备的观测数据,构建全局语义状态,实现可扩展的场景理解、减少冗余探索并利用大语言模型进行高层协调,提升多机器人系统的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01642 2026-07-08 cs.RO 版本更新 78%

FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models

FailSafe: 视觉-语言-动作模型中的失败推理与恢复

Zijun Lin, Jiafei Duan, Haoquan Fang, Dieter Fox, Ranjay Krishna, Cheston Tan, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(title);planning(abstract)

AI总结 提出FailSafe系统,自动生成多样化失败案例及可执行恢复动作,微调LLaVA-OV-7B构建FailSafe-VLM,使机器人检测并恢复失败,在ManiSkill任务上平均提升三个VLA模型性能达22.6%。

Comments IROS 2026. Project Page: https://jimntu.github.io/FailSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06452 2026-07-08 cs.CL cs.AI 新提交 73%

From Voting to Agent Collaboration: Answer-Type-Aware LLM Pipelines for BioASQ 14b

从投票到智能体协作:用于BioASQ 14b的答案类型感知大语言模型管道

Taeyun Roh, Eunha Lee, Wonjune Jang, Sohyun Chung, Junha Jung, Jaewoo Kang

机构 * Korea University(韩国大学) Myongji University(明知大学) AIGEN Sciences(爱根科学公司)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对BioASQ 14b任务B提出特定问题类型的大语言模型框架,依据不同问题类型选择不同推理程序,如为是/否问题用片段洗牌等,经初步实验和官方评估,框架性能具竞争力,在第4批次事实性子任务中夺冠,证明相关方法结合的有效性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05438 2026-07-08 cs.IR cs.AI 新提交 70%

Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

模态相关性并非模态效用:用于成本感知多模态RAG的事后选择性模态升级

Xue Li, Yiming Gai

机构 * Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究多模态检索增强生成中模态选择决策点问题,提出事后选择性模态升级方法,先低成本从文本和表格回答,再按需支付VLM证据费用,校准路由器决定是否升级,在MultiModalQA上减少视觉调用并缩小与神谕升级率差距,扩展了路由信号层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10758 2026-07-08 cs.CR 版本更新 69%

Agents at Risk: How Users Unwittingly Undermine LLM Safety

处于风险中的智能体:用户如何在不知情的情况下破坏大语言模型的安全性

Fengchao Chen, Tingmin Wu, Van Nguyen, Surya. Nepal, Carsten Rudolph

专题命中 规划推理 :planning(abstract,comments);reasoning(abstract)

AI总结 研究基于大语言模型的智能体安全问题,介绍用户中继上下文操纵攻击,通过让良性用户在请求中传递对抗性内容,实验表明该攻击在多种防御下优于提示注入基线,揭示当前智能体框架设计缺陷。

Comments User-relayed Context Manipulation; LLM-based Agents; Agent Security; Human Factors in Cybersecurity; Web-Use Agents; Planning Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06278 2026-07-08 cs.NI 新提交 67%

Quality-Aware Personalized AI Service Provisioning in UAV-Assisted 6G Networks

无人机辅助6G网络中质量感知的个性化人工智能服务供应

Mohammad Farhoudi, Masoud Shokrnezhad, Tarik Taleb

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 研究无人机辅助6G网络中质量感知的个性化AI服务供应问题,提出HyPE框架,集成移动感知预测、学习增强决策和启发式服务放置与路由,模拟实验显示其在覆盖范围、延迟、服务个性化等方面优于基线,突出预测学习增强供应的前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07089 2026-07-08 cs.CV 版本更新 67%

RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent

RS-Agent:通过智能代理实现遥感任务自动化

Wenjia Xu, Zijian Yu, Boyang Mu, Jiuniu Wang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(网络与交换技术国家重点实验室,北京邮电大学,中国) City University of HongKong, Hong Kong 999077, China(香港城市大学,中国) School of Geographic Sciences, Hunan Normal University, Changsha 410081, China(地理科学学院,湖南师范大学,中国)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 针对多模态大语言模型在遥感任务中的局限,提出RS-Agent智能代理,通过结构化任务规划等连接用户意图与遥感流程,含四个组件及两种方法,实验显示其在多任务中显著优于现有模型,证明结合两者用于智能地理空间分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06157 2026-07-08 cs.CL cs.AI 新提交 62%

LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability

用于协商协作的大语言模型智能体:部分可观测联合决策下的联合决策研究

Chenxu Wang, Yongkun Yang, Boyuan Du, Shiwei Lin, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Fuzhou University(福州大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究部分可观测联合决策任务下的协商LLM智能体,通过形式化问题、引入基准、实例化框架和协议并评估LLMs,发现复杂任务仍挑战语言模型,协商过程有反思纠错机会,为评估改进LLM智能体奠定基础。

Comments Code is available at https://github.com/wcx21/deliberative-collaboration-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05888 2026-07-08 cs.CR cs.AI 新提交 61%

i-EXAM: Instructable and Explainable Attack Connectivity Graph Modeler

i-EXAM:可指导且可解释的攻击连通性图建模器

Rakesh Podder, Wadia Ganim, Sarath Sreedharan, Indrajit Ray, Indrakshi Ray

机构 * Colorado State University(科罗拉多州立大学)

专题命中 规划推理 :planning(abstract,comments);分类 cs.AI

AI总结 i-EXAM工具借助规划编译,帮系统管理员创建复杂网络安全配置文件并做假设分析,可识别攻击路径、评估指标、生成强化策略,还能用大语言模型解释策略。

Comments In the Proceedings of the International Conference on Automated Planning and Scheduling (ICAPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06461 2026-07-08 eess.AS cs.CL cs.SD 新提交 57%

WordVoice: Explicit and Decoupled Multi-Dimensional Word-Level Control for LLM-Based TTS

WordVoice:基于大语言模型的文本转语音中显式且解耦的多维词级控制

Sihang Nie, Jinxin Ji, Xiaofen Xing, Deyi Tuo, Chengbin Jin, Jialong Mai, Xiangmin Xu

机构 * South China University of Technology(南方科技大学) Huya Inc.(Huya公司) Tongji University(同济大学) The Hongkong polytechnic university(香港理工大学) Foshan University(佛山大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 研究针对基于LLM的TTS系统词级控制粗糙的问题,提出统一框架。构建含五维注释的数据集,引入WordVoice将隐式生成变为显式可控范式,经实验验证其在多声学维度上实现卓越解耦控制且保持零样本合成稳定性。

Comments 10 pages, 4 figures, 6 tables; Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06001 2026-07-08 cs.AI cs.MA 新提交 57%

Information Limits and Attractor Dynamics in Economies of Frontier LLM Agents: A Pre-Registered Test

前沿语言模型智能体经济中的信息限制与吸引子动力学:一项预注册测试

Cheng Qian

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究对前沿语言模型智能体小型经济体进行预注册实验,测试耦合多智能体系统的两个预测。通过实验验证了比例投注耦合经济体中一些信息论相关定律,同时发现残差缩放测试结果否定了平滑平均场模型假设,还发布了相关代码等资料。

Comments 15 pages. Preprint. Zenodo: https://doi.org/10.5281/zenodo.21185866. Companion synthesis: arXiv:2606.12502

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05722 2026-07-08 cs.CL 新提交 57%

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

Nemotron-Labs-Diffusion:一种统一自回归、扩散和自推测解码的三模式语言模型

Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

机构 * Nemotron-Labs(Nemotron实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 介绍了统一AR、扩散和自推测解码的三模式语言模型Nemotron-Labs-Diffusion,通过联合目标训练,能切换模式。研究表明其目标互补,自推测模式表现优,有长期潜力,该模型家族在精度和速度上优于现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05758 2026-07-08 cond-mat.mtrl-sci cs.LG 新提交 57%

From Closed-Loop Optimization to Open Decision Making: Coupled Digital Twins for Predictive and Autonomous Microscopy

从闭环优化到开放决策:用于预测性和自主性显微镜的耦合数字孪生

Yu Liu, Boris Slautin, Ian Mercer, Jon-Paul Maria, Sergei V. Kalinin

机构 * Department of Materials Science and Engineering, University of Tennessee, Knoxville, Tennessee, 37996, USA(田纳西大学材料科学与工程系) Materials Science and Engineering Department, Materials Research Institute, the Pennsylvania State University, University Park, Pennsylvania, 16802, USA(宾夕法尼亚州立大学材料研究学院材料科学与工程系)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 研究从闭环优化到开放决策的自动化实验,提出耦合数字孪生框架,通过样本孪生和仪器孪生分别编码材料状态与信号等,用于预测显微镜操作等,以力 - 距离曲线编码器等实现框架,为预测性操作和自主实验规划奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06234 2026-07-08 cs.CV 新提交 50%

WING: A Window-Prior-Based Generative Network with Gated Inception for Cross-Modality CT Synthesis

WING:一种基于窗口先验的带门控inception的生成网络用于跨模态CT合成

Siyuan Mei, Yan Xia, Yipeng Sun, Siming Bayer, Zirong Li, Chengze Ye, Daiqi Liu, Fuxin Fan, Yixing Huang, Andreas Maier

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(模式识别实验室,埃尔朗根-纽伦堡弗里德里希-亚历山大大学) Department of Orthodontics and Orofacial Orthopaedics, Friedrich-Alexander-Universität Erlangen-Nürnberg(正畸与口腔颌面正畸科,埃尔朗根-纽伦堡弗里德里希-亚历山大大学) Siemens Healthineers(西门子医疗) Institute of Medical Technology, Peking University(北京大学医学技术研究所)

专题命中 规划推理 :planning(abstract)

AI总结 研究旨在从MRI和CBCT生成CT体积改善放疗计划。核心方法是将回归目标重构成窗口表示,引入WING网络,含门控inception生成器、融合与细化变压器及联合对抗训练目标。主要贡献是在相关基准上达最优性能且支持单模型多解剖合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06078 2026-07-08 cs.SE 新提交 50%

Collaborative Multi-Agent Testing for Emergent Failure Discovery in Autonomous Driving Systems

用于自动驾驶系统中突发故障发现的协作式多智能体测试

Ruizhen Gu, Konstantinos Koufos, Donghwan Shin, Vahid Garousi, Mehrdad Dianati

专题命中 规划推理 :planning(abstract)

AI总结 研究针对自动驾驶系统故障发现问题,提出协作式多智能体测试框架CREAD,通过共享黑板和协调器组织相关功能,经实验验证该框架在不同环境下能有效提升故障发现率,是ADS突发行为发现的有前途方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05482 2026-07-08 cs.SE cs.RO 新提交 50%

TypeGo: An OS Runtime for Embodied Agents

TypeGo:一种用于具身智能体的操作系统运行时

Guojun Chen, Alex Schott, Lin Zhong

机构 * Yale University(耶鲁大学)

专题命中 规划推理 :planning(abstract)

AI总结 研究针对具身智能体大语言模型规划与实时控制等的矛盾,提出TypeGo运行时,将基于大语言模型的规划构建为异步循环,管理智能体物理身体,通过自然语言指令编程,能降低延迟并支持并发任务,提供了初步设计证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01148 2026-07-08 cs.SI cs.SY eess.SY 新提交 50%

Emergence of Preferential Attachment and Glass-Ceiling Effects in Autonomous Networks of LLMs

LLM自主网络中优先连接与玻璃天花板效应的涌现

Yiming Zhang, Vikram Krishnamurthy

专题命中 规划推理 :reasoning(abstract)

AI总结 研究LLM代理自主选择合作者时网络结构的涌现,发现优先连接和类型依赖的玻璃天花板效应,通过平均场模型证明中心性收敛,实验验证了网络动态对集体性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏