arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-05 至 2026-08-05 共收录 155 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 31 篇

2608.03735 2026-08-05 cs.MA cs.CL 新提交 79%

An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures

多语言多智能体规划失败的可操作诊断

Vikas Pahuja, Jonathan Brokman, Omer Hofman, Tamir Nizri, Daniel Vishna, Seraphina Goldfarb-Tarrant, Kelly Marchisio, Hisashi Kojima, Roman Vainshtein

专题命中 规划推理 :planning(title,abstract);分类 cs.CL

AI总结 本研究针对多语言多智能体系统在非英语场景下的规划失败问题,提出规划-接地失败分类法,开发TART方法,在多语言任务中显著提升了现有系统的性能。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03468 2026-08-05 cs.AI 新提交 79%

ToolLIFT: Lifting Tool-Specific Trajectories into Function-Level Graphs for Generalizable Tool Planning

ToolLIFT:将工具特定轨迹提升为函数级图以实现可泛化的工具规划

Xiuhui You, Jiayi Luo, Zichao Shen, Qingyun Sun, Ziwei Zhang

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出ToolLIFT框架,通过将工具特定轨迹提升为函数级工作流图,实现了更具泛化性的工具规划,在多个基准上优于现有方法,对未见过的工具集泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03028 2026-08-05 cs.AI 新提交 79%

Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

评估药物安全推理中对患者信息的反事实敏感性

Zhitian Hou, Yuhang Liu, Pengkai Wang, Zeyu Liu, Guanghao Zhu, Zheng Liu, Shuo Cai, Congkai Xie, Zhijie Sang, Kun Zeng, Hongxia Yang

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03408 2026-08-05 cs.RO cs.DC 新提交 78%

Flying over The Uncertain Nature (FORTUNE): Intelligent and Humanistic 3D Path Planning for Low-Altitude Collaboration

飞越不确定性自然(FORTUNE):面向低空协同的智能且人文的三维路径规划

Minghui Liwang, Wenhan Jia, Xinlei Yi, Wenbo Zhu, Yuhan Su, Xianbin Wang

专题命中 规划推理 :planning(title,abstract)

AI总结 本文针对低空智能体的三维多无人机路径规划问题,提出FORTUNE分层离线-在线框架,其在真实与合成场景中性能优于现有最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03169 2026-08-05 cs.CR cs.SE 新提交 78%

Test-time reasoning effort and unauthorized tool use in language-model agents: a prespecified equivalence study

语言模型智能体的测试时推理工作量与未授权工具使用:一项预先指定的等效性研究

Xiaonan Xu, Wenjing Wu

专题命中 规划推理 :reasoning(title,abstract)

AI总结 该研究在GPT-5.6上开展预先指定的等效性研究,发现调整推理工作量未导致未授权工具使用,且规则探测率上升的模式与针对性搜索假设不符。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02974 2026-08-05 cs.SE 新提交 78%

ConFL: Explainable Concurrent Fault Localization via Hierarchy-Guided LLM Reasoning

ConFL:基于层次引导大语言模型推理的可解释并发故障定位框架

Shuai Shao, Dingbang Wang, Yiming Zeng, Tingting Yu

专题命中 规划推理 :reasoning(title,abstract)

AI总结 ConFL是一种可解释的并发故障定位框架,通过构建并发知识库与LLM引导的层次检索,在8个Java项目的并发漏洞实验中,其MRR达0.503、MAP达0.486,性能优于同类基线方法且鲁棒性良好。

Comments Accepted at ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03502 2026-08-05 cs.AI cs.LG cs.MA 新提交 73%

Hybrid LLM-Augmented Reinforcement Learning Agents for Complex Sequential Decision Tasks

用于复杂序列决策任务的混合大语言模型增强强化学习智能体

Christophe D. Hounwanou, John Emeka Eze, Yaé Ulrich Gaba

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合LLM增强RL智能体,融合LLM规划与RL动作优化,经实验验证其在序列决策任务上优于仅RL、仅LLM的基线方法,为构建更强自主系统提供了新方向。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12029 2026-08-05 cs.SE 版本更新 67%

Enhancing LLM Performance Through Debate: An Empirical Study on Multi-Agent Debate for Coding Tasks

通过辩论提升大语言模型性能:针对编码任务的多智能体辩论实证研究

Yong Jin Chun, Qihong Chen, Jiawei Li, Iftekhar Ahmed

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本研究探究多智能体辩论(MAD)在软件工程四类编码任务上的有效性,适配NLP的MAD框架并提出两种变体,证实结构化辩论可提升LLM编码性能,凸显其协作协同效应。

Comments accepted to ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03868 2026-08-05 cs.LG cs.AI 新提交 62%

GENESIS: Towards Explainable Causal Discovery

GENESIS:迈向可解释的因果发现

Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat, Harsh Vardhan Singh Chauhan, Niranjan Pedanekar

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出可解释混合因果发现框架GENESIS,实现100%决策可追溯性,在多数基准数据集上性能优于纯统计方法,可与先进LLM辅助方法媲美。

Comments 13 pages, 2 figures, 13 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03263 2026-08-05 cs.LG cs.AI 新提交 62%

The Ignition Is Real, and It Lives at the Readout: Latent composition, difficulty-clocked ignition, and the interface-constituted commit in a recurrent-depth reasoner

激活是真实存在的,且存在于读出层:循环深度推理器中的潜在组成、难度驱动的激活以及由界面构成的提交

Simon Lam-Muir

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究验证潜在推理模型的“组成激活”为真实计算,复现30M参数循环深度推理器,发现激活存在于读出层,决策时边际跃升,隐藏状态方向突变后冻结,撤回早期速度低谷声明。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25459 2026-08-05 cs.CL cs.LG 版本更新 62%

SimulRAG: Simulator-based RAG for Grounding LLMs in Long-form Scientific QA

SimulRAG:基于模拟器的检索增强生成(RAG)框架,用于将大型语言模型(LLMs)落地到长篇科学问答任务中

Haozhou Xu, Dongxia Wu, Matteo Chinazzi, Ruijia Niu, Rose Yu, Yi-An Ma

机构 * University of California San Diego(加州大学圣迭戈分校) Stanford University(斯坦福大学) Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 针对LLMs在长篇科学问答中易幻觉的问题,本文提出SimulRAG框架,引入UE+SBA机制,发布相关基准,实验表明其信息量与事实性较基线分别提升30.4%、16.3%

Comments Haozhou Xu and Dongxia Wu are co-first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03958 2026-08-05 cs.AI 新提交 57%

A game theory for foundation models shows new paths to rational cooperation through similarity inference

基础模型的博弈论:通过相似性推理实现理性合作的新路径

Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出针对基础模型智能体的嵌入贝叶斯智能体理论模型,通过嵌入均衡机制实现相似性推理,破解经典博弈论预测的社会困境中相互背叛问题,达成稳定合作。

Comments 75 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03918 2026-08-05 cs.CV cs.AI 新提交 57%

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

何时与何地查看:用于高效长视频理解的自适应视觉证据调度

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03420 2026-08-05 cs.AI 新提交 57%

Towards Improving Sequential Decision-Making in LLM Agents via Experience Memory

基于经验记忆提升大语言模型智能体的序列决策能力

Jakub Rada, Viliam Lisý

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究针对LLM智能体序列决策性能不足的问题,提出带经验记忆的智能体框架,通过对局后反思与规则提取,在不修改模型权重的情况下提升了井字棋任务的表现。

Comments 8 pages, 6 figures, 14 tables, 5 appendices, accepted at Neuro-Symbolic Intelligence for LLMs and Autonomous Agents workshop at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03413 2026-08-05 cs.AI cs.ET 新提交 57%

Enactive Artificial Intelligence: A Decision-Centric Architecture for Complex Systems

能动人工智能:面向复杂系统的以决策为中心的架构

Zuojun Max Shen, Yuan Qu, Pujun Zhang, Anbang Liu, Yunhao Liang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出能动人工智能框架,通过组织世界、站点世界等四个角色构建以决策为中心的架构,拓展AI前沿,为企业与工业复杂系统的可靠AI部署提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03190 2026-08-05 cs.AI 新提交 57%

TumorBoard: Evidence-Grounded Multi-Agent Decision Support for Longitudinal Neuro-Oncology

TumorBoard:基于证据的多智能体纵向神经肿瘤学决策支持系统

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 TumorBoard是基于证据的多智能体纵向神经肿瘤学决策支持系统,经360例基准测试,其性能优于现有基线,安全管控模块可有效降低有害建议比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02950 2026-08-05 cs.LG cs.ET 新提交 57%

Schedule-Informed Temporal Fusion Forecasting of Hourly Airport Security-Checkpoint Throughput

基于航班时刻的机场安检点每小时吞吐量时间融合预测

Yinxiao Zhang, Sen Wang, Yi Gao

机构 * School of Aviation and Transportation Technology, Purdue University(普渡大学航空与运输技术学院) Department of Geography, The Ohio State University(俄亥俄州立大学地理系) College of Aeronautics and Engineering, Kent State University(肯特州立大学航空与工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本研究开发了将航班时刻表转换为安检负荷信号的框架,结合时间融合Transformer模型,在机场每小时吞吐量预测中优于RNN和LSTM,可支撑安检点人员配置与规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00747 2026-08-05 cs.RO cs.AI cs.CR cs.MA 版本更新 57%

When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems

当提示控制机器人时:多智能体机器人系统中的提示注入攻击

Neha Nagaraja, Amisha Bagari, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(北亚利桑那大学信息学、计算与网络安全学院) Department of Software Science, Tallinn University of Technology(塔林理工大学软件科学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文针对基于LLM的多智能体机器人系统,系统研究了直接和间接提示注入攻击的风险、传播特性及架构对攻击成功率的影响,是该领域的首项系统性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00076 2026-08-05 cs.CV cs.AI 版本更新 57%

Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

哪种模态起决定作用?多模态大语言模型的反事实模态归因

Vahidin Hasic, Chao Wang, Luis C. Garcia-Peraza-Herrera, David Watson, Senka Krivic

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21644 2026-08-05 cs.LG cs.SY eess.SY 版本更新 57%

Toward Goal-Agnostic Joint-Embedding Predictive Control of Partial Differential Equations

迈向偏微分方程的目标无关联合嵌入预测控制

Jonathan Gallagher, Roberto Guglielmi

机构 * University of Waterloo(滑铁卢大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 该研究针对偏微分方程提出目标无关控制框架,基于联合嵌入预测架构,通过离线训练小型二维ViT编码器等,经模型预测路径积分控制器复用。在相关基准测试中,KE探测器规划提升奖励、降低误差,验证了潜在动力学与目标无关及校准可观测量用于状态控制的优势。

Comments Associated code will be open sourced alongside a later, updated submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28114 2026-08-05 cs.AI 版本更新 57%

Language model agents show in-group trust bias invisible to standard behavioural audits

指令调优语言模型代理中类似人类的内群体偏见

Messi H. J. Lee

机构 * Independent Researcher(独立研究者)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 通过多代理模拟,发现指令调优语言模型在群体标签可见时表现出内群体信任偏见、行动同质性和网络同配性,且这种歧视在标准审计中不可见,但会累积为结构性不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01243 2026-08-05 cs.CL 版本更新 57%

Suffix-Constrained Greedy Search Algorithms for Causal Language Models

后缀约束的贪心搜索算法用于因果语言模型

Ayoub Hammal, Pierre Zweigenbaum, Caio Corro

机构 * Université Paris-Saclay, CNRS, LISN(巴黎萨克雷大学、法国国家科学研究中心、LISN) Université de Rennes, INSA Rennes, CNRS, IRISA(雷恩大学、里昂国立应用科学学院、法国国家科学研究中心、IRISA)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出后缀约束贪心搜索算法,用于在因果语言模型中确保最终答案的结构化提取,同时不损害性能甚至提升结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13769 2026-08-05 cs.AI cs.CE cs.NE 版本更新 57%

OR-Agent: Bridging Evolutionary Search and Structured Research for Automated Algorithm Discovery

OR-Agent:连接进化搜索与结构化研究以实现自动化算法发现

Qi Liu, Ruochen Hao, Can Li, Wanjing Ma

机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education(教育部道路与交通工程重点实验室) College of Transportation, Tongji University(同济大学交通运输学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 OR-Agent通过结构化树形工作流和进化-系统化构想机制,实现自动化算法发现的高效探索与科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03648 2026-08-05 cs.MA 新提交 50%

Group Perspective Matters: Regulating Debate Relationships Can Mitigate Blind Conformity in Multi-Agent Debate

群体视角至关重要:调控辩论关系可缓解多智能体辩论中的盲目从众

Hao Wu, Shoucheng Song, Chang Yao, Haoyu Wang, Huaiyu Wan, Youfang Lin, Kai Lv

专题命中 规划推理 :reasoning(abstract)

AI总结 针对多智能体辩论中LLMs易盲目从众的问题,提出DEAR框架,通过动态调控辩论关系缓解该问题,实验显示其性能更优且token消耗显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03631 2026-08-05 cs.CV 新提交 50%

SEER: A Self-Grounded Evidence Interface for Controlled Spatial Relation Classification

SEER:用于受控空间关系分类的自 grounding 证据接口

Feixiang Liu, Likun Wang, Qiang Qiu, Hui Xu, Huawei Shen, Xueqi Cheng

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出针对冻结VLM的无训练推理时证据接口SEER,通过构建查询特定证据缓解空间关系分类错误,在多数据集上取得显著性能提升,证明该干预措施的有效性。

Comments 23 pages total, 2 figures. Code: https://github.com/SouthWinter/SEER

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13981 2026-08-05 cs.CR 版本更新 50%

VirtualCrime: Evaluating the Criminal Potential and Agentic Behaviors of Large Language Models via Sandbox Simulation

VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力

Yilin Tang, Yu Wang, Lanlan Qiu, Wenchang Gao, Yunfei Ma, Baicheng Chen, Tianxing He

专题命中 规划推理 :planning(abstract)

AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 10 篇

2608.03763 2026-08-05 cs.CV 新提交 82%

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03882 2026-08-05 cs.CL cs.AI cs.IR 新提交 81%

MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning

MultiGlobeQA:面向地理空间推理的多语言且全球多样化基准

Martin Böckling, Elizaveta Nosova, Heiko Paulheim, Andreea Iana

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MultiGlobeQA是覆盖201个国家地区的多语言地理空间推理基准,含46060个问答对,实验发现LLMs在网格索引等任务上表现差,计算是瓶颈且低收入地区表现差距大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06415 2026-08-05 cs.RO cs.AI cs.CV 79%

Semantic Enrichment of CAD-Based Industrial Environments via Scene Graphs for Simulation and Reasoning

通过场景图实现基于CAD的工业环境语义增强以用于模拟与推理

Nathan Pascal Walus, Ranulfo Bezerra, Shotaro Kojima, Tsige Tadesse Alemayoh, Satoshi Tadokoro, Kazunori Ohno

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Tough Cyberphysical AI Research Center, Tohoku University(东北大学 Tough 跨物理AI研究中心) RWTH Aachen University(亚琛工业大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出通过场景图增强CAD环境,利用大型视觉-语言模型生成语义信息,以提升工业环境的模拟与推理能力。

Comments Accepted to IEEE SSRR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03187 2026-08-05 cs.NE 新提交 78%

NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏