arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-15 至 2026-05-15 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 26 篇

2605.14465 2026-05-15 cs.AI 85%

From Table to Cell: Attention for Better Reasoning with TABALIGN

从表格到单元格:用于基于TABALIGN的更好推理的注意力

Tung Sum Thomas Kwok, Zeyong Zhang, Xinyu Wang, Chunhe Wang, Xiaofeng Lin, Hanwei Wu, Lei Ding, Guang Cheng, Zhijiang Guo

机构 * University of California, Los Angeles(加州大学洛杉矶分校) New Jersey Institute of Technology(新泽西理工学院) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) University of Manitoba(曼尼托巴大学) SimpleWay The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出TABALIGN框架,通过引入DLM Planner和TABATTN验证器,提升表格推理的准确性和效率,实验显示在多个基准测试中准确率提升15.76个百分点,推理速度加快44.64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14857 2026-05-15 cs.AI cs.IR 83%

A Deterministic Agentic Workflow for HS Tariff Classification: Multi-Dimensional Rule Reasoning with Interpretable Decisions

一种确定性代理工作流用于HS税则分类:多维规则推理与可解释决策

Yu Zhang, Dongjiang Zhuang, Qu Zhou, Zheng Huang, Junhe Wu, Jing Cao, Kai Chen

机构 * School of Information and Electronic Engineering, Shanghai Jiao Tong University, Shanghai, China(信息与电子工程学院,上海交通大学,上海,中国) Nanjing Jiyun Information Technology Co., Ltd., Nanjing, China(南京吉云信息技术有限公司,南京,中国) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(计算机科学学院,上海交通大学,上海,中国)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出确定性代理工作流,通过多维规则推理实现HS税则分类,通过结构化输出和引用注释提升可解释性,实验显示在六位和四位税则层面均取得较高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14403 2026-05-15 cs.CV 82%

DermAgent: A Self-Reflective Agentic System for Dermatological Image Analysis with Multi-Tool Reasoning and Traceable Decision-Making

DermAgent: 一种用于皮肤病图像分析的自反思代理系统,具备多工具推理和可追溯决策制定

Yize Liu, Siyuan Yan, Ming Hu, Lie Ju, Xieji Li, Feilong Tang, Wei Feng, Zongyuan Ge

机构 * AIM for Health Lab, Faculty of Information Technology, Monash University, Melbourne, Australia(健康人工智能实验室,信息科技学院,墨尔本大学,澳大利亚) Faculty of Information Technology, Monash University, Melbourne, Australia(信息科技学院,墨尔本大学,澳大利亚) University College London, Institute of Ophthalmology, London, United Kingdom(伦敦大学学院,眼科研究所,英国)

专题命中 规划推理 :reasoning(title,abstract);self-correction(abstract)

AI总结 DermAgent通过多工具协作和反思框架,在皮肤病图像分析中实现可追溯的诊断推理,优于现有模型。

Comments MICCAI2026 early acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15044 2026-05-15 cs.SD cs.AI cs.LG cs.MM eess.AS 81%

SpeakerLLM: A Speaker-Specialized Audio-LLM for Speaker Understanding and Verification Reasoning

SpeakerLLM:一种面向说话人理解与验证推理的说话人专用音频大语言模型

KiHyun Nam, Jungwoo Heo, Siu Bae, Ha-Jin Yu, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) University of Seoul(首尔大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 SpeakerLLM通过统一说话人特征建模、录音条件理解及验证推理,提升音频大语言模型在说话人识别与验证中的性能与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14851 2026-05-15 cs.MA cs.AI 79%

IFPV: An Integrated Multi-Agent Framework for Generative Operational Planning and High-Fidelity Plan Verification

IFPV:一种用于生成性操作规划和高保真计划验证的集成多智能体框架

Zhigao Huang, Zhengqing Hu, Dong Chen, Shaohan Zhang, Zhao Jin, Bo Zhang, Han Wu, Mingliang Xu

机构 * School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Engineering Research Center of Intelligent Swarm Systems, Ministry of Education(教育部智能群体系统工程研究中心) National Supercomputing Center in Zhengzhou(郑州国家超算中心) Henan Research Center for Large Model Technology(河南省大模型技术与新质软件工程研究中心)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 IFPV通过多视角分层智能体和对抗认知仿真引擎,提升复杂战场环境下的规划准确性和验证严格性,实验显示其在任务成功率和运营成本上有显著提升。

Comments Submitted to Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14386 2026-05-15 cs.NE cs.AI 79%

Darwin Family: MRI-Trust-Weighted Evolutionary Merging for Training-Free Scaling of Language-Model Reasoning

达尔文家族:基于MRI-信任权重的进化合并框架,用于无训练扩展语言模型推理

Taebong Kim, Youngsik Hong, Minsik Kim, Sunyoung Choi, Jaewon Jang, Junghoon Shin, Minseo Kim

机构 * VIDRAFT Inc.(VIDRAFT公司)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 达尔文家族通过无梯度权重空间重组实现大语言模型的无训练进化合并,展示出在推理任务中无需额外训练即可提升性能的可行性。

Comments NeurIPS 2026 submission. 18 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21174 2026-05-15 cs.LG 79%

Breaking the Reasoning Horizon in Entity Alignment Foundation Models

突破实体对齐基础模型中的推理地平线

Yuanning Cui, Zequn Sun, Wei Hu, Kexuan Xin, Zhangjie Fu

机构 * Nanjing University of Information Science and Technology(南京信息工程大学) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University(南京大学健康数据科学国家研究院) University of Queensland(昆士兰大学) Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学数字取证工程研究中心)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出基于并行编码策略的实体对齐基础模型,通过局部锚点引导信息流和合并关系图,有效解决实体对齐中长距离依赖捕捉问题,验证了模型在未见过的知识图谱上的强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14051 2026-05-15 cs.AI 79%

SPIN: Structural LLM Planning via Iterative Navigation for Industrial Tasks

SPIN:通过迭代导航进行工业任务的结构LLM规划

Yusuke Ozaki, Dhaval Patel

机构 * University at Albany(阿尔巴马大学) IBM(国际商业机器公司) Kwansei Gakuin University(关西大学)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 SPIN通过结合验证的有向无环图规划与前缀执行控制,减少任务执行次数并提高完成率,适用于工业任务规划。

Comments 31 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12501 2026-05-15 cs.IT math.IT 78%

A Heterogeneous Dual-Network Framework for Emergency Delivery UAVs: Communication Assurance and Path Planning Coordination

一种异构双网络框架用于应急配送无人机:通信保障与路径规划协调

Ping Huang, Bin Duo, Ziedor Godfred, Liuwei Huo, Jin Ning, Xiaojun Yuan, Jun Li

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出异构双网络框架HDNF,通过结合应急通信支持网络和配送路径网络,提升无人机在灾害环境中的通信可靠性与路径规划效率,优化任务分配和能源消耗。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14126 2026-05-15 cs.LG cs.AI 73%

Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)

用于快速医疗互操作资源(FHIR)的强化学习工具调用代理

Marius S. Knorr, Robert Müller, Jan P. Bremer, Nils Schweingruber

机构 * IDM gGmbH, University Medical Center Hamburg-Eppendorf, Hamburg, Germany(IDM公司,汉堡埃彭多夫大学医疗中心,德国汉堡)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在FHIR中通过强化学习提升多轮推理性能,采用自定义环境和工具训练模型,提升回答准确性至77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14266 2026-05-15 cs.AI cs.CY 70%

Agentic AI Ecosystems in Higher Education: A Perspective on AI Agents to Emerging Inclusive, Agentic Multi-Agent AI Framework for Learning, Teaching and Institutional Intelligence

高等教育中的代理AI生态系统:对AI代理在新兴包容性、代理多代理AI框架中学习、教学和机构智能的视角

Vidya K Sudarshan, Anushka Sisodia, Reshma A Ramachandra, Sia Batra, Josephine Chong Leng Leng

机构 * College of Computing and Data Science, Nanyang Technological University, NTU, Singapore(南洋理工大学计算机与数据科学学院) DeepMed Ptd Ltd, India(印度DeepMed公司)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨高等教育中代理多代理AI平台的整合,旨在解决教育机构复杂性中的碎片化问题,强调包容性和适应性决策的重要性。

Comments 50 pages, 14 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15188 2026-05-15 cs.LG cs.AI cs.CL 67%

FutureSim: Replaying World Events to Evaluate Adaptive Agents

FutureSim:通过重放世界事件来评估适应性智能体

Shashwat Goel, Nikhil Chandak, Arvindh Arun, Ameya Prabhu, Steffen Staab, Moritz Hardt, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) Tübingen AI Center(图宾根人工智能中心) University of Tübingen(图宾根大学) University of Southampton(南安普顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FutureSim,通过重放真实世界事件顺序来评估智能体适应能力,测试了不同智能体在2026年1月至3月期间预测世界事件的准确性,发现最佳智能体的准确率为25%。

Comments 31 pages, 10 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12624 2026-05-15 cs.RO cs.CV 67%

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1:统一流架构使VLA超越VA用于自动驾驶

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Li Auto Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 MindVLA-U1通过统一流架构实现自动驾驶中VLA超越VA,采用统一视觉语言模型骨干和流匹配连续动作轨迹,在保持各模态自然输出形式的同时,实现高效规划和低延迟。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14851 2026-05-15 cs.CV cs.RO 67%

AutoMoT: A Unified Vision-Language-Action Model with Asynchronous Mixture-of-Transformers for End-to-End Autonomous Driving

AutoMoT:一种基于异步混合变换器的统一视觉-语言-动作模型用于端到端自动驾驶

Wenhui Huang, Songyan Zhang, Qihang Huang, Zhidong Wang, Zhiqi Mao, Collister Chua, Zhan Chen, Long Chen, Chen Lv

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Harvard University, US(哈佛大学,美国)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出AutoMoT,一种统一视觉-语言-动作模型,通过异步混合变换器架构解决自动驾驶中推理与动作空间分布不一致、推理效率低等问题,实验证明其在多基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14290 2026-05-15 cs.CR cs.AI cs.CL cs.SE 62%

Web Agents Should Adopt the Plan-Then-Execute Paradigm

网络代理应采用计划-然后执行范式

Julien Piet, Annabella Chow, Yiwei Hou, Muxi Lyu, Sylvie Venuto, Jinhao Zhu, Raluca Ada Popa, David Wagner

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出网络代理应默认采用计划-然后执行范式,而非ReAct架构。该范式通过预先制定任务特定程序,避免运行时网页内容的干扰,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13050 2026-05-15 cs.CL cs.AI 62%

Context Training with Active Information Seeking

基于主动信息获取的上下文训练

Zeyu Huang, Adhiguna Kuncoro, Qixuan Feng, Jiajun Shen, Lucio Dery, Arthur Szlam, Marc'Aurelio Ranzato

机构 * The University of Edinburgh(爱丁堡大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过引入维基百科搜索和浏览器工具改进上下文优化,通过搜索驱动训练流程提升模型性能,适用于低资源翻译、医疗场景和推理任务,证明方法高效且鲁棒。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15085 2026-05-15 stat.ML cs.LG stat.AP stat.ME 57%

From Data to Action: Accelerating Refinery Optimization with AI

从数据到行动:利用AI加速炼油优化

Dániel Pfeifer, Ábrahám Papp, Tibor Bernáth, Tamás Zoltán Varga, Márk Czifra, Botond Szilágyi, Edith Alice Kovács

机构 * Budapest University of Technology and Economics(布达佩斯技术与经济大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出利用AI方法提升炼油优化的可信度,通过分析历史数据与当前计划对比,结合异常检测工具和改进的ECOD方法,发现炼油调度中的商业机会和数据错误。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14396 2026-05-15 cs.CV cs.CR cs.LG cs.RO 57%

Systematic Discovery of Semantic Attacks in Online Map Construction through Conditional Diffusion

通过条件扩散系统发现在线地图构建中的语义攻击

Chenyi Wang, Ruoyu Song, Raymond Muller, Jean-Philippe Monteuuis, Jonathan Petit, Z. Berkay Celik, Ryan Gerdes, Ming F. Li

机构 * University of Arizona(亚利桑那大学) Purdue University(普渡大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出MIRAGE框架,系统发现能绕过对抗防御的语义攻击,通过寻找环境变化(如阴影、湿路)来降低地图预测准确性,实验显示两种攻击在多种防御下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20984 2026-05-15 cs.CR cs.LG 57%

ACE: A Security Architecture for LLM-Integrated App Systems

ACE:用于集成大语言模型的应用系统的安全架构

Evan Li, Tushin Mallick, Evan Rose, William Robertson, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出ACE架构,通过分离规划阶段提升LLM集成应用系统的安全性和可用性,验证其在对抗性攻击中的有效性。

Comments 25 pages, 13 figures, 8 tables; accepted by Network and Distributed System Security Symposium (NDSS) 2026

Journal ref Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15181 2026-05-15 cs.CV 50%

From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing

从计划到像素:学习计划与协调以实现开放性图像编辑

Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种长期视图图像编辑框架,通过规划器生成结构化原子分解和协调器选择工具和区域执行每一步,结合视觉语言判断者提供基于结果的奖励,提升编辑的连贯性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14849 2026-05-15 cs.HC 50%

Beliefs and Misconceptions around Integrated Conversational AI

集成对话式AI中的信念与误解

William Seymour, Adam Jenkins, Mark Cote, Jose Such

专题命中 规划推理 :planning(abstract)

AI总结 研究探讨用户在使用内置对话式AI的浏览器时如何建立信任并判断输出可靠性,通过20名参与者使用微软Edge Copilot AI进行信息检索,发现引用增强了信任感,用户倾向于依赖相同信息源进行事实核查。

Comments Accepted to ACM CUI '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14312 2026-05-15 cs.SE 50%

Making OpenAPI Documentation Agent-Ready: Detecting Documentation and REST Smells with a Multi-Agent LLM System

使OpenAPI文档具备代理准备性:利用多代理LLM系统检测文档和REST气味

Rayfran Rocha Lima, Davi G. Assunção Pinheiro, Thiago Medeiros de Menezes

专题命中 规划推理 :planning(abstract)

AI总结 研究通过多代理LLM系统检测OpenAPI文档和REST相关问题,发现2450个气味,揭示微服务环境中结构有效性不保证语义准备性,推动API治理流程改进。

Comments 10 pages. Accepted in EASE 2026, 9-12 June 2026, Glasgow, Scotland, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11809 2026-05-15 cs.CV 50%

From Street View to Visual Network: Mapping the Visibility of Urban Landmarks with Vision-Language Models

从街景到视觉网络:利用视觉语言模型映射城市地标可见性

Zicheng Fan, Kunihiko Fujiwara, Pengyuan Liu, Fan Zhang, Filip Biljecki

机构 * organization= Department of Architecture, National University of Singapore , country= Singapore organization= Research \& Development Institute, Takenaka Corporation , country= Japan organization= Urban Analytics Subject Group, Urban Studies \& Social Policy Division, University of Glasgow , country= United Kingdom organization= Institute of Remote Sensing GIS, Peking University , country= China organization= Department of Real Estate, National University of Singapore , country= Singapore

专题命中 规划推理 :planning(abstract)

AI总结 本文提出利用视觉语言模型将地标可见性分析转化为图像空间中的视觉搜索问题,通过街景图像实现高效可见性评估,构建异构可见性图以表示地标、街景位置及城市空间之间的视觉连接,实验表明方法在数据受限情况下具有较高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14119 2026-05-15 cs.MA 50%

Privacy Preserving Multi Agent Path Finding

隐私保护的多智能体路径寻找

Rotem Lev Lehman, Roni Stern, Guy Shani

专题命中 规划推理 :planning(abstract)

AI总结 本文提出两种隐私保护机制,通过添加虚拟智能体和后处理技术,在多智能体路径寻找中实现规划和执行层面的隐私保护,实验表明后处理技术有效降低路径成本。

Comments 16 pages, 5 figures, to be published in AAMAS 2026 as an extended abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14109 2026-05-15 eess.SY cs.SY 50%

Grid Integration of Gigawatt-Scale AI Data Centers under Connect-and-Manage

在连接与管理下的千兆瓦级人工智能数据中心电网集成

Xin Lu, Qianwen Xu

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种分层架构,通过学习规划层生成电力请求,TSO通过稳健接受机制评估请求,并通过单步执行优化器在实现的电力预算下保持可行性,减少弃风弃光比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14085 2026-05-15 eess.SY cs.SY 50%

Receding Horizon Multi-Agent Deceptive Path Planner

滚动时域多智能体欺骗路径规划

Xubin Fang, Brian M. Sadler, Rick S. Blum

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于玻尔兹曼分布的多智能体欺骗路径规划框架,通过短时域轨迹计算实现动态欺骗与约束适应,支持在线调整以应对环境变化。

详情

展开后加载摘要…

URL PDF HTML 收藏