arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-18 至 2026-05-18 共收录 23 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 23 篇

2605.16205 2026-05-18 cs.AI cs.CL cs.LG cs.MA cs.SY eess.SY 85%

Context, Reasoning, and Hierarchy: A Cost-Performance Study of Compound LLM Agent Design in an Adversarial POMDP

上下文、推理与层次:在对抗性POMDP中的复合LLM代理设计成本-性能研究

Igor Bogdanov, Chung-Horng Lung, Thomas Kunz, Jie Gao, Adrian Taylor, Marzia Zaman

机构 * Carleton University(卡尔顿大学)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了在对抗性部分可观测序贯环境中,复合LLM代理设计的上下文、推理和层次分解对性能与成本的影响,发现程序化状态抽象在成本效率上表现最佳,而分层分解无需推理可获得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15692 2026-05-18 cs.CL cs.LG 81%

TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning

TemplateRL: 结构化模板引导的强化学习用于大语言模型推理

Jinyang Wu, Chonghua Liao, Mingkuan Feng, Shuai Zhang, Zhengqi Wen, Haoran Luo, Ling Yang, Huazhe Xu, Jianhua Tao

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Princeton University(普林斯顿大学) Shanghai AI Lab(上海人工智能实验室) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 TemplateRL通过结构化模板引导强化学习提升大语言模型推理能力,通过MCTS构建问题解决模板库并整合到RL训练中,提高轨迹命中率并减少无效探索,实验显示在AIME和AMC上表现优于GRPO。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21465 2026-05-18 cs.LG 79%

Talking Trees: Reasoning-Assisted Induction of Decision Trees for Tabular Data

谈话树木:基于推理的决策树诱导用于表格数据

George Yakushev, Alina Shutova, Ivan Rubachev, Natalia Bereberdina, Renat Sergazinov, Artem Babenko

机构 * Yandex HSE University(俄罗斯高等经济大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出利用具备推理能力的LLM诱导小规模表格数据的决策树,生成轻量级树结构,优于CART和非贪心树学习器,并在低资源表格问题中与树集成竞争。

Comments Preprint, code at https://github.com/yandex-research/TalkingTrees

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10057 2026-05-18 cs.AI cs.MA 79%

STAR: Failure-Aware Markovian Routing for Multi-Agent Spatiotemporal Reasoning

STAR:面向多智能体时空推理的故障感知马尔可夫路由

Ruiyi Yang, Lihuan Li, Hao Xue, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 STAR通过故障感知路由框架提升多智能体时空推理性能,通过外部化智能体间控制实现状态条件下的转移策略,结合专家指定的常规路由与执行轨迹学习的恢复转换,提升错误状态下的恢复能力。

Comments 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15315 2026-05-18 cs.AI cs.CL 76%

Context Pruning for Coding Agents via Multi-Rubric Latent Reasoning

通过多标准潜在推理进行编码代理的上下文剪枝

Jingjing Wang, Xiwen Chen, Wenhui Zhu, Huayu Li, Zhengxiao He, Feiyang Cai, Ana S. Carreon-Rascon, Xuanzhao Dong, Feng Luo

机构 * Clemson University(克莱姆森大学) Morgan Stanley(摩根大通) Arizona State University(亚利桑那州立大学) University of Arizona(亚利桑那大学)

专题命中 规划推理 :reasoning(title);分类 cs.CL、cs.AI

AI总结 本文提出LaMR框架,通过分解代码相关性为语义证据和依赖支持两个维度,利用多任务CRF模型提升编码代理的上下文剪枝效果,实验表明其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22604 2026-05-18 cs.AI cs.HC cs.RO 74%

Bootstrapping Human-Like Planning via LLMs

通过大语言模型实现人类样式的规划

David Porfirio, Vincent Hsiao, Morgan Fine-Morris, Leslie Smith, Laura M. Hiatt

机构 * Navy Center for Applied Research in AI, US Naval Research Laboratory(美国海军人工智能应用研究中心)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 本文研究如何结合自然语言接口与拖放界面,利用大语言模型生成人类风格的动作序列,并与手工指定的动作序列进行比较。

Comments Accepted by the 2025 34th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14892 2026-05-18 cs.AI 70%

Beyond Individual Intelligence: Surveying Collaboration, Failure Attribution, and Self-Evolution in LLM-based Multi-Agent Systems

超越个体智能:调查基于大语言模型的多智能体系统的协作、故障归因与自我进化

Shihao Qi, Jie Ma, Rui Xing, Wei Guo, Xiao Huang, Zhitao Gao, Jianhao Deng, Jun Liu, Lingling Zhang, Bifan Wei, Boqian Yang, Pinghui Wang, Jianwen Sun, Jing Tao, Yaqiang Wu, Hui Liu, Yu Yao, Tongliang Liu

机构 * MOE KLINNS Lab(MOE KLINNS实验室) School of Computer Science and Technology(计算机科学与技术学院) School of Cyber Science and Engineering(网络安全工程学院) School of Software Engineering(软件工程学院) School of Control Science and Engineering(控制科学与工程学院) Shaanxi Provincial Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Laboratory for AI and New Forms of Education(人工智能与新型教育实验室) Lenovo AI Technology Center, CTOO, Lenovo(联想AI技术中心,联想CTOO) Sydney AI Centre, The University of Sydney(悉尼AI中心,悉尼大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了基于大语言模型的多智能体系统中协作、故障归因与自我进化之间的因果关系,提出LIFE进展模型,系统分类各阶段并揭示其依赖与约束,为自适应多智能体系统提供理论框架和研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11708 2026-05-18 cs.CR cs.LG 70%

Unveiling the Black Box: A Multi-Layer Framework for Explaining Reinforcement Learning-Based Cyber Agents

揭开黑箱:一种多层框架用于解释基于强化学习的网络代理

Diksha Goel, Kristen Moore, Jeff Wang, Minjune Kim, Thanh Thi Nguyen

机构 * Monash University(墨尔本大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出一种多层解释框架,用于解释基于强化学习的攻击代理,揭示策略和战术层面的决策过程,提升网络安全领域的可解释性与防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16054 2026-05-18 cs.LG cs.AI 62%

Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making

Ada-Diffuser: 面向决策制定的潜在意识自适应扩散模型

Fan Feng, Selena Ge, Minghao Fu, Zijian Li, Yujia Zheng, Zeyu Tang, Yingyao Hu, Biwei Huang, Kun Zhang

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Ada-Diffuser,通过显式建模潜在动态过程,提升决策制定的精度与适应性,实验验证其在模拟控制与机器人基准中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09378 2026-05-18 cs.AI cs.LG 62%

Frontier Large Language Models Rival State-of-the-Art Planners

前沿大语言模型与最先进的规划器相媲美

Augusto B. Corrêa, André G. Pereira, Jendrik Seipp

机构 * University of Oxford(牛津大学) Federal University of Rio Grande do Sul(里约格兰德杜斯尔大学) Linköping University(林霍普大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究显示前沿大语言模型在规划任务中超越传统规划器, Gemini 3.1 Pro在标准任务中表现突出,GPT-5表现接近基线,且在符号规划中仍具竞争力,揭示了大语言模型规划能力的提升趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15202 2026-05-18 cs.AI cs.CL cs.IR 62%

DeepSlide: From Artifacts to Presentation Delivery

DeepSlide:从瑕疵到演示交付

Ming Yang, Zhiwei Zhang, Jiahang Li, Haoseng Liu, Yuzheng Cai, Weiguo Zheng

机构 * School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 DeepSlide是一种人机协同的多智能体系统,旨在优化演示全过程,从需求获取到脚本生成,提升演示的动态表现力和叙事流畅性。

Comments 37 pages,10 figures,9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16255 2026-05-18 cs.DC cs.AI 57%

Designing Datacenter Power Delivery Hierarchies for the AI Era

为AI时代设计数据中心电力交付层级

Grant Wilkins, Fiodar Kazhamiaka, Alok Gautam Kumbhare, Chaojie Zhang, Ricardo Bianchini

机构 * Stanford University(斯坦福大学) Microsoft Azure Research(微软Azure研究院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文研究了AI时代数据中心电力交付层级设计的挑战,提出了一种评估框架,结合吞吐量、功率和成本指标,分析多资源短缺对部署容量、资本支出和性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15963 2026-05-18 cs.AI 57%

PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control

PAGER:弥合点精确几何GUI控制中的语义-执行鸿沟

Jingxuan Wei, Xi Bai, Shan Liu, Caijun Jia, Zheng Sun, Xinglong Xu, Siyuan Li, Linzhuang Sun, Bihui Yu, Conghui He, Cheng Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) China University of Petroleum-Beijing(中国石油大学(北京))

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出PAGER,通过依赖结构规划与像素级执行,解决对点精确几何GUI任务的需求,提升任务成功率至62%以上,填补语义-执行鸿沟。

Comments 27 pages, 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15815 2026-05-18 cs.SE cs.CL cs.MA 57%

BootstrapAgent: Distilling Repository Setup into Reusable Agent Knowledge

BootstrapAgent: 将仓库设置提炼为可重用的代理知识

Sihan Fu, Oucheng Liu, Shiyuan Wang, Jin Shi, Chengkun Wei

机构 * Zhejiang University(浙江大学) The Australian National University(澳大利亚国立大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 BootstrapAgent通过提炼仓库初始化过程中的启发式知识,生成可验证的代理合同,提升代码代理在 unfamiliar repositories 的任务成功率和效率。

Comments 19 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10813 2026-05-18 cs.AI 57%

NanoResearch: Co-Evolving Skills, Memory, and Policy for Personalized Research Automation

NanoResearch: 为个性化研究自动化共进化技能、记忆与政策

Jinhang Xu, Qiyuan Zhu, Yujun Wu, Zirui Wang, Dongxu Zhang, Marcia Tian, Yiling Duan, Siyuan Li, Jingxuan Wei, Sirui Han, Yike Guo, Odin Zhang, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Zhejiang University(浙江大学) Xi'an Jiaotong University(西安交通大学) East China University of Science and Technology(东华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出NanoResearch框架,通过三重共进化解决研究自动化中的个性化需求,提升研究效率与用户体验。

Comments 40 pages, 14 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04003 2026-05-18 cs.AI 57%

When AI Persuades: Adversarial Explanation Attacks on Human Trust in AI-Assisted Decision Making

当AI说服人:对抗性解释攻击对人类信任AI辅助决策的影响

Shutong Fan, Lan Zhang, Xiaoyong Yuan

机构 * Clemson University(克莱姆森大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了对抗性解释攻击如何通过操控LLM生成的解释框架,影响人类对AI输出的信任,揭示了认知层的新型安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15625 2026-05-18 cs.AI cond-mat.soft 57%

ColPackAgent: Agent-Skill-Guided Hard-Particle Monte Carlo Workflows for Colloidal Packing

ColPackAgent:基于代理技能的硬粒子蒙特卡罗工作流程用于胶体堆积

Lijie Ding, Changwoo Do

机构 * Neutron Scattering Division, Oak Ridge National Laboratory, Oak Ridge, TN 37831, USA(奥克勒德国家实验室中子散射部)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 ColPackAgent通过MCP工具服务器和代理技能实现胶体堆积模拟的自主工作流程,展示了如何利用LLM代理执行模拟任务并评估不同模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15585 2026-05-18 cs.AI cs.CV 57%

See Before You Code: Learning Visual Priors for Spatially Aware Educational Animation Generation

在编码前看到:学习视觉先验以生成空间感知的教育动画

Yuejia Li, Ke He, Junheng Li, Shutong Chen, Jingkang Xia, Zhiyue Su, Junchi Zhang, Mang Ye

机构 * Wuhan University(武汉大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出OmniManim框架,通过视觉规划和反馈机制提升教育动画生成质量,改进渲染效果和教学效果。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15465 2026-05-18 cs.LG eess.SP 57%

Toward World Modeling of Physiological Signals with Chaos-Theoretic Balancing and Latent Dynamics

向生理信号的世界建模迈进:基于混沌理论的平衡与潜在动态

Yunfei Luo, Xi Chen, Yuliang Chen, Lanshuang Zhang, Md Mofijul Islam, Siwei Zhao, Peter Kotanko, Subhasis Dasgupta, Andrew Campbell, Rakesh Malhotra, Tauhidur Rahman

机构 * University of California San Diego(加州大学圣地亚哥分校) Dartmouth College(达特茅斯学院) Amazon Web Services(亚马逊网络服务) Sanderling Renal Services(Sanderling 肾脏服务) Renal Research Institute(肾脏研究研究所) Icahn School of Medicine at Mount Sinai(辛克尔医学院(Mount Sinai))

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出NormWear-2模型,通过将多变量生理信号与临床干预变量编码到共享潜在空间,结合先验知识推理与非参数潜在状态转移适应,实现多时间尺度的预测。混沌理论平衡动态制度多样性提升了表示鲁棒性,且在不同临床场景下表现优异。

Comments NormWear Collection: https://huggingface.co/collections/mosaic-laboratory/normwear

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26139 2026-05-18 cs.CL 57%

HIVE: Hidden-Evidence Verification for Hallucination Detection in Diffusion Large Language Models

HIVE:用于扩散大语言模型中幻觉检测的隐藏证据验证

Guoshenghui Zhao, Tan Yu, Weijie Zhao

机构 * Rochester Institute of Technology(罗切斯特理工学院) NVIDIA Corporation(英伟达公司)

专题命中 规划推理 :verifier(abstract);分类 cs.CL

AI总结 HIVE通过提取去噪轨迹中的压缩隐藏证据,结合语言模型前缀嵌入进行验证,提升幻觉检测性能,优于多个基线模型。

Comments 5 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09884 2026-05-18 cs.AI 57%

Quantum Artificial Intelligence for Mission-Critical Systems: Foundations, Architectural Elements, and Future Directions

量子人工智能用于关键任务系统:基础、架构要素与未来方向

Siva Sai, Rajkumar Buyya

机构 * Quantum Cloud Computing and Distributed Systems (qCLOUDS) Laboratory, School of Computing and Information Systems, The University of Melbourne(量子云计算与分布式系统实验室,计算与信息系统学院,墨尔本大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨量子人工智能在关键任务系统中的应用,分析其在可靠性、确定性和低延迟决策中的挑战,并提出量子资源管理框架及未来研究方向。

Comments 15 pages, 5 figures, revised and accepted version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15799 2026-05-18 cs.MA cs.RO 50%

From Gridworlds to Warehouses: Adapting Lightweight One-shot Multi-Agent Pathfinding for AGVs

从网格世界到仓库:为AGVs适应轻量级一次性多智能体路径规划

Hiroki Nagai, Keisuke Okumura

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(日本国家先进工业科学与技术研究院) Keio University(庆应大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出多智能体仓库路径规划(MAWPF),针对差分驱动AGVs的运动特性,引入四条约束条件,改进传统MAPF算法,通过实验验证PP和LNS2在多智能体场景下的不足,PIBT类方法在可扩展性上表现更优。

Comments To be presented at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19732 2026-05-18 cs.MA 50%

Helix: A Dual-Helix Co-Evolutionary Multi-Agent System for Prompt Optimization and Question Reformulation

Helix:一种双螺旋协同进化多智能体系统用于提示优化和问题重述

Kewen Zhu, Liping Yi, Zhiming Zhao, Xiang Li, Qinghua Hu

专题命中 规划推理 :reasoning(abstract)

AI总结 Helix通过三阶段协同进化框架联合优化问题重述与提示指令,解决现有方法在提示模板固定、搜索空间有限及单向优化上的不足,实验表明其在12个基准上提升了3.95%的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏