arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 854 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 854 篇

2607.23678 2026-07-28 cs.AI 新提交 70%

Focus Is All You Need: Adaptive Goal-aware Attention Orchestration for Multi-Agent Graph Systems

你所需要的只是专注:多智能体图系统的自适应目标感知注意力编排

Mingzhou Fan, Siyuan Xu, Mingxuan Yuan

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究多智能体图系统中注意力分配问题,提出自适应目标感知注意力编排框架AGAO,结合目标、拓扑、资源感知注意力,将静态图转变为自适应系统,经实验验证其能提高任务有效性并减少计算等消耗,确立注意力工程方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23045 2026-07-28 cs.AI cs.RO 新提交 70%

Stress-testing large language model agents in a robotic chemistry laboratory

在机器人化学实验室中对大型语言模型智能体进行压力测试

Lulu Guo, Yingkai Sun, Xiaobo Li, Luyao Ge, Ziming Wang, Haitao Zheng, Jingyu Li, Huijuan Zhang, Bingxu Chen, Daobin Liu, Yuebo Liu, Jie Li, Xiaohui Li, Linjiang Chen, Yi Luo, Jun Jiang

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究以机器人化学实验室为测试平台,使科学智能可衡量,通过4608次试验发现工作流程执行率低、长期规划有挑战,反馈促使局部调整,提供了部署评估及改进诊断框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22954 2026-07-28 cs.CL stat.AP 新提交 70%

Toward Automated Detection of Documentation Inconsistencies in Electronic Health Records

迈向电子健康记录中文档不一致性的自动检测

Jian Lu, Panyu Chen, Miriam Treggiari, Robert Blessing, Danyang Zhuo, Chunhua Weng, William W. Stead, Anru R. Zhang

机构 * Duke University(杜克大学) Columbia University Medical Center(哥伦比亚大学医学中心) Vanderbilt University Medical Center(范德堡大学医学中心)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究旨在检测电子健康记录中文档不一致性,采用两阶段LLM管道对3000份出院小结进行分析,发现多种类型不一致及反复出现的失败模式,建立了方法基础和概念框架以指导后续大规模分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17560 2026-07-21 cs.AI 新提交 70%

Reinforcement Learning: From Algorithms To Foundation Models

强化学习:从算法到基础模型

Zihan Ding

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文从游戏算法和基础模型时代的RL两个视角展开研究,前者聚焦多智能体RL中相关概念的相互作用,后者利用生成和基础模型丰富序列决策,开发多种模型并进行相关研究,呈现RL在复杂序列域的统一视图,突出其连接多方面的作用。

Comments Princeton University PhD Thesis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17437 2026-07-21 cs.AI 新提交 70%

Empirical Grounding Improves the Realism of LLM Agents Simulating Human Behavior During Disruptions

经验基础提升了在干扰期间模拟人类行为的大语言模型智能体的现实性

Chen Xia, Zexi Kuang, Yuqing Hu

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究探讨经验基础对提升LLM智能体模拟人类行为现实性的作用,开发基于经验的框架,将多项调查数据嵌入其中,通过实验验证该框架能显著提升模拟效果,使LLM智能体成为更具统计可信度的人口行为模拟器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16066 2026-07-20 cs.NI cs.AI 新提交 70%

LLM-Powered Agentic AI for 5G/6G Networks: A Tutorial and Survey on Architectures, Protocols, and Standardization

用于5G/6G网络的基于大语言模型的智能体人工智能:架构、协议和标准化教程与综述

Mazene Ameur, Abdelkader Mekrache, Bouziane Brik, Adlen Ksentini

机构 * EURECOM University of Sharjah(谢贾学院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究5G/6G网络中基于大语言模型的智能体人工智能,通过分为两部分的教程与综述,形式化5G和6G相关平面,涵盖智能体系统基础,映射其能力到控制面等,识别自主电信面临的开放挑战。

Comments 35 pages, 4 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15280 2026-07-20 cs.AI 新提交 70%

GraphDx: A Cost-Aware Knowledge-Enhanced Multi-Agent Framework for Sequential Diagnosis

GraphDx:一种用于顺序诊断的成本感知知识增强多智能体框架

Shaoting Tan, Ning Liu, Yuntao Du, Shuyue Wei, Wu Shuai, Qian Li, Yanyu Xu, Wei Zhang, Lizhen Cui, Haitao Yuan

机构 * Shandong University(山东大学) Nankai University(南开大学) East China Normal University(华东师范大学) National Technological University(国立科技大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对顺序诊断中平衡诊断准确性与资源成本的问题,提出GraphDx框架。该框架通过构建特殊知识图谱及引入协作智能体实现创新,实验表明其能显著提高诊断成功率并降低测试成本,为自动临床诊断提供有效方案。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 21721-21736, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14642 2026-07-17 cs.AI cs.SE 新提交 70%

MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

MCPEvol-Bench:跨MCP服务器动态演化对大语言模型智能体性能进行基准测试

Huanxi Liu, Kun Hu, Jiaqi Liao, Qiang Wang, Pengfei Qian, YuanZhao Zhai, Dawei Feng, Bo Ding, Huaimin Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) State Key Laboratory of Complex & Critical Software Environment(复杂关键软件环境国家重点实验室) National Key Laboratory of Parallel and Distributed Computing(并行与分布式计算国家重点实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对MCP服务器工具接口和功能持续演化致评估有缺陷的问题,引入MCPEvol-Bench基准测试,提出11种变异算子模拟工具演化,对12个先进大语言模型测试,发现前沿模型也难适应,凸显大语言模型驱动工作流程脆弱性,确立评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13560 2026-07-16 q-bio.NC cs.AI 新提交 70%

Grounded world models in biological organisms and future embodied AI

生物有机体和未来具身人工智能中的基础世界模型

Giovanni Pezzulo, Davide Nuzzi, Marco D'Alessandro, Riccardo Proietti, Roberto Bottini, Paul Cisek

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究探讨生物有机体中基础世界模型,通过五个神经回路例子揭示当前具身人工智能缺失的特征,如内在动力学作用等,还讨论了生物系统原则对未来具身人工智能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09195 2026-07-13 cs.AI cond-mat.mtrl-sci 新提交 70%

Toward Auditable AI Scientists: A Hypothesis Evolution Protocol for LLM Agents

迈向可审计的人工智能科学家:大语言模型智能体的假设演化协议

Izumi Takahara, Teruyasu Mizoguchi

机构 * Institute of Industrial Science, The University of Tokyo(东京大学产业科学研究所)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究旨在让大语言模型智能体在科学发现中发挥核心作用。提出假设演化协议(HEP),使假设生成等操作可审计。在材料科学任务中,该协议能让智能体运行关键循环,跨问题概括并随模型能力提升更充分利用协议,迈向可审计的人工智能科学家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08403 2026-07-10 cs.AI 新提交 70%

Game Theory Driven Multi-Agent Framework Mitigates Language Model Hallucination

博弈论驱动的多智能体框架减轻语言模型幻觉

Runzhe Liu, Biquan Bie, Zihao Wang, Yuchao Ma, Yexin Liu, Xinghai Li, Harry Yang, Wenbo Yang, Jinzhe Cao, Shengyang Tao

机构 * Dalian University of Technology(大连理工大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对轻量级大语言模型在科学领域应用受限问题,提出基于博弈论的G-Frame多智能体框架,经结构化推理合成语料库训练出OmniChem模型,性能与GPT 4o mini相当且幻觉大幅减少,为科学领域知识发现提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05438 2026-07-08 cs.IR cs.AI 新提交 70%

Modality Relevance is not Modality Utility: Post-hoc Selective Modality Escalation for Cost-Aware Multimodal RAG

模态相关性并非模态效用:用于成本感知多模态RAG的事后选择性模态升级

Xue Li, Yiming Gai

机构 * Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)

专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 研究多模态检索增强生成中模态选择决策点问题,提出事后选择性模态升级方法,先低成本从文本和表格回答,再按需支付VLM证据费用,校准路由器决定是否升级,在MultiModalQA上减少视觉调用并缩小与神谕升级率差距,扩展了路由信号层次结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05174 2026-07-07 cs.AI 新提交 70%

AgentGym2: Benchmarking Large Language Model Agents in De-Idealized Real-World Environments

AgentGym2:在去理想化真实世界环境中评测大语言模型智能体

Zhiheng Xi, Dingwen Yang, Jiaqi Liu, Jixuan Huang, Honglin Guo, Baodai Huang, Tinggang Chen, Qi Zhang, Zhonghang Lu, Chenyu Liu, Jiajun Sun, Jiazheng Zhang, Dingwei Zhu, Xin Guo, Junzhe Wang, Zhihao Zhang, Yuming Yang, Junjie Ye, Minghe Gao, Dongrui Liu, Jiaming Ji, Guohao Li, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghaijiaotong University(上海交通大学) Peking University(北京大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对现有LLM智能体基准过于理想化的问题,提出去理想化评测框架AgentGym2,可全面测查智能体实操能力,实验显示当前SOTA模型仍存在明显性能缺口。

Comments Accepted as a main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04718 2026-07-07 cs.AI 新提交 70%

FORGE: Research-Trajectory Hijacking Attacks on Deep Research Agents

FORGE:对深度研究智能体的研究轨迹劫持攻击

Yue Pan, Ziheng Zhang, Junxiang Lei, Changhao Jia, Qingyi Si, Hongcheng Guo

机构 * Fudan University(复旦大学) Huazhong University of Science and Technology(华中科技大学) Explore Academy, JD(京东探索研究院)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对深度研究智能体,利用其工作流程中的规划层中毒面,提出FORGE两级攻击劫持子任务规划,还引入PRISM指标和Root Query Anchoring防御,展示攻击效果及防御作用。

Comments 20 pages,8 figures,Code available at https://github.com/yvepan/FORGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04219 2026-07-07 cs.AI cs.MA cs.NI 新提交 70%

Agentic IoT: Architectures, Applications, and Challenges Toward the Internet of Agents

智能物联网:面向智能体互联网的架构、应用及挑战

Rümeysa Hilal Sevinç, Bahaeddin Türkoğlu, İbrahim Kök

机构 * Department of Artificial Intelligence and Data Engineering, Ankara University(人工智能与数据工程系,安卡拉大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 探讨智能物联网,它将自主智能体能力与网络物理系统整合,旨在从以数据为中心的物联网转变为分布式认知智能体生态系统,文中进行了定位、综述、架构框架介绍等

Comments 14 pages, 2 figures, Author's preprint version. The manuscript may be revised based on peer-review feedback and publication requirements

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03449 2026-07-07 cs.RO cs.AI 新提交 70%

HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control

HiMe:用于长距离视觉-语言-动作控制的分层具身记忆

Li Ji, Siyin Wang, Pengfang Qian, Xiaopeng Yu, Yihai Tian, Zhaoye Fei, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对视觉-语言-动作模型处理非马尔可夫任务的不足,提出HiMe分层具身记忆框架,解耦智能为高频执行器等,引入动态知识系统,平衡实时执行与思考规划冲突,提升长距离任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13148 2026-07-02 cs.AI 新提交 70%

TerraBench: Can Agents Reason Over Heterogeneous Earth-System Data?

TerraBench: 智能体能否对异构地球系统数据进行推理?

Dat Tien Nguyen, Thao Nguyen, Fadillah Adamsyah Maani, Huy M. Le, Muhammad Umer Sheikh, Numan Saeed, Muhammad Haris Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出TerraBench基准,基于TerraAgent框架,通过结合大语言模型规划与科学工具,实现跨网格数据、卫星图像、地理空间和模拟器的交互式推理,包含403个任务和24,500个执行步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30658 2026-07-01 cs.CY cs.AI 新提交 70%

Agentic AI Enhances Physician Trust in Clinical Decision Making

智能体AI增强医生在临床决策中的信任

Zhiling Yan, Zhe Fang, David J King, Ann Pongsakul, Eashan Adhikarla, Hui Ren, Sunyang Fu, Quanzheng Li, Lifang He, Xiang Li, Hongfang Liu, Yonghui Wu, Lichao Sun

机构 * Department of Computer Science and Engineering, Lehigh University(里海大学计算机科学与工程系) Department of Epidemiology, Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院流行病学系) Department of Medicine, Division of Cardiology, University of Florida(佛罗里达大学医学院心脏病学系) McGovern Medical School, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦戈文医学院) Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院放射学系) McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦克威廉姆斯生物医学信息学院) Department of Health Outcomes & Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学医学院健康结果与生物医学信息学系)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究通过医生评估多模态临床病例,发现智能体AI相比非智能体基线显著提升医生的认知和行为信任,尤其在治疗规划任务中,但存在对错误输出的过度依赖。

Comments Accepted by AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26874 2026-06-26 cs.AI 新提交 70%

TAVR-VLM: Risk-Conditioned Causal Grounding for Hallucination-Resistant Report Generation

TAVR-VLM:面向抗幻觉报告生成的风险条件因果基础

Zhixiang Lu, Xiwei Liu, Sifan Song, Changkai Ji, Anh Nguyen, Jionglong Su, Imran Razzak, Jinfeng Wang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Shanghai Jiao Tong University(上海交通大学) University of Liverpool(利物浦大学) Kunming University of Science and Technology(昆明理工大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出TAVR-VLM框架,通过风险条件因果注意力(R-CGA)建立“风险→区域→词”的结构化基础路径,在TAVR规划中减少诊断幻觉,实现新最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26298 2026-06-26 cs.AI cs.CR 新提交 70%

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

治理行动,而非智能体:机构证明作为自主AI系统的治理模型

Jakob Salfeld-Nebgen

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对自主AI系统可能执行不可逆高风险行动的问题,提出一种基于机构证明的计算治理模型,将执行权限与规划推理分离,通过独立权威源证明前提条件,并采用防篡改日志记录决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24470 2026-06-24 cs.AI 新提交 70%

The Latent Bridge: A Continuous Slow-Fast Channel for Real-Time Game Agents

潜在桥:用于实时游戏智能体的连续慢-快通道

Bojie Li, Noah Shi

机构 * Pine AI University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对实时游戏智能体,提出一种可学习的连续潜在桥(Latent Bridge),将慢速推理VLM的残差投影到快速反应VLM的输入嵌入空间,在7个Atari游戏和驾驶域中匹配或超越文本桥,且增益高度可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23595 2026-06-23 cs.AI 新提交 70%

SPIRAL: Learning to Search and Aggregate

SPIRAL: 学习搜索与聚合

Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。

Comments Ongoing Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22909 2026-06-23 cs.DB cs.AI cs.IR 新提交 70%

Graph-Enhanced Large Language Models for Spatial Search

用于空间搜索的图增强大型语言模型

Nicole R. Schneider, Kent O'Sullivan, Hanan Samet

机构 * University of Maryland(马里兰大学) University of Sydney(悉尼大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对大语言模型空间推理能力不足的问题,提出图增强方法,将空间数据以图形式存储并与检索增强生成结合,提升复杂空间问题回答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21616 2026-06-23 cs.CL 新提交 70%

LLM and Human Modes of Representation

LLM与人类的表征模式

Shalom Lappin

机构 * Shalom Lappin

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 研究比较大型语言模型(LLM)与人类在语言知识和现实推理中的表征差异,发现LLM在语言任务上表现优异但处理方式不同,且在推理任务中学习与泛化效率低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20761 2026-06-23 cs.SE cs.AI cs.ET cs.MA cs.SY eess.SY 新提交 70%

Integrating Large Language Model Agents with Digital Twins for Industrial Autonomous Systems

将大语言模型代理与数字孪生集成用于工业自主系统

Yuchen Xia

机构 * Institut für Automatisierungs- und Softwaresysteme (IAS) der Universität Stuttgart(自动化与软件系统研究所(IAS)的斯图加特大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出三层框架集成大语言模型、数字孪生与自动化系统,通过TPSR模型和四种LLM角色实现自适应任务规划与执行,提升工业自动化适应性。

Comments Doctoral Dissertation, University of Stuttgart. Doctoral Exam Video Recording: https://youtu.be/Mhd9LiV5TKE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20596 2026-06-23 cs.HC cs.AI cs.SE 新提交 70%

HAAS Studio: A Tool for Simulating, Benchmarking, and Governing Human-AI Work Allocation

HAAS Studio: 用于模拟、基准测试和管理人-AI工作分配的工具

Vicente Pelechano

机构 * Valencian Research Institute for Artificial Intelligence(巴伦西亚人工智能研究 institute)

专题命中 规划推理 :planning(abstract,abstract_cn);分类 cs.AI

AI总结 提出HAAS Studio,一个用于策略感知的自适应人-AI任务分配的模拟与决策支持工具,结合认知表示、协作光谱、多臂老虎机算法和基于契约的治理,支持多领域部署决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18325 2026-06-19 cs.CR cs.AI 新提交 70%

Agentra: A Supervisable Multi-Agent Framework for Enterprise Intrusion Response

Agentra: 一种可监督的多智能体企业入侵响应框架

Raj Patel, Shaswata Mitra, Michele Guida, Stefano Iannucci, Sudip Mittal, Shahram Rahimi

机构 * The University of Alabama, Alabama, USA(阿拉巴马大学) Roma Tre University, Rome, Italy(罗马三大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出可监督的多智能体入侵响应框架Agentra,通过角色划分、规划-验证循环、安全网关和风险评分机制,将警报转化为结构化响应计划,在120事件语料上F1从0.61提升至0.84,有害动作率降至0.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18363 2026-06-18 cs.RO cs.AI 新提交 70%

Guava: An Effective and Universal Harness for Embodied Manipulation

Guava: 一种有效且通用的具身操作工具框架

Haowen Liu, Xirui Li, Shaoxiong Yao, Peng Shi, Tianyi Zhou, Jia-Bin Huang, Furong Huang, Jiayuan Mao

机构 * University of Maryland College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Pennsylvania(宾夕法尼亚大学) Amazon FAR(亚马逊 FAR)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出Guava框架,通过迭代感知-推理-行动循环、语义动作抽象和多模态观测三大关键设计,将具身操作能力蒸馏到4B开源模型中,在仿真和真实环境中性能媲美前沿专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17924 2026-06-17 cs.RO cs.AI 新提交 70%

PearlVLA: Progressive Embodied Action-Plan Refinement in Latent Space

PearlVLA:潜在空间中的渐进式具身动作计划精炼

Bochen Yang, Lianlei Shan

机构 * Imperial College London(帝国理工学院) Tsinghua University(清华大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出PearlVLA框架,通过在VLM潜在空间中进行迭代计划精炼,平衡动作生成效率与显式推理,在LIBERO基准上达到最先进性能。

Comments 21 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16576 2026-06-16 cs.CL 新提交 70%

Can LLM Agents Infer World Models? Evidence from Agentic Automata Learning

LLM智能体能否推断世界模型?来自智能体自动机学习的证据

Reef Menaged, Gili Lior, Shauli Ravfogel, Roee Aharoni, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) New York University(纽约大学) Google Research(谷歌研究)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 提出智能体自动机学习框架,通过成员查询和等价查询评估LLM智能体发现隐藏确定性有限自动机的能力,发现性能随DFA规模增加而急剧下降,推理模型优于非推理模型但仍存在规划、整合和假设构建缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏