PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents
PMMC:面向长期LVLM智能体的前瞻性多模态记忆编译
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对现有LVLM智能体记忆系统的缺陷,提出PMMC框架,将部分记忆推理移至整合阶段,构建结构化问题库,提升答案质量与证据召回率,降低查询成本。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
PMMC:面向长期LVLM智能体的前瞻性多模态记忆编译
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对现有LVLM智能体记忆系统的缺陷,提出PMMC框架,将部分记忆推理移至整合阶段,构建结构化问题库,提升答案质量与证据召回率,降低查询成本。
智能体AI中的OpenClaw与Ollama:迈向完全自主且可扩展的AI智能体系统
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; Cornell University(康奈尔大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 该研究提出智能体AI的分层架构,分析OpenClaw与Ollama组成的全栈系统,验证系统集成可提升智能体能力,指出相关挑战并提供路线图,所有资源公开以支持研究。
世界动作规划器:基于动作条件世界模型的通用决策方法
机构 * Harvard University(哈佛大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本研究提出World Action Planner机器人规划系统,结合VLMs与多任务位姿图像条件世界模型,可迭代优化动作规划,在组合任务、新布局等场景中泛化性能优于VLAs、WAMs等端到端策略模型。
Comments Project page at worldactionplanner.github.io
KAP:弥合大语言模型系统中知识选择与运行时消耗的差距
机构 * QiYuanLab(启元实验室)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG
AI总结 研究大语言模型系统中知识选择与运行时消耗的差距,提出知识访问规划(KAP)范式,通过建立通用中间表示编译知识信号控制KV访问,以GraphSpec实例化,改变长上下文生成扩展轨迹,提升运行时消耗效率。
Comments 3 figures, 5 tables
你所需要的只是专注:多智能体图系统的自适应目标感知注意力编排
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究多智能体图系统中注意力分配问题,提出自适应目标感知注意力编排框架AGAO,结合目标、拓扑、资源感知注意力,将静态图转变为自适应系统,经实验验证其能提高任务有效性并减少计算等消耗,确立注意力工程方向。
在机器人化学实验室中对大型语言模型智能体进行压力测试
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究以机器人化学实验室为测试平台,使科学智能可衡量,通过4608次试验发现工作流程执行率低、长期规划有挑战,反馈促使局部调整,提供了部署评估及改进诊断框架。
迈向电子健康记录中文档不一致性的自动检测
机构 * Duke University(杜克大学) ; Columbia University Medical Center(哥伦比亚大学医学中心) ; Vanderbilt University Medical Center(范德堡大学医学中心)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL
AI总结 研究旨在检测电子健康记录中文档不一致性,采用两阶段LLM管道对3000份出院小结进行分析,发现多种类型不一致及反复出现的失败模式,建立了方法基础和概念框架以指导后续大规模分析。
强化学习:从算法到基础模型
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 本文从游戏算法和基础模型时代的RL两个视角展开研究,前者聚焦多智能体RL中相关概念的相互作用,后者利用生成和基础模型丰富序列决策,开发多种模型并进行相关研究,呈现RL在复杂序列域的统一视图,突出其连接多方面的作用。
Comments Princeton University PhD Thesis 2026
经验基础提升了在干扰期间模拟人类行为的大语言模型智能体的现实性
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究探讨经验基础对提升LLM智能体模拟人类行为现实性的作用,开发基于经验的框架,将多项调查数据嵌入其中,通过实验验证该框架能显著提升模拟效果,使LLM智能体成为更具统计可信度的人口行为模拟器。
用于5G/6G网络的基于大语言模型的智能体人工智能:架构、协议和标准化教程与综述
机构 * EURECOM ; University of Sharjah(谢贾学院)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究5G/6G网络中基于大语言模型的智能体人工智能,通过分为两部分的教程与综述,形式化5G和6G相关平面,涵盖智能体系统基础,映射其能力到控制面等,识别自主电信面临的开放挑战。
Comments 35 pages, 4 figures, Under review
GraphDx:一种用于顺序诊断的成本感知知识增强多智能体框架
机构 * Shandong University(山东大学) ; Nankai University(南开大学) ; East China Normal University(华东师范大学) ; National Technological University(国立科技大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究针对顺序诊断中平衡诊断准确性与资源成本的问题,提出GraphDx框架。该框架通过构建特殊知识图谱及引入协作智能体实现创新,实验表明其能显著提高诊断成功率并降低测试成本,为自动临床诊断提供有效方案。
Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 21721-21736, 2026
MCPEvol-Bench:跨MCP服务器动态演化对大语言模型智能体性能进行基准测试
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; State Key Laboratory of Complex & Critical Software Environment(复杂关键软件环境国家重点实验室) ; National Key Laboratory of Parallel and Distributed Computing(并行与分布式计算国家重点实验室)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究针对MCP服务器工具接口和功能持续演化致评估有缺陷的问题,引入MCPEvol-Bench基准测试,提出11种变异算子模拟工具演化,对12个先进大语言模型测试,发现前沿模型也难适应,凸显大语言模型驱动工作流程脆弱性,确立评估标准。
生物有机体和未来具身人工智能中的基础世界模型
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究探讨生物有机体中基础世界模型,通过五个神经回路例子揭示当前具身人工智能缺失的特征,如内在动力学作用等,还讨论了生物系统原则对未来具身人工智能的影响。
迈向可审计的人工智能科学家:大语言模型智能体的假设演化协议
机构 * Institute of Industrial Science, The University of Tokyo(东京大学产业科学研究所)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究旨在让大语言模型智能体在科学发现中发挥核心作用。提出假设演化协议(HEP),使假设生成等操作可审计。在材料科学任务中,该协议能让智能体运行关键循环,跨问题概括并随模型能力提升更充分利用协议,迈向可审计的人工智能科学家。
博弈论驱动的多智能体框架减轻语言模型幻觉
机构 * Dalian University of Technology(大连理工大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究针对轻量级大语言模型在科学领域应用受限问题,提出基于博弈论的G-Frame多智能体框架,经结构化推理合成语料库训练出OmniChem模型,性能与GPT 4o mini相当且幻觉大幅减少,为科学领域知识发现提供新途径。
模态相关性并非模态效用:用于成本感知多模态RAG的事后选择性模态升级
机构 * Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学)
专题命中 规划推理 :reasoning(abstract);verifier(abstract);分类 cs.AI
AI总结 研究多模态检索增强生成中模态选择决策点问题,提出事后选择性模态升级方法,先低成本从文本和表格回答,再按需支付VLM证据费用,校准路由器决定是否升级,在MultiModalQA上减少视觉调用并缩小与神谕升级率差距,扩展了路由信号层次结构。
AgentGym2:在去理想化真实世界环境中评测大语言模型智能体
机构 * Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Shanghaijiaotong University(上海交通大学) ; Peking University(北京大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对现有LLM智能体基准过于理想化的问题,提出去理想化评测框架AgentGym2,可全面测查智能体实操能力,实验显示当前SOTA模型仍存在明显性能缺口。
Comments Accepted as a main conference paper at ACL 2026
FORGE:对深度研究智能体的研究轨迹劫持攻击
机构 * Fudan University(复旦大学) ; Huazhong University of Science and Technology(华中科技大学) ; Explore Academy, JD(京东探索研究院)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究针对深度研究智能体,利用其工作流程中的规划层中毒面,提出FORGE两级攻击劫持子任务规划,还引入PRISM指标和Root Query Anchoring防御,展示攻击效果及防御作用。
Comments 20 pages,8 figures,Code available at https://github.com/yvepan/FORGE
智能物联网:面向智能体互联网的架构、应用及挑战
机构 * Department of Artificial Intelligence and Data Engineering, Ankara University(人工智能与数据工程系,安卡拉大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 探讨智能物联网,它将自主智能体能力与网络物理系统整合,旨在从以数据为中心的物联网转变为分布式认知智能体生态系统,文中进行了定位、综述、架构框架介绍等
Comments 14 pages, 2 figures, Author's preprint version. The manuscript may be revised based on peer-review feedback and publication requirements
HiMe:用于长距离视觉-语言-动作控制的分层具身记忆
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; East China Normal University(华东师范大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对视觉-语言-动作模型处理非马尔可夫任务的不足,提出HiMe分层具身记忆框架,解耦智能为高频执行器等,引入动态知识系统,平衡实时执行与思考规划冲突,提升长距离任务成功率。
TerraBench: 智能体能否对异构地球系统数据进行推理?
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出TerraBench基准,基于TerraAgent框架,通过结合大语言模型规划与科学工具,实现跨网格数据、卫星图像、地理空间和模拟器的交互式推理,包含403个任务和24,500个执行步骤。
智能体AI增强医生在临床决策中的信任
机构 * Department of Computer Science and Engineering, Lehigh University(里海大学计算机科学与工程系) ; Department of Epidemiology, Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院流行病学系) ; Department of Medicine, Division of Cardiology, University of Florida(佛罗里达大学医学院心脏病学系) ; McGovern Medical School, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦戈文医学院) ; Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院放射学系) ; McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心麦克威廉姆斯生物医学信息学院) ; Department of Health Outcomes & Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学医学院健康结果与生物医学信息学系)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 研究通过医生评估多模态临床病例,发现智能体AI相比非智能体基线显著提升医生的认知和行为信任,尤其在治疗规划任务中,但存在对错误输出的过度依赖。
Comments Accepted by AMIA 2026 Annual Symposium
TAVR-VLM:面向抗幻觉报告生成的风险条件因果基础
机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Liverpool(利物浦大学) ; Kunming University of Science and Technology(昆明理工大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出TAVR-VLM框架,通过风险条件因果注意力(R-CGA)建立“风险→区域→词”的结构化基础路径,在TAVR规划中减少诊断幻觉,实现新最优性能。
治理行动,而非智能体:机构证明作为自主AI系统的治理模型
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对自主AI系统可能执行不可逆高风险行动的问题,提出一种基于机构证明的计算治理模型,将执行权限与规划推理分离,通过独立权威源证明前提条件,并采用防篡改日志记录决策。
潜在桥:用于实时游戏智能体的连续慢-快通道
机构 * Pine AI ; University of Washington(华盛顿大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对实时游戏智能体,提出一种可学习的连续潜在桥(Latent Bridge),将慢速推理VLM的残差投影到快速反应VLM的输入嵌入空间,在7个Atari游戏和驾驶域中匹配或超越文本桥,且增益高度可预测。
SPIRAL: 学习搜索与聚合
机构 * Stanford University(斯坦福大学)
专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出SPIRAL框架,通过强化学习联合训练语言模型在推理时使用顺序推理、并行采样和聚合三种原语,实现端到端优化,显著提升推理计算扩展效率。
Comments Ongoing Work
用于空间搜索的图增强大型语言模型
机构 * University of Maryland(马里兰大学) ; University of Sydney(悉尼大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 针对大语言模型空间推理能力不足的问题,提出图增强方法,将空间数据以图形式存储并与检索增强生成结合,提升复杂空间问题回答能力。
LLM与人类的表征模式
机构 * Shalom Lappin
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL
AI总结 研究比较大型语言模型(LLM)与人类在语言知识和现实推理中的表征差异,发现LLM在语言任务上表现优异但处理方式不同,且在推理任务中学习与泛化效率低于人类。
将大语言模型代理与数字孪生集成用于工业自主系统
机构 * Institut für Automatisierungs- und Softwaresysteme (IAS) der Universität Stuttgart(自动化与软件系统研究所(IAS)的斯图加特大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI
AI总结 提出三层框架集成大语言模型、数字孪生与自动化系统,通过TPSR模型和四种LLM角色实现自适应任务规划与执行,提升工业自动化适应性。
Comments Doctoral Dissertation, University of Stuttgart. Doctoral Exam Video Recording: https://youtu.be/Mhd9LiV5TKE
HAAS Studio: 用于模拟、基准测试和管理人-AI工作分配的工具
机构 * Valencian Research Institute for Artificial Intelligence(巴伦西亚人工智能研究 institute)
专题命中 规划推理 :planning(abstract,abstract_cn);分类 cs.AI
AI总结 提出HAAS Studio,一个用于策略感知的自适应人-AI任务分配的模拟与决策支持工具,结合认知表示、协作光谱、多臂老虎机算法和基于契约的治理,支持多领域部署决策。