KGARevion: An AI Agent for Knowledge-Intensive Biomedical QA
专题命中 规划决策 :agent(title,abstract);AI agent(title);分类 cs.AI
Journal ref ICLR2025
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 规划决策 :agent(title,abstract);AI agent(title);分类 cs.AI
Journal ref ICLR2025
专题命中 规划决策 :planning(title,abstract);agent(title);分类 cs.LG
专题命中 规划决策 :agent(title);multi-agent(title);planning(abstract);分类 cs.AI
专题命中 规划决策 :agent(title,abstract);planning(title);分类 cs.AI
Comments Technological Forecasting and Social Change, 106 , pp. 74-84, 2016
专题命中 规划决策 :agent(title);multi-agent(title);planning(abstract);分类 cs.AI
Journal ref Journal Of Artificial Intelligence Research, Volume 47, pages 649-695, 2013
面向混合知识图谱的模式无关图推理智能体
专题命中 规划决策 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出图推理智能体GRA,探索混合知识图谱,在工业基准UFK-M上准确率优于全上下文智能体,读取令牌更少,增益源于选择性访问。
三叉戟:如何突破深度强化学习网络防御(智能体式)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对DRL网络防御对自适应威胁鲁棒性不足的问题,提出Trident智能体式LLM红队框架,通过含三类组件的设计,发现现有防御存在根本性脆弱性,大幅降低蓝方防御性能并揭示新兴行为。
Comments code: https://anonymous.4open.science/r/Trident-A934
用于定制产前护理的PATHFinder智能体
机构 * University of Michigan(密歇根大学)
专题命中 规划决策 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究针对产前护理,提出PATHFinder智能体这一端到端对话系统,通过结构化对话收集信息并制定个性化计划,展示社区资源。经评估前沿大语言模型,GPT-5.2平均分最高,还发现检测建议差距,将开展人体研究和随机对照试验验证。
Comments Accepted as demo at ACM Interactive Health 2026. https://realize-lab.github.io/PATHFinder/
南贝格4.2 - 3B:以紧凑模式解锁智能体能力
机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL
AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。
压缩表示空间中的运动规划
机构 * MIT LIDS(麻省理工学院信息与决策系统实验室)
专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 提出一种生成式框架,通过高压缩率自编码器学习离散层级化潜在空间,并在其中直接搜索进行运动规划,兼顾灵活性与效率,无需任务特定训练。
Comments To appear in the Proceedings of the 43rd International Conference on Machine Learning
智能体模型批判
机构 * Institute of Foundation Models, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学基础模型研究所) ; School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
专题命中 规划决策 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文区分了自动化与智能体,提出真正智能体需内化目标、身份、决策、自我调节和学习等结构,并设计了GIC通用智能体架构。
超越静态端点:工具程序作为灵活智能体网络服务的接口
机构 * School of Computer Science, Peking University, Beijing, China ; School of Software \& Microelectronics, Peking University, Beijing, China ; Institute for Artificial Intelligence, Peking University, Beijing, China
专题命中 规划决策 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 提出ToolPro,将工具意图表示为可执行程序,通过约束引导构建、效应感知重放和策略决策,在MCP服务上实现最高53.4%的延迟降低和96.1%的流量减少。
Comments Accepted by ICML 2026
能否用Vibe编码击败研究生计算机科学学生?一个LLM与人类编码竞赛在市场驱动的战略规划中的表现
机构 * University of Southampton(苏塞克斯大学) ; University of Oxford and Alan Turing Institute(牛津大学和艾伦·图灵研究所)
专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个基于现实物流优化问题(拍卖、取件和送货问题)的多智能体推理驱动基准,该问题结合了竞争拍卖与容量受限路由。研究通过比较40个LLM编码代理与17个人类编码代理在12场双打全部比赛和约4万场比赛中的表现,揭示了人类编码代理在战略规划和优化任务中的优势,以及LLM在现实世界中生成有效代码的能力不足。
面向高效且基于证据的移动预测:基于LLM驱动的智能体
机构 * The University of Tokyo(东京大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of New South Wales, Sydney(新南威尔士大学(悉尼)) ; LocationMind Inc.(LocationMind公司) ; Southern University of Science and Technology(南方科技大学) ; Jilin University(吉林大学)
专题命中 规划决策 :agent(title,abstract);tool use(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 提出一种无需训练的LLM驱动智能体框架AgentMob,通过自适应证据收集机制解决移动预测中的模糊情况,在多个数据集上达到最优性能。
COMAP:面向LLM智能体的世界模型与智能体策略协同进化
机构 * Central South University(中南大学) ; College of Computer Science, Sichuan University(四川大学计算机学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 规划决策 :agent(title,abstract);tool-use(abstract);planning(abstract);分类 cs.AI、cs.CL
AI总结 提出COMAP框架,通过闭环交互协同进化文本世界模型和智能体策略,在具身任务规划、网页导航和工具使用基准上显著提升性能。
PathWise:通过世界模型规划实现基于自进化LLM的自动启发式设计
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 提出PathWise多智能体推理框架,将启发式生成建模为基于蕴含图的序列决策过程,通过策略智能体、世界模型智能体和评论智能体的协作实现状态感知规划,在组合优化问题上收敛更快、泛化更强。
Comments Accepted to ICML 2026
EndoCogniAgent: 闭环代理推理与自我一致性验证用于内窥镜诊断
机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) ; Jiangsu Key Laboratory of Biomaterials and Devices, Southeast University(江苏省生物材料与器件重点实验室) ; State Key Laboratory of Digital Medical Engineering, Southeast University(国家数字医学工程重点实验室) ; The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) ; Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) ; Jiangsu Provincial Joint International Research Laboratory of Medical Information Processing(江苏省联合国际医学信息处理联合实验室) ; Laboratory of Image Science and Technology, the School of Computer Science and Engineering, Southeast University(图像科学与技术实验室,东南大学计算机科学与工程学院)
专题命中 规划决策 :agentic(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出EndoCogniAgent框架,通过闭环代理推理和自我一致性验证提升内窥镜诊断的准确性与可靠性,其核心方法是将诊断过程建模为受控状态更新过程,并引入EndoAgentBench基准进行评估。
Comments 10 pages, 8 figures, 2 tables. Revised version with major updates on methodology and extended evaluation on EndoAgentBench. Code and data are available at https://github.com/Tyyds-ai/EndoCogniAgent
先规划,后扩散:用于长视距扩散规划的外在图引导
机构 * Technion(技术Ion大学) ; Harvard(哈佛大学)
专题命中 规划决策 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种外在搜索引导的扩散模型(XDiffuser),通过在状态空间图上先规划再引导扩散过程,以提高长视距规划的效率和效果,尤其在低质量数据和未见任务中表现优异。
FlowSteer:通过强化递进画布编辑设计代理工作流
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FlowSteer,一种通过强化学习递进画布编辑设计代理工作流的新范式,解决传统工作流构建中依赖人类、缺乏图级执行反馈和无法在长周期内修复错误的问题。
Comments 51 pages, 6 figures, 5 tables. Project page: http://flowsteer.org/
CHAL:层次代理语言委员会
专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 CHAL框架通过将辩论视为信念优化过程,改进了LLM在可反驳领域中的推理能力,通过层次代理结构和可审计的信念记录,实现了更透明和可解释的多代理辩论系统。
Skill-R1:通过强化学习实现智能体技能进化
机构 * UC San Diego(UC圣地亚哥大学) ; Adobe Research(Adobe研究院)
专题命中 规划决策 :agent(title);tool use(abstract);planning(abstract);agentic(abstract)
AI总结 Skill-R1通过强化学习框架实现实例级递归技能优化,利用可验证奖励训练轻量级技能生成器,提升智能体在复杂多步骤任务中的表现。
CastFlow:学习用于时间序列预测的角色专用代理工作流
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 规划决策 :agentic(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.LG
AI总结 CastFlow通过动态代理框架实现多视角时间模式提取和多轮上下文特征获取,提升时间序列预测的准确性和适应性。
设备本机自主代理用于隐私保护的谈判
专题命中 规划决策 :autonomous agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于设备的自主代理系统,通过零知识证明和本地推理实现隐私保护的谈判,实验显示在保险和B2B采购场景中成功率高,隐私保护效果显著。
Comments 9 pages, 6 figures, 9 tables. This version updates metadata after publication in IEEE Xplore
Journal ref 2026 IEEE SoutheastCon, Huntsville, AL, USA, 2026
SafetyALFRED:评估多模态大语言模型的安全意识规划
机构 * University of Michigan(密歇根大学) ; Boise State University(博伊西州立大学)
专题命中 规划决策 :planning(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。
Comments Work accepted at ACL 2026 Findings
MM-WebAgent:一种用于网页生成的分层多模态网络代理
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xi'an Jiaotong University(西安交通大学) ; Tongji University(同济大学) ; Microsoft Corporation(微软公司)
专题命中 规划决策 :agent(title,abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本文提出MM-WebAgent,一种分层多模态网页生成框架,通过分层规划和迭代自反思协调AIGC元素生成,提升网页全局布局与视觉一致性。
LLMOrbit:大型语言模型的圆形分类法——从扩展壁垒到智能体AI系统
机构 * Microsoft(微软)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出LLMOrbit,通过八个维度分析2019-2025年50余种大型语言模型,揭示数据稀缺、成本激增和能源消耗三大危机,并提出六种突破扩展壁垒的范式,推动生成AI和智能体系统的发展。
OctoTools: 一个具有可扩展工具的代理框架,用于复杂推理
机构 * Stanford University(斯坦福大学)
专题命中 规划决策 :agentic(title);agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 OctoTools通过标准化工具卡、规划器和执行器,提供一种无需训练的多代理框架,实现跨领域复杂推理,其在16种任务中达到9.3%的平均准确率提升。
Comments 88 pages, 18 figures. Accepted to ACL 2026
超越流畅性:迈向可靠的代理信息检索轨迹
机构 * Google(谷歌)
专题命中 规划决策 :agentic(title,abstract);autonomous agent(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了代理信息检索中轨迹完整性与因果归因的重要性,提出通过验证门和系统性回避策略来减少累积误差和欺骗性流畅性,强调过程正确性而非终点准确性。
课程引导的大规模多智能体系统解决稳健长周期任务
机构 * Wipro Innovation Networks(威普罗创新网络)
专题命中 规划决策 :agent(title,abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出一种分层多智能体架构,通过空间课程逐步扩展网格区域,使智能体先掌握中央任务再处理外围任务,提升长周期任务的稳定性和推理能力。
Comments 22 pages, 2 tables, 9 figures
CLAUSE: 通过动态可学习上下文工程实现基于代理的神经符号知识图谱推理
机构 * Independent Researcher(独立研究员) ; School of Computer Science, The University of Sydney, Australia(悉尼大学计算机科学学院) ; College of Computing & Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 CLAUSE通过动态可学习上下文工程实现神经符号知识图谱推理,优化多跳问答的准确率、延迟和成本,减少子图增长和端到端延迟。