Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents
下一代智能体强化学习系统实现自进化智能体
专题命中 规划决策 :agentic(title,abstract);agent(abstract)
AI总结 针对企业级大规模智能体服务中自进化部署的瓶颈,提出智能体在线强化学习系统需在轨迹数据协议、数据代理和进化控制平面三方面进行协同设计,并通过AReaL2.0实例化。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
下一代智能体强化学习系统实现自进化智能体
专题命中 规划决策 :agentic(title,abstract);agent(abstract)
AI总结 针对企业级大规模智能体服务中自进化部署的瓶颈,提出智能体在线强化学习系统需在轨迹数据协议、数据代理和进化控制平面三方面进行协同设计,并通过AReaL2.0实例化。
KidnapRAG:针对代理式检索增强生成系统中推理劫持的黑盒攻击
专题命中 规划决策 :agentic(title,abstract);agent(abstract)
AI总结 提出KidnapRAG,一种针对代理式RAG系统的黑盒顺序投毒攻击,通过三种角色文档(诱饵、链环、恶意指令)劫持多步推理链,实验表明在多种框架和基准上优于现有方法。
Comments Preprint
ActPlane:面向代理框架的可编程操作系统级策略执行
专题命中 规划决策 :agent(title,abstract);AI agent(abstract)
AI总结 提出ActPlane,一种在操作系统内核中执行代理策略的引擎,通过eBPF实现信息流控制,弥补语义鸿沟,覆盖工具层无法观察的间接执行路径,开销1.9%-8.4%。
基于锚定机器人关键点的顺序规划
机构 * Department of Electrical, Computer, and Systems Engineering(电气、计算机与系统工程系) ; Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 提出SPARK,一种无训练神经符号操作系统,通过单一Gemini调用生成类型化行为树,结合SAM3的替代提示检测和恢复循环,在LIBERO-PRO上达到43.7%,超越CaP-Agent0和VLA基线。
Comments 29 pages, 14 figures
数百个浮动机器人的运动规划
机构 * Institute for Dynamic Systems and Control, ETH Zürich(苏黎世联邦理工学院动态系统与控制研究所)
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 针对大型浮动机器人编队的无碰撞运动规划问题,提出一种可扩展的流水线方法,通过碰撞图分解为独立子问题并行求解,在500个机器人仿真和实际演示中验证了有效性。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
具有双LLM模块的分层提示用于机器人任务和运动规划
机构 * IBM, Krakow, Poland(IBM公司,波兰克拉科夫) ; Jagiellonian University, Krakow, Poland(雅盖隆大学,波兰克拉科夫) ; AGH University, Krakow, Poland(AGH大学,波兰克拉科夫)
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文提出一个分层语言驱动框架,通过双LLM模块提升服务和协助场景中人机交互的自然性和直观性,结合目标检测与运动执行实现高成功率的任务规划。
Journal ref Proc. IEEE International Conference on Advanced Robotics and its Social Impacts (ARSO), 2026, pp. 245-250
Evo-RAD:通过自进化代理检索导航罕见视网膜疾病诊断
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Northwestern Polytechnical University(西北工业大学) ; National University of Singapore(新加坡国立大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract)
AI总结 提出Evo-RAD框架,将检索增强诊断建模为马尔可夫决策过程,通过图代理动态删除不相关证据、插入病理一致样本或终止进化,利用同质性感知奖励优化,显著提升罕见视网膜疾病诊断性能。
Comments Accepted by MICCAI 2026. 10 pages, 2 figures, 3 tables
新颖性感知的智能检索:通过结构化多步推理比较研究贡献
专题命中 规划决策 :agentic(title,abstract);agent(abstract)
AI总结 提出新颖性感知研究智能体,通过结构化多步推理增强RAG,实现论文间重叠、差异及问题-方法缺失的对比分析,在100篇论文语料上支持五种结构化比较能力。
Comments 9 pages, 1 figure, 14 tables
三思而后行:通过隔离规划保护LLM代理免受工具描述投毒攻击
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 提出Tool-Guard系统级防御,通过隔离规划机制将可疑工具调用隔离到受感染列表,阻断投毒描述持续影响,在AgentDojo和ASB基准上显著降低攻击成功率并保持任务效用。
Comments Accepted to ICML 2026
OpenPINT:BNCT研究中等效应核治疗的开源规划
专题命中 规划决策 :planning(title,abstract);workflow(abstract)
AI总结 提出开源治疗计划系统OpenPINT,集成蒙特卡洛剂量计算与光子等效应剂量评估模块,通过解析和体素化基准验证,实现BNCT剂量计算与分析。
Comments 19 pages, 8 figures, 4 tables. Preprint manuscript
GitOfThoughts: 版本控制的推理与可回放、差异比较和合并的智能体记忆
机构 * QpiAI
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出GitOfThoughts框架,将智能体推理树存储为git仓库,实现推理的可回放、审计和合并;实验表明,对于新问题,任何记忆格式均不能可靠提升准确率,仅当检索案例与当前问题高度相似(>0.8)时才有显著提升,且收益来自答案检索而非方法迁移。
Comments 10 pages, 1 figure, 9 tables
JumpStarter:基于任务结构化上下文策展的人机协作规划
专题命中 规划决策 :planning(title,abstract);workflow(abstract)
AI总结 提出JumpStarter系统,通过任务结构化上下文策展框架动态分解目标、限定上下文范围,实现细粒度个性化与复用,用户研究显示规划质量显著优于ChatGPT。
Comments 29 pages, 20 Figures, 9 tables
测试集中式和多中心计算规划
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文提出一个可复现的合成基准,在模拟经济中比较计算规划者、基于代理的市场和混合元市场,发现规划者福利损失更低,但结果受设计选择影响,主要贡献是方法论而非意识形态。
AlignDrive: 用于端到端自动驾驶的对齐横向-纵向规划
机构 * School of Software Engineering, XJTU(软件工程学院,西安交通大学) ; Horizon Robotics ; Shenzhen Loop Area Institute(深圳河套学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文提出一种 cascaded 框架,通过将纵向规划转化为路径条件推理过程,提升自动驾驶的协调性和安全性。方法引入锚点回归设计和规划导向的数据增强策略,实现在 Bench2Drive 上达到 SOTA 性能。
Comments underreview
SIL: 语言条件的人机协同适应的共生交互学习
机构 * Technical University of Leoben(莱博恩技术大学)
专题命中 规划决策 :agent(title,abstract);autonomous agent(abstract)
AI总结 提出共生交互学习(SIL)框架,实现人类与智能体在共享潜在任务空间中的双向协同适应,通过联合信念状态、FM空间推理和记忆架构,在指令跟随等任务中达到90.4%完成率和0.83信念对齐分数。
TRACE:一种用于高效智能体强化学习的统一展开预算分配框架
机构 * Tsinghua University(清华大学) ; Tencent(腾讯)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 针对多轮智能体强化学习中奖励对比度不足的问题,提出TRACE框架,通过将每个ReAct式思考-行动-观察步骤建模为语义节点,在固定采样预算内将预算分配到提示根和中间前缀,增强奖励对比,提升策略更新信号。
Comments 32 pages, 12 figures, 6 tables
因果集成智能体:基于LLM引导的专家重加权的层次化因果发现
机构 * The University of Melbourne(墨尔本大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Peking University(北京大学) ; Adelaide University(阿德莱德大学) ; Hong Kong Baptist University(香港浸会大学) ; The University of Sydney(悉尼大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 规划决策 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出因果集成智能体(CEA)框架,通过线性意见池聚合不同层次的统计因果发现结果,并利用大语言模型(LLM)作为元裁判在决策边界附近动态重加权专家,从而构建更准确完整的因果图。
使用深度确定性策略梯度的路径规划:一种强化学习方法
机构 * Hampton University(汉普顿大学) ; Air Force Research Laboratory(空军研究实验室)
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 提出基于深度确定性策略梯度的路径规划方法,将威胁建模为圆形禁行区,通过奖励函数引导智能体学习从状态到动作的映射,找到最大安全起始点集,相比传统最优控制方法速度更快,适用于实时应用。
Comments 14 pages, 12 figures
GOPAgen: 基于结构记忆与层次推理的运动感知高效智能长视频理解
机构 * Peking University(北京大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract)
AI总结 提出GOPAgen方法,通过视频编解码的GOP运动代理、GOP树推理算法和结构记忆机制,实现高效长视频理解,在多个VQA基准上取得领先性能。
超越SMILES:评估药物发现中的代理系统
专题命中 规划决策 :agentic(title,abstract);planning(abstract)
AI总结 评估药物发现代理系统在肽药物、体内药理学和资源受限环境中的泛化能力,发现五个能力缺口,并提出下一代框架的设计要求和能力矩阵。
Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission
思考与想象:基于世界模拟器的智能视觉空间推理
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Beihang University(北航大学)
专题命中 规划决策 :agentic(title,abstract);tool-use(abstract)
AI总结 提出Astra框架,通过强化学习训练VLM策略与Bagel世界模拟器交互,在推理中生成想象视觉证据,解决空间推理中的未观察布局、跨视角一致性和替代视角推理问题。
Comments Project page: https://zcmax.github.io/projects/Thinking-With-Imagination
面向智能体数据分析的无监督技能发现
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 规划决策 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 提出DataCOPE框架,通过无监督验证器引导从探索轨迹中发现可复用的数据分析技能,在报告式和推理式分析任务上分别提升平均得分9.71%和32.30%。
Comments Work in progress
用于机器人控制的智能体AI:灵活但依然脆弱
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Cambridge(剑桥大学) ; Technical University of Munich(慕尼黑技术大学) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; German Aerospace Center (DLR)(德国航空航天中心(DLR))
专题命中 规划决策 :agentic(title,abstract);planning(abstract)
AI总结 本文提出一种基于推理型语言模型的智能体控制系统,通过迭代规划-执行循环选择并调用机器人技能完成任务,在两种物理平台上实验表明系统灵活但存在非确定性行为、指令遵循错误和提示敏感等脆弱性。
开放源代码驾驶代理的实验韧性评估
机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)
专题命中 规划决策 :agent(title,abstract);planning(abstract)
AI总结 本文提出基于系统理论过程分析(STPA)的故障注入框架,用于评估开放源代码驾驶代理openpilot在不同环境条件和传感器数据故障下的韧性,通过战略性软件故障注入方法提高不安全场景的覆盖率,从而更有效地模拟安全关键故障并测试自动驾驶车辆。
Comments 10 pages, 7 figures
基于PANOC的路交口分布式运动规划非线性模型预测控制
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文提出了一种在合理车对车通信要求下的分布式运动规划方案,通过实时求解非线性模型预测控制问题,解决路交口中高度自动化车辆协调中的非凸挑战问题。
Comments IEEE Conference on Decision and Control (CDC) 2019
一种用于规划与习惯控制系统的仲裁新模型
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文提出一种结合规划与习惯控制的仲裁模型,通过模拟双关节机械臂任务展示其在动态环境中的高效性和鲁棒性。
基于伽马谐波势场的运动规划
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文扩展了谐波势场方法,用于处理无法分割为独立区域的机器人工作空间。通过任务导向的概率描述符和目标点生成导航策略,能够适应存在矢量漂移场的复杂环境。
Journal ref IEEE Transactions on Aerospace and Electronic Systems, 48 (4), 2012, pp. 2786 - 2801
信息最大化协同规划传感器网络的潜在游戏方法
专题命中 规划决策 :planning(title,abstract);agent(abstract)
AI总结 本文提出了一种潜在游戏方法,用于分布式选择信息性传感器,以最大化测量变量与目标量之间的互信息。通过证明局部效用函数导致潜在游戏,最终收敛到纯策略纳什均衡。
Comments 9 pages, 4 figures, submitted to IEEE Transactions on Control Systems Technology
CVPR 2026 CASTLE挑战赛第三名:基于层次化知识图谱检索的智能多视角长视频理解
机构 * TAHAKOM(塔哈科姆)
专题命中 规划决策 :agentic(title,abstract);workflow(abstract)
AI总结 提出一种免训练的智能框架,通过视频知识图谱和层次化检索索引,解决大规模多视角视频中的复杂时空推理问题,在CASTLE挑战赛中获得第三名。
TuneAgent: 基于强化学习的智能操作系统内核调优
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 提出TuneAgent框架,利用基于规则的强化学习使大语言模型自主探索Linux内核空间,通过结构化奖励函数和两阶段训练策略解决稀疏反馈问题,实现高达5.6%的性能提升。