Where Agent Frameworks Fall Short: Examining Functional Challenges and Usability Concerns
对现代LLM代理框架中缺陷的实证研究
专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.SE
AI总结 本文通过分析998个缺陷报告,发现现代LLM代理框架中缺陷主要源于API误用、不兼容和文档不同步,集中在自我行动阶段,导致功能错误、崩溃和构建失败。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
对现代LLM代理框架中缺陷的实证研究
专题命中 工具调用 :agent(title,abstract);workflow(abstract);分类 cs.SE
AI总结 本文通过分析998个缺陷报告,发现现代LLM代理框架中缺陷主要源于API误用、不兼容和文档不同步,集中在自我行动阶段,导致功能错误、崩溃和构建失败。
SkillMOO:软件工程中代理技能的多目标优化
机构 * King's College London(伦敦国王学院) ; Queen's University Belfast(贝尔法斯特女王大学) ; Nanjing University(南京大学) ; Johannes Gutenberg University Mainz(美因茨约翰尼斯·古滕贝格大学) ; University College London(伦敦大学学院) ; University of Duisburg-Essen(杜伊斯堡- Essen大学)
专题命中 工具调用 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出SkillMOO框架,通过LLM提议的编辑和NSGA-II算法优化代理技能包,提升任务成功率并降低推理成本。
调用还是不调用:评估和优化LLM工具调用的框架
机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; Ruhr University Bochum(博德姆鲁尔大学) ; UAR RC Trust(UAR RC信托)
专题命中 工具调用 :tool use(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI
AI总结 提出一个基于决策理论的框架,从必要性、效用和可负担性三个关键因素评估LLM的网页搜索工具调用决策,并训练轻量级估计器优化调用,提升任务性能。
Comments Preprint, under review
令牌原生存储:以智能体的语言进行读写
专题命中 工具调用 :agent(title);分类 cs.CL
AI总结 本文提出令牌原生存储思路,将文本以模型的BPE令牌ID保存,压缩比和读写速度均优于UTF-8等字节编码,呼吁AI实验室标准化令牌化器以推进该方案。
Comments 12 pages, 6 figures, 2 tables
CRINN:用于近似最近邻搜索的对比强化学习
机构 * DeepReinforce Team(深强化团队)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 研究针对近似最近邻搜索算法,提出CRINN新范式,将其优化视为强化学习问题,以执行速度为奖励信号,实验证明该方法在多个基准数据集上有效,且其成功验证了强化学习增强语言模型用于算法优化的有效性。
Comments Preprint Version
PrivacyPeek: 审计基于LLM的智能体获取了什么,而不仅仅是它们说了什么
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Southeast University(东南大学)
专题命中 工具调用 :agent(abstract);分类 cs.AI
AI总结 提出PrivacyPeek基准,通过检查工具调用轨迹和探针诱导,评估基于LLM的智能体在获取阶段不必要的敏感信息泄露,发现该问题普遍存在且现有防御效果有限。
Comments 21 pages, 17 figures
隐形墨水威胁:计算机使用智能体中合法任务背后的对抗目标
专题命中 工具调用 :agent(abstract)
AI总结 该研究针对计算机使用智能体的隐形墨水威胁,构建II-Bench与HITLCUA框架评估后发现,低危害注入可绕过防御,暴露出现有CUAs的安全风险。
用于个性化剂量探索试验中最佳生物剂量组合识别的贝叶斯优化方法
专题命中 工具调用 :agent(abstract)
AI总结 针对个性化剂量探索试验样本量小、难识别最佳生物剂量组合的问题,提出融合疗效与毒性信息的贝叶斯优化方法,经模拟验证其表现良好。
Comments 4 Figures, 1 Table
毫秒级多机器人运动:基于向量加速的采样规划原语
机构 * Parasol Lab, School of Computing and Data Science, University of Illinois at Urbana Champaign(帕索尔实验室,计算与数据科学学院,伊利诺伊大学厄巴纳-香槟分校) ; Department of Computer Science at Instituto Tecnológico Autónomo de México (ITAM)(墨西哥自治理工学院(ITAM)计算机科学系)
专题命中 规划决策 :planning(title,summary_cn)
AI总结 本文扩展了Vector-Accelerated Motion Planning框架,开发了多机器人MotionValidation和FindFirstConflict原语,利用SIMD并行性实现多机器人运动规划的高效验证与冲突检测,显著提升规划效率。
GrandCode: 通过代理强化学习实现竞技编程的Grandmaster级别
机构 * DeepReinforce Team(DeepReinforce 团队)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出GrandCode,一种用于竞技编程的多代理强化学习系统,通过代理模块协同训练和代理GRPO算法,实现了在竞技编程比赛中超越人类选手的突破。
Comments Tech Report; Pre-print
SP-Mind: 用于空间蛋白质组学分析的自主推理智能体
机构 * Department of Computer Science, Stanford University, Stanford, USA(计算机科学系,斯坦福大学,斯坦福,美国) ; Department of Radiation Oncology, Stanford University, Stanford, USA(放射肿瘤学系,斯坦福大学,斯坦福,美国)
专题命中 规划决策 :agent(title,abstract);AI agent(abstract);分类 cs.AI
AI总结 提出首个自主AI智能体SP-Mind,统一空间蛋白质组学分析流程,通过自然语言查询实现端到端分析,在SP-Bench基准上达到最优性能。
Comments 24 pages, 6 figures. Accepted to ICML 2026. Equal contribution by Yucheng Yuan and Yuanfeng Ji
A-SR:通过分层协调实现符号回归的自进化智能体大语言模型
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 A-SR是一种自进化智能体框架,通过分层协调实现符号回归,在LLM-SRBench科学领域和真实世界任务上显著提升了符号回归的Acc@0.01和归一化均方误差指标。
Comments 18 pages, 8 figures, including appendix
如您所愿:利用LLM在精准农业中进行形式化验证的任务规划
机构 * University of California, Merced(加州大学默塞德分校)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
AI总结 针对自然语言歧义性,提出基于线性时序逻辑(LTL)反馈循环的LLM任务规划系统,通过双LLM分工实现规范生成与验证,提升精准农业任务规划的可靠性。
Journal ref Published in Proceedings of 2026 International Conference on Robotics and Automation (ICRA)
基于强化学习的清洁机器人路径规划
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
AI总结 针对现有清洁机器人路径规划模型环境适应性差的问题,提出结合PPO算法与多种技术的方法,经实验验证其训练性能、收敛速度及清洁性能均优于传统方法。
Comments 7 pages with 11 figures
超越单纯的环境规模扩展:为多模态智能体学习设计有效的环境分布
专题命中 规划决策 :agent(title,abstract)
AI总结 该研究针对多模态智能体学习中单纯扩展环境数量无效的问题,提出AES与HDC两种方法优化环境分布,提升了智能体训练效果。
Comments Code: https://github.com/GaryStack/Beyond-MMEnv-Scaling
P-ARC:利用子问题独立性实现并行多机器人运动规划
机构 * Parasol Lab, School of Computing and Data Science, University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校计算与数据科学学院Parasol实验室)
专题命中 规划决策 :planning(title,abstract)
AI总结 提出P-ARC并行算法,通过并行化ARC的三个阶段并采用OR并行多启动策略,在多机器人运动规划中实现近4倍加速。
一维皮亚诺连续统上的运动规划
专题命中 规划决策 :planning(title)
AI总结 该研究将一维空间的Lusternik-Schnirelmann范畴与拓扑复杂度定义为闭滤过长度,依据皮亚诺连续统的野性秩刻画其数值,发现其可任意高,与一维CW复形结果形成对比。
Comments 22 pages, 6 figures
Dream-MPC:基于梯度与潜在想象的模型预测控制
机构 * Autonomous Intelligent Systems, Computer Science Institute VI - Intelligent Systems(自主智能系统,计算机科学研究所VI - 智能系统) ; Robotics, Center for Robotics(机器人学,机器人中心) ; the Lamarr Institute for Machine Learning(拉马尔机器学习研究所) ; Artificial Intelligence, University of Bonn, Germany(人工智能,波恩大学,德国)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 提出Dream-MPC方法,通过从展开策略生成少量候选轨迹,并利用学习的世界模型进行梯度上升优化,结合不确定性正则化和时间上的优化迭代摊销,显著提升了底层策略性能,在24个连续控制任务上优于无梯度MPC和现有基线。
Comments Accepted for International Conference on Machine Learning (ICML) 2026
利用序列建模预测心力衰竭患者一年临床不稳定性和死亡率
机构 * Sahlgrenska University Hospital(斯德哥尔摩大学医院) ; Department of Computer Science and Engineering, Chalmers University of Technology and University of Gothenburg(计算机科学与工程系,查尔姆斯理工大学和乌普萨拉大学) ; Department of Molecular and Clinical Medicine, Sahlgrenska Academy, University of Gothenburg(分子与临床医学系,斯德哥尔摩学院,乌普萨拉大学) ; Department of Medicine, Geriatrics and Emergency Medicine, Sahlgrenska University Hospital(医学、老年医学和急诊医学系,斯德哥尔摩大学医院) ; Department of Food and Nutrition, and Sport Science, Faculty of Education, University of Gothenburg(营养学与体育科学系,教育学院,乌普萨拉大学) ; School of Public Health and Community Medicine, Institute of Medicine, University of Gothenburg(公共卫生与社区医学系,医学院,乌普萨拉大学)
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究通过序列模型预测心力衰竭患者一年内的临床不稳定性和死亡风险,发现Llama模型在有限数据下表现优异,为出院后风险分层提供依据。
季风混乱到市场波动:斯里兰卡渔业韧性预测
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 本研究开发框架结合STL分解、ITS回归等方法,分析斯里兰卡渔业受气候与重大事件的影响,发现海洋与内陆渔业的差异,成果可支撑渔业规划与决策。
Comments Accepted to MERCon 2026
谁在检查引用?法律幻觉检测的基准测试
机构 * Princeton University(普林斯顿大学)
专题命中 规划决策 :agentic(abstract);分类 cs.CL
AI总结 针对AI生成法律文件中频繁出现虚假引用的问题,本研究提出法律引用幻觉分类法,构建包含1300条注入错误的摘要数据集,并基准测试五种模型,发现即使最先进的GPT-5在代理框架下召回率82.8%、F1分数60.5%,仍难以处理细微错误类别。
RICE-PO:将检索交互转化为推理智能体的信用信号
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿姆赫斯特分校) ; Texas Tech University(得克萨斯科技大学) ; University of Connecticut(康涅狄格大学)
专题命中 规划决策 :agent(abstract);分类 cs.CL
AI总结 提出RICE-PO框架,通过将检索交互转化为局部学习信号,解决推理型检索智能体在训练中推理步骤的信用分配问题,在BRIGHT和BEIR上优于基线。
动态目标掩码作为视觉目标条件强化学习的目标表示
机构 * University of Alberta(阿尔伯塔大学) ; McGill University(麦吉尔大学) ; University of Ottawa(渥太华大学) ; AMII ; CIFAR Canada AI Chair(CIFAR加拿大人工智能主席) ; Vector Institute(向量研究所)
专题命中 规划决策 :agent(abstract);分类 cs.LG
AI总结 该研究针对视觉目标条件强化学习,提出动态目标掩码作为目标表示,结合Detic等预训练检测器生成掩码,在机械臂和仿真导航任务中实现高成功率与高效学习,支持仿真到现实迁移。
基于溶液过程的机器人纳米粒子合成
机构 * Department of Mechanical Engineering, Stony Brook University(石溪大学机械工程系) ; Department of Chemistry, Stony Brook University(石溪大学化学系)
专题命中 规划决策 :planning(abstract)
AI总结 本文提出一种基于螺旋几何的操控规划框架,用于实现基于溶液的合成自动化,通过金和磁铁矿纳米粒子的制备进行演示。该框架通过编程演示提取约束,实现化学家无需机器人知识即可重新编程系统。
基于GPU原生顺序二次规划的并行时间非线性最优控制
专题命中 规划决策 :planning(abstract)
AI总结 本文提出一种基于GPU的并行时间非线性最优控制方法,结合顺序二次规划与共识交替方向乘子法,通过时间分裂策略实现大规模并行计算,显著提升求解效率和硬件利用率。
Afford-X:面向任务型操作的通用且轻量化的可供性推理模型
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; Institute for Al Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; Department of Computer Science, Tsinghua University(清华大学计算机科学系)
专题命中 规划决策 :planning(abstract)
AI总结 研究人员推出LVIS-Aff数据集,开发了Afford-X可供性推理模型,其性能优于现有非LLM方法和此前会议论文结果,参数紧凑、推理速度快,可部署于本地设备助力机器人任务导向型操作。
离线纳什求解器与在线树搜索在图上多智能体博弈中的结合
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);planning(abstract)
AI总结 多智能体追逃博弈计算纳什均衡策略有挑战,本文提出原始引导树搜索框架PGTS,结合离线精确纳什均衡计算与在线树搜索,实验表明其显著优于现有基线,在多种图拓扑上对对手保持稳健性能。
SimMOF:用于自动化MOF模拟的AI代理
机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST)化学与生物分子工程系)
专题命中 多智能体 :agent(title,abstract);AI agent(title);workflow(abstract);分类 cs.AI
AI总结 SimMOF通过自然语言查询自动化MOF模拟全流程,实现依赖感知计划生成、可运行输入生成、多代理协同执行及结果分析,提供数据驱动的MOF研究可扩展基础。
Comments 42 pages, 7 figures, 3 tables
面向通信的多智能体强化学习用于分布式协同无人机部署
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Boeing Research and Technology(波音研究与技术)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract);分类 cs.LG
AI总结 本文提出基于图的多智能体强化学习框架,通过集中训练分散执行策略,在部分可观测和间歇性链路条件下实现高效无人机协同部署,展示了在合作中继部署和对抗任务中的优越性能。
DVAR:对抗性多智能体辩论用于视频真实性检测
机构 * Zhejiang University(浙江大学) ; Guangming Lab(光明实验室)
专题命中 多智能体 :agent(title,abstract);multi-agent(title,abstract)
AI总结 DVAR通过多智能体辩论框架,将视频真实性检测转化为结构化推理过程,利用生成假设代理与自然机制代理的竞争,结合MDL框架和GenVideoKB知识库,实现对未知生成架构的强泛化能力。
Comments 9 pages