SoK: The Attack Surface of Agentic AI - Tools and Autonomy
SoK:代理AI的攻击面——工具与自主性
专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract)
AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SoK:代理AI的攻击面——工具与自主性
专题命中 工具调用 :agentic(title,abstract);agent(abstract);multi-agent(abstract)
AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。
OpenVisTool:用于合成具有指导性的视觉工具使用轨迹的开源方案
专题命中 工具调用 :tool-use(title,abstract);tool use(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出OpenVisTool框架,构建含因果监督的视觉工具使用轨迹数据集OpenVisTool-42K,微调后模型视觉工具使用性能提升,大模型接近领先闭源系统。
EviBack:通过证据约束的教师退避进行搜索智能体强化学习
专题命中 工具调用 :agent(title);agentic(abstract);分类 cs.AI
AI总结 研究针对智能体RAG系统中全零展开组问题,提出EviBack方法,通过证据约束教师退避提供辅助监督。利用全自动管道生成两阶段教师,提升了下游F1等指标,在多个问答基准上取得更好效果。
CuSearch:通过搜索深度进行课程展开采样以实现代理RAG
机构 * Nanjing University(南京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; University of Hong Kong(香港大学)
专题命中 工具调用 :agentic(title,abstract);分类 cs.AI
AI总结 本文提出CuSearch,通过搜索深度贪心分配策略改进代理RAG训练,提升检索监督密度,实验显示在ZeroSearch上性能提升达11.8个精确匹配点。
Comments The paper has been accepted by COLM 2026. Code: https://github.com/MrToser/CuSearch
论智能体工具调用与强化学习训练的有效性与效率
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
专题命中 工具调用 :agentic(title);分类 cs.AI、cs.LG
AI总结 本文系统分析工具调用评估中的实现选择对结果敏感性的影响,并针对强化学习训练中的计算浪费提出两种加速技术。
Comments ICML 2026
AgentSnare:学习延迟、转移和瓦解自主渗透智能体
专题命中 工具调用 :agent(abstract);分类 cs.CL、cs.LG
AI总结 AgentSnare是一种轨迹自适应欺骗系统,通过动态构建诱饵环境,吸收渗透智能体工具调用、转移其轨迹并瓦解攻击,在CVE-Bench实验中成功阻止了所有真实目标被利用。
无限期随机规划的对偶动态规划
专题命中 工具调用 :planning(abstract)
AI总结 针对无限期随机规划,本文提出CE-Inf-EDDP算法,通过整合割共享等策略提升迭代复杂度,在报童及水火电规划问题中大幅缩短迭代时间并改善解质量。
Comments Major revision updates
StepPO: 面向智能体强化学习的步骤对齐策略优化
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 规划决策 :agent(title,abstract);agentic(abstract,abstract_cn);分类 cs.CL
AI总结 提出StepPO,一种步骤级策略优化方法,通过将智能体强化学习从token级MDP重构为步骤级MDP并引入步骤级信用分配,以解决现有算法在智能体决策粒度上的不匹配问题,在多跳问答等任务上优于多种RL算法。
CARD:用于信用卡模拟的受控智能体Reddit讨论框架
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; U.S. Bank(美国银行) ; Stanford University(斯坦福大学)
专题命中 规划决策 :agentic(title,abstract_cn);planning(abstract);分类 cs.AI
AI总结 本研究提出CARD框架,通过规划器、生成器与校准循环,结合多维度控制项生成逼真信用卡讨论线程,经多指标评估,其效果优于多种LLM模拟基线。
Evo-Bench:语言模型能否改进智能体框架?
专题命中 规划决策 :agent(title,abstract);autonomous agent(abstract);分类 cs.CL
AI总结 本研究推出首个智能体框架进化基准Evo-Bench,评估语言模型的自主框架优化能力,发现其在通用、搜索任务中优于人工框架,在办公任务中表现不佳,且合成框架可迁移提升各类模型。
CastFSR:用于上下文感知时间序列预测的快慢反思智能体推理框架
专题命中 规划决策 :agentic(title,abstract);workflow(abstract);分类 cs.AI
AI总结 本研究提出CastFSR智能体框架,将上下文感知时间序列预测建模为快慢反思工作流,通过实验证明其在公共数据集上的表现优于代表性基线。
SearchArt:使用可扩展的合成和经过验证的任务训练长视野搜索代理
专题命中 规划决策 :agent(title);tool-use(abstract);planning(abstract);分类 cs.LG
AI总结 针对训练长视野搜索代理的挑战,SearchArt提出通过验证驱动任务合成及多阶段训练管道的框架,构建大规模数据集并验证数据可靠性,经此训练的代理在多基准测试中表现出色,参数少却成绩优异。
DAEP:面向医学视频语料时序答案 grounding 的难度感知证据规划
机构 * TikTok, ByteDance(字节跳动TikTok) ; Beijing Institute of Graphic Communication(北京印刷学院) ; Lingnan University(岭南大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.CL
AI总结 BIGC团队提出DAEP方案,通过多模态证据排名与难度感知规划,在NLPCC 2026共享任务中以0.2728的平均得分获第一名,提升了医学视频时序答案定位的性能。
Comments 12 pages, 2 figures, 5 tables, accepted by NLPCC 2026 Shared Task Track 3
当批评如何提升AI辅助理论物理?SCALAR:用于代理推理的结构化批评-代理循环
机构 * Department of Physics, CCTP ; ITCP, University of Crete, 71303, Greece ; Centre for Theoretical Physics, Department of Physics ; Astronomy, Queen Mary University of London, London E1 4NS, United Kingdom ; Theoretical Physics Department, CERN, Geneva, Switzerland
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 本文研究了研究人员与代理交互对AI辅助理论物理研究的影响,通过SCALAR框架评估不同交互结构对科学发现的促进作用。
Comments V2. Expanded experiments. Accepted at ICML 2026 Workshop (AI4Physics); 18 pages; 9 figures
计划任务防护:通过使其不可解来检测和修复计划任务中的缺陷
机构 * J.P. Morgan AI Research(摩根大通人工智能研究)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
AI总结 本文提出计划任务防护方法,通过最小修改使计划任务不可解来检测和修复缺陷,验证了算法在不同规模任务中的有效性。
时间拉直用于隐式规划
机构 * New York University(纽约大学) ; Brown University(布朗大学) ; University of Toronto(多伦多大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.LG
AI总结 受人类视觉处理中感知拉直假说启发,提出时间拉直方法,通过曲率正则化联合学习JEPA世界模型的编码器和预测器,改善隐式规划中的表示学习,使梯度规划更稳定并提高目标到达任务成功率。
Comments ICML2026 Camera Ready
用于零样本物体目标导航的分层快慢ReAct智能体
专题命中 规划决策 :agent(title,abstract)
AI总结 该研究针对零样本物体目标导航,提出分层快慢ReAct智能体,结合价值图控制器与坐标锚定记忆及VLM,在HM3D、MP3D验证集上取得零样本方法最高成功率,远前沿审议可提升性能。
Comments 11 pages, 6 figures
基于高斯人类代价函数的MPPI规划用于社交导航
机构 * VJTI(维杰拉吉·鲁勒学院(VJTI))
专题命中 规划决策 :planning(title,abstract)
AI总结 该研究针对普通MPPI规划低估动态场景风险的问题,提出PGIF方法,结合高斯排斥场实现0%碰撞率,同时保持实时规划性能,适用于社交导航。
Comments Will appear in Springer's Proceedings in Advanced Robotics series
基于采样的可视性任务规划
机构 * School of Mechanical Engineering, Tel-Aviv University(特拉维夫大学机械工程学院)
专题命中 规划决策 :planning(title,abstract)
AI总结 本文针对视觉传感器等可视性设备,提出VisPRM和VisRRT两种新型采样TAMP算法,经仿真与物理实验验证,其成功率和运行效率优于RRT、PRM等适配算法。
Comments Accepted to IEEE RA-L
通过仿真评估的随机优化方法增强滚动时域生产计划
专题命中 规划决策 :planning(title,abstract)
AI总结 该研究将场景随机规划融入滚动时域框架,经仿真对比发现,无缓冲高拥堵环境中随机优化比MRP降本最多68%,引入安全库存后确定性优化占优,为生产计划管理提供了见解。
跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准
机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Harvard Business School, Harvard University(哈佛大学哈佛商学院)
专题命中 规划决策 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。
Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习
机构 * Purdue University(普渡大学) ; Carnegie Mellon University(卡内基梅隆大学) ; WorldQuant University(WorldQuant大学) ; UC Berkeley(加州大学伯克利分校) ; Aix-Marseille University(阿维尼翁-马赛大学) ; MIT(麻省理工学院) ; University of Zurich(苏黎世大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Stuttgart(斯图加特大学) ; University of Buenos Aires(布宜诺斯艾利斯大学) ; California State University, Fresno(弗雷斯诺加州州立大学) ; University of Chicago(芝加哥大学)
专题命中 规划决策 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG
AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。
Comments RLC 2026: Accepted to Finding the Frame Workshop
MT-PingEval:通过私人信息游戏评估多轮协作
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.CL、cs.LG
AI总结 MT-PingEval通过私人信息游戏评估语言模型在多轮协作中的表现,发现其在规划和执行多轮对话方面存在显著缺陷,并强调了提高对话连贯性和信息管理的重要性。
Comments CoLM camera-ready version
LLM推理的周期表:推理范式、方法与失败模式的结构化综述
机构 * Singapore Institute of Technology(新加坡理工大学) ; Nvidia AI Center (SNAIC)(英伟达人工智能中心(SNAIC)) ; MIDAS Lab, IIIT Delhi(IIIT德里MIDAS实验室) ; MIDAS Lab, IIT Mandi(IIT曼迪MIDAS实验室) ; Owl Autonomous Imaging, Inc.(Owl自主成像公司) ; College of Computing & Data Science, NTU Singapore(新加坡南洋理工大学计算与数据科学学院) ; NVIDIA AI Technology Centre, Singapore(英伟达新加坡人工智能技术中心) ; Department of Computer Science and Engineering, IIT Kanpur(IIT坎普尔计算机科学与工程系)
专题命中 规划决策 :tool use(abstract);agentic(abstract);分类 cs.CL
AI总结 本文系统综述了300多篇论文,提出LLM推理研究的结构化分类法,涵盖多种推理范式,分析方法论趋势,并总结常见限制与失败模式,旨在为开发更鲁棒、可解释和可泛化的推理系统提供参考。
欧几里得-MCP:一个通过Prolog进行确定性逻辑推理的模型上下文协议服务器
专题命中 规划决策 :agentic(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 研究针对大型语言模型多步逻辑推理不可靠问题,提出开源的欧几里得-MCP服务器,通过引入欧几里得-IR及支持特定循环的工具接口实现确定性逻辑推理,经评估在处理大问题时效果优于LLMs,可作稳定推理基础。
UXCascade: 可扩展的可用性测试与模拟用户代理
专题命中 规划决策 :agent(abstract);workflow(abstract)
AI总结 UXCascade通过多级分析工作流程,帮助从业者在早期界面开发中实现迭代反馈,通过提取、汇总和展示代理生成的可用性反馈,支持可操作的设计改进。
Comments 10 pages, 7 figures, accepted at UIST 2026
为生产大语言模型代理选择和组合运行时架构模式的方法
机构 * AI Architect, Independent Researcher(人工智能架构师,独立研究员) ; Stanford School of Engineering(斯坦福大学工程学院)
专题命中 规划决策 :agent(abstract,comments);分类 cs.AI、cs.SE
AI总结 本文提出了一种方法,用于选择和组合运行时架构模式,以定义大语言模型代理的随机-确定性边界,并探讨其在不同代理类型中的应用及可靠性分解。
Comments 26 pages, 2 figures, 6 tables. Companion repo at https://github.com/vasundras/agent-runtime-patterns
努力而非明智:推理模型无法在不同问题间合理分配测试时计算资源
专题命中 规划决策 :planning(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出考试式评估框架发现推理模型无法在不同难度分值的问题间合理分配共享测试时计算预算,明确规划提示可使分配更均匀但仍不敏感于分值难度,全局预算分配是现有模型未掌握的独特能力。
策略掩码私有专家:稀疏混合专家(MoE)模型中的可审计可逆能力访问控制
专题命中 规划决策 :tool use(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出Policy-Masked Private Experts方法,在稀疏MoE模型中实现可审计可逆的能力访问控制,经Qwen、DeepSeek等实验验证其能严格限制未授权访问并保留私有分支效用。
Comments 14 pages, 1 figure, 8 tables. Corrected the DeepSeek decoding and evaluation results and updated the corresponding analysis; corrected the mathematical statement of the frozen-parameter guarantee; clarified paired statistical inference; expanded related work and corrected references
TS-Mob:面向人类移动性预测的社交与地理感知时间序列基础模型框架
机构 * MobS Lab, Bruno Kessler Foundation(布鲁诺·凯瑟林基金会移动实验室) ; Department of Computer Science, University of Trento(特伦托大学计算机科学系)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 TS-Mob框架通过结合地理社交信号与天气协变量微调TimesFM模型,在多类移动性预测基准上显著优于各类基线,且在不同时间区间表现稳健。