WebMCP Tool Surface Poisoning: Runtime Manipulation Attacks on LLM Agents
WebMCP工具表面投毒:针对LLM智能体的运行时操纵攻击
专题命中 工具调用 :agent(abstract);AI agent(abstract)
AI总结 本文提出一种新的威胁——会话中工具注入(MSTI),通过第三方脚本在活跃会话中注入恶意工具,并细分为工具劫持和工具框架两类,实验证明可破坏WebMCP功能,最后给出缓解方向和安全设计建议。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
WebMCP工具表面投毒:针对LLM智能体的运行时操纵攻击
专题命中 工具调用 :agent(abstract);AI agent(abstract)
AI总结 本文提出一种新的威胁——会话中工具注入(MSTI),通过第三方脚本在活跃会话中注入恶意工具,并细分为工具劫持和工具框架两类,实验证明可破坏WebMCP功能,最后给出缓解方向和安全设计建议。
从言语到思想:通过结构化消息传递实现可扩展的多LLM聚合
专题命中 工具调用 :agent(abstract);multi-agent(abstract)
AI总结 提出基于二分因子图的消息传递框架,通过语义层集成多个LLM的输出分布,实现高效、可扩展的多模型聚合,在降低97%令牌使用和6倍API调用的同时,性能优于现有方法。
LLM代理的一致性如何?测量多步工具调用流水线中的行为可重复性
机构 * Independent Researcher(独立研究者)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 研究多步工具调用LLM代理在重复相同调用时是否选择相同工具、顺序和参数,通过系统实验测量行为一致性,并发现代理存在显著不一致性。
Comments 16 pages, 6 figures
网络安全AI(CAI)数据集
专题命中 工具调用 :agent(abstract);AI agent(abstract)
AI总结 提出CAI数据集,一个包含十四个月网络安全LLM轨迹的大规模语料库,旨在解决专家操作轨迹是LLM性能瓶颈的问题,并揭示了集中化API提供商带来的安全风险。
带障碍物的移动目标车辆路径问题的最优解:懒惰分支定价法
机构 * Robotics Institute at Carnegie Mellon University(卡内基梅隆大学机器人学院) ; Mechanical and Aerospace Engineering at Michigan Technological University(密歇根理工大学机械与航空航天工程系) ; Robotics and AI Institute(机器人与人工智能研究所) ; UM-SJTU Joint Institute and Department of Automation at Shanghai Jiao Tong University(上海交通大学与美国密歇根大学联合研究所及自动化系) ; Department of Mechanical Engineering and Department of Computer Science and Engineering at Texas A&M University(德克萨斯农工大学机械工程系和计算机科学与工程系)
专题命中 工具调用 :agent(abstract);planning(abstract)
AI总结 针对带障碍物的移动目标车辆路径问题(MT-VRP-O),提出懒惰分支定价法(Lazy BPRC),通过松弛连续性约束的延迟成本计算和凸集图搜索,实现最优解并显著加速。
OpenClaw 中的安全、隐私与伦理风险
专题命中 工具调用 :agent(abstract);AI agent(abstract)
AI总结 本文系统研究了本地可执行AI代理系统OpenClaw在安全、隐私、伦理及可追溯性方面的风险,并呼吁多方合作构建更安全可靠的AI代理系统。
Comments Accepted by Journal of Information and Intelligence(JII)
GenEvolve: 通过工具编排的视觉经验蒸馏实现自我进化的图像生成智能体
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Meituan(美团) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 工具调用 :agent(abstract);agentic(abstract)
AI总结 提出GenEvolve框架,通过工具编排的视觉经验蒸馏,使图像生成智能体在多样化任务中自我进化,提升工具使用和生成质量。
TSR:用于LLM代理多轮RL的轨迹搜索
机构 * Technical University Munich(慕尼黑技术大学) ; IBM Research(IBM研究院)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出TSR,一种在训练时改进每轮轨迹生成的方法,通过轻量级树状搜索构造高质量轨迹,提升rollout质量和学习稳定性,适用于多轮RL任务。
为LLM代理的安全性需要意图到执行的完整性
专题命中 工具调用 :agent(abstract);agentic(abstract)
AI总结 本文提出了一种新的正确性属性,用于定义LLM代理在执行时如何忠实反映用户的意图,同时提出了四个必须同时满足的完整性属性,以确保代理的安全性。
TIER: 用于多步工具组合的轨迹不变执行奖励
机构 * UC San Diego(加州大学圣迭戈分校) ; Cisco Research(思科研究)
专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出TIER,一种基于函数模式和运行时执行的奖励框架,能够提供密集且可解释的序列级反馈,支持多种解决方案策略并适应变化的工具接口,在DepthBench等基准上实现了高准确率。
Comments Preprint. Submitted to NeurIPS 2026. 28 pages, 7 figures, 8 tables. Code and datasets available at https://github.com/anaykulkarni/TIER
通过超越128K上下文的泛化有效训练长上下文视觉-语言模型
机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系)
专题命中 工具调用 :tool use(abstract);agentic(abstract)
AI总结 本文研究了长上下文视觉-语言模型的持续预训练,通过平衡数据和检索优化,提出MMProLong模型在长文档VQA等任务中表现优异,且能扩展至更长上下文和多任务场景。
Comments work in progress
对话追踪:测量AI聊天机器人上的内容和身份曝光
专题命中 工具调用 :agent(abstract,abstract_cn)
AI总结 研究系统测量20种流行AI聊天机器人上的网络追踪,发现17种共享至少一个第三方信息,3种通过Microsoft Clarity分享对话文本,15种通过广告、分析或社交端点共享URL或标识符。
EGSS: 基于熵引导的逐步缩放以实现可靠的软件工程
机构 * Ant Group(蚂蚁集团)
专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 EGSS通过熵引导的自适应搜索和稳健的测试套件增强,解决了代理测试时间缩放中的计算开销问题,提升了性能并降低了推理时间。
在无状态执行环境中模拟复杂多轮工具调用交互
机构 * IBM Research AI(IBM人工智能研究院)
专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出DiGiT-TC方法,用于生成无状态环境下多轮工具调用对话,通过新颖的生成模式隐式表示工具调用,验证了在有状态问题设置中取得显著性能提升。
基于大语言模型的化学合成与设计决策程序
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑校区) ; National Centre of Competence in Research (NCCR) Catalysis(催化领域竞争力研究国立中心) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学)
专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出利用大语言模型增强的 retrosynthesis 规划方法,通过高效编码反应路径和新的路线搜索策略,提升多步合成规划与可合成分子设计能力。
Comments ICML 2025
CASCADE:基于案例的连续适应:在部署期间为大型语言模型进行持续适应
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, Jilin University(吉林大学知识驱动人机智能工程研究中心) ; International Center of Future Science, Jilin University(吉林大学未来科学国际中心) ; Department of Informatics, King’s College London(伦敦国王学院信息学院) ; The Alan Turing Institute(艾伦·图灵研究所) ; AI Centre, Department of Computer Science, UCL(UCL计算机科学系人工智能中心)
专题命中 工具调用 :tool use(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出CASCADE框架,通过在部署期间持续学习提升LLM性能,实现20.9%的提升,并在多个领域任务中优于基线方法。
LLM-AutoDP: 通过LLM代理实现模型微调的自动数据处理
机构 * Ant Group(蚂蚁集团)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出LLM-AutoDP框架,利用LLM代理自动生成和优化数据处理策略,通过迭代学习机制提升处理质量,同时减少隐私风险和人工成本。
Comments Accepted by VLDB2026
学习提问:当LLM代理遇见模糊指令
机构 * Renmin University of China(中国人民大学) ; The Chinese University of Hong Kong(香港中文大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) ; Johns Hopkins University(约翰霍普金斯大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 本文提出AwN框架,通过让LLM在遇到模糊指令时主动提问以提升工具使用性能,并设计自动化评估工具ToolEvaluator,验证了在NoisyToolBench基准下的优越性。
Comments EMNLP 2025
科学的软件空间
专题命中 工具调用 :tool use(abstract);workflow(abstract)
AI总结 研究通过分析130万篇论文中的软件提及,揭示科学领域软件工具的结构化分布及学科间工具组合的演变。
元工具:用于小语言模型的高效少样本工具适应
机构 * LexisNexis, USA(LexisNexis美国公司)
专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文通过Meta-Tool研究小语言模型是否能在不复杂适应机制下实现强工具使用性能,发现超网络适应无显著提升,提示应关注提示工程与示例整理。
Comments Accepted to Findings of ACL 2026
基于ECLASS的语义产品搜索增强
专题命中 工具调用 :agent(abstract);autonomous agent(abstract)
AI总结 本文提出利用LLM密集检索和ECLASS层次语义提升电子元件语义搜索效果,实验显示其在准确率和效率上均优于传统方法。
DR-MMSearchAgent:多模态搜索代理中的深度推理
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ; East China Normal University(东华大学) ; Shanghai Innovation Institute(上海创新研究院) ; University College London(伦敦大学学院) ; Independent Researcher(独立研究者) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 工具调用 :agent(abstract);agentic(abstract)
AI总结 本文提出DR-MMSearchAgent框架,通过结构接近性从完整批处理轨迹中提取优势信号,提升不同长度轨迹的生成能力,并采用差异化高斯奖励动态校准交互容忍度,以提高信息可靠性并减少冗余。
AdaExplore: 基于失败的适应与多样性保持搜索用于高效内核生成
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学) ; Arm Ltd(Arm有限公司)
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 AdaExplore通过积累执行反馈实现自我改进,通过失败驱动适应和多样性保持搜索提升内核生成的正确性和优化性能,无需额外微调或外部知识。
Comments Preliminary work. The implementation is available at https://github.com/StigLidu/AdaExplore
SealQA: 提升搜索增强语言模型在事实性问题中的推理能力
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 工具调用 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 SealQA是一个新的挑战性基准,用于评估搜索增强语言模型在事实性问题上的能力,揭示当前模型在处理冲突、噪声或无用搜索结果时的局限性。
Comments Camera Ready version for ICLR 2026
基于大型语言模型的异构数据源中缺失人员情报提取与验证方案
机构 * Old Dominion University(欧道明大学)
专题命中 工具调用 :planning(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出Guardian Parser Pack,通过AI驱动的解析与规范化流程,将多源调查文档统一为符合模式的表示,提升缺失人员情报的提取与验证效率,同时展示系统架构及性能评估结果。
Comments 9 pages, 6 figures. Accepted at International Conference on Intelligent Digitization of Systems and Services (IDSS 2026)
超越点击:一种从行为日志中推断认知轨迹的框架
专题命中 工具调用 :agent(abstract);multi-agent(abstract)
AI总结 本文提出一种基于信息觅食理论的框架,通过标注公开数据集生成认知标签,验证认知轨迹在行为特征薄弱时的显著提升效果,并开源工具和代码以支持未来认知感知用户模拟研究。
Journal ref Proceedings of the 48th European Conference on Information Retrieval (ECIR 2026)
通过原理性提升大语言模型的注意力来实现指令遵循
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 工具调用 :tool-use(abstract);分类 cs.AI、cs.CL、cs.LG
AI总结 本文提出InstABoost方法,通过提升指令相关注意力来增强指令遵循,避免了其他方法的缺陷,提升了指令引导与任务相关上下文的平衡。
PHANTOM手
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 工具调用 :tool-use(abstract);planning(abstract)
AI总结 PHANTOM手通过结合精确分析形状与鲁棒合规抓取,实现自由运动规划的亚度精度和连续可预测力输出,提升欠驱动手的负载与灵活性。
Comments 8 pages. Submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026
放射治疗中的全面剂量学验证与位置敏感性分析:一种用于 HDR 和 LDR 治疗的统一 ESAPI 工具
专题命中 工具调用 :planning(abstract);workflow(abstract)
AI总结 本文提出了一种基于 Varian Eclipse Scripting API 的独立软件工具,用于验证 HDR 和 LDR 放射治疗的 QA,通过比较点源和线源模型,分析位置不确定性,并提高临床工作流程的安全性。
Comments 13 pages, 2 tables, 5 figures
未来无车道城市基础设施的容量
专题命中 工具调用 :agent(abstract);multi-agent(abstract)
AI总结 本文通过分析与仿真方法探讨了未来无车道城市交通的潜在容量和空间效率,提出OptWULF方法实现了无车道交叉口的高效管理,验证了容量与街道宽度的连续关系及对称需求模式的适应性。
Comments 9 pages, 8 figures, submitted to IEEE Transactions on Intelligent Transportation Systems