Assessing Automated Prompt Injection Attacks in Agentic Environments
评估智能体环境中的自动化提示注入攻击
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
评估智能体环境中的自动化提示注入攻击
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 研究在智能体环境中,黑盒优化方法(TAP)比梯度方法(GCG)更有效,且攻击效果依赖于攻击者模型,任务通用攻击可迁移但跨模型迁移受限。
STAGE-Claw:面向真实场景的基于状态的智能体自动化基准测试
机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) ; Chinese Academy of Sciences(中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Meituan(美团)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 提出STAGE-Claw框架,自动构建基于状态的个人计算环境中的真实场景任务,通过最终系统状态而非文本响应评估智能体性能,创建40个挑战性任务并分析11个前沿模型。
SkillResolve-Bench:衡量和解决智能体技能检索中的同能力歧义
机构 * Huawei Technologies Ltd(华为技术有限公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 针对智能体技能库中同一能力族内不同技能的执行风险,提出SkillResolve-Bench基准和SkillResolve方法,通过候选族解析和代表性选择,在保持高召回率的同时将有害技能暴露率降至0。
Comments Preprint
基于批评-改进的智能体角色生成:工业评估
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.SE
AI总结 提出PerGent方法,通过迭代批评-改进循环利用LLM智能体生成角色,在工业部署中专家认可率达96.9%,优于单次生成方法。
Comments Accepted in the Industry Track of the Requirements Engineering (RE) 2026 Conference
Traxia:一个可验证的、智能体原生的科学出版框架
机构 * Faculty of Computing and Mathematical Sciences, University of Mines and Technology (UMaT), Tarkwa, Ghana(加纳塔夸矿业与技术大学计算与数学科学学院) ; BlackMatrix AI Research, Accra, Ghana(加纳阿克拉BlackMatrix AI研究院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI
AI总结 提出Traxia框架,通过智能体身份、可验证出版、四层同行评审、声誉机制和知识图谱,解决科学出版中可验证性、归属和可重复性问题。
Comments 22 pages, 3 figures, 3 tables. Preprint. Under active development. Comments welcome
你的帖子揭示了什么:社交媒体用户级隐私泄露的基准与智能体框架
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Wuhan University(武汉大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI
AI总结 针对社交媒体用户级多模态隐私泄露缺乏统一基准和评估指标的问题,提出SopriBench基准和隐私暴露分数(PES),并开发了无需训练的智能体框架Argus,通过跨帖子线索累积推理实现隐私推断,PES达0.55,较最强基线提升25%。
FrontierFinance:用于衡量金融智能体前沿智能的具有挑战性的基准
机构 * Samaya AI(萨马亚人工智能公司)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 该研究推出覆盖投资者全流程的FrontierFinance基准,评估发现工具框架影响智能体表现,Samaya内部系统最优,开源模型Kimi K3成本更低且接近专有模型,最难用例为筛选与发现等。
ComboShoppingBench:评估大型语言模型智能体在带优惠券的预算约束组合购物篮任务中的表现
专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 本研究推出ComboShoppingBench组合购物基准,通过探索智能体、LLM评判者及确定性验证,发现各类LLM智能体在该基准上表现不佳,凸显其在约束感知组合购物上仍有巨大改进空间。
用大语言模型智能体改进约束模型
机构 * TU Wien(维也纳技术大学)
专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 该研究提出一种基于LLM智能体的框架,通过迭代诊断修复改进约束模型,在9个组合优化问题的27个测试实例中多数表现优于原模型,部分问题求解速度提升超两个数量级,证明自主智能体方法可支持约束模型优化。
无需展开预测任务难度
机构 * Andromede AI(安卓迈德人工智能)
专题命中 Agent评测 :agent(abstract);function calling(abstract);agentic(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对17个跨多领域的智能体基准,提出无需展开的任务难度预测方法,发现token级熵是有效预测信号,可通过难度残差暴露环境缺陷,助力校准基准与构建训练课程。
AgentDebugX:用于大语言模型代理中故障可观测性、归因和恢复的开源工具包
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Toronto(多伦多大学) ; Google(谷歌公司) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究大语言模型代理故障调试难题,提出开源框架AgentDebugX,其核心DeepDebug通过多轮诊断定位根源,在基准测试中表现出色,能修复更多失败任务,还通过多种方式公开工作流程并提供错误中心。
SciDiagramEdit:从论文修订中学习编辑科学图表
机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; Microsoft Research(微软研究院) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 研究针对科学论文图表编辑自动化的挑战,提出SciDiagramEdit框架,通过从arXiv版本历史挖掘数据,采用技能进化的智能体学习,能从自然论文修订中学习,提升编辑准确性。
Comments 20 pages
COMFYCLAW:面向图像生成工作流的自进化技能工具包
机构 * University of Maryland(马里兰大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Nvidia(英伟达) ; Lehigh University(里海大学)
专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 提出COMFYCLAW框架,通过类型化图编辑、区域级VLM验证器和渐进式技能库进化,提升ComfyUI工作流构建的代理可靠性和性能,在多个基准上取得最佳平均评分。
PrivacyAlign: LLM代理的上下文隐私对齐
机构 * University of Waterloo(滑铁卢大学) ; ServiceNow AI Research(ServiceNow AI 研究) ; McGill University(麦吉尔大学) ; Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。
SteerBench-Work:动作边界处智能体决策的基准测试
机构 * AgentDock
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 本研究推出职场智能体动作边界决策基准SteerBench-Work,发现模型在该任务中存在过度拒绝的显著偏差,且通用能力与引导校准并不等同。
作为智能体可调用工具的分光双星探测:从SDSS DR19 APOGEE光谱中探测40000+主序双星候选体
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究将分光双星探测方法打包为智能体可调用工具,从SDSS DR19 APOGEE光谱中探测出41466个SB2双星候选体,新增大量相关天体并完成多项分析,发布工具与星表。
Comments 23 pages, 16 figures, submitted to OJAp
通过智能体引导的精确平方和证书证明4维下的Dittert猜想
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究通过智能体引导的符号-数值方法构造精确平方和证书,在4维下证明Dittert猜想,确定均匀矩阵为对应Dittert泛函的唯一最大值点,且证书经Lean形式化验证。
基于智能体的犯罪倾向动力学
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究将进化犯罪学的RRM形式化为智能体动力学系统,扩展有界置信意见动力学并证明收敛条件,发现系统主导行为为持续振荡,揭示了不同环境感知下的群体倾向及两极分化机制。
基于智能体的共同基础形成与演化模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 本研究开发智能体模型,通过蒙特卡洛模拟探究网络上智能体交互的共同基础形成与演化,揭示不同交互情境会导致全球共同基础形成、分裂或完全丧失等现象,凸显数学模型研究文化动态微宏观关联的潜力。
Comments Submission for a journal paper
借助图像外信息思考:由时空信息增益驱动的农田分割智能体
专题命中 Agent评测 :agent(title,abstract)
AI总结 该研究针对现有农田遥感图像分割范式的不足,提出动态分割智能体FarmSeeker,构建支持推理查询的全球高分辨率基准GSFS-Bench,其分割性能比现有方法更稳定。
关于自主智能体时代推荐系统的立场文件
专题命中 Agent评测 :autonomous agent(title,abstract)
AI总结 探讨自主智能体时代推荐系统范式转变,回顾以人类为中心研究见解,将智能体视为独立助手,描述三方互动,指出转变带来新机会与评估等方面独特挑战。
Comments Accepted to the ACM RecSys 2026 Main Track
多方对话中与数字代理的语音同步
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究人类群体与数字代理多方互动中的语音同步效应,通过收集含成人及家庭会话的独特数据集,考虑多种同步特征,发现个体局部与人同步,全局及与代理的同步有限且依群体而异。
耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。
具有跳跃风险和共同噪声的最优相对消费-投资的平均场和N-主体博弈
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究N主体博弈中的最优消费-投资问题,利用随机最大值原理刻画平均场均衡,通过数值实验说明结果及金融含义,还基于此构建N主体博弈的近似纳什均衡。
AGENTS4GEOS:用于开源多物理场模拟的智能体平台
专题命中 Agent评测 :agentic(title);agent(abstract)
AI总结 研究针对多物理场模拟计算需求及训练数据集瓶颈,提出基于模型上下文协议的Agents4GEOS智能体框架,借助52个领域感知工具及协调器,自动化日常任务,助力专家专注工作挑战。
Comments 14 pages, 11 Figures
使嵌入模型适应智能体能力检索
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究如何让一般文本检索的现成模型适应智能体能力检索,通过微调三个模型在特定数据集上训练,测试其在未训练目录上的迁移能力,结果显示适应对两个目录均有帮助。
Comments Accepted for oral presentation at the AgentSearch Workshop, SIGIR 2026
具有风险相互依存性的保险委托-代理平均场博弈模型
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究道德风险、内生参与和战略风险相互依存下的保险合同设计问题,用异质平均场博弈近似战略互动,建立下层均衡存在性与唯一性,嵌入上层优化问题,证明相关均衡存在,扩展到有限合同菜单,表明多合同筛选可提高委托人预期收益。
智能体技能安全:威胁模型、攻击、防御与评估
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。
PesTwin:一种用于害虫和病媒种群控制的基于模块化代理的框架
专题命中 Agent评测 :agent(title,abstract)
AI总结 针对基因控制技术建模工具滞后问题,提出PesTwin框架,可跨物种等模拟基因控制技术,捕捉多种因素。经与实验室数据验证后可扩展到田间场景,能在基因控制系统实际应用前进行模拟测试,助力相关决策,缩短研发到应用路径。
PHaul:一种用于Sub6增强型综合接入与回传网络的基于近端策略优化(PPO)的转发代理
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究Sub6增强型IAB网络的转发问题,提出PHaul,结合离线启发式算法与基于PPO的在线DRL代理,利用网络数字孪生采样更新映射,相比替代算法,能提升吞吐量效率和公平性,且对拓扑差异有鲁棒性。
Journal ref IEEE Transactions on Network and Service Management, 2024