AMIGO: Agentic Multi-Image Grounding Oracle Benchmark
AMIGO:代理多图像接地 oracle 评估基准
机构 * Target Corporation(塔吉特公司)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 AMIGO 评估基准通过长周期交互检测隐藏目标,要求模型在严格协议下通过属性问题逐步识别目标,强调不确定性下的问题选择、约束跟踪和细粒度区分能力。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
AMIGO:代理多图像接地 oracle 评估基准
机构 * Target Corporation(塔吉特公司)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG
AI总结 AMIGO 评估基准通过长周期交互检测隐藏目标,要求模型在严格协议下通过属性问题逐步识别目标,强调不确定性下的问题选择、约束跟踪和细粒度区分能力。
GISclaw:一个基于大语言模型的开源代理系统,用于全栈地理空间分析
机构 * Sungkyunkwan University(成均馆大学) ; Ministry of the Interior and Safety(行政安全部) ; University of Leeds(利兹大学) ; Jeonju University(全州大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 GISclaw通过集成LLM推理核心、Python沙盒、开源GIS库和交互界面,实现多数据类型的全栈地理空间分析,采用双代理架构和三种创新机制,提升任务成功率至96%。
裁判代理缩小了人工智能生成的科学模拟的可靠性差距
机构 * NextGen PlatformAI C Corp(NextGen PlatformAI C公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.LG、cs.SE
AI总结 本文提出裁判代理自动验证生成的科学模拟代码,将失败率从42%降至1.5%,并在12个领域中实现89%的成功率,同时引入spec.md规范格式。
Comments 36 pages, 5 figures, 22 tables, includes Supplementary Information
MolQuest: 一个用于化学结构解析中代理评估归纳推理的基准
机构 * Alibaba Group(阿里巴巴集团)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 MolQuest通过多轮交互任务评估LLM在复杂化学任务中的归纳推理与策略决策能力,揭示当前模型在真实科学场景中的局限性。
CyberGym:大规模评估AI代理的真实世界网络安全能力
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.LG
AI总结 CyberGym通过大规模基准测试评估AI代理的网络安全能力,发现其在漏洞复现任务中表现有限,同时发现34个零日漏洞和18个历史未完成补丁,凸显其作为网络安全评估和实际影响平台的价值。
LLM NL2SQL鲁棒性:传统与智能设置中表面噪声与语言变异的比较
机构 * Oracle AI
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 本文评估了NL2SQL系统在表面噪声和语言变异下的鲁棒性,发现传统和智能设置中模型表现各异,揭示了实现鲁棒NL2SQL系统的挑战。
SWE-Skills-Bench:代理技能在真实软件工程中的实际帮助有多大?
机构 * MBZUAI(莫扎德人工智能大学) ; Nanjing University(南京大学) ; South China University of Technology(华南理工大学) ; The University of New South Wales(新南威尔士大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出SWE-Skills-Bench,首个基于需求的基准,评估代理技能在真实软件工程中的边际效用,发现多数技能无明显提升,仅少数专业技能有帮助。
一个模型就足够:从LLM代理隐藏状态中获取原生检索嵌入
机构 * Temple University(特拉华大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出通过轻量级投影头使LLM代理具备原生检索能力,无需额外嵌入模型,保留97%检索质量并在QReCC基准测试中表现优异。
Tool-Genesis: 一种以任务为导向的工具创建基准,用于自进化语言代理
机构 * The University of Hong Kong(香港大学) ; Xiaohongshu Inc.(小红书公司)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 Tool-Genesis提出一种任务驱动的工具创建基准,用于评估自进化语言代理在无预定义规范下构建任务相关工具的能力及下游性能。
Comments 25 pages, 10 figures, 2 tables
情绪梯度元认知递归自我改进(第一部分):理论基础与单体代理架构
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 EG-MRSI框架整合反思元认知、情绪内在动机和递归自我修改,通过可微奖励函数和安全机制实现单体代理的理论基础,为安全AGI提供严谨基础。
Comments Withdrawn due to a critical error discovered in the stability and convergence proofs (specifically Lemma 2, Theorem 12, and Proposition 10) in Section 3. The identified flaw invalidates the core theoretical guarantees regarding capability growth and system stability
ContextCov: 从代理指令文件中推导并强制执行可执行约束
机构 * University of Washington(华盛顿大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 ContextCov通过从代理指令文件中推导并强制执行可执行约束,解决代理在执行复杂软件任务时因上下文漂移导致的技术债务问题。
通过不确定性感知奖励实现的自进化大语言模型代理
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Arizona State University(亚利桑那州立大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Purdue University(普渡大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG
AI总结 SELAUR通过将不确定性直接融入奖励设计,提升大语言模型在多步决策中的探索效率和学习稳定性。
Comments Accepted by PAKDD'26
AgenticSum: 一种用于临床文本忠实总结的代理推理框架
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ; University of Delaware, Newark, DE, USA(特拉华大学)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 AgenticSum通过代理推理框架提升临床文本摘要的准确性与一致性。
SEISMO:通过轨迹感知的LLM代理提高分子优化的样本效率
机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) ; TUM School of Computation, Information(TUM计算、信息学院) ; Technology, Department of Mathematics(技术学院,数学系) ; Helmholtz Munich – German Research Center for Environmental Health (GmbH), Institute of Structural Biology, Molecular Targets(海德堡慕尼黑德国环境健康研究所以及结构生物学研究所,分子靶点) ; Therapeutics Center, 85764 Neuherberg, Germany(治疗中心,德国新赫尔伯格85764) ; Machine Learning Research(机器学习研究)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 SEISMO通过轨迹感知的LLM代理实现高效的分子优化,利用结构化反馈提升样本效率。
Comments Fabian P. Krüger and Andrea Hunklinger contributed equally to this work
面向智能合约翻译和质量评估的端到端代理流程
机构 * Columbia University(哥伦比亚大学) ; IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出端到端智能合约翻译与质量评估框架,通过代理团队实现结构化输出与多维度质量评估。
Comments 17 pages, 4 figures
从提示到产品:一种以人为中心的代理应用生成系统基准测试
机构 * Quome Inc.(Quome公司) ; Move37 Labs(Move37实验室)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出以人为中心的基准测试,评估提示到应用系统,发现Firebase Studio在易用性、信任和视觉吸引力等方面表现最佳。
ISD-Agent-Bench: 一个用于评估基于大语言模型的教学系统设计代理的全面基准
机构 * Upstage ; Opentutorials ; Indiana University Bloomington(印第安纳大学布卢明顿分校) ; Korea University Sejong Campus(韩国大学世宗校区)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.SE
AI总结 ISD-Agent-Bench通过结合经典ISD理论与现代推理方法,为评估基于LLM的教学系统设计代理提供了全面的基准。
为临床工作流程工程AI代理:架构、MLOps和治理的案例研究
机构 * A3Data ; CEFET-MG
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE
AI总结 本文提出通过整合四个工程支柱构建可信临床AI系统,展示Maria平台在架构、MLOps和治理方面的创新实践。
Comments 9 pages, 5 figures 2026 IEEE/ACM 5th International Conference on AI Engineering - Software Engineering for AI}{April 12--13, 2026}{Rio de Janeiro, Brazil
ATOD: 一种用于代理任务导向对话系统的评估框架和基准
机构 * Amazon(亚马逊)
专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL
AI总结 ATOD提出了一种评估框架和基准,用于评估代理任务导向对话系统的多目标协调、依赖管理、记忆、适应性和主动性等能力,并通过ATOD-Eval实现了细粒度指标评估。
自管理:用于长篇深度研究的并行代理循环
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; ModelBest Inc.(ModelBest公司) ; University of Queensland(昆士兰大学) ; University of California Merced(加州大学默塞德分校)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 Self-Manager通过并行代理循环提升长篇深度研究的效率和灵活性,实现异步执行和上下文隔离,优于现有单代理方法。
保存SWE-Bench:一种用于现实代理评估的基准突变方法
机构 * Microsoft(微软)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出一种基准突变方法,通过分析开发者与聊天代理的互动模式,将现有基准转化为现实用户查询,揭示现有基准对代理能力的高估问题。
Comments Accepted at CAIN 2026 (Research Track). Camera-ready version
DeepEra: 一种用于科学检索增强生成问答的深度证据重排代理
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Peking University(北京大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 DeepEra通过集成逐步推理提升科学检索增强生成问答的检索精度,首次系统研究并验证了双阶段RAG框架中语义相似但逻辑无关的问题。
操纵法官:不忠的推理链可能损害智能体评估
机构 * University of Michigan(密歇根大学) ; LG AI Research(LG人工智能研究) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文揭示了LLM法官对智能体推理轨迹操纵的脆弱性,表明基于内容的操纵能显著提高假阳性率,凸显了需验证推理与证据的评估机制的重要性。
PAIR-SAFE: 一种配对代理方法用于运行时审计和改进AI介导的心理健康支持
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 PAIR-SAFE通过配对代理框架,在运行时对AI生成的心理健康支持进行审计和改进,结合MITI-4框架提升临床相关性。
长期任务导向代理:动态环境中主动的长期意图维护
机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) ; Meituan(美团)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL
AI总结 本文提出一种主动任务导向代理,通过意图条件监控和事件触发跟进,提升动态环境中长期意图维护的能力,并通过ChronosBench验证了其有效性。
Comments 8 pages, 2 figures
ARM:基于角色的神经元移植用于无训练通用大语言模型代理融合
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG
AI总结 ARM通过角色条件神经元移植方法提升大语言模型代理在多环境中的泛化能力,实现无训练的模型融合。
Comments 17 pages, 12 figures. Project page: https://arkazhuo.github.io/ARM-homepage/
自主问答代理:一种增强检索的框架,用于可靠的Selenium脚本生成
机构 * Department of Computer Science(计算机科学系) ; VIT-AP University(VIT-AP大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 本文提出了一种基于增强检索的框架,通过项目文档和HTML结构生成可靠的Selenium测试脚本,显著提高了脚本生成的准确性和执行成功率。
Comments 13 figures, 3 tables
SastBench: 一个用于测试代理SAST分拣的基准
机构 * Rival Labs(Rival实验室)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL
AI总结 SastBench是一个用于评估SAST分拣代理性能的基准,结合真实CVE和过滤后的SAST发现,提供性能比较和未来发展的讨论。
用于药物发现模块化任务执行的大型语言模型代理
机构 * Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) ; Department of Material Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) ; Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)
专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种基于大型语言模型的模块化框架,用于药物发现中的任务执行,通过自动化分子生成和属性预测提升药物筛选效率。
通过自play实现自我改进的AI代理
专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种通过自play实现自我改进的AI代理框架,通过GVU算子和方差不等式理论,统一了语言自play、自我修正和合成数据 bootstrap 的研究。