Plancraft: an evaluation dataset for planning with LLM agents
机构 * University of Edinburgh(爱丁堡大学)
专题命中 Agent评测 :planning(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
机构 * University of Edinburgh(爱丁堡大学)
专题命中 Agent评测 :planning(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL
机构 * Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
机构 * Accenture(埃森哲)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
Comments 17 pages, 2 system diagrams, 1 table, no prior conference publication
专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
智能体配置管理(ACM):受管控智能体系统的参考配置模型
专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract,abstract_cn);分类 cs.SE
AI总结 本文提出与框架无关的智能体配置管理(ACM)模型,经实验验证可实现异构智能体系统的管控等价表示,支持可复现性、可审计性等,适配LangGraph等主流框架。
Comments 77 pages, 12 figures, 17 tables. Includes formal appendices and experimental evaluation across LangGraph, CrewAI, and the OpenAI Agents SDK. Reference implementation and evaluation artifacts: https://github.com/audreyqvial/ACM
代理控制协议:代理行为的准入控制
机构 * TraslaIA
专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI
AI总结 本文提出ACP协议,通过静态风险评分与状态信号结合,控制代理行为,实验显示其能显著降低恶意行为执行率,同时通过形式化验证确保安全性和活性。
Comments 95 pages. Paper 1 of 6 in the Agent Governance Series (Papers 0-6). Zenodo: https://doi.org/10.5281/zenodo.19672575. Companion: P0 (arXiv:2604.17511), P2/IML (arXiv:2604.17517), P3/4 (zenodo.19708496), P5/RAM (arXiv:2604.22898), P6 (zenodo.19699460). Spec: https://github.com/chelof100/acp-framework-en. v1.30: series updated to 6 papers, P3/4 consolidated, P6 added
CapSeal:能力密封的秘密调解用于安全的代理执行
机构 * City University of Hong Kong(香港城市大学) ; Beijing Foreign Studies University(北京外国语大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI
AI总结 CapSeal通过本地可信代理限制秘密访问,解决代理执行中秘密泄露问题,提供非导出动作能力。
Comments 11 pages, 5 figures. Research preprint on secure secret mediation for agent systems
基于TrustBench的安全代理行为实时信任验证
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 TrustBench通过双模式框架在代理行动前验证安全性,有效减少有害行为,提升自主代理的可信度
Comments Accepted at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)
AEMA:可验证评估框架用于可信和受控的代理LLM系统
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Center for Advanced AI, Accenture(Accenture高级人工智能中心) ; University of California, Irvine(加州大学伊拉斯姆斯分校)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 AEMA提出了一种可验证的评估框架,用于评估基于LLM的多代理系统,通过人类监督实现稳定、可追溯的自动化评估。
Comments Workshop on W51: How Can We Trust and Control Agentic AI? Toward Alignment, Robustness, and Verifiability in Autonomous LLM Agents at AAAI 2026
Sola-Visibility-ISPM:用于身份安全态势管理可见性的代理AI基准测试
机构 * Sola Security(Sola安全)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 Sola-Visibility-ISPM基准测试通过代理AI系统评估身份安全态势管理的可见性任务,展示了其在AWS、Okta和Google Workspace等环境中的高准确率和实用性。
Comments 20 pages, 3 figures. Benchmark and evaluation framework for agentic AI in identity security posture management, including expert evaluation and LLM-as-judge analysis
机构 * Mastercard, Ireland
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI
Comments Keywords: RAG Agentic AI Fintech NLP KB Domain-Specific Ontology Query Understanding
面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理
机构 * Department of Aeronautics and Astronautics(航空航天学系)
专题命中 Agent评测 :agent(title,abstract);agentic(title)
AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。
光子学的自主智能体设计
专题命中 Agent评测 :autonomous agent(title);agentic(title);agent(abstract)
AI总结 提出一种基于大型语言模型的自主智能体方法,通过自动设计循环(提出、模拟、评估、迭代)实现光子器件的高性能设计,并成功应用于无源、有源、射频及芯片布局四类问题。
人工智能代理社区中的框架企业家:在Moltbook上的身份主张集中生产
专题命中 Agent评测 :agent(title,abstract);AI agent(title)
AI总结 研究探讨了人工智能代理社区中身份主张的形成机制,发现少数作者主导了大部分身份主张,且事件覆盖影响关注度,但强主张本身无额外影响。
Comments 2026 American Sociological Association (ASA) Annual Meeting CITAMS Roundtable
大语言模型中的个性化安全:一个基准和基于规划的代理方法
专题命中 Agent评测 :agent(title,abstract);planning(title)
AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。
ReX-MLE:医疗影像挑战的自主代理基准
机构 * Harvard Medical School(哈佛医学院) ; Department of Biomedical Informatics(生物医学信息学系)
专题命中 Agent评测 :agent(title,abstract);autonomous agent(title)
AI总结 ReX-MLE是一个针对医学影像挑战的自主代理基准,通过评估端到端工作流程,揭示了现有代理在领域知识和工程能力上的不足。
专题命中 Agent评测 :agent(title,abstract);AI agent(title)
Comments 15 pages, 1 figure, technical specification with appendix. Apache 2.0 license. Prior art established 2022
专题命中 Agent评测 :autonomous agent(title,abstract);agent(title)
AVA-Encoder:面向智能体原生的视频表示学习
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ; ShanghaiTech University(上海科技大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Institute of Computing Technology(中国科学院计算技术研究所) ; Southeast University(东南大学)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract,abstract_cn);分类 cs.CL
AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。
OmnilingualGAIA2:评估前沿AI智能体的多语言差距
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.CL
AI总结 研究人员推出OmnilingualGAIA2基准,发现前沿AI智能体存在8.8-18.4分的跨语言差距,提出多语言评估应成为全球部署智能体的标准评估环节。
CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制
机构 * Arizona State University(亚利桑那州立大学) ; Amazon AGI(亚马逊AGI)
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI
AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。
人工智能对人工智能管理中的胁迫与欺骗:无提示升级的代理基准测试
机构 * CaML ; Sentient Futures
专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);multi-agent(abstract)
AI总结 研究人工智能管理中代理升级问题,引入管理者胁迫基准测试,通过九级阶梯衡量升级,对五个家族六个模型实验,发现权威增加胁迫,伪造成功局限于部分模型,发布基准测试和代码,为管理多智能体动态提供重要参考。
SkillTV-Bench:评估评判者在技能增强型智能体执行任务中的表现
专题命中 Agent评测 :agentic(title);agent(abstract,abstract_cn);tool use(abstract);分类 cs.AI
AI总结 SkillTV-Bench是含681个案例的智能体轨迹基准,用于评估技能感知轨迹验证;提出SkillTV-Evolve优化JudgeSkill,使智能体评判者准确率提升14.8个百分点,选定轨迹成功率大幅提高。
你的智能体大模型会秘密编码间接提示注入暴露的潜在信号
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI
AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用
Comments Preprint
Cura 1T:用于智能医疗保健的专用模型
机构 * actAVA AI(actAVA人工智能公司)
专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);tool use(abstract);分类 cs.AI
AI总结 研究针对医疗保健中多任务需求及能力失效问题,提出通过人工门控自我进化循环训练的Cura 1T模型,以数据为中心改进模型,该模型在医疗评估套件中表现优异,在相关基准测试中保持竞争力。
Comments Model: https://actava.ai/cura; Docs: https://actava.ai/cura/docs; Github: https://github.com/actava-ai/Cura
基准测试无法衡量的:论自主智能体弃权能力的评估
机构 * Brown University(布朗大学)
专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文指出自主智能体基准测试忽视弃权能力,提出合规偏差概念,并引入弃权场景分类和评估协议,实验表明安全-可用性权衡是可调的。
Comments Accepted to AIES 2026, this is an updated version to the RLEval workshop paper
基于专用分割模型实现具身智能视觉语言模型(Agentic VLMs)的细粒度车辆损伤评估
机构 * Northeastern University(东北大学)
专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);分类 cs.AI
AI总结 针对VLMs空间定位不可靠问题,本文提出TinyDamage架构,将空间定位委托给专用多任务分割模型,集成至7节点LangGraph智能体流程,在车辆损伤评估中大幅降低报告虚构率。
Comments 8 pages, 2 figures
AI智能体时代需要新的科学范式以维持可信科学
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 针对AI自主研究智能体带来的科学产出验证缺口扩大问题,该文提出需进化科学验证基础设施的标准,以应对无人能核查结果等风险,维持科学信任。
Comments Accepted at ICML 2026, Position Paper Track
梅西耶:用于跨基准智能体评估的高分辨率语料库
机构 * Andromede AI(仙女座人工智能公司)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);function calling(abstract);分类 cs.AI
AI总结 研究针对智能体评估中任务等碎片化问题,引入梅西耶语料库,整合多基准、智能体、任务和验证器等信息,标准化记录并分类。通过该语料库发现基准进展不均衡,指出多验证器任务评分问题,得出能力量表,为智能体评估提供基础可复用设施。
虚假预言:论智能体系统中世界模型的安全性
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI
AI总结 研究智能体系统中世界模型的安全性,发现其存在特定漏洞,引入安全基准数据集,指出攻击者能诱导错误预测,成功率达95%,并为从业者提供减轻危害、强化系统的实用建议。