arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2605.30916 2026-06-01 cs.LG cs.GT econ.TH 83%

Welfare, Improvability, and Variance: A Principal-Agent Approach to Optimal Benchmark Item Aggregation

福利、可改进性与方差:最优基准测试项聚合的主-代理方法

Andreas Haupt, Justin Hartenstein, Anka Reuel, Mykel Kochenderfer, Sanmi Koyejo

机构 * Department of Economics & Computer Science(经济与计算机科学系) Institute for Computational and Mathematical Engineering(计算与数学工程研究所) Department of Computer Science(计算机科学系) Department of Aeronautics & Astronautics(航空与航天系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 提出将基准测试建模为多任务主-代理博弈,通过福利、可改进性和方差三个维度评估项目,并应用于OLMES数据集识别帕累托劣势项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29893 2026-05-29 cs.AI 83%

Redundant or Necessary? A Benchmark for Detecting Redundant Steps in Agent Trajectories

冗余还是必要?检测智能体轨迹中冗余步骤的基准

Minyang Hu, Bo Yang, Zhinuo Zhou, Jiachen Liang, Guo Jiahao, Yiyang Yin, Xiongwei Han

机构 * Huawei Technologies(华为技术有限公司) Noah Arks’ Lab(Noah Arks实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 针对LLM智能体轨迹中的冗余步骤检测问题,提出RedundancyBench基准,包含标注轨迹的数据集,并评估三种方法,发现最佳方法仅达到24.88%的检测分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27042 2026-05-27 cs.CR cs.AI 83%

Lessons from Penetration Tests on Large-Scale Agent Systems

大规模智能体系统渗透测试的经验教训

Kevin Eykholt, Dhilung Kirat, Xiaokui Shu, Jiyong Jang, Frederico Araujo, Ian Molloy

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文通过对2025年专有智能体产品的两次渗透测试,评估了AI智能体的安全态势是否有所改善,并指出许多安全漏洞并非全新,而是反映了先前计算系统中长期存在的重复性弱点类别。

Comments Accepted at SAGAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25641 2026-05-26 cs.CL 83%

Iterate Until Retrieved: Factual Nugget Optimization for Discoverable Continual Corrections in Agentic RAG

迭代直到检索到:面向可发现持续修正的事实性片段优化在智能体RAG中的应用

Moshe Hazoom, Gal Patel, Alon Talmor, Tom Hope

机构 * Mosaic AI The Hebrew University of Jerusalem(希伯来大学杰里科分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 提出迭代片段优化(INO)方法,通过将反馈转化为事实性片段并利用生产环境智能体RAG系统迭代优化,提升事实性修正的可发现性和使用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23934 2026-05-26 cs.AI quant-ph 83%

Practical Quantum CIM Empowerment via All-Domestic-Core Agentic Large Model

实用量子CIM赋能:基于全自主核心智能体大模型

Wang Rui, Lu Diannan

机构 * Department of Chemical Engineering, Tsinghua University(清华大学化学工程系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究将飞秒激光泵浦的相干伊辛机与LLM驱动的智能体系统结合,实现QUBO/Ising模型校准、约束权重决策迭代和文献方案快速验证,并完全基于国产大模型和硬件完成,同时发现智能体辅助量子计算迭代可反向增强智能体问题解决能力的新范式。

Comments 21 pages 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22645 2026-05-22 cs.AI 83%

AtelierEval: Agentic Evaluation of Humans & LLMs as Text-to-Image Prompters

AtelierEval: 人类与LLM作为文本到图像提示器的代理评估

Hanjun Luo, Zhimu Huang, Sylvia Chung, Yiran Wang, Yingbin Jin, Jialin Li, Jiang Li, Xinfeng Li, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出AtelierEval,首个统一基准,通过360个专家设计的任务量化提示能力,引入技能基于的记忆增强代理评估器,实现与人类专家的高相关性,验证了提示器在图像增强方向的优越性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18991 2026-05-21 cs.CR cs.AI 83%

Agent Security is a Systems Problem

智能体安全是系统问题

Mihai Christodorescu, Earlence Fernandes, Ashish Hooda, Somesh Jha, Johann Rehberger, Kamalika Chaudhuri, Xiaohan Fu, Khawaja Shams, Guy Amir, Jihye Choi, Sarthak Choudhary, Nils Palumbo, Andrey Labunets, Nishit V. Pandya

机构 * Google(谷歌) University of California San Diego(加州大学圣地亚哥分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) EmbraceTheRed Gray Swan AI Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出智能体安全应作为系统问题来解决,强调通过系统层面的安全不变量来保障AI模型的安全性,而非仅仅依赖模型鲁棒性。文章基于系统安全领域的技术,提出了设计可预测安全保证的智能体系统的核心原则,并分析了实际攻击案例和实现这些原则面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19194 2026-05-20 cs.CL 83%

MMoA: An AI-Agent framework with recurrence for Memoried Mixure-of-Agent

MMoA: 一个具有递归性的记忆混合代理框架

Rui Chu

机构 * Rui Chu(楚瑞)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出MMoA框架,通过引入LSTM门控机制,改进了传统混合代理方法在时间依赖性和上下文感知方面的不足,实现了更高效的多代理系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03140 2026-05-20 cs.HC cs.AI 83%

How to Model AI Agents as Personas?: Applying the Persona Ecosystem Playground to 41,300 Posts on Moltbook for Behavioral Insights

如何将AI代理建模为身份?:应用Persona生态系统游乐场分析Moltbook上的41,300条帖子以获取行为洞察

Danial Amin, Joni Salminen, Bernard J. Jansen

机构 * University of Vaasa(瓦萨大学) Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,HBKU)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过Persona生态系统游乐场分析Moltbook上的41,300条帖子,利用k均值聚类和检索增强生成技术生成并验证对话身份,揭示了AI代理行为多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19010 2026-05-20 cs.AI 83%

AgentNLQ: A General-Purpose Agent for Natural Language to SQL

AgentNLQ: 一个通用的自然语言到SQL代理

Olena Bogdanov, Yeunji Jung, Chandra Dhir, Pareekshitreddy Gaddam, Saurabh Jain, Lakshmi Tumati, Vijay Parthasarathy, Anup Shirgaonkar

机构 * JPMorganChase(摩根大通)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出了一种多代理方法,用于改进自然语言到SQL的转换,该方法在BIRD基准测试中实现了78.1%的语义准确率,并通过优化的多代理解决方案、先进的模式增强方法以及跨不同领域和数据集的评估,展示了方法的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07347 2026-05-19 stat.ML cs.LG math.PR 83%

Throughput-Optimal Scheduling Algorithms for LLM Inference and AI Agents

面向LLM推理和AI代理的吞吐量最优调度算法

J. G. Dai, Tianze Deng, Yueying Li, Tianyi Peng

机构 * School of Operations Research and Information Engineering, Cornell University(Cornell大学运筹学与信息工程学院) Operations Management, Booth School of Business, University of Chicago(芝加哥大学博斯商学院运营管理系) Decision, Risk and Operations, Columbia Business School, Columbia University(哥伦比亚大学哥伦比亚商学院决策、风险与运营系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文从排队论角度研究了LLM推理系统的吞吐量优化问题,证明了工作保持调度算法在DAG和Fork-Join路由拓扑中能实现最大吞吐量,并揭示了批量处理网络中K-FCFS调度的流极限框架,评估了Orca和Sarathi-Serve的吞吐量最优性,同时指出批量大小限制和循环路由拓扑对吞吐量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14271 2026-05-19 cs.CL cs.CY 83%

Auditing Agent Harness Safety

审查代理安全

Chengzhi Liu, Yichen Guo, Yepeng Liu, Yuzhe Yang, Qianqi Yan, Xuandong Zhao, Wenyue Hua, Sheng Liu, Sharon Li, Yuheng Bu, Xin Eric Wang

机构 * UCB(加州大学伯克利分校) WISC(威斯康星大学) STANFORD(斯坦福大学) MSR1(微软研究院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出HarnessAudit框架,用于审查执行轨迹中的边界合规性、执行保真度和系统稳定性,揭示多代理Harness中的安全风险,并通过HarnessAudit-Bench验证了安全风险与轨迹长度、领域和代理角色的关系。

Comments 11 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23986 2026-05-19 cs.AI 83%

TusoAI: Agentic Optimization for Scientific Methods

TusoAI: 科学方法的代理优化

Alistair Turcan, Kexin Huang, Lei Li, Martin Jinye Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Phylo

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 TusoAI通过整合领域知识和迭代优化,提升科学任务中计算方法的性能,优于现有专家方法和科学AI代理,在单细胞RNA测序数据去噪和卫星地球监测等任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16282 2026-05-19 cs.CY cs.AI 83%

Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents

AI代理安全基准的分类与一致性分析

Miles Q. Li, Benjamin C. M. Fung, Boyang Li, Heba Ismail, Farkhund Iqbal

机构 * McGill University(麦吉尔大学) Kean University(凯恩大学) Zayed University(扎耶德大学)

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文分析了AI代理安全基准的分类与一致性问题,揭示了方法学选择对安全结论的影响,指出基准选择可能导致矛盾的安全结论,且指标碎片化限制了比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15871 2026-05-18 cs.AI 83%

Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design

代理发现神经架构:AIRA-Compose和AIRA-Design

Alberto Pepe, Chien-Yu Lin, Despoina Magka, Bilge Acun, Yannan Nellie Wu, Anton Protopopov, Carole-Jean Wu, Yoram Bachrach

机构 * FAIR at Meta(Meta的FAIR)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出AIRA-Compose和AIRA-Design框架,通过自主设计神经网络架构,实现超越标准Transformer的基础模型,提升模型性能和效率。

Comments 55 pages, 28 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15109 2026-05-15 cs.AI cs.IR 83%

Why Neighborhoods Matter: Traversal Context and Provenance in Agentic GraphRAG

为什么社区重要:代理图RAG中的遍历上下文与溯源

Riccardo Terrenzi, Maximilian von Zastrow, Serkan Ayvaz

机构 * Centre for Industrial Software, University of Southern Denmark, Alsion 2, 6400 Sønderborg, Denmark(丹麦南部大学工业软件中心)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文探讨了代理图RAG中引用忠实性的轨迹层面问题,通过实验表明引用证据和遍历上下文都对答案准确性有影响。

Comments 7 pages, 2 figures, Submitted at IJCAI-ECAI 2026 Joint Workshop on GENAIK and NORA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14460 2026-05-15 cs.CR cs.SE 83%

Exploiting LLM Agent Supply Chains via Payload-less Skills

通过无负载技能利用LLM代理供应链

Xinyu Liu, Yukai Zhao, Xing Hu, Xin Xia

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.SE

AI总结 研究提出Semantic Compliance Hijacking攻击,利用LLM生成能力动态合成恶意行为,通过无负载技能实现对自主编码环境的攻击,展示了其在不同框架和模型中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11703 2026-05-15 cs.CR cs.AI 83%

Progent: Securing AI Agents with Privilege Control

Progent:通过权限控制保障AI代理

Tianneng Shi, Jingxuan He, Zhun Wang, Hongwei Li, Linyu Wu, Wenbo Guo, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 Progent通过权限控制框架保障AI代理安全,利用LLM生成并更新策略,通过SMT求解器确保权限空间单调收敛,有效降低攻击成功率并保持高实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13940 2026-05-15 cs.CR cs.AI 83%

AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力

Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang, Yili Shen, Yufei Han, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Southern California(南加州大学) LMU Munich(慕尼黑大学) Inria, France(法国国家信息与自动化技术研究院)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13539 2026-05-14 cs.RO cs.SE 83%

Integration of an Agent Model into an Open Simulation Architecture for Scenario-Based Testing of Automated Vehicles

将代理模型整合到开放仿真架构中以用于自动驾驶车辆的基于场景测试

Christian Geller, Daniel Becker, Jobst Beckmann, Lutz Eckstein

机构 * Institute for Automotive Engineering, RWTH Aachen University(汽车工程研究所,亚琛工业大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出一种标准化模块化仿真架构,用于在不同仿真环境中集成交通代理模型,通过Open Simulation Interface和Functional Mock-up Interface实现跨平台一致性验证。

Journal ref at - Automatisierungstechnik - 2026 - Band 74, Heft 5 - Special Issue: AI for automated driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13046 2026-05-14 cs.AI 83%

An Agentic LLM-Based Framework for Population-Scale Mental Health Screening

基于代理的大型语言模型框架用于大规模心理健康筛查

Giuliano Lorenzoni, Paulo Alencar, Donald Cowan

机构 * University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于代理的LLM框架,通过显式策略和代理引导评估,实现对临床信息的处理和适应,展示在抑郁症检测中稳定配置和成本控制的成果。

Comments 8 pages, conference paper presented at IEEE BigData 2025, Macau

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-05-14 cs.AI 83%

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11839 2026-05-13 cs.DC cs.AI 83%

Trade-offs in Decentralized Agentic AI Discovery Across the Compute Continuum

在计算连续体上分布式代理AI发现中的权衡

Patrizio Dazzi, Emanuele Carlini, Matteo Mordacchini, Saul Urso

机构 * Department of Computer Science(计算机科学系) University of Pisa(比萨大学) Institute of Information Science and Technologies(信息科学与技术研究所) National Research Council of Italy(意大利国家研究理事会) Institute of Informatics and Telematics(信息学与电信研究所)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究了在计算连续体上不同结构覆盖家族在代理发现中的权衡,比较了Chord、Pastry和Kademlia等索引子结构,在共享控制平面框架下分析其发现可靠性、启动行为和控制平面开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11645 2026-05-13 cs.MA cs.LG q-fin.ST 83%

GeomHerd: A Forward-looking Herding Quantification via Ricci Flow Geometry on Agent Interactive Simulations

GeomHerd:通过Ricci流几何在代理交互模拟中进行前瞻性从众量化

Lake Yang, Junwei Su, Jingfeng Zeng, Wenhao Lu, Xingzhi Qian, Weitong Zhang, Chuan Wu, Dunhong Jin

机构 * University of Science and Technology of China(科学技术大学) MaxQuant The University of Hong Kong(香港大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出GeomHerd框架,利用Ricci流几何直接量化代理交互图中的协调性,提前预测从众行为,实验显示其在连续自旋模型中提前检测从众现象,且在Vicsek模型中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11224 2026-05-13 cs.CV cs.AI 83%

ABRA: Agent Benchmark for Radiology Applications

ABRA:放射学应用代理基准测试

Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo

机构 * School of Computing(计算学院) Dublin City University(都柏林城市大学) School of Medicine(医学院) University College Dublin(都柏林大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 ABRA是一个放射学代理基准测试,通过21个功能调用工具操作OHIF查看器和Orthanc DICOM服务器,包含655个生成任务,评估代理在规划、执行和结果方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10912 2026-05-12 cs.CL 83%

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

WildClawBench: 一个用于真实世界、长周期代理评估的基准测试

Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。

Comments Github link: https://github.com/internlm/WildClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10721 2026-05-12 physics.soc-ph cs.CL cs.MA 83%

Conformity Generates Collective Misalignment in AI Agents Societies

一致性在AI代理社会中产生集体偏离

Giordano De Marzo, Alessandro Bellina, Claudio Castellano, Viola Priesemann, David Garcia

机构 * University of Konstanz(康斯坦茨大学) Sony Computer Science Laboratories - Rome(索尼计算机科学实验室-罗马) Sapienza University of Rome(罗马大学) Max Planck Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems, University of Gottingen(复杂系统动力学研究所,哥廷根大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

AI总结 研究探讨了个体对齐的AI代理群体在一致性动态下可能陷入长期偏离状态的现象,揭示了集体安全性的不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10480 2026-05-12 cs.AI 83%

ASIA: an Autonomous System Identification Agent

ASIA:一个自主系统识别代理

Dario Piga, Marco Forgione

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 ASIA通过自主编码代理自动完成系统识别中的模型选择与参数调优,基于两个基准测试分析其搜索行为和发现的架构策略,探讨了该方法的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09684 2026-05-12 cs.CR cs.AI 83%

MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring

MonitoringBench: 面向代理监控的半自动化红队测试

Monika Jotautaitė, Maria Angelica Martinez, Ollie Matthews, Tyler Tracy

机构 * Independent(独立)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 本文提出半自动化红队方法,针对代理监控中的攻击检测问题,通过改进攻击生成和测试流程,构建了包含2644条攻击轨迹的MonitoringBench基准,评估监控能力与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08545 2026-05-12 cs.AI 83%

Log analysis is necessary for credible evaluation of AI agents

对AI代理的可信评估需要日志分析

Peter Kirgis, Sayash Kapoor, Stephan Rabanser, Nitya Nadgir, Cozmin Ududec, Magda Dubois, JJ Allaire, Conrad Stosz, Marius Hobbhahn, Jacob Steinhardt, Arvind Narayanan

机构 * Princeton University(普林斯顿大学) Independent(独立) UK AISI(英国AISI) Meridian Labs(梅里登实验室) Transluce Apollo Research(Apollo研究) UC Berkeley(伯克利大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过日志分析解决AI代理评估中的可信问题,揭示了日志分析在识别评估威胁和指导原则中的作用,并展示了tau-Bench Airline中日志分析发现的性能缺陷和部署失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏