arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2603.08835 2026-03-11 cs.AI cs.CL cs.LG 88%

MASEval: Extending Multi-Agent Evaluation from Models to Systems

MASEval: 从模型到系统的多智能体评估扩展

Cornelius Emde, Alexander Rubinstein, Anmol Goel, Ahmed Heakl, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) University of Oxford(牛津大学) University of Tübingen(图宾根大学) TU Darmstadt(德累斯顿理工大学) MBZUAI NAVER AI Lab(NAVER AI实验室) KAIST(韩国科学技术院)

专题命中 Agent评测 :agent(title);multi-agent(title);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 MASEval通过系统层面的比较揭示框架选择与模型选择同等重要,为智能体系统设计提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13999 2026-02-17 cs.RO 88%

It Takes Two to Tango: A Holistic Simulator for Joint Order Scheduling and Multi-Agent Path Finding in Robotic Warehouses

双人探戈也需要两人:一种综合模拟器用于机器人仓库中的联合订单调度和多智能体路径寻找

Haozheng Xu, Wenhao Li, Zifan Wei, Bo Jin, Hongxing Bai, Ben Yang, Xiangfeng Wang

机构 * East China Normal University(东华大学) Tongji University(同济大学) Zhejiang Galaxis Technology Group Co.,Ltd(浙江伽利西科技集团有限公司) Shenzhen Loop Area Institute (SLAI)(深圳环 area 研究院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

AI总结 WareRover是一种综合模拟器,通过闭环优化接口紧密耦合订单调度与多智能体路径寻找,为机器人仓库的鲁棒协调提供挑战性测试环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09139 2026-02-02 cs.CV 88%

MACEval: A Multi-Agent Continual Evaluation Network for Large Models

MACEval: 一种用于大型模型的多智能体持续评估网络

Zijian Chen, Yuze Sun, Yuan Tian, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

AI总结 MACEval通过多智能体持续评估网络,提出新的度量标准以动态评估大型模型,减少评估开销并提升评估效率。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01723 2026-01-06 cs.CR 88%

Structural Representations for Cross-Attack Generalization in AI Agent Threat Detection

结构表示用于AI代理威胁检测中的跨攻击泛化

Vignesh Iyer

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

AI总结 本文提出结构标记化方法,通过编码执行流程模式提升AI代理威胁检测的跨攻击泛化能力,显著提高对未知攻击的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21967 2025-10-28 cs.HC cs.CY 88%

We Need Accountability in Human-AI Agent Relationships

Benjamin Lange, Geoff Keeling, Arianna Manzini, Amanda McCroskery

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10086 2025-10-14 cs.RO 88%

Beyond ADE and FDE: A Comprehensive Evaluation Framework for Safety-Critical Prediction in Multi-Agent Autonomous Driving Scenarios

Feifei Liu, Haozhe Wang, Zejun Wei, Qirong Lu, Yiyang Wen, Xiaoyu Tang, Jingyan Jiang, Zhijian He

机构 * South China Normal University(华南师范大学) Shenzhen Technology University(深圳技术大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00069 2025-10-02 cs.CV 88%

OIG-Bench: A Multi-Agent Annotated Benchmark for Multimodal One-Image Guides Understanding

Jiancong Xie, Wenjin Wang, Zhuomeng Zhang, Zihan Liu, Qi Liu, Ke Feng, Zixun Sun, Yuedong Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Interactive Entertainment Group, Tencent Inc, China(腾讯互动娱乐集团) Key Laboratory of Machine Intelligence and Advanced Computing (MOE), China(机器智能与先进计算重点实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00384 2025-08-04 cs.RO 88%

On Learning Closed-Loop Probabilistic Multi-Agent Simulator

Juanwu Lu, Rohit Gupta, Ahmadreza Moradipari, Kyungtae Han, Ruqi Zhang, Ziran Wang

机构 * Purdue University(普渡大学) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025. Source Code: https://github.com/juanwulu/niva

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23194 2025-08-01 cs.CL cs.AI cs.LG 88%

Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks

Jianghui Wang, Vinay Joshi, Saptarshi Majumder, Xu Chao, Bin Ding, Ziqiong Liu, Pratik Prabhanjan Brahma, Dong Li, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 Agent评测 :agent(title);AI agent(title);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21969 2025-07-30 cs.MA 88%

Towards Cognitive Synergy in LLM-Based Multi-Agent Systems: Integrating Theory of Mind and Critical Evaluation

Adam Kostka, Jarosław A. Chudziak

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments Accepted at CogSci 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09255 2025-07-15 cs.CE cs.MA 88%

StockSim: A Dual-Mode Order-Level Simulator for Evaluating Multi-Agent LLMs in Financial Markets

Charidimos Papadakis, Giorgos Filandrianos, Angeliki Dimitriou, Maria Lymperaiou, Konstantinos Thomas, Giorgos Stamou

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11897 2025-05-27 cs.GT econ.TH 88%

Equilibria under Dynamic Benchmark Consistency in Non-Stationary Multi-Agent Systems

Ludovico Crippa, Yonatan Gur, Bar Light

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09936 2025-05-16 cs.HC cs.GR cs.MA cs.MM 88%

CartoAgent: a multimodal large language model-powered multi-agent cartographic framework for map style transfer and evaluation

Chenglong Wang, Yuhao Kang, Zhaoya Gong, Pengjun Zhao, Yu Feng, Wenjia Zhang, Ge Li

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments 57 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09227 2025-04-15 cs.HC 88%

SceneScout: Towards AI Agent-driven Access to Street View Imagery for Blind Users

Gaurav Jain, Leah Findlater, Cole Gleason

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17258 2025-01-30 cs.HC 88%

Controlling AI Agent Participation in Group Conversations: A Human-Centered Approach

Stephanie Houde, Kristina Brimijoin, Michael Muller, Steven I. Ross, Dario Andres Silva Moran, Gabriel Enrique Gonzalez, Siya Kunde, Morgan A. Foreman, Justin D. Weisz

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

Comments 31 pages, 7 figures. In Proceedings of the 30th International Conference on Intelligent User Interfaces (IUI '25), March 24-27, 2025, Cagliari, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08875 2024-12-13 cs.NE cs.ET q-bio.NC 88%

Brain-inspired AI Agent: The Way Towards AGI

Bo Yu, Jiangning Wei, Minzhen Hu, Zejie Han, Tianjian Zou, Ye He, Jun Liu

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14605 2024-09-25 eess.SY cs.SY 88%

First Field Trial of LLM-Powered AI Agent for Lifecycle Management of Autonomous Driving Optical Networks

Xiaomin Liu, Qizhi Qiu, Yihao Zhang, Yuming Cheng, Lilin Yi, Weisheng Hu, Qunbi Zhuge

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

Comments Version submitted to ECOC PDP 2024 on September 6th

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16307 2024-03-15 cs.CE 88%

TaxAI: A Dynamic Economic Simulator and Benchmark for Multi-Agent Reinforcement Learning

Qirui Mi, Siyu Xia, Yan Song, Haifeng Zhang, Shenghao Zhu, Jun Wang

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments 18 pages, 8 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12045 2023-11-22 q-bio.GN 88%

Using Guided Transfer Learning to Predispose AI Agent to Learn Efficiently from Small RNA-sequencing Datasets

Kevin Li, Danko Nikolić, Vjekoslav Nikolić, Davor Andrić, Lauren M. Sanders, Sylvain V. Costes

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.01838 2022-09-07 cs.RO 88%

A Benchmark for Unsupervised Anomaly Detection in Multi-Agent Trajectories

Julian Wiederer, Julian Schmidt, Ulrich Kressel, Klaus Dietmayer, Vasileios Belagiannis

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

Comments 8 pages, 4 figures, 2 tables, accepted by IEEE ITSC 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.01373 2019-10-07 cs.MA cs.GT 88%

$α$-Rank: Multi-Agent Evaluation by Evolution

Shayegan Omidshafiei, Christos Papadimitriou, Georgios Piliouras, Karl Tuyls, Mark Rowland, Jean-Baptiste Lespiau, Wojciech M. Czarnecki, Marc Lanctot, Julien Perolat, Remi Munos

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04018 2026-08-06 cs.CY cs.AI 新提交 87%

Governing Execution Risk in Agentic AI Systems: A Trajectory-Guided Framework for Red Teaming

管控智能体AI系统的执行风险:一种基于轨迹的红队测试框架

Zhihao Zhu, Yi Yang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);tool use(abstract)

AI总结 本研究提出基于轨迹的红队测试框架TrajRed和运行时管控层TrajGuard,在AgentDojo实验中,TrajRed识别的漏洞更强,TrajGuard可将攻击成功率降至近零且保留任务效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03499 2026-08-05 cs.AI 新提交 87%

WeClawArena: An Auditable Sandbox and Benchmark for Cross-User Agents Collaboration and Security in Human-Centered Agent Networks

WeClawArena:面向以人为中心的智能体网络中跨用户智能体协作与安全的可审计沙箱及基准

Prince Zizhuang Wang, Aojie Yuan, Haiyue Zhang, Xiyang Hu, Yue Zhao, Shuli Jiang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 WeClawArena是面向以人为中心的智能体网络的可审计沙箱与基准,含124个基础任务及620个场景变体,可评估跨用户智能体协作的效用与攻击成功率,支持安全审计与诊断。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02683 2026-08-05 cs.CR cs.AI 新提交 87%

$S^3$: Improving Agent Safety through Multi-Stage Defense

$S^3$:通过多阶段防御提升智能体安全性

Zibo Xiao, Haoyu Wang, Jun Sun

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);agentic(abstract)

AI总结 本研究针对LLM智能体工作流的跨阶段安全风险问题,提出多阶段防御框架$S^3$,引入阶段特定安全技能,构建MSRB基准,实验显示其安全有效性和效用保留均优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02441 2026-08-04 cs.AI 新提交 87%

Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce

智能体商业世界:一种可审计可验证的氛围式商业环境

Shicheng Fan, Mingdai Yang, Duohao Wang, Canyu Chen, Yongfeng Zhang, Hua Wei, Manling Li, Julian McAuley, Kun Zhang, Philip S. Yu, Kejing Yu, Zhiwei Liu

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) Springbrand(斯普林布兰德公司) Northwestern University(西北大学) Rutgers University(罗格斯大学) Arizona State University(亚利桑那州立大学) University of California San Diego(加州大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI(Mohamed bin Zayed 人工智能大学) Microsoft AI(微软人工智能部门)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究提出智能体商业世界(ACWorld)环境,通过氛围式商业协议(VCP)实现可审计可验证的氛围式商业智能体评估,构建含两类轨道的基准并验证模型性能,分析得出过程级证据对评估智能体的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27556 2026-07-31 cs.AI cs.MA 新提交 87%

Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

通过功能、证据和验证评估智能体生物信息学

Phuc Pham, Truong-Son Hy

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)

AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04240 2026-07-07 cs.AI q-bio.CB 新提交 87%

Biological Motifs for Agentic Control

用于智能体控制的生物基序

Bogdan Banu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 研究大语言模型向自主智能体转变带来的可靠性等挑战,通过基因调控网络与智能体软件系统的类型化接口对应,映射生物基序到软件设计模式,给出智能体操作数等核心贡献并具实践可行性。

Comments 80 pages. Preprint; feedback welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24380 2026-07-07 cs.SE 版本更新 87%

Agentic Services Computing

智能服务计算

Shuiguang Deng, Hailiang Zhao, Ziqi Wang, Wenzhuo Qian, Xiang Ao, Guanjie Cheng, Jianwei Yin, Albert Y. Zomaya, Schahram Dustdar

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 探讨服务计算范式转变带来的新问题,基于现有研究基础,引入智能服务计算,扩展服务计算范畴,为未来服务生态系统奠定以服务为中心的基础,实现对自治代理的系统管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27898 2026-07-03 cs.AI 版本更新 87%

A Unified Framework for the Evaluation of LLM Agentic Capabilities

LLM 代理能力评估的统一框架

Pengyu Zhu, Lijun Li, Yaxing Lyu, Qianxin Luo, Jingyi Yang, Yi Liu, Tingfeng Hui, Xinyu Yuan, Li Sun, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学) North China Electric Power University(华北电力大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26519 2026-06-29 cs.AI 新提交 87%

What the LLM Should Not Say: Boundary-Aware Context Grounding for A Seven-Channel EEG Agent

面向低通道EEG智能体的边界感知上下文接地

Zhiyuan Xu, Yueqing Dai, Junling Li, Junwen Luo

机构 * Shanghai Pulse Element Intelligent Technology Co., Ltd. (NeuraDock)(上海脉冲元素智能科技有限公司(NeuraDock))

专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI

AI总结 提出NeuraDock Agent架构,通过分离确定性本地EEG引擎与硬件感知语言层,实现LLM对低通道EEG数据的边界感知接地,经288次测试验证了系统在数值重复性、故障恢复和边界感知方面的有效性。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏