arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2503.13205 2025-03-18 cs.AI cs.CL cs.CV cs.HC cs.MA 88%

MAP: Evaluation and Multi-Agent Enhancement of Large Language Models for Inpatient Pathways

Zhen Chen, Zhihao Peng, Xusheng Liang, Cheng Wang, Peigan Liang, Linsheng Zeng, Minjie Ju, Yixuan Yuan

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20127 2025-02-21 cs.CL cs.AI 88%

M-MAD: Multidimensional Multi-Agent Debate for Advanced Machine Translation Evaluation

Zhaopeng Feng, Jiayuan Su, Jiamei Zheng, Jiahan Ren, Yan Zhang, Jian Wu, Hongwei Wang, Zuozhu Liu

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

Comments Code and data are available at https://github.com/SU-JIAYUAN/M-MAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06882 2025-02-12 cs.CL cs.AI 88%

Multi-Agent Simulator Drives Language Models for Legal Intensive Interaction

Shengbin Yue, Ting Huang, Zheng Jia, Siyuan Wang, Shujun Liu, Yun Song, Xuanjing Huang, Zhongyu Wei

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

Comments Accepted by NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08985 2025-01-16 cs.CL cs.AI cs.GT 88%

Personality Modeling for Persuasion of Misinformation using AI Agent

Qianmin Lou, Wentao Xu

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05255 2024-12-09 cs.AI cs.CL cs.CV cs.MA 88%

TeamCraft: A Benchmark for Multi-Modal Multi-Agent Systems in Minecraft

Qian Long, Zhi Li, Ran Gong, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05208 2024-09-27 cs.AI cs.HC cs.LG cs.MA 88%

ZSC-Eval: An Evaluation Toolkit and Benchmark for Multi-agent Zero-shot Coordination

Xihuai Wang, Shao Zhang, Wenhao Zhang, Wentao Dong, Jingxiao Chen, Ying Wen, Weinan Zhang

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

Comments Accepted in NeurIPS 2024 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02081 2024-06-25 cs.MA cs.AI cs.LG 88%

FightLadder: A Benchmark for Competitive Multi-Agent Reinforcement Learning

Wenzhe Li, Zihan Ding, Seth Karten, Chi Jin

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14767 2024-05-28 q-fin.ST cs.CL cs.LG q-fin.TR 88%

FinRobot: An Open-Source AI Agent Platform for Financial Applications using Large Language Models

Hongyang Yang, Boyu Zhang, Neng Wang, Cheng Guo, Xiaoli Zhang, Likun Lin, Junlin Wang, Tianyu Zhou, Mao Guan, Runjia Zhang, Christina Dan Wang

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.CL、cs.LG

Comments FinRobot Whitepaper V1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19305 2024-04-16 cs.CL cs.AI 88%

MATEval: A Multi-Agent Discussion Framework for Advancing Open-Ended Text Evaluation

Yu Li, Shenyu Zhang, Rui Wu, Xiutian Huang, Yongrui Chen, Wenhao Xu, Guilin Qi, Dehai Min

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.CL

Comments This paper has been accepted as a long paper presentation by DASFAA 2024 Industrial Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.09889 2023-02-06 cs.MA cs.AI cs.LG cs.RO 88%

Nocturne: a scalable driving benchmark for bringing multi-agent learning one step closer to the real world

Eugene Vinitsky, Nathan Lichtlé, Xiaomeng Yang, Brandon Amos, Jakob Foerster

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13626 2022-08-30 cs.AI cs.CV cs.LG cs.MA cs.RO 88%

CH-MARL: A Multimodal Benchmark for Cooperative, Heterogeneous Multi-Agent Reinforcement Learning

Vasu Sharma, Prasoon Goyal, Kaixiang Lin, Govind Thattai, Qiaozi Gao, Gaurav S. Sukhatme

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.05737 2021-03-11 cs.LG cs.AI cs.MA 88%

The AI Arena: A Framework for Distributed Multi-Agent Reinforcement Learning

Edward W. Staley, Corban G. Rivera, Ashley J. Llorens

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.09467 2019-07-24 cs.LG cs.AI cs.MA 88%

Arena: a toolkit for Multi-Agent Reinforcement Learning

Qing Wang, Jiechao Xiong, Lei Han, Meng Fang, Xinghai Sun, Zhuobin Zheng, Peng Sun, Zhengyou Zhang

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);分类 cs.AI、cs.LG

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20950 2026-07-03 cs.AI cs.SY eess.SY 新提交 88%

Power Systems Agent Benchmark: Executable Evaluation of AI Agents in Electric Power Engineering

电力系统智能体基准测试:电力工程中AI智能体的可执行评估

Sergei Trashchenkov

机构 * Electric Power Engineering(电力工程)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 提出电力系统智能体基准测试,通过确定性评估器对智能体在电力工程任务中的结构化解决方案进行可执行评估,涵盖41个任务族,并采用私有种子按需生成保留案例以防止数据污染。

Comments 19 pages, 1 figure, 2 tables. Code and data: https://github.com/trashchenkov/power-systems-agent-benchmark ; archived at https://doi.org/10.5281/zenodo.20753046 v2: fixed unresolved citations and three missing references in Section 2, reference capitalization, Table 1 caption

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25996 2026-07-07 cs.AI cs.CL cs.LG 新提交 88%

Autodata: An agentic data scientist to create high quality synthetic data

Autodata: 一种创建高质量合成数据的智能数据科学家方法

Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yuan, Olga Golovneva, Jack Lanchantin, Yoram Bachrach, Jakob Foerster, Xian Li, Han Fang, Sainbayar Sukhbaatar, Jason Weston

机构 * Meta

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Autodata方法,让AI代理充当数据科学家,通过元优化学习创建更优的训练和评估数据,在计算机科学、法律推理和数学推理任务上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07972 2026-01-29 cs.LG cs.AI cs.CL 88%

HeuriGym: An Agentic Benchmark for LLM-Crafted Heuristics in Combinatorial Optimization

HeuriGym: 一个用于评估LLM生成启发式算法的代理基准

Hongzheng Chen, Yingheng Wang, Yaohui Cai, Hins Hu, Jiajie Li, Shirley Huang, Chenhui Deng, Rongjian Liang, Shufeng Kong, Haoxing Ren, Samitha Samaranayake, Carla P. Gomes, Zhiru Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 HeuriGym是一个用于评估LLM生成启发式算法的代理基准,通过代码执行反馈和迭代改进,揭示了LLM在组合优化中的局限性。

Comments Accepted to ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22846 2026-01-27 cs.LG cs.AI cs.LO cs.SE 88%

RocqStar: Leveraging Similarity-driven Retrieval and Agentic Systems for Rocq generation

RocqStar: 利用相似性驱动检索与智能体系统进行Rocq生成

Andrei Kozyrev, Nikita Khramov, Gleb Solovev, Anton Podkopaev

机构 * JetBrains Research(JetBrains研究)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 RocqStar通过结合相似性驱动检索和智能体系统,显著提升Rocq证明生成的性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08275 2026-06-09 cs.LG cs.AI 新提交 88%

Causal Agent Replay: Counterfactual Attribution for LLM-Agent Failures

因果智能体回放:LLM智能体故障的反事实归因

Jaineet Shah

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI、cs.LG

AI总结 提出Causal Agent Replay (CAR)方法,通过结构因果模型和干预操作,对LLM智能体失败步骤进行反事实归因,解决现有方法无法定位决策步骤的问题。

Comments Open-source: https://github.com/jaineet17/causal-agent-replay

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21800 2026-08-07 cs.AI 版本更新 88%

BioAgent Bench: An AI Agent Evaluation Suite for Bioinformatics

BioAgent Bench: 一个用于生物信息学的AI代理评估套件

Dionizije Fa, Marko Culjak, Bruno Pandza, Mateo Cupic

机构 * Entropic

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文提出BioAgent Bench,用于评估AI代理在常见生物信息学任务中的性能和鲁棒性。通过定制端到端任务和压力测试,发现前沿代理可完成多步骤流程,但鲁棒性测试揭示了在受控扰动下的失败模式,表明高阶流程构建不保证可靠步骤推理。

Comments ICML 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01341 2026-08-04 cs.AI 新提交 88%

402Pilot: An x402 Decision Layer for Autonomous Agent Micropayments

402Pilot:面向自主智能体微支付的x402决策层

Yin Li, Yanbo He, Boo-Ho Yang, Rav Lawana, Ziyue Li, Wei Zeng, Jing Tang, Fugee Tsung

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 针对自主智能体微支付的买方决策问题,提出协议无关的402Pilot决策层,结合PA-DCT策略在402Pilot-Bench基准中验证其自适应采购的有效性,为可编程支付补充买方决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17149 2026-07-21 cs.AI cs.CY 新提交 88%

A Diagnostic Framework for AI Agent Behavior

人工智能代理行为的诊断框架

Xichen Zhang, Yingjie Zhang, Tianshu Sun

机构 * Cheung Kong Graduate School of Business(长江商学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 研究人工智能代理在复杂系统中的行为评估问题,提出层归因诊断框架,该框架含基础计算层和行为调制层,阐明了替代有效性等三个结果,为评估代理行为提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09586 2026-07-13 cs.AI 新提交 88%

TrustX Agent Risk Classification Framework (ARC): Risk-Tiering Internally Created Agentic AI Systems

TrustX智能体风险分类框架(ARC):对内部创建的智能体人工智能系统进行风险分层

Hannah M. Liu, Rhea Saxena, Shiv Asthana

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 针对智能体人工智能系统超出通用风险框架治理能力的问题,提出TrustX智能体风险分类框架(ARC),利用十二维度评分标准等组件量化风险,输出三层治理结果,为相关人员提供工具,且会持续迭代完善。

Comments This is a working paper on our risk classification tool, with iterations currently underway

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26028 2026-07-09 cs.CR cs.AI cs.MA 新提交 88%

Can Trustless Agents Be Trusted? An Empirical Study of the ERC-8004 Decentralized AI Agent Ecosystem

无信任代理能否被信任?ERC-8004 去中心化 AI 代理生态系统的实证研究

Xihan Xiong, Zelin Li, Wei Wei, Qin Wang, William Knottenbelt, Zhipeng Wang

机构 * Imperial College London(伦敦帝国学院) Ohio State University(俄亥俄州立大学) University of Bristol(布里斯托大学) The University of Manchester(曼彻斯特大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本研究首次实证分析 ERC-8004 协议在三条链上的身份、声誉和验证注册表,发现大多数注册为占位符,声誉不可比且易被操纵,大量评论者存在 Sybil 行为,表明该协议目前无法提供可信决策基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02116 2026-07-07 cs.AI 新提交 88%

ContextNest: Verifiable Context Governance for Autonomous AI Agent

ContextNest:自主AI智能体的可验证上下文治理

Misha Sulpovar, Benn R. Konsynski, Qaish Kanchwala, Gabe Goodhart

机构 * PromptOwl, LLC(PromptOwl公司) Goizueta Business School, Emory University(埃默里大学戈伊苏埃塔商学院) IBM Research(IBM研究院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 提出ContextNest,一种在检索前提供上下文治理的开放规范,通过版本链、哈希校验和审计追踪确保知识可验证性,实验表明其在防过时攻击和检索确定性上优于传统方法。

Comments 35 pages, 11 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11770 2026-05-13 cs.CR cs.AI cs.SY eess.SY 88%

Behavioral Integrity Verification for AI Agent Skills

AI代理技能的行为完整性验证

Yuhao Wu, Tung-Ling Li, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出行为完整性验证(BIV)方法,通过类型集比较验证AI代理技能声明与实际能力的一致性,发现80%的技能存在描述与实现差距,并在恶意技能检测中取得高F1值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11487 2026-05-13 cs.CR cs.AI cs.MA 88%

Digital Identity for Agentic Systems: Toward a Portable Authorization Standard for Autonomous Agents

面向代理系统的数字身份:为自主代理建立可携带的授权标准

Partha Madhira

机构 * MIT(麻省理工学院)

专题命中 Agent评测 :autonomous agent(title,abstract);agentic(title);agent(abstract);分类 cs.AI

AI总结 本文针对自主代理在跨组织边界扩展时身份不足的问题,提出基于发行者授权负载、类型约束代数等的可携带授权模型,旨在实现授权的明确性、约束性与可审计性。

Comments 46 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06226 2026-05-12 cs.AI q-bio.GN 88%

A Versatile AI Agent for Rare Disease Diagnosis and Risk Gene Prioritization

一种多功能AI代理用于罕见病诊断和风险基因优先级排序

Tianyu Liu, Wangjie Zheng, Rui Yang, Benny Kai Guo Loo, Hui Zhang, Jeffries Lauran, Jianlei Gu, Botao Yu, Weihao Xuan, Kexin Huang, Nan Liu, James Zou, Yonghui Jiang, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Bioinformatics, Yale University(耶鲁大学计算生物学与生物信息学联合计划) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(哈佛大学与麻省理工学院联合Broad研究所) Center for Biomedical Data Science, Duke-NUS Medical School(杜克-新加坡医学学校生物医学数据科学中心) Sport and Exercise Medicine Service, KK Women’s and Children’s Hospital Training Program, Duke-NUS Medical School(杜克-新加坡医学学校KK妇女儿童医院运动与医学服务培训项目) Training Program, Duke-NUS Medical School(杜克-新加坡医学学校培训项目) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(日本理化学研究所高级智能项目中心) NUS Artificial Intelligence Institute, National University of Singapore(新加坡国立大学人工智能研究所) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Genetics, Yale University(耶鲁大学遗传学系) Wu Tsai Institute, Yale University(耶鲁大学吴天教授研究所) Department of Biomedical Informatics and Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文提出Hygieia系统,通过整合多源数据提升罕见病诊断准确性与风险基因优先级排序能力,实验表明其在多个诊断基准上表现优异,有效减轻临床工作负担。

Comments 32 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27464 2026-05-01 cs.CR cs.AI 88%

Security Attack and Defense Strategies for Autonomous Agent Frameworks: A Layered Review with OpenClaw as a Case Study

自主代理框架的安全攻击与防御策略:以OpenClaw为案例的分层综述

Luyao Xu, Xiang Chen

机构 * School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 本文通过分层分析探讨自主代理框架的安全风险与防御策略,以OpenClaw为案例,揭示威胁跨层传播的可能性及未来研究方向。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24826 2026-04-29 cs.CR cs.AI 88%

A Comparative Evaluation of AI Agent Security Guardrails

AI代理安全防护的比较评估

Qi Li, Jiu Li, Pingtao Wei, Jianjun Xu, Xueyi Wei, Jiwei Shi, Xuan Zhang, Yanhui Yang, Xiaodong Hui, Peng Xu, Lingquan Zhou

机构 * Beijing Caizhi Tech(北京彩智科技)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文比较了DKnownAI Guard与AWS Bedrock Guardrails、Azure Content Safety和Lakera Guard在AI代理安全场景中的性能,发现DKnownAI在召回率和真正负样本率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22436 2026-04-27 cs.AI cs.IR cs.MA 88%

AgentSearchBench: A Benchmark for AI Agent Search in the Wild

AgentSearchBench:面向真实世界的AI代理搜索基准

Bin Wu, Arastun Mammadli, Xiaoyu Zhang, Emine Yilmaz

机构 * Centre for Artificial Intelligence, University College London(人工智能研究中心,伦敦大学学院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 本文提出AgentSearchBench,一个基于真实世界代理的大规模基准,通过执行任务查询和高层任务描述,评估代理相关性,揭示语义相似性与实际性能间的差距,并展示轻量行为信号对排名质量的提升作用。

详情

展开后加载摘要…

URL PDF HTML 收藏