arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2505.19433 2025-06-03 cs.LG 87%

Can Compressed LLMs Truly Act? An Empirical Evaluation of Agentic Capabilities in LLM Compression

Peijie Dong, Zhenheng Tang, Xiang Liu, Lujun Li, Xiaowen Chu, Bo Li

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)

Comments Accepted by ICML2025 as Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09674 2025-01-17 cs.CY cs.AI cs.NI 87%

Authenticated Delegation and Authorized AI Agents

Tobin South, Samuele Marro, Thomas Hardjono, Robert Mahari, Cedric Deslandes Whitney, Dazza Greenwood, Alan Chan, Alex Pentland

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19245 2026-06-19 cs.AI cs.LG 新提交 87%

TxBench-PP: Analyzing AI Agent Performance on Small-Molecule Preclinical Pharmacology

TxBench-PP:分析AI代理在小分子临床前药理学中的表现

Hannah Le, Ramesh Ramasamy, Alex Urrutia, Mahsa Yazdani, Tim Proctor, Kenny Workman

机构 * LatchBio

专题命中 Agent评测 :agent(title);AI agent(title);workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出TxBench-PP基准,用于评估AI代理从真实实验数据中恢复临床前药理学结论的能力,测试显示最强配置Claude Opus 4.8 / Pi仅通过59.3%的端点尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14691 2026-04-21 cs.AI cs.CL cs.CY 87%

CAMO: An Agentic Framework for Automated Causal Discovery from Micro Behaviors to Macro Emergence in LLM Agent Simulations

CAMO:一种用于从微观行为到宏观涌现的LLM代理模拟自动因果发现的框架

Xiangning Yu, Yuwei Guo, Yuqi Hou, Xiao Xue, Qun Ma

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能计算学院) Tianjin Key Laboratory of Healthy Habitat and Smart Technology(天津健康人居环境与智能技术重点实验室) Laboratory of Computation and Analytics of Complex Management Systems, Tianjin University(复杂管理系统计算与分析实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.AI、cs.CL

AI总结 CAMO通过分析LLM代理模拟中的微观行为,自动发现导致宏观结果的因果机制,提供可解释的因果链和干预手段,提升对社会涌现的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17512 2026-02-12 cs.AI cs.CL 87%

Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark

你的大语言模型真的掌握了概念吗?一个多智能体基准

Shuhang Xu, Weijian Deng, Yixuan Zhou, Fangwei Zhong

机构 * Beijing Normal University(北京师范大学) Australian National University(澳大利亚国立大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.CL

AI总结 本文提出CK-Arena,通过多智能体社交推理游戏评估大语言模型的概念理解能力,揭示模型在概念掌握上的差异性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19874 2025-11-26 cs.CR cs.AI cs.LG 87%

Cross-LLM Generalization of Behavioral Backdoor Detection in AI Agent Supply Chains

人工智能代理供应链中行为后门检测的跨LLM泛化

Arun Chowdary Sanna

机构 * Arun Chowdary Sanna(独立研究者)

专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI、cs.LG

AI总结 本研究首次系统探讨了跨LLM行为后门检测的泛化问题,发现模型特定特征导致泛化差距,并提出模型感知检测方法提升检测准确率。

Comments 10 pages, 2 figures, 8 tables. Evaluation across 6 production LLMs with 1,198 traces

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17393 2025-08-26 cs.CL cs.AI 87%

Agent-Testing Agent: A Meta-Agent for Automated Testing and Evaluation of Conversational AI Agents

Sameer Komoravolu, Khalil Mrini

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Grammarly

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12806 2025-08-05 cs.AI cs.CL 87%

MCPEval: Automatic MCP-based Deep Evaluation for AI Agent Models

Zhiwei Liu, Jielin Qiu, Shiyu Wang, Jianguo Zhang, Zuxin Liu, Roshan Ram, Haolin Chen, Weiran Yao, Shelby Heinecke, Silvio Savarese, Huan Wang, Caiming Xiong

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL

Comments https://github.com/SalesforceAIResearch/MCPEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00466 2024-07-02 cs.CL cs.AI 87%

BioKGBench: A Knowledge Graph Checking Benchmark of AI Agent for Biomedical Science

Xinna Lin, Siqi Ma, Junjie Shan, Xiaojing Zhang, Shell Xu Hu, Tiannan Guo, Stan Z. Li, Kaicheng Yu

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.08294 2021-09-20 cs.AI cs.LG cs.MA 87%

A Logic-based Multi-agent System for Ethical Monitoring and Evaluation of Dialogues

Abeer Dyoub, Stefania Costantini, Ivan Letteri, Francesca A. Lisi

专题命中 Agent评测 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.LG

Comments In Proceedings ICLP 2021, arXiv:2109.07914

Journal ref EPTCS 345, 2021, pp. 182-188

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01816 2026-06-02 q-bio.BM cs.LG 87%

Site4Drug: Predicting Drug-Binding Target Sites with an AI Agent

Site4Drug: 利用AI智能体预测药物结合靶点

Taehan Kim, Sarrah Rose Mikhail Leung, Bharat Mekala, Jeongbin Park

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.LG;agentic(comments)

AI总结 提出Site4Drug,一种模态感知的靶点发现智能体,通过整合拓扑、亲水性、翻译后修饰等证据,输出带约束、风险标记和决策日志的可靶向区域排名列表,并自动推荐结合模态。

Comments Accepted to the ICML 2026 Workshop on Generative and Agentic AI for Biology (GenBio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19865 2026-07-23 cs.AI cs.CL cs.LG 新提交 87%

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations

DocOps:复杂文档操作中自主智能体的可验证基准

Jiazhen Jiang, Boxi Cao, Lingyong Yan, Yaojie Lu, Hongyu Lin, Shuaiqiang Wang, Dawei Yin, Xianpei Han, Le Sun

专题命中 Agent评测 :autonomous agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 研究自主智能体处理数字文档的能力,引入DocOps评估框架,解构文档操作,评估多种模型,发现其局限性及关键失败模式,揭示能力边界,为健壮无损智能体设计提供启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19410 2026-05-20 cs.CV 87%

Vision Harnessing Agent for Open Ad-hoc Segmentation

用于开放即兴分割的视觉引导代理

Zilin Wang, Stella X. Yu

机构 * University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);workflow(abstract);agentic(abstract)

AI总结 本文提出了一种名为VASA的视觉引导即兴分割代理,该代理通过结合视觉语言模型、分割基础模型和视觉引导工作流,实现了无需训练的即兴分割任务,其在PARS和RefCOCO等基准测试中均表现出色。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08703 2026-05-12 cs.AI cs.CL cs.CV cs.LG 87%

RewardHarness: Self-Evolving Agentic Post-Training

RewardHarness: 自我进化代理的后训练

Yuxuan Zhang, Penghui Du, Bo Li, Cong Wei, Junwen Miao, Huaisong Zhang, Songcheng Cai, Yubo Wang, Dongfu Jiang, Yuyu Zhang, Ping Nie, Wenhu Chen, Changqian Yu, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Kolors Team, Kuaishou Technology(快手团队) Carnegie Mellon University(卡内基梅隆大学) University of Waterloo(滑铁卢大学) Etude AI Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.CL、cs.LG

AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。

Comments Project page: https://rewardharness.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03117 2026-05-08 cs.CR 87%

AgentDyn: Are Your Agent Security Defenses Deployable in Real-World Dynamic Environments?

AgentDyn: 您的代理安全防御能在现实世界动态环境中部署吗?

Hao Li, Ruoyao Wen, Shanghao Shi, Ning Zhang, Yevgeniy Vorobeychik, Chaowei Xiao

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);planning(abstract);agentic(abstract)

AI总结 本文揭示现有代理安全基准的三大缺陷,提出AgentDyn基准,包含60个挑战性开放任务和560个注入测试用例,评估十种先进防御,发现现有防御不足或过度防御,亟需更适应动态环境的基准。

Comments 26 Pages, 17 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10342 2026-03-12 cs.DC 87%

AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU

AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计

Yuning Zhang, Yan Yan, Nan Yang, Dong Yuan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08706 2026-03-10 cs.AI cs.CL cs.LG 87%

Agentic Critical Training

代理批判训练

Weize Liu, Minghui Liu, Sy-Tuyen Ho, Souradip Chakraborty, Xiyao Wang, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院公园分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。

Comments Project page: https://attention-is-all-i-need.github.io/ACT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16499 2025-12-01 cs.CL cs.AI cs.LG 87%

Automated Composition of Agents: A Knapsack Approach for Agentic Component Selection

代理自动组合:一种背包方法用于代理组件选择

Michelle Yuan, Khushbu Pahwa, Shuaichen Chang, Mustafa Kaba, Jiarong Jiang, Xiaofei Ma, Yi Zhang, Monica Sunkara

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于背包问题的代理组件自动组合框架,通过动态评估组件性能与成本,提升代理系统在不同场景下的成功率和资源利用效率。

Comments Accepted to NeurIPS 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10519 2025-07-28 cs.AI cs.CL cs.LG cs.MA 87%

Toward Super Agent System with Hybrid AI Routers

Yuhang Yao, Haixin Wang, Yibo Chen, Jiawen Wang, Min Chang Jordan Ren, Bosheng Ding, Salman Avestimehr, Chaoyang He

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22457 2024-10-31 cs.AI cs.CL cs.LG cs.MA 87%

Advancing Agentic Systems: Dynamic Task Decomposition, Tool Integration and Evaluation using Novel Metrics and Dataset

Adrian Garret Gabriel, Alaa Alameer Ahmad, Shankar Kumar Jeyakumar

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 38th Conference on Neural Information Processing Systems (NeurIPS 2024), NeurIPS 2024 Workshop on Open-World Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14484 2024-08-28 cs.AI cs.CL cs.LG 87%

Agentic Retrieval-Augmented Generation for Time Series Analysis

Chidaksh Ravuru, Sagar Srinivas Sakhinana, Venkataramana Runkana

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Paper was accepted for Undergraduate Consortium at ACM KDD, 2024. Please find the link: https://kdd2024.kdd.org/undergraduate-consortium/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25398 2026-08-05 cs.AI cs.CL 版本更新 87%

HANDBOOK.md: A Benchmark for Long-Context Agentic Instruction Following

HANDBOOK.md:长上下文代理指令跟随基准测试

Liudas Panavas, Sebastian Minus, Bradley Monton, Derek Ray, Suhaas Garre, Sushant Mehta, Edwin Chen

机构 * Surge AI

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,comments);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 该研究提出HANDBOOK.md基准测试,模拟企业员工遵循公司手册,含65个代理任务跨越多领域多公司。任务修改基础手册防记忆,评分具确定性。测试发现模型配置通过率低,代理常违背策略,还发布了所有任务、环境及评估工具。

Comments 16 pages, 3 figures, 5 tables. Accepted to the Workshop on Agent Behavior (WAB) at COLM 2026. Benchmark, environments, and evaluation harness: https://github.com/surge-ai/handbook

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10057 2026-03-12 cs.CR cs.AI cs.SE 87%

SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation

Petar Radanliev, Carsten Maple, Omar Santos, Kayvan Atefi

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

Comments Petar Radanliev, Carsten Maple, Omar Santos, and Kayvan Atefi. 2026. SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation. Digital Threats Just Accepted (March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19764 2026-03-02 cs.LG cs.AI 87%

Multi-View Encoders for Performance Prediction in LLM-Based Agentic Workflows

多视角编码器在基于大语言模型的代理工作流性能预测中的应用

Patara Trirat, Wonyong Jeong, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Agentic Predictor,通过多视角编码技术与跨领域预训练,实现高效准确的代理工作流性能预测,提升LLM代理系统设计效率。

Comments ICLR 2026, Project Page: https://deepauto-ai.github.io/agentic-predictor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25921 2026-07-29 cs.CV cs.AI 新提交 86%

Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型

Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman

机构 * Sony Interactive Entertainment(索尼互动娱乐)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);分类 cs.AI

AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22368 2026-07-27 cs.AI 新提交 86%

Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

智能体基准测试能衡量能力吗?智能体人工智能时代的协议有效性

Jiaqi Shao, Hanck Chen, Wei Zhang, Maxm Pan, Bing Luo

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(昆山杜克大学)

专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.AI

AI总结 研究智能体基准测试分数能否衡量能力,提出协议有效性概念及HackDetect事后审计方法,通过审计多基准测试轨迹发现暴露和奖励破解证据,量化分数膨胀,强调基准测试报告应证明分数反映预期能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14264 2026-07-17 cs.CV cs.CL 新提交 86%

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理

Yi Lin, Yihao Ding, Elana Benishay, Elefterios Trikantzopoulos, David Nauheim, Hanley Ong, Jiang Bian, Hua Xu, Yuzhe Yang, George Shih, Yifan Peng

机构 * Weill Cornell Medicine(威尔康乃尔医学院) University of Western Australia(西澳大利亚大学) Indiana University(印第安纳大学) Regenstrief Institute(瑞根斯特里夫研究所) Yale University(耶鲁大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.CL

AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16120 2026-06-15 cs.AI 版本更新 86%

LLM-Powered AI Agent Systems and Their Applications in Industry

基于大语言模型的AI智能体系统及其工业应用

Guannan Liang, Qianqian Tong

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文综述了从传统智能体到LLM驱动智能体的演进,分类为软件、物理和自适应混合系统,并讨论了在客服、软件开发、制造、教育、金融和医疗等领域的应用及挑战。

Comments This is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06462 2026-06-05 cs.AI 86%

Benchmark Everything Everywhere All at Once

无处不在的基准测试

Shiyun Xiong, Dongming Wu, Peiwen Sun, Yuang Ai, Bokang Yang, Wencheng Han, Xiao-Hui Li, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(中大香港实验室) CPII under InnoHK(创新香港 CPII) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Shandong University(山东大学) Huawei Technologies(华为技术)

专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出Benchmark Agent,一个全自主智能体系统,自动化基准构建流程,以解决现有基准构建劳动密集、难以复用和性能饱和的问题。

Comments Project page: https://benchmarkagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00931 2026-06-02 cs.CV cs.AI 86%

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

CV-Arena: 面向教学计算机视觉问题求解的开放基准与人类-AI协作偏好

Fangzhou Lin, Peiran Li, Lingyu Xu, Wenjing Chen, Qianwen Ge, Shuo Xing, Mingyang Wu, Xiangbo Gao, Siyuan Yang, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhen Dong, Ming-Hsuan Yang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工大学) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达) UCSB(加州大学圣塔芭芭拉分校) UC Merced(加州大学默塞德分校)

专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 提出CV-Arena基准,包含12K高分辨率真实图像指令对,覆盖16种任务类型,并采用Active Elo协议结合人类与AI偏好评估21个系统,揭示指令遵循、物理推理等方面的差距,同时开发CV-Agent代理模型展示闭环推理的潜力。

Comments 26 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏