arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2606.20630 2026-06-23 cs.HC cs.AI cs.CY 新提交 87%

Design Principles for Human-Agent Interaction

人-智能体交互的设计原则

Haiyi Zhu, Canwen Wang, Qing Xiao, Hong Shen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);tool use(abstract);agentic(abstract)

AI总结 本文提出14条设计原则,涵盖初始、交互、长期和故障四个阶段,以指导设计可用、可信且有效的人-智能体交互系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14769 2026-06-16 econ.EM cs.AI cs.GT 新提交 87%

Agentomics: Economic Foundations for the Valuation, Attribution, and Pricing of AI Agents in Human-AI Workflows

Agentomics:人机协作工作流中AI代理的估值、归因和定价的经济基础

Quanyan Zhu

机构 * Department of Electrical and Computer Engineering, NYU Tandon School of Engineering(纽约大学Tandon工程学院电气与计算机工程系)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 提出Agentomics框架,基于工作流模型将AI部署视为联盟形成问题,使用Shapley值进行经济盈余归因,实现AI代理的估值、归因和定价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07728 2026-06-12 cs.SE cs.CY 87%

SARC: A Governance-by-Architecture Framework for Agentic AI Systems

SARC:一种用于代理AI系统的架构治理框架

Gaston Besanson

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出SARC框架,通过将约束作为第一类规范对象,实现对代理AI系统运行时的治理,减少硬约束违规并提升可审计性。

Comments Working Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15713 2026-06-03 cs.LO cs.AI cs.PL 87%

Just Type It in Isabelle! AI Agents Drafting, Mechanizing, and Generalizing from Human Hints

Just Type It in Isabelle! AI Agents Drafting, Mechanizing, and Generalizing from Human Hints

Kevin Kappelmann, Maximilian Schäffeler, Lukas Stevens, Mohammad Abdulaziz, Andrei Popescu, Dmitriy Traytel

机构 * Department of Computer Science, University of Sheffield, United Kingdom(英国谢菲尔德大学计算机科学系) Department of Informatics, King’s College London, United Kingdom(英国伦敦国王学院信息学院) Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系)

专题命中 Agent评测 :AI agent(title,title_cn);agent(abstract);分类 cs.AI

AI总结 研究Isabelle中秩一多态λ项的类型标注问题,通过人类和AI代理(LLM)分别进行纸笔证明和自动形式化,并利用人类提示进行改进和泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14102 2026-05-20 cs.AI 87%

ChromaFlow: A Negative Ablation Study of Orchestration Overhead in Tool-Augmented Agent Evaluation

ChromaFlow: 一种关于在工具增强代理评估中编排开销的负消融研究

Tarun Mittal

机构 * Octave-X

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);tool use(abstract);planning(abstract)

AI总结 该研究通过ChromaFlow框架分析了在工具增强自主推理中编排开销的影响,发现更激进的编排并未提升整体性能,反而增加了操作噪声,并强调了编排升级、确定性提取、证据协调、提供者健康门控和显式运行门控等作为可靠自主代理评估的第一要求。

Comments 12 pages, 6 tables, 1 figure. Updated with follow-up strict-provider full-Level-1 diagnostic

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16821 2026-05-19 cs.AI 87%

Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework

多范式代理交互实践:buddyMe框架中生成器-评估器、ReAct循环和对抗性评估的系统分析

Xiaohua Wang, Chao Han, Kai Yu, XiaoLiang Xu, Liang Wang

机构 * BuddyMe Research Team(buddyMe研究团队) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物技术有限公司)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文通过系统分析buddyMe框架中生成器-评估器、ReAct循环和对抗性评估三种代理交互范式,揭示了在实际应用中多范式代理系统的设计挑战与优化策略。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09817 2026-05-19 cs.SE cs.CR 87%

Evaluating Tool Cloning in Agentic-AI Ecosystems

评估代理AI生态系统中的工具克隆

Taein Kim, David Jiang, Yuepeng Hu, Yuqi Jia, Neil Gong

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);tool-use(abstract);分类 cs.SE

AI总结 研究通过大规模测量分析代理AI生态系统中工具克隆现象,发现高相似性区域普遍存在,60%的高Jaccard候选和85%的高ssdeep候选被验证为克隆,揭示工具克隆对生态系统多样性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12105 2026-05-13 cs.AI 87%

Autonomy and Agency in Agentic AI: Architectural Tactics for Regulated Contexts

自主性与代理性在代理AI中的作用:受监管环境中的架构策略

Damir Safin, Dian Balta

机构 * fortiss GmbH(fortiss公司) Research Institute of the Free State of Bavaria for software-intensive systems(巴伐利亚自由州软件密集系统研究机构)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);multi-agent(abstract)

AI总结 本文提出一个二维设计空间,通过六个架构策略和五个部署参数,为受监管环境中的代理AI设计提供原则性指导,强调责任、可审计性和可逆性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10763 2026-05-12 cs.AI cs.CR 87%

MATRA: Modeling the Attack Surface of Agentic AI Systems -- OpenClaw Case Study

MATRA:代理AI系统的攻击面建模——OpenClaw案例研究

Tim Van hamme, Thomas Vissers, Javier Carnerero-Cano, Mario Fritz, Emil C. Lupu, Lieven Desmet, Dinil Mon Divakaran

机构 * DistriNet, KU Leuven(DistriNet,根特大学) IBM Research(IBM研究院) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Imperial College London(伦敦帝国理工学院) A*STAR Institute for Infocomm Research(A*STAR信息与通信研究机构)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出MATRA框架,用于评估代理AI系统中已知威胁转化为具体风险的机制,通过OpenClaw案例展示如何利用攻击树和安全控制降低风险。

Comments Accepted for presentation at the 5th International Workshop on Designing and Measuring Security in Systems with AI (DeMeSSAI 2026), co-located with the 11th IEEE European Symposium on Security and Privacy (EuroS&P 2026), Lisbon, Portugal, July 10, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25083 2026-04-29 cs.AI cs.AR 87%

Agentic Architect: An Agentic AI Framework for Architecture Design Exploration and Optimization

代理架构:一种用于建筑设计探索和优化的代理AI框架

Alexander Blasberg, Vasilis Kypriotis, Dimitrios Skarlatos

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(title,summary_cn);分类 cs.AI

AI总结 本文提出Agentic Architect框架,结合LLM驱动的代码进化与精确模拟,实现计算机架构设计的探索与优化,展示了在缓存替换、数据预取和分支预测等领域的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19925 2026-04-23 econ.GN cs.AI cs.CY cs.HC q-fin.EC 87%

Behavioral Transfer in AI Agents: Evidence and Privacy Implications

人工智能代理中的行为迁移:证据与隐私影响

Shilei Luo, Zhiqi Zhang, Hengchen Dai, Dennis Zhang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 研究探讨了AI代理是否系统性地反映其人类所有者的行为特征,发现代理与所有者在行为上存在系统性迁移,且可能带来隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17308 2026-04-21 cs.AI 87%

SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents

SkillFlow:自主代理终身技能发现与演化的基准测试

Ziao Zhang, Kou Shi, Shiting Huang, Avery Nie, Yu Zeng, Yiming Zhao, Zhen Fang, Qishen Su, Haibo Qiu, Wei Yang, Qingnan Ren, Shun Zou, Wenxuan Huang, Lin Chen, Zehui Chen, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of Toronto(多伦多大学) University of Sydney(悉尼大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 SkillFlow通过166个任务测试自主代理能否发现、修复和维护技能库,揭示终身学习中技能演化的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17133 2026-04-21 cs.AI cs.CR 87%

If Only My CGM Could Speak: A Privacy-Preserving Agent for Question Answering over Continuous Glucose Data

若我的连续葡萄糖监测仪能说话:一个隐私保护的问答代理

Yanjun Cui, Ali Emami, Temiloluwa Prioleau, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院) Emory University(埃默里大学)

专题命中 Agent评测 :agent(title,summary_cn);分类 cs.AI

AI总结 本文提出CGM-Agent框架,通过本地计算实现隐私保护的连续葡萄糖数据问答,评估显示顶级模型在合成和现实查询中准确率分别为94%和88%。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16729 2026-04-21 cs.CV cs.AI 87%

Agentic Large Language Models for Training-Free Neuro-Radiological Image Analysis

基于代理的大型语言模型用于无训练神经放射学图像分析

Ayhan Can Erdur, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C. Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(放射肿瘤科,慕尼黑技术大学医院,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(人工智能在医疗和健康领域的主任,慕尼黑技术大学) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(人工智能在影像引导诊断和治疗领域的主任,慕尼黑技术大学) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,英国伦敦) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑分部,德国慕尼黑)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);multi-agent(abstract)

AI总结 本文提出一种无训练代理框架,利用外部工具实现脑MRI分析,涵盖预处理、病灶分割和体积分析,并通过公开BraTS数据集评估代理AI在神经放射学任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13452 2026-04-16 cs.CL 87%

CANVAS: Continuity-Aware Narratives via Visual Agentic Storyboarding

CANVAS:通过视觉代理脚本实现连续性叙事

Ishani Mondal, Yiwen Song, Mihir Parmar, Palash Goyal, Jordan Boyd-Graber, Tomas Pfister, Yale Song

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Google(谷歌)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 CANVAS通过多代理框架实现多镜头叙事中的视觉连续性,提升背景、角色和道具的一致性,优于现有基准,背景连续性提升21.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01487 2026-04-07 cs.AI cs.SI 87%

AgentSocialBench: Evaluating Privacy Risks in Human-Centered Agentic Social Networks

AgentSocialBench: 评估人类中心代理社交网络中的隐私风险

Prince Zizhuang Wang, Shuli Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 研究探讨了人类中心代理社交网络中的隐私挑战,提出AgentSocialBench基准,揭示代理协作中隐私保护的复杂性及现有LLM在隐私保护上的不足。

Comments 43 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23883 2026-04-07 cs.AI 87%

Agentic AI Security: Threats, Defenses, Evaluation, and Open Challenges

代理AI安全:威胁、防御、评估与开放挑战

Anshuman Chhabra, Shrestha Datta, Shahriar Kabir Nahin, Prasant Mohapatra

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文探讨代理AI系统的安全威胁与防御策略,分析其在自动化中的独特风险,并提出安全设计的开放挑战。

Comments Published in IEEE Access. DOI: https://doi.org/10.1109/access.2026.3675554

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11277 2026-03-16 cs.AI 87%

COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethics

COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架

Jean-Sébastien Dessureault, Alain-Thierry Iliho Manzi, Soukaina Alaoui Ismaili, Khadim Lo, Mireille Lalancette, Éric Bélanger

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05066 2026-02-26 cs.CR cs.AI 87%

Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks

通过代理式攻击绕过AI控制协议

Jafar Isbarov, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工学院计算机科学系)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);tool-use(abstract);agentic(abstract)

AI总结 本文提出通过代理式攻击绕过AI监控防御,显示即使大规模监控模型也易受攻击,揭示当前防御机制的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15212 2026-02-18 cs.AI 87%

Secure and Energy-Efficient Wireless Agentic AI Networks

安全且节能的无线代理人工智能网络

Yuanyan Song, Kezhi Wang, Xinmian Xu

机构 * Department of Computer Science, Brunel University of London(布鲁内尔大学计算机科学系) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 本文提出了一种安全且节能的无线代理人工智能网络,通过动态分配代理和优化资源分配,提升服务质量并降低能耗。

Comments Submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20613 2026-02-02 cs.CL 87%

AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios

AgentIF-OneDay: 一个面向日常场景的通用AI代理任务级指令遵循基准测试

Kaiyuan Chen, Qimin Wu, Taiyu Hou, Tianhao Tang, Xueyu Hu, Yuchen Hou, Bikun Li, Chengming Qian, Guoyin Wang, Haolin Chen, Haotong Tian, Haoye Zhang, Haoyu Bian, Hongbing Pan, Hongkang Zhang, Hongyi Zhou, Jiaqi Cai, Jiewu Rao, Jiyuan Ren, Keduan Huang, Lucia Zhu Huang, Mingyu Yuan, Naixu Guo, Qicheng Tang, Qinyan Zhang, Shuai Chen, Siheng Chen, Ting Ting Li, Xiaoxing Guo, Yaocheng Zuo, Yaoqi Guo, Yinan Wang, Yinzhou Yu, Yize Wang, Yuan Jiang, Yuan Tian, Yuanshuo Zhang, Yuxuan Liu, Yvette Yan Zeng, Zenyu Shan, Zihan Yin, Xiaobo Hu, Yang Liu, Yixin Ren, Yuan Gong

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 AgentIF-OneDay是一个面向日常场景的通用AI代理任务级指令遵循基准测试,旨在评估一般用户能否利用自然语言指令和AI代理完成多样化日常任务。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12560 2026-01-21 cs.AI cs.MA 87%

Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents

代理型人工智能(AI):架构、分类及大语言模型代理的评估

Arunkumar V, Gangadharan G. R., Rajkumar Buyya

机构 * University College of Engineering, Anna University(安娜大学工程学院) National Institute of Technology Tiruchirappalli(Tiruchirappalli 国家理工学院) School of Computing and Information Systems University of Melbourne(墨尔本大学计算机与信息系统学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文探讨了代理型人工智能的架构、分类及评估,提出统一分类框架,分析从线性推理到原生推理模型的转变,并指出未来研究方向以提升自主系统的可靠性。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11252 2025-11-17 cs.AI 87%

UAVBench: An Open Benchmark Dataset for Autonomous and Agentic AI UAV Systems via LLM-Generated Flight Scenarios

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)

Comments 18 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04064 2025-11-07 cs.SE 87%

Benchmarking and Studying the LLM-based Agent System in End-to-End Software Development

Zhengran Zeng, Yixin Li, Rui Xie, Wei Ye, Shikun Zhang

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);planning(abstract);workflow(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21117 2025-10-28 cs.AI 87%

DAO-AI: Evaluating Collective Decision-Making through Agentic AI in Decentralized Governance

Agostino Capponi, Alfio Gliozzo, Chunghyun Han, Junkyu Lee

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);workflow(abstract)

Comments 12 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09404 2025-10-14 cs.AI 87%

Agentic Systems in Radiology: Design, Applications, Evaluation, and Challenges

Christian Bluethgen, Dave Van Veen, Daniel Truhn, Jakob Nikolas Kather, Michael Moor, Malgorzata Polacin, Akshay Chaudhari, Thomas Frauenfelder, Curtis P. Langlotz, Michael Krauthammer, Farhad Nooralahzadeh

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);tool-use(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07999 2025-08-29 cs.CL 87%

WideSearch: Benchmarking Agentic Broad Info-Seeking

Ryan Wong, Jiawei Wang, Junjie Zhao, Li Chen, Yan Gao, Long Zhang, Xuan Zhou, Zuo Wang, Kai Xiang, Ge Zhang, Wenhao Huang, Yang Wang, Ke Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11027 2025-08-18 cs.CL 87%

Hell or High Water: Evaluating Agentic Recovery from External Failures

Andrew Wang, Sophia Hager, Adi Asija, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract);workflow(abstract)

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10055 2025-06-18 cs.CL 87%

TaskCraft: Automated Generation of Agentic Tasks

Dingfeng Shi, Jingyi Cao, Qianben Chen, Weichen Sun, Weizhen Li, Hongxuan Lu, Fangchen Dong, Tianrui Qin, King Zhu, Minghao Liu, Jian Yang, Ge Zhang, Jiaheng Liu, Changwang Zhang, Jun Wang, Yuchen Eleanor Jiang, Wangchunshu Zhou

机构 * Full author list in Contributions(完整作者列表)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02747 2025-06-12 cs.RO cs.AI cs.CR 87%

PatchPilot: A Cost-Efficient Software Engineering Agent with Early Attempts on Formal Verification

Hongwei Li, Yuheng Tang, Shiqi Wang, Wenbo Guo

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Meta

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏