arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2605.13471 2026-05-14 cs.CR 85%

Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents

睡眠通道与溯源门:始终在线自主AI代理中的持久提示注入

Narek Maloyan, Dmitry Namiot

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,abstract_cn)

AI总结 研究提出睡眠通道概念,揭示始终在线AI代理中持久提示注入的机制,并通过层级防御方案和形式化证明提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10622 2026-05-12 cs.CL cs.AI cs.LG 85%

SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation

SDialog:一个用于端到端代理构建、用户模拟、对话生成和评估的Python工具包

Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert, Pawel Cyrta, Yiyang Chen, Srikanth Madikeri, Thomas Schaaf, Esaú Villatoro-Tello, Ahmed Hassoon, Ricard Marxer, Petr Motlicek

机构 * Idiap Research Institute(Idiap研究 institute) Université de Toulon(里昂大学) Aix Marseille Univ(马赛大学) LIS(LIS实验室) Avignon University(阿维尼翁大学) Zenidoc University of Zurich(苏黎世Zenidoc大学) Stenograf Solventum CNRS & ILLS(Solventum CNRS与ILLs) Johns Hopkins University(约翰霍普金斯大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 SDialog工具包通过统一的对话生成、评估和可解释性框架,提供多代理模拟、综合评估、机制可解释性和音频生成功能,支持混合后端实验。

Comments Pre-print submitted to EACL System Demonstration (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08922 2026-05-12 cs.CR 85%

Toward Web 4.0: Bidirectional Trust between AI Agents and Blockchain

迈向Web 4.0:AI代理与区块链之间的双向信任

Yunfeng Xia, Chao Li, Lei Li, Chenhao Zhang, Li Duan, Runhua Xu, Wei Wang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract)

AI总结 本文探讨AI代理与区块链之间的双向信任机制,分析区块链为代理提供的信任基础设施及AI代理在区块链核心机制中的参与,揭示现有标准生态的不足及未来研究方向。

Comments due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19968 2026-04-23 physics.soc-ph econ.GN nlin.AO q-fin.EC 85%

Stochastic Networked Governance: Bridging Econophysics and Institutional Dynamics in a Positive-Sum Agent-Based Model

随机网络治理:在积极和解的 agent-based 模型中连接经济物理学与制度动态

Alok Yadav, Saroj Yadav

专题命中 Agent评测 :agent(title,title_cn)

AI总结 本文提出随机网络治理模型,通过二进制制度基因定义司法管辖区,研究制度互补性、内生增长和结构性改革的非线性宏观经济惩罚,利用历史数据模拟1970-2017年全球前100经济体的经济演变。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08538 2026-04-14 cs.CV 85%

ParseBench: A Document Parsing Benchmark for AI Agents

ParseBench:面向AI代理的文档解析基准测试

Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Daniel B. Ospina, Simon Suo

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract)

AI总结 本文提出ParseBench,一个包含2000多页企业文档的基准测试,涵盖表格、图表、内容忠实度、语义格式和视觉关联五大能力维度,揭示了当前系统在这些方面的能力缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03733 2026-04-07 q-fin.GN 85%

SoK: Blockchain Agent-to-Agent Payments

SoK: 区块链代理间支付

Yuanzhe Zhang, Yuexin Xiang, Yuchen Lei, Qin Wang, Tian Qiu, Yujing Sun, Spiridon Zarkov, Tsz Hon Yuen, Andreas Deppeler, Jiangshan Yu, Kwok-Yan Lam

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract)

AI总结 本文系统化研究区块链支持的代理间支付,提出四阶段生命周期,识别关键挑战并提出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02792 2026-04-06 cs.CY cs.HC 85%

Generative AI Use in Professional Graduate Thesis Writing: Adoption, Perceived Outcomes, and the Role of a Research-Specialized Agent

生成AI在专业研究生论文写作中的应用:采用情况、感知成果及研究专用代理的作用

Kenji Saito, Rei Tajika, Satoru Shibuya, Hiroshi Kanno

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);workflow(abstract)

AI总结 研究探讨了生成AI在研究生论文写作中的应用现状、学生感知效果及研究专用代理的作用,发现AI使用广泛,学生普遍认为其提升了论文结构、修订质量和写作效率,但对输出准确性仍存顾虑。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23801 2026-03-26 cs.CR 85%

AgentRFC: Security Design Principles and Conformance Testing for Agent Protocols

AgentRFC:关于智能体协议的安全设计原则与合规性测试

Shenghan Zheng, Qifan Zhang

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出AgentProtocolStack、Agent-AgnosticSecurityModel和AgentConform,旨在为智能体协议提供系统性的安全框架,解决协议合规性测试问题,并揭示协议组合时的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18922 2026-03-24 cs.CL cs.AI cs.LG 85%

Why Agent Caching Fails and How to Fix It: Structured Intent Canonicalization with Few-Shot Learning

为何智能体缓存失效及如何修复:基于少样本学习的结构化意图规范化

Abhinaba Basu

专题命中 Agent评测 :agent(title);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出结构化意图分解框架W5H2,通过少样本学习显著提升缓存效率,实验显示在多个基准测试中性能优于现有方法,同时实现成本降低。

Comments Added github repo and Hugging Face dataset link

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08199 2026-03-20 cs.OS cs.DC 85%

Fork, Explore, Commit: OS Primitives for Agentic Exploration

分支、探索、提交:用于代理探索的操作系统原语

Cong Wang, Yusheng Zheng

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 本文提出分支上下文操作系统抽象,支持并行探索路径和原子提交回滚,通过BranchFS和branch系统调用实现,提升代理探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13517 2026-03-18 cs.CR 85%

CTI-REALM: Benchmark to Evaluate Agent Performance on Security Detection Rule Generation Capabilities

CTI-REALM:评估安全检测规则生成能力的基准测试

Arjun Chakraborty, Sandra Ho, Adam Cook, Manuel Meléndez

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);workflow(abstract)

AI总结 CTI-REALM基准测试旨在评估AI代理解读网络威胁情报和生成检测规则的能力,通过模拟真实安全分析师工作流程,评估代理在不同系统和平台上的表现,展示了AI代理在检测工程中的潜力。

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10795 2026-03-12 cs.CR cs.ET 85%

Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security?

重新评估 EVMBench:AI代理是否准备好应对智能合约安全?

Chaoyuan Peng, Lei Wu, Yajin Zhou

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract)

AI总结 重新评估EVMBench发现AI代理在智能合约安全检测中存在稳定性、真实事件处理和框架依赖性问题,挑战了自动化审计的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01564 2026-03-03 cs.CR 85%

From Secure Agentic AI to Secure Agentic Web: Challenges, Threats, and Future Directions

从安全代理AI到安全代理网络:挑战、威胁与未来方向

Zhihang Deng, Jiaping Gui, Weinan Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 本文探讨了从安全代理AI到安全代理网络的过渡,分析了代理系统在开放网络环境中的安全挑战与威胁,并提出了应对策略和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01051 2026-03-03 cs.LG cs.AI cs.CL 85%

GEM: A Gym for Agentic LLMs

GEM:代理大语言模型的训练环境

Zichen Liu, Anya Sims, Keyu Duan, Changyu Chen, Simon Yu, Xiangxin Zhou, Haotian Xu, Shaopan Xiong, Bo Liu, Chenmien Tan, Chuen Yang Beh, Weixun Wang, Hao Zhu, Weiyan Shi, Diyi Yang, Michael Shieh, Yee Whye Teh, Wee Sun Lee, Min Lin

机构 * Sea AI Lab(海智实验室) NUS(国立大学新加坡) Oxford(牛津大学) SMU(南卫理安大学) Stanford(斯坦福大学) Northeastern(东北大学) OpenRLHF(开放强化学习基金会) ROLL RL2 absolute AI(绝对人工智能)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 GEM是一个为代理LLM设计的开源训练环境,提供标准化接口、多样化环境和基准测试功能,用于促进基于经验的学习和强化学习算法的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12685 2026-02-16 cs.CL cs.AI cs.LG 85%

ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction

ToolACE-MT:非自回归生成用于代理多轮交互

Xingshan Zeng, Weiwen Liu, Lingzhi Wang, Liangyou Li, Fei Mi, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 ToolACE-MT通过非自回归生成方法高效构建高质量多轮代理对话,解决传统自回归方法效率低下的问题。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22269 2026-02-02 cs.AI cs.CL cs.LG 85%

JAF: Judge Agent Forest

JAF:裁判代理森林

Sahil Garg, Brad Cheezum, Sridhar Dutta, Vishal Agarwal

机构 * Averlon

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 JAF通过裁判代理森林框架,利用联合推理和集合学习原理,提升主代理的自我改进能力,通过高效的哈希算法优化多样示例选择,改进推理路径探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09150 2026-01-30 cs.HC 85%

World Craft: Agentic Framework to Create Visualizable Worlds via Text

World Craft: 一种通过文本创建可视化世界的代理框架

Jianwen Sun, Yukang Feng, Kaining Ying, Chuanhao Li, Zizhen Li, Fanrui Zhang, Jiaxin Ai, Yifan Chang, Yu Dai, Yifei Huang, Kaipeng Zhang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract)

AI总结 World Craft通过文本描述创建可视化世界,结合结构化模块和多代理框架,提升环境构建的效率和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05788 2025-12-18 eess.SY cs.SY 85%

Task-Specific Trust Evaluation for Multi-Hop Collaborator Selection via GNN-Aided Distributed Agentic AI

基于图神经网络的多跳协作者选择任务特定信任评估

Botao Zhu, Xianbin Wang, Dusit Niyato

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract)

AI总结 本文提出基于图神经网络的分布式代理人工智能框架,用于多跳协作者选择中的任务特定信任评估,通过整合设备可信度评估结果,实现隐私保护的任务路径规划。

Journal ref IEEE Journal on Selected Areas in Communications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09964 2025-12-12 q-bio.GN 85%

Development of an Agentic AI Model for NGS Downstream Analysis Targeting Researchers with Limited Biological Background

面向生物背景有限研究者的NGS下游分析代理AI模型开发

Donghyeon Lee, Dongseok Kim, Seokhwan Ko, Seo-Young Park, Junghwan Cho

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)

AI总结 本文提出了一种面向生物背景有限研究者的代理AI模型,通过自动化NGS下游分析、文献支持的解释和高级分析方法推荐,实现从基础数据处理到假设验证的无缝过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03180 2025-12-04 cs.MA cs.ET 85%

AGENTSAFE: A Unified Framework for Ethical Assurance and Governance in Agentic AI

AGENTSAFE:面向代理AI的统一伦理保障与治理框架

Rafflesia Khan, Declan Joyce, Mansura Habiba

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract)

AI总结 AGENTSAFE提出一个统一的治理框架,通过风险分类转化为可操作的设计、运行时和审计控制,提供可衡量的预部署保障,并通过运行时治理和问责机制建立代理AI生态系统的信任。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19955 2025-10-23 cs.LG cs.AI cs.CL 85%

MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research

Hui Chen, Miao Xiong, Yujie Lu, Wei Han, Ailin Deng, Yufei He, Jiaying Wu, Yibo Li, Yue Liu, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 49 pages, 9 figures. Accepted by NeurIPS 2025 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14064 2025-10-08 cs.CR 85%

DoomArena: A framework for Testing AI Agents Against Evolving Security Threats

Leo Boisvert, Mihir Bansal, Chandra Kiran Reddy Evuru, Gabriel Huang, Abhay Puri, Avinandan Bose, Maryam Fazel, Quentin Cappart, Jason Stanley, Alexandre Lacoste, Alexandre Drouin, Krishnamurthy Dvijotham

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09734 2025-09-15 cs.CL cs.AI cs.LG 85%

MCP-AgentBench: Evaluating Real-World Language Agent Performance with MCP-Mediated Tools

Zikang Guo, Benfeng Xu, Chiwei Zhu, Wentao Hong, Xiaorui Wang, Zhendong Mao

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17967 2025-09-03 cs.LG cs.AI cs.CL cs.MA q-fin.ST 85%

Agent Trading Arena: A Study on Numerical Understanding in LLM-Based Agents

Tianmi Ma, Jiawei Du, Wenxin Huang, Wenjie Wang, Liang Xie, Xian Zhong, Joey Tianyi Zhou

机构 * Wuhan University of Technology(武汉理工大学) Agency for Science, Technology and Research, Singapore(新加坡科技研究局) Hubei University(湖北大学) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17435 2025-08-26 cs.CV 85%

An LLM-LVLM Driven Agent for Iterative and Fine-Grained Image Editing

Zihan Liang, Jiahao Sun, Haoran Ma

机构 * Kunming University of Science and Technology(昆明理工大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);agentic(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02808 2025-08-06 cs.CL cs.AI cs.LG 85%

Clinically Grounded Agent-based Report Evaluation: An Interpretable Metric for Radiology Report Generation

Radhika Dua, Young Joon, Kwon, Siddhant Dogra, Daniel Freedman, Diana Ruan, Motaz Nashawaty, Danielle Rigau, Daniel Alexander Alber, Kang Zhang, Kyunghyun Cho, Eric Karl Oermann

机构 * New York University(纽约大学) NYU Langone Health(纽约大学兰格医学中心) Genentech(基因泰克) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) Wenzhou Medical University(温州医科大学) Macau University of Science and Technology(澳门科学大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09420 2025-06-12 cs.AI cs.CL cs.HC cs.LG cs.MA 85%

A Call for Collaborative Intelligence: Why Human-Agent Systems Should Precede AI Autonomy

Henry Peng Zou, Wei-Chieh Huang, Yaozu Wu, Chunyu Miao, Dongyuan Li, Aiwei Liu, Yue Zhou, Yankai Chen, Weizhi Zhang, Yangning Li, Liancheng Fang, Renhe Jiang, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Tokyo(东京大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06994 2025-06-10 cs.SE cs.AI cs.CL 85%

SyncMind: Measuring Agent Out-of-Sync Recovery in Collaborative Software Engineering

Xuehang Guo, Xingyao Wang, Yangyi Chen, Sha Li, Chi Han, Manling Li, Heng Ji

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05439 2025-05-01 cs.AI cs.CE cs.CL cs.LG 85%

Agentic AI Systems Applied to tasks in Financial Services: Modeling and model risk management crews

Izunna Okpala, Ashkan Golgoon, Arjun Ravi Kannan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15418 2025-04-23 cs.RO cs.SY eess.SY 85%

MRTA-Sim: A Modular Simulator for Multi-Robot Allocation, Planning, and Control in Open-World Environments

Victoria Marie Tuck, Hardik Parwana, Pei-Wei Chen, Georgios Fainekos, Bardh Hoxha, Hideki Okamoto, S. Shankar Sastry, Sanjit A. Seshia

机构 * Department of Electrical Engineering and Computer Sciences, University of California at Berkeley(加州大学伯克利分校电子工程与计算机科学系) Toyota Motor North America(丰田北美公司)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);multi-agent(abstract)

Comments 8 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏