arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2605.12673 2026-05-14 cs.AI cs.CR 86%

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

安卓会为打破游戏而做梦吗?通过BenchJack系统性审计AI代理基准

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出BenchJack系统,通过自动化红队系统审计AI代理基准,发现219种奖励黑客漏洞,提升基准鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05846 2026-05-08 cs.CR cs.AI 86%

LoopTrap: Termination Poisoning Attacks on LLM Agents

LoopTrap: 对 LLM agent 的终止污染攻击

Huiyu Xu, Zhibo Wang, Wenhui Zhang, Ziqi Zhu, Yaopeng Wang, Kui Ren, Chun Chen

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) School of Cyber Science and Engineering(网络安全与工程学院) Southeast University(东南大学)

专题命中 Agent评测 :agent(title_cn,summary_cn);分类 cs.AI

AI总结 本文研究了LLM agent迭代执行循环中的终止污染风险,提出10种攻击策略并通过实验证明不同agent的行为特征影响攻击效果,设计了自动化框架LoopTrap以提升红队攻击效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27309 2026-05-01 cs.AI 86%

End-to-End Evaluation and Governance of an EHR-Embedded AI Agent for Clinicians

面向临床医生的嵌入式电子健康记录(EHR)AI代理的端到端评估与治理

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级医疗)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada(内华达大学儿科系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出一个端到端治理框架,通过rubric验证、实时部署反馈、技术性能监控和成本追踪,持续优化临床AI系统性能,实验显示系统性能显著提升。

Comments 19 pages, 6 figures, 6 tables, submitted to npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15080 2026-03-19 cs.DB cs.AI q-bio.QM 86%

Open Biomedical Knowledge Graphs at Scale: Construction, Federation, and AI Agent Access with Samyama Graph Database

大规模开放生物医学知识图谱:基于Samyama图数据库的构建、联邦与AI代理访问

Madhulatha Mandarapu, Sandeep Kunkunuru

机构 * VaidhyaMegha Private Limited(维达希亚梅加私人有限公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出三种开源生物医学知识图谱,通过可重复的ETL模式构建大规模图谱,实现跨图谱联邦与AI代理访问,展示了高精度的领域特定工具。

Comments 12 pages, 7 tables, open-source code and data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01952 2026-03-03 cs.AI 86%

LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations

LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准

Viet-Thanh Pham, Lizhen Qu, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 Agent评测 :agent(title);multi-agent(title);autonomous agent(abstract);分类 cs.AI

AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08412 2026-02-12 cs.AI 86%

From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent

从助手到双代理:形式化和评估 OpenClaw 对个性化本地 AI 代理的攻击

Yuhang Wang, Feiming Xu, Zheng Lin, Guangyu He, Yuzhe Huang, Haichang Gao, Zhenxing Niu, Shiguo Lian, Zhaoxiang Liu

机构 * Xidian University(西安电子科技大学) Data Science & Artificial Intelligence Research Institute(数据科学与人工智能研究院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出个性化代理安全评估框架 PASB,用于评估 OpenClaw 在现实部署中的安全风险,揭示其在多个执行阶段的关键漏洞。

Comments 11 pages,2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00685 2026-02-03 cs.AI 86%

HumanStudy-Bench: Towards AI Agent Design for Participant Simulation

HumanStudy-Bench: 向参与者模拟的AI代理设计迈进

Xuan Liu, Haoyang Shang, Zizhang Liu, Xinyan Liu, Yunze Xiao, Yiwen Tu, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 HUMANSTUDY-BENCH通过代理设计问题重建人类受试者实验,评估代理行为与人类行为的一致性,涵盖个体认知、战略互动和社会心理学领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08333 2026-01-14 cs.AI 86%

Semantic Laundering in AI Agent Architectures: Why Tool Boundaries Do Not Confer Epistemic Warrant

人工智能代理架构中的语义清洗:为什么工具边界不赋予认知证成

Oleg Romanchuk, Roman Bondar

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文指出基于LLM的代理架构中存在语义清洗问题,即缺乏证成的命题通过架构信任接口被接受,导致认知证成无法消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24045 2026-01-07 cs.DC cs.LG 86%

Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC

Agent.xpu: 高效调度代理LLM工作负载于异构SoC

Xinming Wei, Jiahao Zhang, Haoran Li, Jiayu Chen, Haoning Guan, Rui Qu, Maoliang Li, Xiang Chen, Guojie Luo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) The University of Hong Kong(香港大学) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(title);分类 cs.LG

AI总结 Agent.xpu通过异构执行图和流感知协调技术,高效调度代理LLM工作负载,提升主动吞吐量和反应性响应性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00481 2026-01-05 cs.NI cs.AI 86%

MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability

MAESTRO:多智能体评估套件用于测试、可靠性与可观测性

Tie Ma, Yixi Chen, Vaastav Anand, Alessandro Cornacchia, Amândio R. Faustino, Guanheng Liu, Shan Zhang, Hongbin Luo, Suhaib A. Fahmy, Zafar A. Qazi, Marco Canini

机构 * Beihang University(北航大学)

专题命中 Agent评测 :agent(title);multi-agent(title);agentic(abstract);分类 cs.AI

AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22529 2025-12-30 cs.AI cond-mat.mtrl-sci 86%

Multi-AI Agent Framework Reveals the "Oxide Gatekeeper" in Aluminum Nanoparticle Oxidation

多AI代理框架揭示铝纳米颗粒氧化的'氧化守门人'

Yiming Lu, Tingyu Lu, Di Zhang, Lili Ye, Hao Li

专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI

AI总结 本文提出多AI代理框架,揭示铝纳米颗粒氧化的'氧化守门人'机制,解决氧化过程中的质量传输问题,建立统一的原子尺度设计框架。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02823 2025-11-05 cs.AI 86%

Optimizing AI Agent Attacks With Synthetic Data

Chloe Loughridge, Paul Colognese, Avery Griffin, Tyler Tracy, Jon Kutasov, Joe Benton

专题命中 Agent评测 :agent(title);AI agent(title);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04550 2025-10-14 cs.AI 86%

TRAJECT-Bench:A Trajectory-Aware Benchmark for Evaluating Agentic Tool Use

Pengfei He, Zhenwei Dai, Bing He, Hui Liu, Xianfeng Tang, Hanqing Lu, Juanhui Li, Jiayuan Ding, Subhabrata Mukherjee, Suhang Wang, Yue Xing, Jiliang Tang, Benoit Dumoulin

机构 * Michigan State University(密歇根州立大学) Amazon Inc.(亚马逊公司) Hippocratic AI Penn State University(宾夕法尼亚州立大学)

专题命中 Agent评测 :tool use(title,abstract);agentic(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21501 2025-09-29 cs.HC cs.CL 86%

LLM Agent Meets Agentic AI: Can LLM Agents Simulate Customers to Evaluate Agentic-AI-based Shopping Assistants?

Lu Sun, Shihan Fu, Bingsheng Yao, Yuxuan Lu, Wenbo Li, Hansu Gu, Jiri Gesi, Jing Huang, Chen Luo, Dakuo Wang

机构 * University of California San Diego La Jolla California United States Northeastern University Boston Massachusetts United States North Carolina State University Raleigh North Carolina United States Independent Researcher Seattle Washington United States Independent Researcher Palo Alto California United States University of California San Diego Northeastern University North Carolina State University Independent Researcher

专题命中 Agent评测 :agentic(title,abstract);agent(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18293 2025-05-30 cs.AI 86%

MineStudio: A Streamlined Package for Minecraft AI Agent Development

Shaofei Cai, Zhancun Mu, Kaichen He, Bowei Zhang, Xinyue Zheng, Anji Liu, Yitao Liang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title);AI agent(title);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21347 2025-05-01 cs.AI cs.HC 86%

IRL Dittos: Embodied Multimodal AI Agent Interactions in Open Spaces

Seonghee Lee, Denae Ford, John Tang, Sasa Junuzovic, Asta Roseway, Ed Cutrell, Kori Inkpen

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17631 2025-03-11 cs.AI cs.CE cs.MA 86%

BioDiscoveryAgent: An AI Agent for Designing Genetic Perturbation Experiments

Yusuf Roohani, Andrew Lee, Qian Huang, Jian Vora, Zachary Steinhart, Kexin Huang, Alexander Marson, Percy Liang, Jure Leskovec

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08418 2024-11-14 cs.AI 86%

Enhanced Classroom Dialogue Sequences Analysis with a Hybrid AI Agent: Merging Expert Rule-Base with Large Language Models

Yun Long, Yu Zhang

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02723 2024-06-06 cs.AI 86%

Predicting AI Agent Behavior through Approximation of the Perron-Frobenius Operator

Shiqi Zhang, Darshan Gadginmath, Fabio Pasqualetti

专题命中 Agent评测 :AI agent(title,abstract);agent(title);分类 cs.AI

Comments 12 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09669 2023-04-20 cs.RO cs.AI 86%

Autonomous Agent for Beyond Visual Range Air Combat: A Deep Reinforcement Learning Approach

Joao P. A. Dantas, Marcos R. O. A. Maximo, Takashi Yoneyama

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13323 2023-03-24 stat.ML cs.LG cs.MA 86%

Deep Generative Multi-Agent Imitation Model as a Computational Benchmark for Evaluating Human Performance in Complex Interactive Tasks: A Case Study in Football

Chaoyi Gu, Varuna De Silva

专题命中 Agent评测 :agent(title);multi-agent(title);AI agent(abstract);分类 cs.LG

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.05637 2019-04-02 cs.AI 86%

Text-based Adventures of the Golovin AI Agent

Bartosz Kostka, Jaroslaw Kwiecien, Jakub Kowalski, Pawel Rychlikowski

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 86%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);planning(abstract)

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02712 2026-08-05 cs.SE cs.AI 新提交 86%

Don't Regenerate, Debug: A Domain-Specific Agent for Repairing Near-Miss Hardware Operators

不要重新生成,要调试:一种用于修复近失配硬件算子的领域特定智能体

Yansong Sun, Shenxiu Wu, Siyuan Chen, Runlin Hou, Junhao Qiu, Junming Cao, Shudi Shao, Zhichao Lu, Qingfu Zhang

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究提出领域特定调试智能体,通过调试而非重新生成修复硬件近失配算子,其调试Pass@1准确率更高、token消耗更少,可拓展能力边界并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 86%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 Agent评测 :AI agent(title);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18366 2026-07-22 cs.AI cs.CL cs.CY 新提交 86%

Operational Hallucination and Safety Drift in AI Agents

人工智能代理中的操作幻觉与安全漂移

Shasha Yu, Fiona Carroll, Barry L. Bentley

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13428 2026-07-22 cs.SE cs.AI 版本更新 86%

SWE-Milestone: Evaluating AI Agents on Continuous Software Evolution

EvoClaw: 评估AI代理在持续软件演化中的表现

Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang

机构 * USC(美国斯克利普斯大学) UCR(加州大学河滨分校) UCSD(加州大学圣地亚哥分校) Army Research Office(陆军研究办公室) Stanford(斯坦福大学) Princeton(普林斯顿大学) Haven OpenHands

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 针对现有基准测试忽视软件演化中时间依赖和技术债务的问题,提出EvoClaw基准,通过从提交日志重建可验证里程碑DAG,评估AI代理在持续开发中维持系统完整性和限制错误累积的能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 86%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.CL

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15579 2026-07-07 cs.SE cs.AI cs.CR 版本更新 86%

Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents

领域特定智能体的符号护栏:在不牺牲效用的情况下提供更强的安全性和安全性保证

Yining Hong, Yining She, Eunsuk Kang, Christopher S. Timperley, Christian Kästner

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 本文研究了符号护栏在提高AI智能体安全性和安全性方面的有效性,通过系统回顾80个最新基准测试,发现74%的政策要求可通过符号护栏实现,从而在不牺牲效用的情况下提升安全性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04532 2026-07-03 cs.CL cs.AI 版本更新 86%

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

多语言提示本地化用于法官-代理系统:在需求级评估中的语言与骨干敏感性

Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学) Texas A&M University(德克萨斯农工大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 研究探讨了多语言提示在法官-代理系统评估中的影响,发现语言与骨干模型的交互作用显著,不同语言下不同模型表现各异,强调语言应作为评估变量。

详情

展开后加载摘要…

URL PDF HTML 收藏