arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15686 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15686 篇

2508.09171 2025-08-14 cs.NI cs.AI 79%

webMCP: Efficient AI-Native Client-Side Interaction for Agent-Ready Web Design

D. Perera

专题命中 Agent评测 :agent(title);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06600 2025-08-12 cs.CL cs.IR 79%

BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent

Zijian Chen, Xueguang Ma, Shengyao Zhuang, Ping Nie, Kai Zou, Andrew Liu, Joshua Green, Kshama Patel, Ruoxi Meng, Mingyi Su, Sahel Sharifymoghaddam, Yanxi Li, Haoran Hong, Xinyu Shi, Xuye Liu, Nandan Thakur, Crystina Zhang, Luyu Gao, Wenhu Chen, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) CSIRO(澳大利亚联邦科学与工业研究组织) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) The University of Queensland(昆士兰大学)

专题命中 Agent评测 :agent(title);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05338 2025-08-08 cs.AI cs.CY 79%

The Term 'Agent' Has Been Diluted Beyond Utility and Requires Redefinition

Brinnae Bent

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments Accepted to AIES 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05653 2025-08-06 cs.HC cs.AI 79%

The influence of persona and conversational task on social interactions with a LLM-controlled embodied conversational agent

Leon O. H. Kroczek, Alexander May, Selina Hettenkofer, Andreas Ruider, Bernd Ludwig, Andreas Mühlberger

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23124 2025-08-05 cs.GT cs.LG 79%

Learning to Incentivize in Repeated Principal-Agent Problems with Adversarial Agent Arrivals

Junyan Liu, Arnab Maiti, Artin Tajdini, Kevin Jamieson, Lillian J. Ratliff

机构 * Paul G. Allen School of Computer Science \& Engineering, University of Washington, Seattle, USA Department of Electrical Computer Engineering, University of Washington, Seattle, USA

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

Comments To appear at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19495 2025-07-29 cs.HC cs.AI 79%

Simulating Human Behavior with the Psychological-mechanism Agent: Integrating Feeling, Thought, and Action

Qing Dong, Pengyuan Liu, Dong Yu, Chen Kang

机构 * Beijing Language and Culture University(北京语言大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16562 2025-07-23 cs.HC cs.AI 79%

Evaluating Social Acceptance of eXtended Reality (XR) Agent Technology: A User Study (Extended Version)

Megha Quamara, Viktor Schmuck, Cristina Iani, Axel Primavesi, Alexander Plaum, Luca Vigano

机构 * Department of Informatics, King’s College London(信息学院,伦敦国王学院) Department of Engineering, King’s College London(工程学院,伦敦国王学院) Department of Surgery, Medicine, Dentistry and Morphological Sciences, University of Modena and Reggio Emilia(外科、医学、牙科和形态学科学系,摩德纳和雷吉奥艾米利亚大学) Deutsche Welle(德国之声)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments 26 pages (18 pages main body, 8 pages user consent form), 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14969 2025-07-22 cs.SE 79%

Think Like an Engineer: A Neuro-Symbolic Collaboration Agent for Generative Software Requirements Elicitation and Self-Review

Sai Zhang, Zhenchang Xing, Jieshan Chen, Dehai Zhao, Zizhong Zhu, Xiaowang Zhang, Zhiyong Feng, Xiaohong Li

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12767 2025-07-18 cs.HC cs.AI 79%

Autonomy for Older Adult-Agent Interaction

Jiaxin An

机构 * The University of Texas at Austin(德克萨斯大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08584 2025-07-14 q-fin.ST cs.AI cs.CE cs.MA q-fin.CP 79%

To Trade or Not to Trade: An Agentic Approach to Estimating Market Risk Improves Trading Decisions

Dimitrios Emmanoulopoulos, Ollie Olby, Justin Lyon, Namid R. Stillman

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

Comments 31 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02252 2025-07-04 cs.CV cs.AI 79%

SurgVisAgent: Multimodal Agentic Model for Versatile Surgical Visual Enhancement

Zeyu Lei, Hongyuan Yu, Jinlin Wu, Zhen Chen

机构 * University of Chinese Academy of Sciences Multimedia Department, Xiaomi Inc Chinese Academy of Sciences, Institute of Automation Hong Kong Institute of Science \& Innovation, Chinese Academy of Sciences

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22852 2025-07-01 cs.CL 79%

Knowledge Augmented Finetuning Matters in both RAG and Agent Based Dialog Systems

Yucheng Cai, Yuxuan Wu, Yi Huang, Junlan Feng, Zhijian Ou

机构 * EE Department, Tsinghua University(清华大学电子工程系) China Mobile Research Institute(中国移动研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18746 2025-06-30 cs.AI 79%

$C^3$-Bench: The Things Real Disturbing LLM based Agent in Multi-Tasking

Peijie Yu, Yifan Yang, Jinjian Li, Zelong Zhang, Haorui Wang, Xiao Feng, Feng Zhang

机构 * Tencent HunYuan Team(腾讯文言团队)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21174 2025-06-27 eess.AS cs.LG 79%

Performance improvement of spatial semantic segmentation with enriched audio features and agent-based error correction for DCASE 2025 Challenge Task 4

Jongyeon Park, Joonhee Lee, Do-Hyeon Lim, Hong Kook Kim, Hyeongcheol Geum, Jeong Eun Lim

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

Comments DCASE 2025 challenge Task4, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17332 2025-06-25 cs.CR cs.AI 79%

CVE-Bench: A Benchmark for AI Agents' Ability to Exploit Real-World Web Application Vulnerabilities

Yuxuan Zhu, Antony Kellermann, Dylan Bowman, Philip Li, Akul Gupta, Adarsh Danda, Richard Fang, Conner Jensen, Eric Ihli, Jason Benn, Jet Geronimo, Avi Dhir, Sudhit Rao, Kaicheng Yu, Twm Stone, Daniel Kang

机构 * University of Illinois, Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

Comments 15 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12152 2025-06-17 cs.AI 79%

Because we have LLMs, we Can and Should Pursue Agentic Interpretability

Been Kim, John Hewitt, Neel Nanda, Noah Fiedel, Oyvind Tafjord

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05174 2025-06-12 cs.CR cs.AI 79%

MELON: Provable Defense Against Indirect Prompt Injection Attacks in AI Agents

Kaijie Zhu, Xianjun Yang, Jindong Wang, Wenbo Guo, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00505 2025-06-11 cs.AI cs.MA 79%

FREIDA: A Framework for developing quantitative agent based models based on qualitative expert knowledge

Frederike Oetker, Vittorio Nespeca, Rick Quax

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments 26 pages, 4 figures, 15 tables, Appendix I-II

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08192 2025-06-11 cs.CR cs.LG 79%

Interpreting Agent Behaviors in Reinforcement-Learning-Based Cyber-Battle Simulation Platforms

Jared Claypoole, Steven Cheung, Ashish Gehani, Vinod Yegneswaran, Ahmad Ridley

机构 * SRI(SRI研究院) Laboratory for Advanced Cybersecurity Research(高级网络安全研究实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

Journal ref The AAAI-25 Workshop on Artificial Intelligence for Cyber Security (AICS), March 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04649 2025-06-06 cs.CL 79%

Flex-TravelPlanner: A Benchmark for Flexible Planning with Language Agents

Juhyun Oh, Eunsu Kim, Alice Oh

机构 * School of Computing(计算机学院) KAIST(韩国科学技术院)

专题命中 Agent评测 :planning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00675 2025-06-05 cs.CL 79%

ReFoRCE: A Text-to-SQL Agent with Self-Refinement, Consensus Enforcement, and Column Exploration

Minghang Deng, Ashwin Ramachandran, Canwen Xu, Lanxiang Hu, Zhewei Yao, Anupam Datta, Hao Zhang

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24787 2025-06-02 cs.CV cs.CL 79%

Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation

Yucheng Zhou, Jiahao Yuan, Qianning Wang

机构 * University of Macau China(澳门大学) East China Normal University China(华东师范大学) Auckland University of Technology New Zealand(技术大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02644 2025-06-02 cs.CR cs.AI 79%

Agent Security Bench (ASB): Formalizing and Benchmarking Attacks and Defenses in LLM-based Agents

Hanrong Zhang, Jingyuan Huang, Kai Mei, Yifei Yao, Zhenting Wang, Chenlu Zhan, Hongwei Wang, Yongfeng Zhang

机构 * Zhejiang University(浙江大学) Rutgers University(罗格斯大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14662 2025-06-02 cs.CL cs.IR 79%

iAgent: LLM Agent as a Shield between User and Recommender Systems

Wujiang Xu, Yunxiao Shi, Zujie Liang, Xuying Ning, Kai Mei, Kun Wang, Xi Zhu, Min Xu, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学) University of Technology Sydney(悉尼技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

Comments Findings of ACL 2025 and WWW2025@HCRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19623 2025-05-29 cs.IR cs.AI 79%

AgentRecBench: Benchmarking LLM Agent-based Personalized Recommender Systems

Yu Shang, Peijie Liu, Yuwei Yan, Zijing Wu, Leheng Sheng, Yuanqing Yu, Chumeng Jiang, An Zhang, Fengli Xu, Yu Wang, Min Zhang, Yong Li

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21389 2025-05-28 cs.CL 79%

AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs

Xuanwen Ding, Chengjun Pan, Zejun Li, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) University of Southern California(南加州大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07960 2025-05-27 cs.HC cs.CL 79%

AgentClinic: a multimodal agent benchmark to evaluate AI in simulated clinical environments

Samuel Schmidgall, Rojin Ziaei, Carl Harris, Eduardo Reis, Jeffrey Jopling, Michael Moor

机构 * Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Stanford University Hospital Israelita Albert Einstein(斯坦福大学医院以色列阿尔伯特·爱因斯坦医院) ETH Zurich(苏黎世联邦理工学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02398 2025-05-27 cs.IR cs.AI 79%

PersonaX: A Recommendation Agent Oriented User Modeling Framework for Long Behavior Sequence

Yunxiao Shi, Wujiang Xu, Zeqi Zhang, Xing Zi, Qiang Wu, Min Xu

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

Comments 2025 ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17673 2025-05-26 cs.AI 79%

Rethinking Agent Design: From Top-Down Workflows to Bottom-Up Skill Evolution

Jiawei Du, Jinlong Wu, Yuzheng Chen, Yucheng Hu, Bing Li, Joey Tianyi Zhou

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15196 2025-05-22 cs.CL 79%

EcomScriptBench: A Multi-task Benchmark for E-commerce Script Planning via Step-wise Intention-Driven Product Association

Weiqi Wang, Limeng Cui, Xin Liu, Sreyashi Nag, Wenju Xu, Chen Luo, Sheikh Muhammad Sarwar, Yang Li, Hansu Gu, Hui Liu, Changlong Yu, Jiaxin Bai, Yifan Gao, Haiyang Zhang, Qi He, Shuiwang Ji, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST, Hong Kong SAR, China(香港科技大学计算机科学与工程系) Amazon.com Inc(亚马逊公司) Department of Computer Science & Engineering, Texas A&M University(德克萨斯农工大学计算机科学与工程系)

专题命中 Agent评测 :planning(title,abstract);分类 cs.CL

Comments ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏