arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

2503.13524 2025-10-08 cs.CL cs.CY 83%

Agent-Enhanced Large Language Models for Researching Political Institutions

Joseph R. Loffredo, Suyeol Yun

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

Comments 46 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03984 2025-10-07 cs.IR cs.LG 83%

Beyond Static Evaluation: Rethinking the Assessment of Personalized Agent Adaptability in Information Retrieval

Kirandeep Kaur, Preetam Prabhu Srikar Dammu, Hideo Joho, Chirag Shah

机构 * University of Washington(华盛顿大学) University of Tsukuba(筑波大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.LG

Journal ref Proceedings of the 2025 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00245 2025-10-07 cs.HC cs.AI 83%

Can AI agents understand spoken conversations about data visualizations in online meetings?

Rizul Sharma, Tianyu Jiang, Seokki Lee, Jillian Aurisano

机构 * DaVInCi Laboratory(DaVInCi实验室) University of Cincinnati(克利夫兰大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

Journal ref The 2nd MERCADO Workshop at IEEE VIS 2025: Multimodal Experiences for Remote Communication Around Data Online, IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00795 2025-10-02 cs.AI 83%

Benchmarking Agentic Systems in Automated Scientific Information Extraction with ChemX

Anastasia Vepreva, Julia Razlivina, Maria Eremeeva, Nina Gubina, Anastasia Orlova, Aleksei Dmitrenko, Ksenya Kapranova, Susan Jyakhwo, Nikita Vasilev, Arsen Sarkisyan, Ivan Yu. Chernyshov, Vladimir Vinogradov, Andrei Dmitrenko

机构 * Center for AI in Chemistry, ITMO University(人工智能化学中心,ITMO大学) D ONE AG(D ONE公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

Comments Accepted at The AI for Accelerated Materials Discovery (AI4Mat) Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09993 2025-10-01 cs.CL 83%

Agent-as-Judge for Factual Summarization of Long Narratives

Yeonseok Jeong, Minsoo Kim, Seung-won Hwang, Byung-Hak Kim

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Seoul National University(首尔国立大学) Hyundai Card(现代卡)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01813 2025-09-30 cs.AI 83%

The Ultimate Test of Superintelligent AI Agents: Can an AI Balance Care and Control in Asymmetric Relationships?

Djallel Bouneffouf, Matthew Riemer, Kush Varshney

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :AI agent(title);agent(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23270 2025-09-30 cs.AI 83%

Socio-Economic Model of AI Agents

Yuxinyue Qian, Jun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18557 2025-09-24 cs.AI 83%

LLMZ+: Contextual Prompt Whitelist Principles for Agentic LLMs

Tom Pawelek, Raj Patel, Charlotte Crowell, Noorbakhsh Amiri, Sudip Mittal, Shahram Rahimi, Andy Perkins

机构 * Department of Computer Science Mississippi State University(计算机科学系密苏里州立大学) Department of Computer Science The University of Alabama(计算机科学系阿拉巴马大学) Mississippi State University, Mississippi State, MS, USA(密苏里州立大学) The University of Alabama, Tuscaloosa, AL, USA(阿拉巴马大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

Comments 7 pages, 5 figures, to be published and presented at ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20148 2025-09-22 cs.AI cs.HC cs.MA 83%

The Anatomy of a Personal Health Agent

A. Ali Heydari, Ken Gu, Vidya Srinivas, Hong Yu, Zhihan Zhang, Yuwei Zhang, Akshay Paruchuri, Qian He, Hamid Palangi, Nova Hammerquist, Ahmed A. Metwally, Brent Winslow, Yubin Kim, Kumar Ayush, Yuzhe Yang, Girish Narayanswamy, Maxwell A. Xu, Jake Garrison, Amy Armento Lee, Jenny Vafeiadou, Ben Graef, Isaac R. Galatzer-Levy, Erik Schenck, Andrew Barakat, Javier Perez, Jacqueline Shreibati, John Hernandez, Anthony Z. Faranesh, Javier L. Prieto, Connor Heneghan, Yun Liu, Jiening Zhan, Mark Malhotra, Shwetak Patel, Tim Althoff, Xin Liu, Daniel McDuff, Xuhai "Orson" Xu

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

Comments Minor updates to the manuscript (V2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10875 2025-09-16 cs.AI cond-mat.soft 83%

Is the `Agent' Paradigm a Limiting Framework for Next-Generation Intelligent Systems?

Jesse Gardner, Vladimir A. Baulin

机构 * Active Inference Institute(主动推断研究所)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10147 2025-09-15 cs.AI 83%

Virtual Agent Economies

Nenad Tomasev, Matija Franklin, Joel Z. Leibo, Julian Jacobs, William A. Cunningham, Iason Gabriel, Simon Osindero

机构 * Google DeepMind(谷歌DeepMind) University of Toronto(多伦多大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02773 2025-09-15 cs.CY cs.AI econ.GN q-fin.EC 83%

Web3 x AI Agents: Landscape, Integrations, and Foundational Challenges

Yiming Shen, Jiashuo Zhang, Zhenzhe Shao, Wenxuan Luo, Yanlin Wang, Ting Chen, Zibin Zheng, Jiachi Chen

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23643 2025-09-04 cs.CR cs.AI 83%

Securing AI Agents with Information-Flow Control

Manuel Costa, Boris Köpf, Aashish Kolluri, Andrew Paverd, Mark Russinovich, Ahmed Salem, Shruti Tople, Lukas Wutschitz, Santiago Zanella-Béguelin

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06821 2025-09-01 cs.CL 83%

Inducing Programmatic Skills for Agentic Tasks

Zora Zhiruo Wang, Apurva Gandhi, Graham Neubig, Daniel Fried

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(title);agent(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21411 2025-09-01 cs.AI 83%

CARJAN: Agent-Based Generation and Simulation of Traffic Scenarios with AJAN

Leonard Frank Neis, Andre Antakli, Matthias Klusch

机构 * institutetext: German Research Center for Artificial Intelligence (DFKI) Saarland Informatics Campus, Saarbruecken, Germany(德国人工智能研究中心(DFKI)萨尔兰州信息学校区,萨尔布吕肯,德国)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15164 2025-08-22 cs.CL 83%

ContextualLVLM-Agent: A Holistic Framework for Multi-Turn Visually-Grounded Dialogue and Complex Instruction Following

Seungmin Han, Haeun Kwon, Ji-jun Park, Taeyang Yoon

机构 * Dongguk University(东国大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12259 2025-08-22 cs.CR cs.AI cs.ET 83%

Fortifying the Agentic Web: A Unified Zero-Trust Architecture Against Logic-layer Threats

Ken Huang, Yasir Mehmood, Hammad Atta, Jerry Huang, Muhammad Zeeshan Baig, Sree Bhargavi Balija

机构 * Qorvex Consulting Kleiner Perkins Wentworth Institute of Higher Education

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05508 2025-08-08 cs.AI 83%

Auto-Eval Judge: Towards a General Agentic Framework for Task Completion Evaluation

Roshita Bhonsle, Rishav Dutta, Sneha Vavilapalli, Harsh Seth, Abubakarr Jaye, Yapei Chang, Mukund Rungta, Emmanuel Aboah Boateng, Sadid Hasan, Ehi Nosakhare, Soundar Srinivasan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft Corporation(微软公司) University of Maryland(马里兰大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01581 2025-08-05 cs.AI math.CO stat.CO 83%

Polymorphic Combinatorial Frameworks (PCF): Guiding the Design of Mathematically-Grounded, Adaptive AI Agents

David Pearl, Matthew Murphy, James Intriligator

机构 * Department of Mechanical Engineering Tufts University(机械工程系 塔夫茨大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17186 2025-08-01 cs.CL 83%

FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain

Lingfeng Zeng, Fangqi Lou, Zixuan Wang, Jiajie Xu, Jinyi Niu, Mengping Li, Yifan Dong, Qi Qi, Wei Zhang, Ziwei Yang, Jun Han, Ruilun Feng, Ruiqi Hu, Lejie Zhang, Zhengbo Feng, Yicheng Ren, Xin Guo, Zhaowei Liu, Dongpo Cheng, Weige Cai, Liwen Zhang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21017 2025-07-29 cs.AI 83%

MIRAGE-Bench: LLM Agent is Hallucinating and Where to Find Them

Weichen Zhang, Yiyou Sun, Pohao Huang, Jiayue Pu, Heyue Lin, Dawn Song

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments Code and data: https://github.com/sunblaze-ucb/mirage-bench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13729 2025-07-21 cs.RO cs.AI 83%

AGENTS-LLM: Augmentative GENeration of Challenging Traffic Scenarios with an Agentic LLM Framework

Yu Yao, Salil Bhatnagar, Markus Mazzola, Vasileios Belagiannis, Igor Gilitschenski, Luigi Palmieri, Simon Razniewski, Marcel Hallgarten

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06323 2025-07-10 cs.CR cs.AI 83%

Bridging AI and Software Security: A Comparative Vulnerability Assessment of LLM Agent Deployment Paradigms

Tarek Gasmi, Ramzi Guesmi, Ines Belhadj, Jihene Bennaceur

专题命中 Agent评测 :agent(title,abstract);function calling(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16248 2025-07-10 cs.CR cs.AI 83%

Real AI Agents with Fake Memories: Fatal Context Manipulation Attacks on Web3 Agents

Atharv Singh Patlan, Peiyao Sheng, S. Ashwin Hebbar, Prateek Mittal, Pramod Viswanath

机构 * Princeton University Princeton University \& Sentient Foundation

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01861 2025-07-10 cs.DC cs.AI cs.MA 83%

Towards Enterprise-Ready Computer Using Generalist Agent

Sami Marreed, Alon Oved, Avi Yaeli, Segev Shlomov, Ido Levy, Offer Akrabi, Aviad Sela, Asaf Adi, Nir Mashkif

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01931 2025-07-09 cs.CL 83%

On the Role of Feedback in Test-Time Scaling of Agentic AI Workflows

Souradip Chakraborty, Mohammadreza Pourreza, Ruoxi Sun, Yiwen Song, Nino Scherrer, Furong Huang, Amrit Singh Bedi, Ahmad Beirami, Jindong Gu, Hamid Palangi, Tomas Pfister

机构 * Google(谷歌) University of Maryland(马里兰大学) University of Central Florida(中央佛罗里达大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03493 2025-07-08 cs.CL 83%

AI-VaxGuide: An Agentic RAG-Based LLM for Vaccination Decisions

Abdellah Zeggai, Ilyes Traikia, Abdelhak Lakehal, Abdennour Boulesnane

机构 * Department of Fundamental Computing and its Applications, Faculty of NTIC(基础计算及其应用系) BIOSTIM Laboratory, Medicine Faculty Salah Boubnider Constantine 03 University(BIOSTIM实验室,医学系Salah Boubnider Constantine 03大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08842 2025-07-01 cs.CR cs.CL 83%

LibVulnWatch: A Deep Assessment Agent System and Leaderboard for Uncovering Hidden Vulnerabilities in Open-Source AI Libraries

Zekun Wu, Seonglae Cho, Umar Mohammed, Cristian Munoz, Kleyton Costa, Xin Guan, Theo King, Ze Wang, Emre Kazim, Adriano Koshiyama

机构 * Holistic AI University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

Comments ACL 2025 Student Research Workshop and ICML 2025 TAIG Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20806 2025-06-27 cs.CR cs.AI 83%

Poster: Enhancing GNN Robustness for Network Intrusion Detection via Agent-based Analysis

Zhonghao Zhan, Huichi Zhou, Hamed Haddadi

机构 * Department of Computing Imperial College London(计算系伦敦帝国理工学院)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments Poster accepted at the 10th IEEE European Symposium on Security and Privacy (Euro S&P 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14539 2025-06-27 cs.AI cs.CR 83%

Doppelganger Method: Breaking Role Consistency in LLM Agent via Prompt-based Transferable Adversarial Attack

Daewon Kang, YeongHwan Shin, Doyeon Kim, Kyu-Hwan Jung, Meong Hi Son

机构 * Research Institute for Future Medicine, Samsung Medical Center(未来医学研究所,三星医疗中心) Department of Digital Health, SAIHST, Sungkyunkwan University(数字健康系,SAIHST,成均馆大学) Department of Medical Device Management and Research, SAIHST, Sungkyunkwan University(医疗设备管理与研究系,SAIHST,成均馆大学) Department of Emergency Medicine, Samsung Medical Center(急诊医学系,三星医疗中心)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏