arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2601.01090 2026-01-22 cs.MA cs.AI cs.CY 77%

Harm in AI-Driven Societies: An Audit of Toxicity Adoption on Chirper.ai

AI驱动社会中的危害:对Chirper.ai上毒性采用的审计

Erica Coppolillo, Luca Luceri, Emilio Ferrara

机构 * University of Southern California, Los Angeles, California(美国南加州大学) University of Calabria, Rende, Italy(意大利卡拉布里亚大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究通过分析Chirper.ai上AI代理的毒性行为,揭示了暴露于有害内容如何影响代理行为,并提出通过监控毒性暴露来减轻有害行为的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21046 2026-01-21 cs.AI 77%

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence

自我进化代理的综述:何时、何地、如何进化以实现人工超级智能

Huan-ang Gao, Jiayi Geng, Wenyue Hua, Mengkang Hu, Xinzhe Juan, Hongzhang Liu, Shilong Liu, Jiahao Qiu, Xuan Qi, Yiran Wu, Hongru Wang, Han Xiao, Yuhang Zhou, Shaokun Zhang, Jiayi Zhang, Jinyu Xiang, Yixiong Fang, Qiwen Zhao, Dongrui Liu, Qihan Ren, Cheng Qian, Zhenhailong Wang, Minda Hu, Huazheng Wang, Qingyun Wu, Heng Ji, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Michigan(密歇根大学) Oregon State University(俄勒冈州立大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California San Diego(加州大学圣地亚哥分校) University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文综述了自我进化代理的现状,探讨了进化机制、适应方法及挑战,为实现人工超级智能提供路线图。

Comments 77 pages, 9 figures, Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08105 2026-01-14 cs.CL 77%

Query Suggestion for Retrieval-Augmented Generation via Dynamic In-Context Learning

通过动态上下文学习实现检索增强生成的查询建议

Fabian Spaeh, Tianyi Chen, Chen-Hao Chiang, Bin Shen

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出通过动态上下文学习实现检索增强生成的查询建议,以提升用户交互的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22462 2026-01-14 cs.AI 77%

Learning "Partner-Aware" Collaborators in Multi-Party Collaboration

在多方协作中学习“伙伴感知”的协作者

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出ICR算法,通过学习伙伴感知的协作者,提升多任务协作中的共同基础一致性与解决方案多样性。

Comments Fixed typographic errors in the previous manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06216 2026-01-13 cs.CY cs.AI 77%

LLM Agents in Law: Taxonomy, Applications, and Challenges

法律中的LLM代理:分类、应用与挑战

Shuang Liu, Ruijia Zhang, Ruoyun Ma, Yujia Deng, Lanyi Zhu, Jiayu Li, Zelong Li, Zhibin Shen, Mengnan Du

机构 * Carnegie Mellon University(卡内基梅隆大学) National University of Singapore(国立新加坡大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) The University of Chicago(芝加哥大学) Rutgers University(罗格斯大学) Columbia University(哥伦比亚大学) New Jersey Institute of Technology(新泽西理工学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨了法律领域中LLM代理的分类、应用及挑战,分析了技术转变、应用分类、评估方法及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03281 2026-01-08 eess.SY cs.AI cs.SY 77%

$α^3$-Bench: A Unified Benchmark of Safety, Robustness, and Efficiency for LLM-Based UAV Agents over 6G Networks

$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01673 2026-01-06 cs.CR cs.AI 77%

Exposing Hidden Interfaces: LLM-Guided Type Inference for Reverse Engineering macOS Private Frameworks

揭示隐藏接口:LLM引导的类型推断用于macOS私有框架逆向工程

Arina Kharlamova, Youcheng Sun, Ting Yu

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 MOTIF通过LLM引导的类型推断技术,显著提升了对macOS私有框架的逆向工程能力,实现了更高的签名恢复率和更稳定的推断结果。

Comments IEEE S&P'26 under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20068 2025-12-23 cs.DC cs.LG cs.SY eess.SY 77%

JITServe: SLO-aware LLM Serving with Imprecise Request Information

JITServe: 带有服务级别目标的LLM服务系统

Wei Zhang, Zhiyu Wu, Yi Mu, Rui Ning, Banruo Liu, Nikhil Sarda, Myungjin Lee, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.LG

AI总结 JITServe通过即时调度和优化资源分配,提升LLM服务吞吐量并实现资源节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10206 2025-12-15 cs.AI 77%

CP-Env: Evaluating Large Language Models on Clinical Pathways in a Controllable Hospital Environment

CP-Env:在可控医院环境中评估大型语言模型在临床路径中的表现

Yakun Zhu, Zhongzhen Huang, Qianhan Feng, Linjie Mu, Yannian Gu, Shaoting Zhang, Qi Dou, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 CP-Env通过可控医院环境评估大型语言模型在复杂临床路径中的表现,揭示其在决策和伦理方面的挑战,并推动医疗AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09577 2025-12-11 cs.HC cs.AI 77%

Auto-BenchmarkCard: Automated Synthesis of Benchmark Documentation

Auto-BenchmarkCard:自动化生成基准测试文档

Aris Hofmann, Inge Vejsbjerg, Dhaval Salwala, Elizabeth M. Daly

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 Auto-BenchmarkCard通过多智能体数据提取与大语言模型合成,自动化生成准确的AI基准测试文档,提升基准测试的透明性和可比性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19536 2025-11-26 cs.CR cs.AI 77%

AttackPilot: Autonomous Inference Attacks Against ML Services With LLM-Based Agents

AttackPilot: 基于大语言模型的自主推断攻击对抗ML服务

Yixin Wu, Rui Wen, Chi Cui, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) Institute of Science Tokyo(东京科学研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AttackPilot利用大语言模型开发自主代理,实现无需人工干预的推断攻击,展现高任务完成率和低成本,有效提升非专家对ML服务风险评估的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13223 2025-11-25 cs.AI cs.SY eess.SY math.OC 77%

Distributionally Robust Free Energy Principle for Decision-Making

面向决策的分布鲁棒自由能原理

Allahkaram Shafiei, Hozefa Jesawada, Karl Friston, Giovanni Russo

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出分布鲁棒自由能模型,通过设计增强代理的鲁棒性,使其在训练与环境不一致时仍能完成任务。

Comments Contains main text and supplementary information. Supplementary movie is at the paper repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13987 2025-11-19 cs.AI 77%

Artificial Intelligence Agents in Music Analysis: An Integrative Perspective Based on Two Use Cases

Antonio Manuel Martínez-Heredia, Dolores Godrid Rodríguez, Andrés Ortiz García

机构 * Dpto. Ingeniería de Comunicaciones, Universidad de Málaga, Campus de Teatinos(通信工程系,马拉加大学,泰蒂诺校区) Universidad Rey Juan Carlos(雷乌安卡洛斯大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

Comments Extended version of the conference paper presented at SATMUS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01015 2025-11-04 cs.LG 77%

What's the next frontier for Data-centric AI? Data Savvy Agents

Nabeel Seedat, Jiashuo Liu, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.LG

Comments Presented at ICLR 2025 Data-FM. Seedat & Liu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21228 2025-10-27 cs.CL cs.HC 77%

DispatchMAS: Fusing taxonomy and artificial intelligence agents for emergency medical services

Xiang Li, Huizi Yu, Wenkong Wang, Yiran Wu, Jiayan Zhou, Wenyue Hua, Xinxin Lin, Wenjia Tan, Lexuan Zhu, Bingyi Chen, Guang Chen, Ming-Li Chen, Yang Zhou, Zhao Li, Themistocles L. Assimes, Yongfeng Zhang, Qingyun Wu, Xin Ma, Lingyao Li, Lizhou Fan

机构 * Shandong University(山东大学) The Chinese University of Hong Kong(香港中文大学) Pennsylvania State University(宾夕法尼亚州立大学) Stanford University School of Medicine(斯坦福大学医学院) University of California(加州大学) University of Macau(澳门大学) New York University(纽约大学) Broad Institute of MIT(MITBroad研究所) The University of Hong Kong(香港大学) Chinese Academy of Medical Sciences(中国医学科学院) Peking Union Medical College(北京协和医学院) Rutgers University(罗格斯大学) University of South Florida(佛罗里达州立大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.CL

Comments 27 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17491 2025-10-21 cs.CL 77%

Empowering Real-World: A Survey on the Technology, Practice, and Evaluation of LLM-driven Industry Agents

Yihong Tang, Kehai Chen, Liang Yue, Jinxin Fan, Caishen Zhou, Xiaoguang Li, Yuyang Zhang, Mingming Zhao, Shixiong Kai, Kaiyang Guo, Xingshan Zeng, Wenjing Cun, Lifeng Shang, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(计算机科学与技术学院,哈尔滨工业大学,深圳,中国) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23886 2025-10-20 cs.DB cs.AI 77%

Text2Schema: Filling the Gap in Designing Database Table Structures based on Natural Language

Qin Wang, Youhuan Li, Yansong Feng, Si Chen, Ziming Li, Pan Zhang, Zihui Si, Yixuan Chen, Zhichao Shi, Zebin Huang, Guo Chen, Wenqiang Jin

机构 * Hunan University(湖南大学) Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

Comments 19 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26506 2025-10-01 cs.AI 77%

SCUBA: Salesforce Computer Use Benchmark

Yutong Dai, Krithika Ramakrishnan, Jing Gu, Matthew Fernandez, Yanqi Luo, Viraj Prabhu, Zhenyu Hu, Silvio Savarese, Caiming Xiong, Zeyuan Chen, Ran Xu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14801 2025-09-19 cs.LG 77%

STEP: Structured Training and Evaluation Platform for benchmarking trajectory prediction models

Julian F. Schumann, Anna Mészáros, Jens Kober, Arkady Zgonnikov

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00858 2025-09-15 cs.AI cs.HC 77%

Learning to Plan with Personalized Preferences

Manjie Xu, Xinyi Yang, Wei Liang, Chi Zhang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Yangtze Delta Region Academy of Beijing Institute of Technology, Jiaxing, China(北京理工大学扬子江地区研究院) National Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06435 2025-09-12 cs.AI 77%

Simulating Human-like Daily Activities with Desire-driven Autonomy

Yiding Wang, Yuxuan Chen, Fangwei Zhong, Long Ma, Yizhou Wang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) The University of Hong Kong(香港大学) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Academy for Advanced Interdisciplinary Studies, Peking University(北京大学先进跨学科研究学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Center on Frontiers of Computing Studies, School of Computer Science, Nat’l Eng. Research Center of Visual Technology, Peking University(计算前沿研究中心,计算机科学学院,国家工程视觉技术研究中心,北京大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16427 2025-09-03 cs.AI 77%

HAICOSYSTEM: An Ecosystem for Sandboxing Safety Risks in Human-AI Interactions

Xuhui Zhou, Hyunwoo Kim, Faeze Brahman, Liwei Jiang, Hao Zhu, Ximing Lu, Frank Xu, Bill Yuchen Lin, Yejin Choi, Niloofar Mireshghallah, Ronan Le Bras, Maarten Sap

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Allen Institute for AI(人工智能研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);tool use(abstract);分类 cs.AI

Comments Both the second and third authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14925 2025-08-22 cs.CR cs.LG 77%

MCPTox: A Benchmark for Tool Poisoning Attack on Real-World MCP Servers

Zhiqiang Wang, Yichao Gao, Yanting Wang, Suyuan Liu, Haifeng Sun, Haoran Cheng, Guanquan Shi, Haohua Du, Xiangyang Li

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03728 2025-08-07 cs.CL 77%

WINELL: Wikipedia Never-Ending Updating with LLM Agents

Revanth Gangi Reddy, Tanay Dixit, Jiaxin Qin, Cheng Qian, Daniel Lee, Jiawei Han, Kevin Small, Xing Fan, Ruhi Sarikaya, Heng Ji

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10911 2025-07-16 cs.AI 77%

Lessons Learned from Evaluation of LLM based Multi-agents in Safer Therapy Recommendation

Yicong Wu, Ting Chen, Irit Hochberg, Zhoujian Sun, Ruth Edry, Zhengxing Huang, Mor Peleg

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09389 2025-07-15 cs.AI cs.CY cs.IR 77%

Knowledge Conceptualization Impacts RAG Efficacy

Chris Davis Jaldi, Anmol Saini, Elham Ghiasi, O. Divine Eziolise, Cogan Shimizu

机构 * Wright State University(怀特州立大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17560 2025-06-24 cs.MA cs.AI 77%

Towards Zero-Shot Coordination between Teams of Agents: The N-XPlay Framework

Ava Abderezaei, Chi-Hui Lin, Joseph Miceli, Naren Sivagnanadasan, Stéphane Aroca-Ouellette, Jake Brawer, Alessandro Roncone

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI

Comments Accepted to RSS Workshop on Scalable and Resilient Multi-Robot Systems: Decision-Making, Coordination, and Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12110 2025-06-17 econ.GN cs.AI q-fin.EC 77%

EconGym: A Scalable AI Testbed with Diverse Economic Tasks

Qirui Mi, Qipeng Yang, Zijun Fan, Wentian Fan, Heyang Ma, Chengdong Ma, Siyu Xia, Bo An, Jun Wang, Haifeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, Chinese Academy of Sciences(中国科学院人工智能学院) Nanyang Technological University(南洋理工大学) Nanjing University of Posts and Telecommunications(南京邮电大学) University of Chinese Academy of Sciences, Nanjing(中国科学院大学(南京)) Nanjing Artificial Intelligence Research of IA(南京人工智能研究所) Peking University(北京大学) University of International Business and Economics(对外经济贸易大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 28 pages, 7 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11019 2025-06-16 cs.SE 77%

Mind the Metrics: Patterns for Telemetry-Aware In-IDE AI Application Development using the Model Context Protocol (MCP)

Vincent Koc, Jacques Verre, Douglas Blank, Abigail Morgan

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);workflow(abstract);分类 cs.SE

Comments 16 pages, 5 figures, conference preprint submission. Conceptual systems architecture paper on telemetry-driven prompt optimization and IDE design patterns for AI development. Builds on Opik MCP open-source architecture and Comet trace infrastructure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07320 2025-05-29 cs.HC cs.AI 77%

When Trust Collides: Decoding Human-LLM Cooperation Dynamics through the Prisoner's Dilemma

Guanxuan Jiang, Shirao Yang, Yuyang Wang, Pan Hui

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏