arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

2512.09142 2025-12-15 cs.AI 83%

SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation

SDialog:一个用于端到端代理构建、用户模拟、对话生成和评估的Python工具包

Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert, Pawel Cyrta, Yiyang Chen, Srikanth Madikeri, Esaú Villatoro-Tello, Thomas Schaaf, Ricard Marxer, Petr Motlicek

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 SDialog是一个开源Python工具包,提供端到端的对话代理构建、用户模拟、对话生成和评估功能,结合机理可解释性工具和综合评估方法,帮助研究人员更系统地研究对话系统。

Comments We have an old version of the paper at arXiv:2506.10622, we will update this old version instead (even though the authors and the title have changed since this first old version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06710 2025-12-09 cs.AI 83%

Stochasticity in Agentic Evaluations: Quantifying Inconsistency with Intraclass Correlation

代理评估中的随机性:通过组内相关系数量化不一致性

Zairah Mustahsan, Abel Lim, Megna Anand, Saahil Jain, Bryan McCann

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过组内相关系数量化代理评估中的不一致性,以提高评估可靠性,建议在基准测试中报告ICC和查询内方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04535 2025-12-08 cs.AI 83%

GTM: Simulating the World of Tools for AI Agents

GTM: 为AI代理模拟工具世界

Zhenzhen Ren, Xinpeng Zhang, Zhenxing Qian, Yan Gao, Yu Shi, Shuxin Zheng, Jiyan He

机构 * Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Computer Science, Fudan University, Shanghai, China(计算机学院,复旦大学,上海,中国)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 GTM通过模拟工具提升AI代理训练效率,实现快速且低成本的工具交互模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04367 2025-12-05 cs.AI 83%

AgentBay: A Hybrid Interaction Sandbox for Seamless Human-AI Intervention in Agentic Systems

AgentBay:一种混合交互沙盒,用于无缝的人工智能干预在代理系统中

Yun Piao, Hongbo Min, Hang Su, Leilei Zhang, Lei Wang, Yue Yin, Xiao Wu, Zhejing Xu, Liwei Qu, Hang Li, Xinxin Zeng, Wei Tian, Fei Yu, Xiaowei Li, Jiayi Jiang, Tongxu Liu, Hao Tian, Yufei Que, Xiaobing Tu, Bing Suo, Yuebing Li, Xiangting Chen, Zeen Zhao, Jiaming Tang, Wei Huang, Xuguang Li, Jing Zhao, Jin Li, Jie Shen, Jinkui Ren, Xiantao Zhang

机构 * Alibaba Cloud Computing(阿里云计算)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 AgentBay通过混合交互沙盒实现无缝人机协作,提升代理系统在复杂任务中的成功率与网络适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03955 2025-12-04 cs.AI cs.ET 83%

Benchmark for Planning and Control with Large Language Model Agents: Blocksworld with Model Context Protocol

基于大语言模型代理的规划与控制基准:带有模型上下文协议的积木世界

Niklas Jobs, Luis Miguel Vieira da Silva, Jayanth Somashekaraiah, Maximilian Weigand, David Kube, Felix Gehlhoff

机构 * Institute of Automation Technology, Helmut Schmidt University / University of the Federal Armed Forces Hamburg, Germany(自动化技术研究所,海姆·施密特大学/联邦武装部队大学汉堡,德国) Siemens AG, Nuremberg, Germany(西门子股份公司,纽伦堡,德国)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一个基于大语言模型的规划与控制基准,通过积木世界问题和模型上下文协议,提供五个复杂度类别以评估不同代理架构的性能。

Comments This work has been submitted to IFAC for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21510 2025-12-02 cs.MA cs.AI 83%

Tool-RoCo: An Agent-as-Tool Self-organization Large Language Model Benchmark in Multi-robot Cooperation

Tool-RoCo: 一种基于机器人协作的大型语言模型自组织评估基准

Ke Zhang, Xiaoning Zhao, Ce Zheng, Jiahong Ning, Dandan Zhu, Wenqi Zhang, Chen Sun, Toshiharu Sugawara

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 Tool-RoCo提出了一种评估大型语言模型在多机器人协作中自主性和协作能力的基准,通过四种不同自主性范式和三个任务测试工具使用效果。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21444 2025-11-27 cs.AI physics.ao-ph 83%

EWE: An Agentic Framework for Extreme Weather Analysis

EWE:极端天气分析的代理框架

Zhe Jiang, Jiong Wang, Xiaoyu Yue, Zijie Guo, Wenlong Zhang, Fenghua Ling, Wanli Ouyang, Lei Bai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Sydney(悉尼大学)

专题命中 Agent评测 :agentic(title);agent(abstract);planning(abstract);分类 cs.AI

AI总结 EWE是首个用于极端天气分析的智能代理框架,通过知识引导的规划和闭环推理实现自动化诊断,提供首个该领域基准测试,推动科学发现民主化进程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15097 2025-11-26 cs.CR cs.AI 83%

MAIF: Enforcing AI Trust and Provenance with an Artifact-Centric Agentic Paradigm

MAIF:基于 artifacts 的代理范式强化 AI 可信度与溯源

Vineeth Sai Narajala, Manish Bhatt, Idan Habler, Ronald F. Del Rosario, Ads Dawson

机构 * Security Researcher Cisco(安全研究员 希思科) Researcher OWASP/Project Kuiper Security(研究员 OWASP/项目 Kuiper 安全) Adversarial AI Security Research Cisco(对抗性AI安全研究 希思科)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 MAIF 通过以 artifacts 为中心的代理范式,解决 AI 的可信度、安全性和问责问题,实现数据的主动信任执行和高效处理。

Comments 7 Pages, 2 Figures, 6 Tables, Repo: https://github.com/vineethsai/maifscratch-1, Added additional Author and fixed Citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13646 2025-11-25 cs.SE cs.AI cs.CL cs.LG 83%

Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?

Live-SWE-agent: 软件工程代理能否在飞行中自我进化?

Chunqiu Steven Xia, Zhe Wang, Yan Yang, Yuxiang Wei, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Live-SWE-agent是一种能够在运行时自主进化其自身框架的软件代理,通过解决现实软件问题实现了77.4%的解决率,优于现有所有软件代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24591 2025-11-25 cs.CL astro-ph.IM 83%

ReplicationBench: Can AI Agents Replicate Astrophysics Research Papers?

ReplicationBench: 人工智能代理能否复制天体物理学研究论文?

Christine Ye, Sihan Yuan, Suchetha Cooray, Steven Dillmann, Ian L. V. Roque, Dalya Baron, Philipp Frank, Sergio Martin-Alvarez, Nolan Koblischke, Frank J Qu, Diyi Yang, Risa Wechsler, Ioana Ciuca

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

AI总结 ReplicationBench旨在评估人工智能代理复制天体物理学研究论文的能力,通过测试代理在实验设置、推导、数据分析和代码库等任务上的表现,揭示代理在科学研究中的可靠性及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18405 2025-11-25 cs.AI cs.HC cs.IR 83%

A Multimodal Conversational Agent for Tabular Data Analysis

面向表格数据分析的多模态对话代理

Mohammad Nour Al Awad, Sergey Ivanov, Olga Tikhonova, Ivan Khodnenko

机构 * ITMO University(ITMO大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 Talk2Data是一种多模态对话代理,通过语音和文本交互实现表格数据分析,结合LLM、ASR、代码生成和TTS技术,提供多轮对话和可验证计算。

Comments \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15511 2025-11-24 cs.RO cs.AI 83%

AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models

AeroVerse:用于模拟、预训练、微调和评估航空航天具身世界模型的UAV-Agent基准套件

Fanglong Yao, Yuanchang Yue, Youzhi Liu, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所目标认知与应用技术重点实验室)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 AeroVerse是一个用于模拟、预训练、微调和评估航空航天具身世界模型的基准套件,包含多个数据集和评估指标,旨在推动航空航天具身智能的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15759 2025-11-21 cs.CR cs.AI 83%

Securing AI Agents Against Prompt Injection Attacks

保护AI代理免受提示注入攻击

Badrinath Ramakrishnan, Akshaya Balaji

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种多层防御框架,通过评估RAG系统中的提示注入风险,将攻击成功率降低至8.7%,同时保持高任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14136 2025-11-19 cs.AI 83%

Beyond Accuracy: A Multi-Dimensional Framework for Evaluating Enterprise Agentic AI Systems

Sushant Mehta

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13860 2025-11-19 econ.GN cs.AI q-fin.EC 83%

Randomized Controlled Trials for Phishing Triage Agent

James Bono

机构 * Microsoft Corporation(微软公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08181 2025-11-18 cs.IR cs.AI 83%

MARC: Multimodal and Multi-Task Agentic Retrieval-Augmented Generation for Cold-Start Recommender System

Seung Hwan Cho, Yujin Yang, Danik Baeck, Minjoo Kim, Young-Min Kim, Heejung Lee, Sangjin Park

机构 * Department of Industrial Data Engineering, Hanyang University, Republic of Korea(工业数据工程系,翰阳大学) School of Interdisciplinary Industrial Studies, Hanyang University, Republic of Korea(跨学科工业研究学院,翰阳大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

Comments 13 pages, 2 figures, Accepted at RDGENAI at CIKM 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08042 2025-11-12 cs.AI 83%

Towards a Standard, Enterprise-Relevant Agentic AI Benchmark: Lessons from 5.5 billion tokens' worth of agentic AI evaluations

JV Roig

机构 * Kamiwaza AI

专题命中 Agent评测 :agentic(title,abstract);tool use(abstract);分类 cs.AI

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04464 2025-11-07 cs.AI 83%

Beyond Shortest Path: Agentic Vehicular Routing with Semantic Context

Carnot Braun, Rafael O. Jarczewski, Gabriel U. Talasso, Leandro A. Villas, Allan M. de Souza

机构 * Institute of Computing (IC)(计算学院) Hub de Inteligência Artificial e Arquiteturas Cognitivas (H.IAAC)(人工智能与认知架构中心) Universidade Estadual de Campinas (UNICAMP)(坎皮纳斯州立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04032 2025-11-07 cs.AI 83%

Detecting Silent Failures in Multi-Agentic AI Trajectories

Divya Pathak, Harshit Kumar, Anuska Roy, Felix George, Mudit Verma, Pratibha Moogi

机构 * IBM Research(IBM研究院) IIIT Bangalore(班加罗尔IIIT)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03051 2025-11-06 cs.AI cs.IR 83%

No-Human in the Loop: Agentic Evaluation at Scale for Recommendation

Tao Zhang, Kehui Yao, Luyi Ma, Jiao Chen, Reza Yousefi Maragheh, Kai Zhao, Jianpeng Xu, Evren Korpeoglu, Sushant Kumar, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球技术)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

Comments 4 page, NeurIPS 2025 Workshop: Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01218 2025-11-04 cs.LG 83%

Optimizing Electric Vehicle Charging Station Placement Using Reinforcement Learning and Agent-Based Simulations

Minh-Duc Nguyen, Dung D. Le, Phi Long Nguyen

机构 * organization= Center for Environmental Intelligence, VinUniversity , city= Hanoi , country= Vietnam organization= College of Engineering \& Computer Science, VinUniversity , city= Hanoi , country= Vietnam

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20414 2025-10-28 cs.GR cs.CV cs.LG cs.RO 83%

SceneWeaver: All-in-One 3D Scene Synthesis with an Extensible and Self-Reflective Agent

Yandan Yang, Baoxiong Jia, Shujie Zhang, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(1 通用人工智能国家重点实验室、BIGAI) Tsinghua University(2 清华大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025, 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21524 2025-10-27 cs.AI 83%

EU-Agent-Bench: Measuring Illegal Behavior of LLM Agents Under EU Law

Ilija Lichkovski, Alexander Müller, Mariam Ibrahim, Tiwai Mhundwa

机构 * AI Safety Initiative Groningen(格罗宁根人工智能安全倡议)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments Accepted at the Workshop on Regulatable ML at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18131 2025-10-22 cs.SE 83%

BlueCodeAgent: A Blue Teaming Agent Enabled by Automated Red Teaming for CodeGen AI

Chengquan Guo, Yuzhou Nie, Chulin Xie, Zinan Lin, Wenbo Guo, Bo Li

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17814 2025-10-22 eess.SY cs.AI cs.SY 83%

LLM Assisted Alpha Fairness for 6 GHz WiFi and NR_U Coexistence: An Agentic Orchestrator for Throughput, Energy, and SLA

Qun Wang, Yingzhou Lu, Guiran Liu, Binrong Zhu, Yang Liu

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) School of Medicine, Stanford University(医学院,斯坦福大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16248 2025-10-21 cs.CL 83%

FinResearchBench: A Logic Tree based Agent-as-a-Judge Evaluation Framework for Financial Research Agents

Rui Sun, Zuo Bai, Wentao Zhang, Yuxiang Zhang, Li Zhao, Shan Sun, Zhengwen Qiu

机构 * Stepfun FinStep

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02649 2025-10-21 cs.AI 83%

Fully Autonomous AI Agents Should Not be Developed

Margaret Mitchell, Avijit Ghosh, Alexandra Sasha Luccioni, Giada Pistilli

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11108 2025-10-21 cs.MA cs.AI cs.CR 83%

A Vision for Access Control in LLM-based Agent Systems

Xinfeng Li, Dong Huang, Jie Li, Hongyi Cai, Zhenhong Zhou, Wei Dong, XiaoFeng Wang, Yang Liu

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) National University of Singapore, Singapore(国立新加坡大学,新加坡)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11694 2025-10-14 cs.AI 83%

Operand Quant: A Single-Agent Architecture for Autonomous Machine Learning Engineering

Arjun Sahney, Ram Gorthi, Cezary Łastowski, Javier Vega

机构 * Operand Research(Operand研究)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

Comments 8 pages. No figures. Evaluated on MLE-Benchmark 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07943 2025-10-10 cs.AI 83%

Agent-Based Genetic Algorithm for Crypto Trading Strategy Optimization

Qiushi Tian, Churong Liang, Kairan Hong, Runnan Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏