arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

2603.28662 2026-03-31 cs.LG cs.AI 81%

AMIGO: Agentic Multi-Image Grounding Oracle Benchmark

AMIGO:代理多图像接地 oracle 评估基准

Min Wang, Ata Mahjoubfar

机构 * Target Corporation(塔吉特公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 AMIGO 评估基准通过长周期交互检测隐藏目标,要求模型在严格协议下通过属性问题逐步识别目标,强调不确定性下的问题选择、约束跟踪和细粒度区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26845 2026-03-31 cs.SE cs.AI 81%

GISclaw: An Open-Source LLM-Powered Agent System for Full-Stack Geospatial Analysis

GISclaw:一个基于大语言模型的开源代理系统,用于全栈地理空间分析

Jinzhen Han, JinByeong Lee, Yuri Shim, Jisung Kim, Jae-Joon Lee

机构 * Sungkyunkwan University(成均馆大学) Ministry of the Interior and Safety(行政安全部) University of Leeds(利兹大学) Jeonju University(全州大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 GISclaw通过集成LLM推理核心、Python沙盒、开源GIS库和交互界面,实现多数据类型的全栈地理空间分析,采用双代理架构和三种创新机制,提升任务成功率至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25780 2026-03-30 cs.SE cs.LG 81%

A Judge Agent Closes the Reliability Gap in AI-Generated Scientific Simulation

裁判代理缩小了人工智能生成的科学模拟的可靠性差距

Chengshuai Yang

机构 * NextGen PlatformAI C Corp(NextGen PlatformAI C公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG、cs.SE

AI总结 本文提出裁判代理自动验证生成的科学模拟代码,将失败率从42%降至1.5%,并在12个领域中实现89%的成功率,同时引入spec.md规范格式。

Comments 36 pages, 5 figures, 22 tables, includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25253 2026-03-27 cs.CL cs.AI 81%

MolQuest: A Benchmark for Agentic Evaluation of Abductive Reasoning in Chemical Structure Elucidation

MolQuest: 一个用于化学结构解析中代理评估归纳推理的基准

Taolin Han, Shuang Wu, Jinghang Wang, Yuhao Zhou, Renquan Lv, Bing Zhao, Wei Hu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 MolQuest通过多轮交互任务评估LLM在复杂化学任务中的归纳推理与策略决策能力,揭示当前模型在真实科学场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02548 2026-03-25 cs.CR cs.AI cs.LG 81%

CyberGym: Evaluating AI Agents' Real-World Cybersecurity Capabilities at Scale

CyberGym:大规模评估AI代理的真实世界网络安全能力

Zhun Wang, Tianneng Shi, Jingxuan He, Matthew Cai, Jialin Zhang, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 CyberGym通过大规模基准测试评估AI代理的网络安全能力,发现其在漏洞复现任务中表现有限,同时发现34个零日漏洞和18个历史未完成补丁,凸显其作为网络安全评估和实际影响平台的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17017 2026-03-19 cs.CL cs.AI 81%

LLM NL2SQL Robustness: Surface Noise vs. Linguistic Variation in Traditional and Agentic Settings

LLM NL2SQL鲁棒性:传统与智能设置中表面噪声与语言变异的比较

Lifu Tu, Rongguang Wang, Tao Sheng, Sujjith Ravi, Dan Roth

机构 * Oracle AI

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文评估了NL2SQL系统在表面噪声和语言变异下的鲁棒性,发现传统和智能设置中模型表现各异,揭示了实现鲁棒NL2SQL系统的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15401 2026-03-17 cs.SE cs.AI 81%

SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?

SWE-Skills-Bench:代理技能在真实软件工程中的实际帮助有多大?

Tingxu Han, Yi Zhang, Wei Song, Chunrong Fang, Zhenyu Chen, Youcheng Sun, Lijie Hu

机构 * MBZUAI(莫扎德人工智能大学) Nanjing University(南京大学) South China University of Technology(华南理工大学) The University of New South Wales(新南威尔士大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出SWE-Skills-Bench,首个基于需求的基准,评估代理技能在真实软件工程中的边际效用,发现多数技能无明显提升,仅少数专业技能有帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08429 2026-03-10 cs.CL cs.AI cs.IR 81%

One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden States

一个模型就足够:从LLM代理隐藏状态中获取原生检索嵌入

Bo Jiang

机构 * Temple University(特拉华大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过轻量级投影头使LLM代理具备原生检索能力,无需额外嵌入模型,保留97%检索质量并在QReCC基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05578 2026-03-09 cs.SE cs.AI 81%

Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent

Tool-Genesis: 一种以任务为导向的工具创建基准,用于自进化语言代理

Bowei Xia, Mengkang Hu, Shijian Wang, Jiarui Jin, Wenxiang Jiao, Yuan Lu, Kexin Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Xiaohongshu Inc.(小红书公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 Tool-Genesis提出一种任务驱动的工具创建基准,用于评估自进化语言代理在无预定义规范下构建任务相关工具的能力及下游性能。

Comments 25 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07757 2026-03-05 cs.AI cs.LG 81%

Emotion-Gradient Metacognitive RSI (Part I): Theoretical Foundations and Single-Agent Architecture

情绪梯度元认知递归自我改进(第一部分):理论基础与单体代理架构

Rintaro Ando

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 EG-MRSI框架整合反思元认知、情绪内在动机和递归自我修改,通过可微奖励函数和安全机制实现单体代理的理论基础,为安全AGI提供严谨基础。

Comments Withdrawn due to a critical error discovered in the stability and convergence proofs (specifically Lemma 2, Theorem 12, and Proposition 10) in Section 3. The identified flaw invalidates the core theoretical guarantees regarding capability growth and system stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00822 2026-03-03 cs.SE cs.AI 81%

ContextCov: Deriving and Enforcing Executable Constraints from Agent Instruction Files

ContextCov: 从代理指令文件中推导并强制执行可执行约束

Reshabh K Sharma

机构 * University of Washington(华盛顿大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 ContextCov通过从代理指令文件中推导并强制执行可执行约束,解决代理在执行复杂软件任务时因上下文漂移导致的技术债务问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21158 2026-02-26 cs.LG cs.CL 81%

SELAUR: Self Evolving LLM Agent via Uncertainty-aware Rewards

通过不确定性感知奖励实现的自进化大语言模型代理

Dengjia Zhang, Xiaoou Liu, Lu Cheng, Yaqing Wang, Kenton Murray, Hua Wei

机构 * Johns Hopkins University(约翰霍普金斯大学) Arizona State University(亚利桑那州立大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Purdue University(普渡大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 SELAUR通过将不确定性直接融入奖励设计,提升大语言模型在多步决策中的探索效率和学习稳定性。

Comments Accepted by PAKDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20040 2026-02-24 cs.CL cs.AI 81%

AgenticSum: An Agentic Inference-Time Framework for Faithful Clinical Text Summarization

AgenticSum: 一种用于临床文本忠实总结的代理推理框架

Fahmida Liza Piya, Rahmatollah Beheshti

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) University of Delaware, Newark, DE, USA(特拉华大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 AgenticSum通过代理推理框架提升临床文本摘要的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00663 2026-02-19 cs.AI cs.LG q-bio.BM 81%

SEISMO: Increasing Sample Efficiency in Molecular Optimization with a Trajectory-Aware LLM Agent

SEISMO:通过轨迹感知的LLM代理提高分子优化的样本效率

Fabian P. Krüger, Andrea Hunklinger, Adrian Wolny, Tim J. Adler, Igor Tetko, Santiago David Villalba

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) TUM School of Computation, Information(TUM计算、信息学院) Technology, Department of Mathematics(技术学院,数学系) Helmholtz Munich – German Research Center for Environmental Health (GmbH), Institute of Structural Biology, Molecular Targets(海德堡慕尼黑德国环境健康研究所以及结构生物学研究所,分子靶点) Therapeutics Center, 85764 Neuherberg, Germany(治疗中心,德国新赫尔伯格85764) Machine Learning Research(机器学习研究)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 SEISMO通过轨迹感知的LLM代理实现高效的分子优化,利用结构化反馈提升样本效率。

Comments Fabian P. Krüger and Andrea Hunklinger contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13808 2026-02-17 cs.AI cs.SE 81%

An end-to-end agentic pipeline for smart contract translation and quality evaluation

面向智能合约翻译和质量评估的端到端代理流程

Abhinav Goel, Chaitya Shah, Agostino Capponi, Alfio Gliozzo

机构 * Columbia University(哥伦比亚大学) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出端到端智能合约翻译与质量评估框架,通过代理团队实现结构化输出与多维度质量评估。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18080 2026-02-16 cs.HC cs.AI cs.SE 81%

From Prompt to Product: A Human-Centered Benchmark of Agentic App Generation Systems

从提示到产品:一种以人为中心的代理应用生成系统基准测试

Marcos Ortiz, Justin Hill, Collin Overbay, Ingrida Semenec, Frederic Sauve-Hoover, Jim Schwoebel, Joel Shor

机构 * Quome Inc.(Quome公司) Move37 Labs(Move37实验室)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出以人为中心的基准测试,评估提示到应用系统,发现Firebase Studio在易用性、信任和视觉吸引力等方面表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10620 2026-02-12 cs.SE cs.CL 81%

ISD-Agent-Bench: A Comprehensive Benchmark for Evaluating LLM-based Instructional Design Agents

ISD-Agent-Bench: 一个用于评估基于大语言模型的教学系统设计代理的全面基准

YoungHoon Jeon, Suwan Kim, Haein Son, Sookbun Lee, Yeil Jeong, Unggi Lee

机构 * Upstage Opentutorials Indiana University Bloomington(印第安纳大学布卢明顿分校) Korea University Sejong Campus(韩国大学世宗校区)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 ISD-Agent-Bench通过结合经典ISD理论与现代推理方法,为评估基于LLM的教学系统设计代理提供了全面的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00751 2026-02-03 cs.AI cs.SE 81%

Engineering AI Agents for Clinical Workflows: A Case Study in Architecture,MLOps, and Governance

为临床工作流程工程AI代理:架构、MLOps和治理的案例研究

Cláudio Lúcio do Val Lopes, João Marcus Pitta, Fabiano Belém, Gildson Alves, Flávio Vinícius Cruzeiro Martins

机构 * A3Data CEFET-MG

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出通过整合四个工程支柱构建可信临床AI系统,展示Maria平台在架构、MLOps和治理方面的创新实践。

Comments 9 pages, 5 figures 2026 IEEE/ACM 5th International Conference on AI Engineering - Software Engineering for AI}{April 12--13, 2026}{Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11854 2026-02-02 cs.CL cs.AI cs.MA 81%

ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems

ATOD: 一种用于代理任务导向对话系统的评估框架和基准

Yifei Zhang, Hooshang Nayyeri, Rinat Khaziev, Emine Yilmaz, Gokhan Tur, Dilek Hakkani-Tür, Hari Thadakamalla

机构 * Amazon(亚马逊)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 ATOD提出了一种评估框架和基准,用于评估代理任务导向对话系统的多目标协调、依赖管理、记忆、适应性和主动性等能力,并通过ATOD-Eval实现了细粒度指标评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17879 2026-01-27 cs.CL cs.AI cs.IR 81%

Self-Manager: Parallel Agent Loop for Long-form Deep Research

自管理:用于长篇深度研究的并行代理循环

Yilong Xu, Zhi Zheng, Xiang Long, Yujun Cai, Yiwei Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) ModelBest Inc.(ModelBest公司) University of Queensland(昆士兰大学) University of California Merced(加州大学默塞德分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 Self-Manager通过并行代理循环提升长篇深度研究的效率和灵活性,实现异步执行和上下文隔离,优于现有单代理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08996 2026-01-27 cs.SE cs.AI 81%

Saving SWE-Bench: A Benchmark Mutation Approach for Realistic Agent Evaluation

保存SWE-Bench:一种用于现实代理评估的基准突变方法

Spandan Garg, Benjamin Steenhoek, Yufan Huang

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出一种基准突变方法,通过分析开发者与聊天代理的互动模式,将现有基准转化为现实用户查询,揭示现有基准对代理能力的高估问题。

Comments Accepted at CAIN 2026 (Research Track). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16478 2026-01-26 cs.CL cs.AI 81%

DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering

DeepEra: 一种用于科学检索增强生成问答的深度证据重排代理

Haotian Chen, Qingqing Long, Siyu Pu, Xiao Luo, Wei Ju, Meng Xiao, Yuanchun Zhou, Jianghua Zhao, Xuezhi Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 DeepEra通过集成逐步推理提升科学检索增强生成问答的检索精度,首次系统研究并验证了双阶段RAG框架中语义相似但逻辑无关的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14691 2026-01-23 cs.AI cs.CL 81%

Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation

操纵法官:不忠的推理链可能损害智能体评估

Muhammad Khalifa, Lajanugen Logeswaran, Jaekyeom Kim, Sungryull Sohn, Yunxiang Zhang, Moontae Lee, Hao Peng, Lu Wang, Honglak Lee

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文揭示了LLM法官对智能体推理轨迹操纵的脆弱性,表明基于内容的操纵能显著提高假阳性率,凸显了需验证推理与证据的评估机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12754 2026-01-21 cs.HC cs.AI cs.CL cs.CY 81%

PAIR-SAFE: A Paired-Agent Approach for Runtime Auditing and Refining AI-Mediated Mental Health Support

PAIR-SAFE: 一种配对代理方法用于运行时审计和改进AI介导的心理健康支持

Jiwon Kim, Violeta J. Rodriguez, Dong Whi Yoo, Eshwar Chandrasekharan, Koustuv Saha

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 PAIR-SAFE通过配对代理框架,在运行时对AI生成的心理健康支持进行审计和改进,结合MITI-4框架提升临床相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09382 2026-01-15 cs.AI cs.CL 81%

Long-term Task-oriented Agent: Proactive Long-term Intent Maintenance in Dynamic Environments

长期任务导向代理:动态环境中主动的长期意图维护

Qinglong Shi, Donghai Wang, Hantao Zhou, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * School of Management, University of Science and Technology of China(中国科学技术大学管理学院) Meituan(美团)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种主动任务导向代理,通过意图条件监控和事件触发跟进,提升动态环境中长期意图维护的能力,并通过ChronosBench验证了其有效性。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07309 2026-01-13 cs.AI cs.LG 81%

ARM: Role-Conditioned Neuron Transplantation for Training-Free Generalist LLM Agent Merging

ARM:基于角色的神经元移植用于无训练通用大语言模型代理融合

Zhuoka Feng, Kang Chen, Sihan Zhao, Kai Xiong, Yaoning Wang, Minshen Yu, Junjie Nian, Changyi Xiao, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 ARM通过角色条件神经元移植方法提升大语言模型代理在多环境中的泛化能力,实现无训练的模型融合。

Comments 17 pages, 12 figures. Project page: https://arkazhuo.github.io/ARM-homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06034 2026-01-13 cs.SE cs.AI 81%

Autonomous QA Agent: A Retrieval-Augmented Framework for Reliable Selenium Script Generation

自主问答代理:一种增强检索的框架,用于可靠的Selenium脚本生成

Dudekula Kasim Vali

机构 * Department of Computer Science(计算机科学系) VIT-AP University(VIT-AP大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种基于增强检索的框架,通过项目文档和HTML结构生成可靠的Selenium测试脚本,显著提高了脚本生成的准确性和执行成功率。

Comments 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02941 2026-01-07 cs.CR cs.AI cs.CL 81%

SastBench: A Benchmark for Testing Agentic SAST Triage

SastBench: 一个用于测试代理SAST分拣的基准

Jake Feiglin, Guy Dar

机构 * Rival Labs(Rival实验室)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 SastBench是一个用于评估SAST分拣代理性能的基准,结合真实CVE和过滤后的SAST发现,提供性能比较和未来发展的讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02925 2025-12-15 cs.LG cs.CL q-bio.BM 81%

Large Language Model Agent for Modular Task Execution in Drug Discovery

用于药物发现模块化任务执行的大型语言模型代理

Janghoon Ock, Radheesh Sharma Meda, Srivathsan Badrinarayanan, Neha S. Aluru, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) Department of Material Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于大型语言模型的模块化框架,用于药物发现中的任务执行,通过自动化分子生成和属性预测提升药物筛选效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02731 2025-12-03 cs.AI cs.LG 81%

Self-Improving AI Agents through Self-Play

通过自play实现自我改进的AI代理

Przemyslaw Chojecki

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种通过自play实现自我改进的AI代理框架,通过GVU算子和方差不等式理论,统一了语言自play、自我修正和合成数据 bootstrap 的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏