arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15686 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15686 篇

2605.07180 2026-05-11 cs.CL 79%

Learning Agent Routing From Early Experience

从早期经验学习代理路由

Yimin Wang, Jiahao Qiu, Xuan Qi, Xinzhe Juan, Jingzhe Shi, Zelin Zhao, Hongru Wang, Shilong Liu, Mengdi Wang

机构 * AI Lab, Princeton University(普林斯顿大学人工智能实验室) University of Michigan(密歇根大学) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息学院) Shanghai Jiao Tong University(上海交通大学) University of Edinburgh(爱丁堡大学) King’s College London(伦敦国王学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文研究在冷启动条件下如何在轻量级LLM推理与完整代理执行间进行路由,提出无需训练的BoundaryRouter框架,通过早期行为经验和指导性推理决定是否直接使用LLM还是升级至代理,实验显示其在降低推理时间与提升性能方面优于其他方法。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07073 2026-05-11 cs.AI 79%

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

TeamBench: 在强制角色分离下评估代理协调

Yubin Kim, Chanwoo Park, Taehan Kim, Eugene Park, Samuel Schmidgall, Salman Rahman, Chunjong Park, Cynthia Breazeal, Xin Liu, Hamid Palangi, Hae Won Park, Daniel McDuff

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 TeamBench通过851个任务模板和931个预设实例,评估在操作系统强制角色分离下代理协调的能力,发现提示仅和沙盒强制团队的通过率无显著差异,但提示仅团队更易出现验证者篡改执行者代码的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07011 2026-05-11 cs.LG 79%

Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

双代理协同训练用于健康教练的隐式对抗偏好优化

Da Long, Lingyi Fu, Diya Michelle Rao, Jasmine Ruales Carrera, Yang Bai, Shandian Zhe

机构 * Kahlert School of Computing University of Utah(Utah大学计算学院Kahlert学院) Department of Health and Kinesiology University of Utah(健康与运动科学系Utah大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出双代理框架,通过隐式对抗偏好优化提升健康教练质量,改进对话和模拟器训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02934 2026-05-11 cs.SE 79%

AgenticSZZ: Temporal Knowledge Graph-Guided Agentic Bug-Inducing Commit Identification

AgenticSZZ: 基于时间知识图谱的代理式Bug引发提交识别

Yu Shi, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.SE

AI总结 本文提出AgenticSZZ,利用时间知识图谱改进Bug引发提交识别,通过构建包含时间与结构关系的知识图谱,并结合LLM代理进行图搜索,提升识别精度与效果。

Comments Add RQ3 with open-source LLMs evaluation, such as DeepSeek-V4-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05379 2026-05-08 cs.AI cs.CC cs.ET 79%

Partial Evidence Bench: Benchmarking Authorization-Limited Evidence in Agentic Systems

部分证据基准:在代理系统中受授权限制的证据基准测试

Krti Tallam

机构 * KamiwazaAI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出Partial Evidence Bench,用于评估代理系统在授权限制下的证据处理能力,通过四个维度评估系统表现,展示不同行为模式对完成度的影响。

Comments Benchmark paper with deterministic synthetic corpora, 14 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 79%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01604 2026-05-05 cs.AI 79%

Evaluating Agentic AI in the Wild: Failure Modes, Drift Patterns, and a Production Evaluation Framework

在真实环境中评估代理AI:故障模式、漂移模式及生产评估框架

Mukund Pandey

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文针对代理AI在生产环境中持续运行时的评估挑战,提出七种故障模式分类及PAEF框架,揭示传统指标在检测故障模式上的不足。

Comments 11 pages, 6 tables, 1 figure. Reference implementation: https://github.com/mukund1985/llm-eval-toolkit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01209 2026-05-05 cs.SE cs.FL 79%

ClarifySTL: An Interactive LLM Agent Framework for STL Transformation through Requirements Clarification

ClarifySTL: 一种通过需求澄清的交互式LLM代理框架用于STL转换

Yue Fang, Zhi Jin, Jie An, Hongshen Chen, Xiaohong Chen, Naijun Zhan

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出ClarifySTL框架,通过交互式澄清需求中的模糊和歧义信息,提升STL转换的准确性与效率,实验表明其在多个基准测试中表现优异。

Comments 32 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00383 2026-05-04 cs.CL 79%

Agentic AI for Substance Use Education: Integrating Regulatory and Scientific Knowledge Sources

代理AI用于物质使用教育:整合监管与科学知识源

Kosar Haghani, Zahra Kolagar, Mohammed Atiquzzaman

机构 * Department of Social Science, Texas Woman's University(德克萨斯女子大学社会科学系) Department of Computer Science, Augsburg University of Applied Sciences(应用科学大学计算机科学系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出一种基于代理的AI系统,结合监管数据与科学文献,提供实时、权威的物质使用教育,通过专家评估验证其准确性与适用性。

Comments 22 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00314 2026-05-04 cs.CR cs.AI cs.PL 79%

Semia: Auditing Agent Skills via Constraint-Guided Representation Synthesis

Semia:通过约束引导的表示合成审计代理技能

Hongbo Wen, Ying Li, Hanzhi Liu, Chaofan Shou, Yanju Chen, Yuan Tian, Yu Feng

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Semia通过约束引导的表示合成技术,对代理技能进行静态审计,发现超过一半的技能存在关键语义风险,其召回率和F1值显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28093 2026-05-01 cs.AI 79%

What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design

什么样的终端-智能体基准任务是好的:为对抗性、困难和可理解的评估设计提供指南

Ivan Bercovich

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文探讨了如何设计有效的终端-智能体基准任务,指出任务应具备对抗性、难度和可理解性,以避免常见的失败模式,并通过实证证据表明超过15%的基准任务存在奖励可 hack 的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28049 2026-05-01 cs.AI 79%

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

不依赖代理的生产环境SQL准确性评估

Taslim Jamal Arif, Kuldeep Singh

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27849 2026-05-01 cs.AI 79%

A Grid-Aware Agent-Based Model for Analyzing Electric Vehicle Charging Systems

一种面向电网的基于代理的模型用于分析电动汽车充电系统

Khalil Al-Rahman Youssefi, Marija Gojkovic, Walter Stefanutti, Mika Auer, Melanie Schranz

机构 * Lakeside Labs(拉克西德实验室) Silicon Austria Labs(硅 Austria 实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种可配置的、面向电网的基于代理的模型,用于系统分析电动汽车充电系统在可配置基础设施和运营条件下的表现,通过整合异构的电动汽车行为、充电柱约束和共享的能源沙盒,研究用户导向的充电动态和设施层面的电力行为。

Comments This is the author's version of a paper submitted to SIMULTECH. 12 Pages, 1 Table, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27820 2026-05-01 cs.AI cs.DB cs.IR cs.MA 79%

ObjectGraph: From Document Injection to Knowledge Traversal -- A Native File Format for the Agentic Era

ObjectGraph:从文档注入到知识遍历——面向代理时代的原生文件格式

Mohit Dubey, Open Gigantic

机构 * Open Gigantic(开放巨型)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出ObjectGraph文件格式,通过将文档视为类型化有向知识图谱而非文本字符串,解决代理任务中文档处理的效率与准确性问题,实现95.3%的token减少和98.7%的内容保留。

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27725 2026-05-01 cs.HC cs.AI 79%

AgentEconomist: An End-to-end Agentic System Translating Economic Intuitions into Executable Computational Experiments

AgentEconomist:一个端到端的代理系统,将经济直觉转化为可执行的计算实验

Jiaju Chen, Jinghua Piao, Xia Xu, Songwei Li, Tong Xia, Xiangnan He, Yong Li

机构 * Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院)

专题命中 Agent评测 :agentic(title);workflow(abstract);分类 cs.AI

AI总结 AgentEconomist通过模块化多阶段架构,将经济直觉转化为可执行的计算实验,通过文献基础假设生成、实验设计和执行阶段,结合人类与AI协作,提升研究创新性与文献相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26958 2026-05-01 cs.CY cs.AI 79%

Designing Ethical Learning for Agentic AI: Toegye Yi Hwang's Ethical Emotion Regulation Framework

为智能代理AI设计道德学习:Toegye Yi Hwang的道德情感调节框架

Ji Yeon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出一种基于Toegye Yi Hwang道德哲学的智能代理AI道德情感调节框架,通过五阶段架构和评估工具规范自主决策周期中的道德情感过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23283 2026-04-28 cs.LG 79%

Revisable by Design: A Theory of Streaming LLM Agent Execution

为设计而可逆:流式LLM代理执行的理论

Zhiyuan Zhai, Ming Li, Xin Wang

机构 * Fudan University(复旦大学) Guangming Lab(光明实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文提出流式LLM代理执行的可逆性理论,通过定义可逆性分类,证明冲突可逆动作导致不可满足性,提出修订吸收器算法提升执行灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 79%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21480 2026-04-24 cs.AI 79%

Efficient Agent Evaluation via Diversity-Guided User Simulation

通过多样性引导的用户模拟实现高效的代理评估

Itay Nakash, George Kour, Ateret Anaby-Tavor

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出DIVERT框架,通过快照和覆盖引导的方式高效探索代理与用户交互,提升评估效率和覆盖范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19533 2026-04-23 cs.CR cs.AI 79%

Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps

网络防御基准:针对LLM在SecOps中的代理威胁狩猎评估

Alankrit Chona, Igor Kozlov, Ambuj Kumar

机构 * Simbian AI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出网络防御基准,评估LLM代理在威胁狩猎任务中的表现,发现现有模型在无引导情况下无法有效识别恶意事件。

Comments 13 pages, 3 figures, 5 tables. Complete benchmark and hunt traces available on request

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19689 2026-04-22 cs.AI 79%

A-MAR: Agent-based Multimodal Art Retrieval for Fine-Grained Artwork Understanding

A-MAR:基于代理的多模态艺术检索用于细粒度艺术作品理解

Shuai Wang, Hongyi Zhu, Jia-Hong Huang, Yixian Shen, Chengxi Zeng, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

机构 * University of Amsterdam(阿姆斯特丹大学) University of Bristol(布里斯托大学) Amazon AGI(亚马逊人工智慧) College of Business and Economics(商学院和经济学学院) University of Johannesburg(约翰内斯堡大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出A-MAR框架,通过结构化推理计划显式指导多模态艺术检索,提升解释质量和证据 grounding 能力,在艺术领域验证了代理式多模态推理的有效性。

Journal ref ICMR 2026, ACM International Conference on Multimedia Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17557 2026-04-21 cs.LO cs.AI 79%

Causal-Temporal Event Graphs: A Formal Model for Recursive Agent Execution Traces

因果-时间事件图:递归代理执行记录的正式模型

Simon Foldvik

机构 * Independent researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出因果-时间事件图(CTEG)作为递归代理执行记录的正式模型,通过递归闭包和单调算子的最小固定点,实现执行轨迹的结构化表示与验证。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17309 2026-04-21 cs.AI 79%

Knows: Agent-Native Structured Research Representations

Knows: 代理原生结构化研究表示

Guangsheng Yu, Xu Wang

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Knows通过轻量级规范将结构化声明、证据、溯源和可验证关系绑定到研究成果,提升LLM代理处理长文档的能力,实验显示使用侧车可显著提升弱模型准确率,且减少输入token数量。

Comments This paper serves as a technical report/white paper for the Knows.Academy project (https://knows.academy)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17238 2026-04-21 cs.CL 79%

Personalizing Student-Agent Interactions Using Log-Contextualized Retrieval-Augmented Generation (RAG)

基于日志上下文的检索增强生成在个性化学生代理互动中的应用

Clayton Cohn, Surya Rayala, Caitlin Snyder, Joyce Fonteles, Shruti Jain, Naveeduddin Mohammed, Umesh Timalsina, Sarah K. Burriss, Ashwin T S, Namrata Srivastava, Menton Deweese, Angela Eeds, Gautam Biswas

机构 * 1Department of Computer Science, Vanderbilt University, Nashville, USA 2College of Engineering \& Science, University of Detroit Mercy, Detroit, USA 3The School for Science Math, Vanderbilt University, Nashville, USA

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出日志上下文化检索增强生成(LC-RAG)方法,通过环境日志增强协作对话的检索能力,使协作同伴代理Copa能提供个性化指导,支持学生在C2STEM环境中的批判性思维和知识决策。

Comments Peer reviewed; appeared in the International Conference on Artificial Intelligence in Education (AIED25) Workshop on Epistemics and Decision-Making in AI-Supported Education

Journal ref https://sites.google.com/view/edm-aied-2025/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15840 2026-04-20 cs.CL 79%

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

CoEvolve:通过代理-数据互演训练LLM代理

Shidong Yang, Ziyu Ma, Tongwen Huang, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) AMAP

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出CoEvolve框架,通过闭环交互训练提升LLM代理性能,利用反馈信号识别失败模式并指导任务合成,实验显示在AppWorld和BFCL上显著提升表现。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15327 2026-04-20 cs.HC cs.AI 79%

Eco-Bee: A Personalised Multi-Modal Agent for Advancing Student Climate Awareness and Sustainable Behaviour in Campus Ecosystems

Eco-Bee:一种面向校园生态系统的个性化多模态代理,用于提升学生气候意识和可持续行为

Caleb Adu, Neil Kapadia, Binhe Liu, Jonathan Randall, Sruthi Viswanathan

机构 * University of Hull(赫尔大学) The Spaceship Academy(太空学院) City St George’s, University of London(伦敦大学城市学院) King’s College London(伦敦国王学院) Lancaster University(兰卡斯特大学) University of Oxford(牛津大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Eco-Bee通过整合大语言模型、行星边界框架(Eco-Score)和对话代理,为学生提供个性化反馈和行为激励,推动校园可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24621 2026-04-20 cs.AI 79%

ARC-AGI-3: A New Challenge for Frontier Agentic Intelligence

ARC-AGI-3:前沿代理智能的新挑战

ARC Prize Foundation

机构 * ARC Prize Foundation(ARC奖基金会)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出ARC-AGI-3基准测试,通过新颖的抽象回合制环境评估代理智能的适应效率,人类可完全解决环境,而前沿AI系统得分低于1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14220 2026-04-17 cs.IR cs.AI 79%

Knowledge Graph RAG: Agentic Crawling and Graph Construction in Enterprise Documents

知识图谱RAG:企业文档中的代理爬取与图谱构建

Koushik Chakraborty, Koyel Guha

机构 * Google AI, Global Services Delivery(谷歌AI,全球服务交付)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出基于递归爬取的代理知识图谱,解决复杂企业文档语义检索的局限性,提升法规查询的准确率。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13047 2026-04-16 cs.SI cs.AI cs.CY 79%

Integration of Deep Reinforcement Learning and Agent-based Simulation to Explore Strategies Counteracting Information Disorder

深度强化学习与基于代理的仿真整合以探索对抗信息紊乱的策略

Luigi Lomasto, Andrea Camoia, Alfonso Guarino, Nicola Lettieri, Delfina Malandrino, Rocco Zaccagnino

机构 * Department of Computer Science, University of Salerno(萨勒诺大学计算机科学系) National Institute for Public Policy Analysis (INAPP)(公共政策分析国家研究所)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文整合深度强化学习与基于代理的仿真,研究如何通过科学模拟复杂假新闻动态及遏制策略,以对抗信息紊乱现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11767 2026-04-15 cs.PL cs.MA cs.SE 79%

$λ_A$: A Typed Lambda Calculus for LLM Agent Composition

$λ_A$: 一种用于LLM代理组合的类型lambda演算

Qin Liu

专题命中 Agent评测 :agent(title,abstract);分类 cs.SE

AI总结 本文提出$λ_A$类型lambda演算,通过引入oracle调用、有界固定点、概率选择和可变环境扩展简单类型lambda演算,证明类型安全性和终止性,并展示其在代理配置检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏