arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15662 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15662 篇

2601.03641 2026-04-14 cs.CL 83%

Agent-Dice: Disentangling Knowledge Updates via Geometric Consensus for Agent Continual Learning

Agent-Dice: 通过几何共识解耦知识更新以实现智能体持续学习

Zheng Wu, Xingyu Lou, Xinbei Ma, Yansi Li, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.CL

AI总结 本文提出Agent-Dice框架,通过几何共识过滤和曲率重要性加权解耦知识更新,解决智能体持续学习中的稳定性与可塑性矛盾,实验表明其在GUI智能体和工具使用领域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09470 2026-04-13 cs.CL 83%

Agentic Jackal: Live Execution and Semantic Value Grounding for Text-to-JQL

代理Jackal:用于文本到JQL的实时执行与语义价值接地

Vishnu Murali, Anmol Gulati, Elias Lumer, Kevin Frank, Sindy Campagna, Vamse Kumar Subbiah

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 本文提出Jackal基准,通过实时执行和语义检索工具提升文本到JQL的准确性,验证了代理方法在解决语义歧义中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09285 2026-04-13 cs.AI 83%

SAGE: A Service Agent Graph-guided Evaluation Benchmark

SAGE:基于服务代理图的评估基准

Ling Shi, Yuqin Dai, Ziyin Wang, Ning Gao, Wei Zhang, Chaozheng Wang, Yujie Wang, Wei He, Jinpeng Wang, Deiyi Xiong

机构 * Tianjin University(天津大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Independent Researcher(独立研究员)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出SAGE基准,通过动态对话图验证逻辑合规性,解决现有基准无法评估多维度用户行为和SOP的问题,揭示模型在意图分类与后续动作推导间的执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07142 2026-04-13 cs.HC cs.AI 83%

Exploring Teachers' Perspectives on Using Conversational AI Agents for Group Collaboration

探索教师使用对话式AI代理进行小组协作的视角

Prerna Ravi, Carúmey Stevens, Beatriz Flamia Azevedo, Jasmine David, Brandon Hanks, Hal Abelson, Grace Lin, Emma Anderson

机构 * Massachusetts Institute of Technology(麻省理工学院) Instituto Politécnico de Bragança(布拉干萨理工学院)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究探讨教师如何感知对话式AI代理对小组协作的影响,揭示设计中的核心矛盾及教学应用考量。

Comments Accepted to 27th International Conference on AI in Education (AIED) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07988 2026-04-10 cs.DC cs.AI 83%

LogAct: Enabling Agentic Reliability via Shared Logs

LogAct:通过共享日志实现代理可靠性

Mahesh Balakrishnan, Ashwin Bharambe, Davide Testuggine, David Geraghty, David Mao, Vidhya Venkat, Ilya Mironov, Rithesh Baradi, Gayathri Aiyer, Victoria Dudin

机构 * Meta

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 LogAct通过共享日志实现代理可靠性,允许代理通过LLM推理分析执行历史,实现故障恢复、健康检查和优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06582 2026-04-10 cs.IR cs.AI cs.MA 83%

Agentic SPARQL: Evaluating SPARQL-MCP-powered Intelligent Agents on the Federated KGQA Benchmark

代理SPARQL:在联邦知识图谱问答基准上评估基于SPARQL-MCP的智能代理

Daniel Dobriy, Frederik Bauer, Amr Azzam, Debayan Banerjee, Axel Polleres

机构 * WU Vienna(维也纳经济大学) Leuphana Universität Lüneburg(吕讷堡大学) Complexity Science Hub Vienna(维也纳复杂性科学中心)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了基于SPARQL-MCP的智能代理在联邦SPARQL查询中的潜力,扩展了知识图谱问答基准,并评估了通过MCP集成SPARQL联邦与LLM代理的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02837 2026-04-06 cs.CR cs.AI 83%

Towards Secure Agent Skills: Architecture, Threat Taxonomy, and Security Analysis

面向安全的智能体技能:架构、威胁分类与安全分析

Zhiyuan Li, Jingzheng Wu, Xiang Ling, Xing Cui, Tianyue Luo

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文首次系统分析了智能体技能框架的安全性,识别各生命周期阶段的攻击面,构建了包含七类十七种场景的威胁分类,并提出针对各威胁类别的防御方向和研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29848 2026-04-01 cs.AI cs.MA 83%

AgentFixer: From Failure Detection to Fix Recommendations in LLM Agentic Systems

AgentFixer: 从LLM代理系统中故障检测到修复建议

Hadar Mulian, Sergey Zeltyn, Ido Levy, Liane Galanti, Avi Yaeli, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一个综合验证框架,通过系统诊断和改进可靠性故障,结合轻量规则检查与LLM评估,提升代理系统性能,通过实验展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29199 2026-04-01 cs.AI 83%

AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction

AEC-Bench:一种用于建筑、工程和施工领域代理系统的多模态基准

Harsh Mankodiya, Chase Gallik, Theodoros Galanos, Andriy Mulyar

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 AEC-Bench旨在评估建筑、工程和施工领域代理系统在真实任务中的表现,涵盖图纸理解、跨表单推理和项目级协调任务,通过多模型基准测试提升基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26682 2026-03-31 cs.HC cs.AI cs.CY 83%

Operationalizing Perceptions of Agent Gender: Foundations and Guidelines

将智能代理性别感知操作化:基础与指南

Katie Seaborn, Madeleine Steeds, Ilaria Torre, Martina De Cet, Katie Winkle, Marcus Göransson

机构 * Institute of Science Tokyo(东京科学大学) University of Cambridge(剑桥大学) University College Dublin(都柏林大学学院) Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学与哥德堡大学) Uppsala University(乌普萨拉大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨智能代理性别感知的操作化方法,提出理论驱动的框架以提高研究严谨性和包容性,解决现有标准缺失的问题。

Journal ref CHI 2026 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20953 2026-03-24 cs.CR cs.AI 83%

Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents

在工具调用之前:自主AI代理的确定性预行动授权

Uchi Uchibeke

机构 * APort Technologies Inc.(APort技术公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出Open Agent Passport,通过同步拦截工具调用、评估声明性策略并生成加密审计记录,实现自主AI代理的确定性预授权,提升安全性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18197 2026-03-20 cs.AI cs.CR cs.NI 83%

Access Controlled Website Interaction for Agentic AI with Delegated Critical Tasks

受控网站交互用于代理AI的委托关键任务

Sunyoung Kim, Hokeun Kim

机构 * Arizona State University(亚利桑那州立大学)

专题命中 Agent评测 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出一种受控网站交互设计,用于代理AI执行关键任务,通过细粒度访问控制机制提升安全性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17639 2026-03-19 cs.AI 83%

VeriGrey: Greybox Agent Validation

VeriGrey:灰盒代理验证

Yuntong Zhang, Sungmin Kang, Ruijie Meng, Marcel Böhme, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出VeriGrey方法,通过工具调用序列反馈函数驱动测试过程,发现LLM代理中隐含的提示注入漏洞,并在实际案例中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15639 2026-03-19 cs.AI 83%

The Comprehension-Gated Agent Economy: A Robustness-First Architecture for AI Economic Agency

基于理解的智能体经济:面向AI经济代理的鲁棒性优先架构

Rahul Baxi

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出Comprehension-Gated Agent Economy架构,通过对抗鲁棒性审计生成验证函数,实现经济权限的鲁棒性约束,确保经济安全与竞争力。

Comments v2: updated correspondence email

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16586 2026-03-18 cs.AI 83%

Runtime Governance for AI Agents: Policies on Paths

AI代理的运行时治理:路径上的政策

Maurits Kaptein, Vassilis-Javed Khan, Andriy Podstavnychy

机构 * Eindhoven University of Technology(埃因霍温理工大学) Kyvvu B.V.(Kyvvu公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过路径作为核心对象,研究AI代理运行时治理,探讨路径依赖政策的框架与实现,分析合规性评估及开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16161 2026-03-18 cs.AI 83%

SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory Aggregation

SQL-ASTRA: 缓解代理SQL中的稀疏反馈 via 列集匹配和轨迹聚合

Long Li, Zhijian Zhou, Jiangxuan Long, Peiyang Liu, Weidi Xu, Zhe Wang, Shirui Pan, Chao Qu

机构 * Griffith University(格里菲斯大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Peking University(北京大学) InFly Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出SQL-ASTRA框架,通过列集匹配和轨迹聚合解决代理SQL中的稀疏反馈问题,引入轨迹奖励和列集匹配奖励,提升多轮任务的奖励分配效率与稳定性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15976 2026-03-18 cs.AI 83%

An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

面向AI生成科学代码的PETSc代理评估框架

Hong Zhang, Barry Smith, Satish Balay, Le Chen, Murat Keceli, Lois Curfman McInnes, Junchao Zhang

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出petscagent-bench框架,通过代理评估代理的方式,评估AI生成的科学代码在正确性、性能、代码质量等方面的表现,揭示传统指标的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08117 2026-03-18 cs.AI cs.IR 83%

UIS-Digger: Towards Comprehensive Research Agent Systems for Real-world Unindexed Information Seeking

UIS-Digger:面向现实世界未索引信息检索的综合性研究代理系统

Chang Liu, Chuqiao Kuang, Tianyi Zhuang, Yuxin Cheng, Huichi Zhou, Xiaoguang Li, Lifeng Shang

机构 * Huawei Technologies Ltd.(华为技术有限公司) The University of Hong Kong(香港大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出UIS-Digger,一种新型多代理框架,通过双模式浏览和同时网页搜索与文件解析,解决未索引信息检索问题,展示了其在UIS-QA基准上的性能优势。

Comments 21 pages, 5 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09821 2026-03-11 cs.CL 83%

One-Eval: An Agentic System for Automated and Traceable LLM Evaluation

One-Eval: 一个用于自动化和可追溯的LLM评估代理系统

Chengyu Shen, Yanheng Hou, Minghui Pan, Runming He, Zhen Hao Wong, Meiyi Qiang, Zhou Liu, Hao Liang, Peichao Lai, Zeang Sheng, Wentao Zhang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.CL

AI总结 One-Eval通过自动化和可追溯的评估流程,提升大语言模型评估的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06884 2026-03-10 cs.AI 83%

Distributed Legal Infrastructure for a Trustworthy Agentic Web

分布式法律基础设施用于可信代理网络

Tomer Jordi Chaffer, Victor Jiawei Zhang, Sante Dino Facchini, Botao Amber Hu, Helena Rong, Zihan Guo, Xisen Wang, Carlos Santana, Giovanni De Gasperis

机构 * Institute for Technoscience and Society(科技与社会研究所) Berkeley Center for Law & Technology(伯克利法与科技中心) U.C. Berkeley Law School(伯克利法学院) Technical University of Munich(慕尼黑技术大学) Università degli Studi dell’Aquila(阿奎拉大学) University of Oxford(牛津大学) Existential Risk Alliance(存在风险联盟) NYU Shanghai(纽约大学上海分校) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出分布式法律基础设施,旨在通过可互操作的协议构建可信代理网络,实现连贯治理与合法性维持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01203 2026-03-09 cs.AI 83%

How Well Does Agent Development Reflect Real-World Work?

代理开发是否能反映现实世界的工作?

Zora Zhiruo Wang, Sanidhya Vijayvargiya, Aspen Chen, Hanmo Zhang, Venu Arvind Arangarajan, Jett Chen, Valerie Chen, Diyi Yang, Daniel Fried, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04902 2026-03-06 cs.CR cs.AI 83%

AgentSCOPE: Evaluating Contextual Privacy Across Agentic Workflows

AgentSCOPE: 在代理工作流中评估上下文隐私

Ivoline C. Ngong, Keerthiram Murugesan, Swanand Kadhe, Justin D. Weisz, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy

机构 * University of Vermont(佛蒙特大学) IBM Research(IBM研究院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 AgentSCOPE通过评估代理工作流中的隐私流,揭示了中间阶段的隐私风险,指出输出层面评估不足以反映代理系统的隐私问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09937 2026-03-05 cs.AI cs.DC 83%

Why Do AI Agents Systematically Fail at Cloud Root Cause Analysis?

为何AI代理在云根因分析中系统性失败?

Taeyoon Kim, Woohyeok Park, Hoyeong Yun, Kyungyong Lee

机构 * Hanyang University(汉阳大学) OKESTRO Co., Ltd.(OKESTRO公司)

专题命中 Agent评测 :AI agent(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文分析了基于LLM的云根因分析代理在推理、通信和环境交互中的系统性故障,揭示了幻觉数据和不完全探索等普遍问题,并通过改进通信协议减少故障率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00858 2026-03-03 econ.TH cs.AI cs.IT cs.SY eess.SY math.IT 83%

Artificial Superintelligence May be Useless: Equilibria in the Economy of Multiple AI Agents

人工超智能可能无用:多智能体经济中的均衡

Huan Cai, Ziqing Lu, Catherine Xu, Weiyu Xu, Jie Zheng

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文研究了多智能体经济中的均衡,发现除非代理能翻倍边际效用,否则不会发生购买行为,且更强大AI代理可能对低能力代理贡献零效用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00462 2026-03-03 cs.CV cs.AI 83%

OPGAgent: An Agent for Auditable Dental Panoramic X-ray Interpretation

OPGAgent: 一种用于可审计牙科全景X光解读的智能体

Zhaolin Yu, Litao Yang, Ben Babicka, Ming Hu, Jing Hao, Anthony Huang, James Huang, Yueming Jin, Jiasong Wu, Zongyuan Ge

机构 * AIM for Health Lab Faculty of Information Technology, Monash University(信息科技学院,莫纳什大学) Monash University(莫纳什大学) Curae Health Faculty of Dentistry, The University of Hong Kong(牙科学院,香港大学) National University of Singapore(新加坡国立大学) Southeast University(东南大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 OPGAgent是一种用于可审计牙科全景X光解读的智能体系统,通过多工具协调和共识机制,在结构化报告和VQA评估中优于现有牙科VLMs和医疗智能体框架。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00318 2026-03-03 cs.CR cs.AI 83%

AESP: A Human-Sovereign Economic Protocol for AI Agents with Privacy-Preserving Settlement

AESP:面向AI代理的人类主权经济协议:具有隐私保护的结算

Jian Sheng Wang

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 AESP是一种面向AI代理的人类主权经济协议,通过五种机制确保代理在经济上具备能力但不具有主权,同时实现隐私保护和高效结算。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22814 2026-02-27 cs.AI cs.HC 83%

When Should an AI Act? A Human-Centered Model of Scene, Context, and Behavior for Agentic AI Design

AI何时行动?面向智能体AI设计的场景、情境与行为的人本模型

Soyoung Jung, Daehoo Yoon, Sung Gyu Koh, Young Hwan Kim, Yehan Ahn, Sung Park

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种人本模型,用于设计具有情境敏感性和判断力的智能体AI系统,通过整合场景、情境和人类行为因素,指导智能体的干预行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22452 2026-02-27 cs.AI cs.RO 83%

CWM: Contrastive World Models for Action Feasibility Learning in Embodied Agent Pipelines

CWM: 用于具身智能体流水线中动作可行性学习的对比世界模型

Chayan Banerjee

机构 * School of Electrical Engineering and Robotics, Queensland University of Technology(电气工程与机器人学学院,昆士兰理工大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI

AI总结 CWM通过对比训练提升动作可行性评分,优于SFT方法,提升精度并增强安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17046 2026-02-20 cs.AI 83%

Dynamic System Instructions and Tool Exposure for Efficient Agentic LLMs

动态系统指令与工具暴露用于高效代理LLM

Uria Franko

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 通过动态系统指令和工具暴露技术,ITR显著减少LLM代理的上下文令牌使用和运行成本,提升工具路由准确性,适用于长期自主代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16429 2026-02-19 cs.CL 83%

TabAgent: A Framework for Replacing Agentic Generative Components with Tabular-Textual Classifiers

TabAgent:一种用表格-文本分类器替代代理生成组件的框架

Ido Levy, Eilam Shapira, Yinon Goldshtein, Avi Yaeli, Nir Mashkif, Segev Shlomov

机构 * IBM Research, Haifa, Israel(IBM研究所在以色列海法)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 TabAgent通过表格-文本分类器替代生成决策组件,显著降低代理系统延迟和成本,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏