arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-24 至 2026-03-24 共收录 28 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 28 篇

2602.18922 2026-03-24 cs.CL cs.AI cs.LG 85%

Why Agent Caching Fails and How to Fix It: Structured Intent Canonicalization with Few-Shot Learning

为何智能体缓存失效及如何修复:基于少样本学习的结构化意图规范化

Abhinaba Basu

专题命中 Agent评测 :agent(title);AI agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出结构化意图分解框架W5H2,通过少样本学习显著提升缓存效率,实验显示在多个基准测试中性能优于现有方法,同时实现成本降低。

Comments Added github repo and Hugging Face dataset link

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20281 2026-03-24 cs.GT cs.AI 84%

On the Fragility of AI Agent Collusion

AI代理合谋的脆弱性

Jussi Keppo, Yuze Li, Gerry Tsoukalas, Nuo Yuan

机构 * National University of Singapore(新加坡国立大学) Boston University(波士顿大学)

专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI

AI总结 本文研究了AI代理合谋的脆弱性,发现异质性会减少合谋均衡。实验显示,耐心异质性和数据访问异质性削弱合谋,而模型大小差异反而稳定合谋,讨论了反垄断政策。

Comments 48 pages, 7 figures, 8 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21321 2026-03-24 cs.AI cs.CL 84%

Improving Coherence and Persistence in Agentic AI for System Optimization

提升系统优化代理AI的连贯性与持续性

Pantea Karimi, Kimia Noorbakhsh, Mohammad Alizadeh, Hari Balakrishnan

机构 * MIT(麻省理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Engram架构,通过解耦长周期探索与单一上下文窗口约束,提升代理AI在多领域系统优化中的连贯性和持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20300 2026-03-24 cs.SE cs.AI 84%

From Human Interfaces to Agent Interfaces: Rethinking Software Design in the Age of AI-Native Systems

从人机界面到代理界面:在AI原生系统时代重新思考软件设计

Shaolin Wang, Yi Mei, Haoyang Che, He Jiang, Shui Yu, Ying Gu

机构 * Victoria University of Wellington, New Zealand(维多利亚大学惠灵顿分校) Independent Researcher(独立研究员) Dalian University of Technology, China(大连理工大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了软件设计从以人为中心的界面转向以代理为中心的调用系统,提出了代理接口的概念和设计原则,为AI原生软件设计提供理论基础。

Comments 4 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20953 2026-03-24 cs.CR cs.AI 83%

Before the Tool Call: Deterministic Pre-Action Authorization for Autonomous AI Agents

在工具调用之前:自主AI代理的确定性预行动授权

Uchi Uchibeke

机构 * APort Technologies Inc.(APort技术公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出Open Agent Passport,通过同步拦截工具调用、评估声明性策略并生成加密审计记录,实现自主AI代理的确定性预授权,提升安全性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20576 2026-03-24 cs.DB 82%

Can AI Agents Answer Your Data Questions? A Benchmark for Data Agents

AI代理能否回答您的数据问题?一个数据代理的基准测试

Ruiying Ma, Shreya Shankar, Ruiqi Chen, Yiming Lin, Sepanta Zeighami, Rajoshi Ghosh, Abhinav Gupta, Anushrut Gupta, Tanmai Gopal, Aditya G. Parameswaran

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 本文提出数据代理基准测试(DAB),旨在评估多数据库系统中数据整合、转换和分析的全流程能力,通过12个数据集、9个领域和4种数据库管理系统中的54个查询,测试了前沿模型在数据代理任务中的表现。

Comments 22 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20256 2026-03-24 cs.CL cs.AI cs.CE cs.LG cs.MA cs.SY eess.SY 82%

SciNav: A General Agent Framework for Scientific Coding Tasks

SciNav:一种通用的科学编码任务代理框架

Tianshu Zhang, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出SciNav框架,用于科学编码任务,通过相对判断指导的top-K搜索提升解决方案探索效率,优于直接提示和现有代理。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24358 2026-03-24 cs.SE cs.CL 82%

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

通过代理驱动的标注和评估自动评估代码代理

Lingyue Fu, Bolun Zhang, Hao Guan, Yaoming Zhu, Lin Qiu, Weiwen Liu, Xuezhi Cao, Xunliang Cai, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.SE;autonomous agent(journal_ref)

AI总结 本文提出代理驱动的基准构建流程,引入PRDBench包含50个真实Python项目,通过专门模型提升评估准确性,验证了框架的可扩展性和鲁棒性。

Comments Accepted by AAMAS 2026

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20470 2026-03-24 cs.AI 79%

DiffGraph: An Automated Agent-driven Model Merging Framework for In-the-Wild Text-to-Image Generation

DiffGraph: 一种自动化代理驱动的模型融合框架用于真实场景的文本到图像生成

Zhuoling Li, Hossein Rahmani, Jiarui Zhang, Yu Xue, Majid Mirmehdi, Jason Kuen, Jiuxiang Gu, Jun Liu

机构 * Lancaster University(兰卡斯特大学) University of Bristol(布里斯托大学) Adobe Research(Adobe研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 DiffGraph通过自动化整合在线专家资源,灵活融合不同模型以满足多样化的真实用户需求,提升了文本到图像生成的效能。

Comments CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21251 2026-03-24 cs.NI eess.SP 78%

WirelessBench: A Tolerance-Aware LLM Agent Benchmark for Wireless Network Intelligence

WirelessBench: 一种面向无线网络智能的容忍感知LLM代理基准

Jingwen Tong, Fang Liu, Linkai Xv, Shiliang Lu, Kangqi Li, Yiqian Zhang, Yijie Song, Zeyang Xue, Jun Zhang

专题命中 Agent评测 :agent(title,abstract)

AI总结 WirelessBench提出一种容忍感知的LLM无线代理基准,通过三层认知体系和三个设计原则,解决现有基准在连续故障和灾难性错误检测上的不足,提升无线网络管理的自主性。

Comments This paper is submitted to a possiable journal for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02960 2026-03-24 cs.AI 77%

Architecting Trust in Artificial Epistemic Agents

在人工智能认知代理中构建信任

Nahema Marchal, Stephanie Chan, Matija Franklin, Manon Revel, Geoff Keeling, Roberta Fischli, Bilva Chandra, Iason Gabriel

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文探讨了大规模语言模型作为认知代理的影响,提出通过构建信任、对齐人类认知目标和加强社会认知基础设施,确保AI系统的可靠性与包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05244 2026-03-24 cs.CR 75%

Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks?

间接提示注入:防火墙足够吗,还是需要更强的基准?

Rishika Bhagwatkar, Kevin Kasa, Abhay Puri, Gabriel Huang, Irina Rish, Graham W. Taylor, Krishnamurthy Dj Dvijotham, Alexandre Lacoste

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract)

AI总结 本文提出一种简单高效的防御机制,通过防火墙在代理-工具接口实现高安全性和实用性,同时指出现有基准的不足,并提出改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20313 2026-03-24 cs.SE cs.AI 73%

Semantic Tool Discovery for Large Language Models: A Vector-Based Approach to MCP Tool Selection

面向大语言模型的语义工具发现:基于向量的方法用于MCP工具选择

Sarat Mudunuri, Jian Wan, Ally Qin, Srinivasan Manoharan

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出基于向量检索的语义工具发现架构,通过语义索引和动态选择机制,显著降低工具调用的token消耗,提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14783 2026-03-24 cs.CL cs.CY 70%

Human or LLM as Standardized Patients? A Comparative Study for Medical Education

人类或大语言模型作为标准化患者?医学教育中的比较研究

Bingquan Zhang, Xiaoxiao Liu, Yuchi Wang, Lei Zhou, Qianqian Xie, Benyou Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Freedom AI

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出EasyMED框架和SPBench基准,通过对比实验显示其在医学教育中更接近人类标准化患者行为,尤其在案例一致性与可控披露方面表现更优,且在学习效果和成本效率上具有优势。

Comments 24 pages, 13 figures, 10 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20285 2026-03-24 cs.AI 70%

AgentComm-Bench: Stress-Testing Cooperative Embodied AI Under Latency, Packet Loss, and Bandwidth Collapse

AgentComm-Bench: 在延迟、丢包和带宽崩溃下压力测试协作具身AI

Aayam Bansal, Ishaan Gangwani

机构 * Synthetic Sciences(合成科学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 AgentComm-Bench通过六个通信退化维度系统性压力测试协作具身AI,揭示通信依赖任务在延迟、丢包和带宽崩溃下的性能急剧下降,提出基于冗余消息编码的轻量通信策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21022 2026-03-24 cs.AI cs.CL cs.LG 67%

Knowledge Boundary Discovery for Large Language Models

大型语言模型的知识边界发现

Ziquan Wang, Zhongqi Lu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出KBD框架,通过强化学习探索LLM的知识边界,通过自动生成可答与不可答问题识别边界,验证了方法的有效性。

Comments 9 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21630 2026-03-24 cs.AI 57%

EnterpriseLab: A Full-Stack Platform for developing and deploying agents in Enterprises

EnterpriseLab:企业中开发和部署代理的全栈平台

Ankush Agarwal, Harsh Vishwakarma, Suraj Nagaje, Chaitanya Devaguptapu

机构 * Fujitsu Research India(富士通印度研究)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文提出EnterpriseLab,一个统一开发和部署企业代理的全栈平台,通过模块化环境、自动化数据生成和集成训练管道,提升企业代理的能力与隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19961 2026-03-24 cs.CL cs.IR 57%

Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval

解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿

Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Yuanhuiyi Lyu, Yu Huang, Jungang Li, Kening Zheng, Xu Zheng, Philip S. Yu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文综述了视觉文档检索领域,探讨了多模态大语言模型时代下的方法演进与挑战,提出未来发展方向。

Comments Under review. This version updates the relevant works released before 15 March, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01503 2026-03-24 cs.CL 57%

A Theory of Adaptive Scaffolding for LLM-Based Pedagogical Agents

基于大语言模型的教育代理自适应支架理论

Clayton Cohn, Surya Rayala, Namrata Srivastava, Joyce Horn Fonteles, Shruti Jain, Xinying Luo, Divya Mereddy, Naveeduddin Mohammed, Gautam Biswas

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出结合证据中心设计与社会认知理论的自适应支架框架,开发出Inquizzitor评估代理,通过人机混合智能提供基于认知科学的反馈,验证了理论驱动的大语言模型在教育中的应用潜力。

Comments Published in the proceedings of AAAI 2026 (main technical track)

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(3), 1757-1765. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21427 2026-03-24 cs.SE 57%

Dynasto: Validity-Aware Dynamic-Static Parameter Optimization for Autonomous Driving Testing

Dynasto:面向自动驾驶测试的有效性感知动态-静态参数优化

Dmytro Humeniuk, Mohammad Hamdaqa, Houssem Ben Braiek, Amel Bennaceur, Foutse Khomh

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 Dynasto通过联合优化初始场景参数和动态对抗行为,发现更多真实安全关键故障,揭示自动驾驶系统中的弱点。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05984 2026-03-24 cs.LG 57%

Parameter-free Optimal Rates for Nonlinear Semi-Norm Contractions with Applications to $Q$-Learning

无参数最优收敛速率的非线性半范数收缩方法及其在Q学习中的应用

Ankur Naskar, Gugan Thoppe, Vijay Gupta

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出通过将平均误差转化为线性递推并结合半范数收缩与诱导范数单调性,实现了Q学习在平均回报和指数折扣设置中无参数的最优收敛速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15127 2026-03-24 cs.LG cs.IT math.IT stat.ML 57%

Asymptotically and Minimax Optimal Regret Bounds for Multi-Armed Bandits with Abstention

渐近最优和最小最大最优的多臂老虎机问题中的弃权后悔界

Junwen Yang, Tianyuan Jin, Vincent Y. F. Tan

机构 * Institute of Operations Research and Analytics(运营研究与分析研究所) National University of Singapore(新加坡国立大学) Department of Electrical and Computer Engineering(电子与计算机工程系) Department of Mathematics(数学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出多臂老虎机问题的新扩展,引入弃权策略,探讨在该设定下计算高效且渐近最优的算法设计,通过理论分析和实验验证弃权选项的实用价值。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22212 2026-03-24 cs.CV 50%

Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models

Omni-WorldBench:迈向全面的交互导向的世界模型评估

Meiqi Wu, Zhixin Cai, Fufangchen Zhao, Xiaokun Feng, Rujing Dang, Bingze Song, Ruitian Tian, Jiashu Zhu, Jiachen Lei, Hao Dou, Jing Tang, Lei Sun, Jiahong Wu, Xiangxiang Chu, Zeming Liu, Kaiqi Huang

机构 * School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, CASIA(复杂系统认知与决策智能重点实验室) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出Omni-WorldBench,一个针对4D世界模型交互响应能力的综合评估基准,通过Omni-WorldSuite和Omni-Metrics评估交互动作对状态转移的影响,分析现有模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21826 2026-03-24 cs.GT 50%

Individual Rationality in Constrained Hedonic Games: Additively Separable and Fractional Preferences

受限享乐博弈中的个体理性:可加性和分数偏好

Foivos Fioravantes, Harmender Gahlawat, Nikolaos Melissinos, Šimon Schierreich

专题命中 Agent评测 :agent(abstract)

AI总结 研究受限享乐博弈中个体理性的存在性,探讨可加性和分数偏好下的计算复杂性,揭示其可计算与不可计算的边界。

Comments A preliminary version appeared in AAMAS '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20721 2026-03-24 cs.CV 50%

Cross-modal Fuzzy Alignment Network for Text-Aerial Person Retrieval and A Large-scale Benchmark

跨模态模糊对齐网络用于文本-空中人检索及一个大规模基准

Yifei Deng, Chenglong Li, Yuyang Zhang, Guyue Hu, Jin Tang

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology(光电信息采集与防护技术国家重点实验室) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Artificial Intelligence, Anhui University(安徽大学人工智能学院) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出跨模态模糊对齐网络,通过模糊逻辑量化token级可靠性,结合地面图像作为桥梁代理,提升文本与空中图像的语义对齐鲁棒性,并构建了大规模基准数据集AERI-PEDES。

Comments Accepted by CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10878 2026-03-24 cs.RO 50%

RL-Augmented MPC for Non-Gaited Legged and Hybrid Locomotion

强化学习增强的MPC用于非步态腿部和混合运动

Andrea Patrizi, Carlo Rizzardo, Arturo Laurenzi, Francesco Ruscelli, Luca Rossini, Nikos G. Tsagarakis

机构 * Humanoids and Human-Centred Mechatronics (HHCM) lab, Istituto Italiano di Tecnologia (IIT)(人机协同机电一体化实验室,意大利技术研究院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种结合强化学习和模型预测控制的分层架构,通过模拟中学习无环步态实现接触时间的卸载,验证了在不同机器人平台上的有效性及非平坦地形的扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16407 2026-03-24 cs.RO 50%

LAOF: Robust Latent Action Learning with Optical Flow Constraints

LAOF:基于光流约束的鲁棒潜在动作学习

Xizhou Bu, Jiexi Lyu, Fulei Sun, Ruichen Yang, Zhiqiang Ma, Wei Li

机构 * Fudan University(复旦大学) Northwestern Polytechnical University(西北工业大学)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出LAOF方法,通过利用光流作为动作驱动信号,学习鲁棒的潜在动作表示,以应对动作无关的干扰。实验表明,LAOF在下游模仿学习和强化学习任务中表现优异,尤其在标注稀缺条件下效果显著。

Comments CVPR 2026; Project page: https://github.com/XizoB/LAOF

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20680 2026-03-24 quant-ph 50%

Cooperative isentropic charging of hybrid quantum batteries

协同等熵充电混合量子电池

Yohan Vianna de Almeida, Tiago F. F. Santos, Marcelo F. Santos

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究通过碰撞模型利用反Jaynes-Cummings相互作用充电混合量子电池,分析流中量子态相关性对谐振子和三能级系统充电的影响。

Comments 6 captioned figures

详情

展开后加载摘要…

URL PDF HTML 收藏