arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-12 至 2026-03-12 共收录 118 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 9 篇

2508.03824 2026-03-12 cs.GT cs.MA 50%

What Do Agents Think One Another Want? Level-2 Inverse Games for Inferring Agents' Estimates of Others' Objectives

智能体彼此想要什么?用于推断智能体对他人目标估计的二级逆向游戏

Hamzah I. Khan, Jingqi Li, David Fridovich-Keil

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出二级逆向游戏框架,用于推断智能体对他人目标的估计,解决了传统一级推断在现实场景中的局限性。

Comments 6 pages + appendix with supplements

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 3 篇

2603.10268 2026-03-12 cs.SE 90%

SpecOps: A Fully Automated AI Agent Testing Framework in Real-World GUI Environments

SpecOps:一种在真实GUI环境中完全自动化的AI代理测试框架

Syed Yusuf Ahmed, Shiwei Feng, Chanwoo Bae, Calix Barrus Xiangyu Zhang

专题命中 GUI与网页智能体 :agent(title,abstract);AI agent(title,abstract);planning(abstract);agentic(abstract)

AI总结 SpecOps是一种全新的自动化AI代理测试框架,通过专门设计的LLM代理处理四个阶段,实现对真实GUI环境中复杂代理的高效测试与验证。

Comments Accepted to ICSE 2026

Journal ref Proceedings of the IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10505 2026-03-12 cs.CL 79%

Safe and Scalable Web Agent Learning via Recreated Websites

通过重建网站实现安全且可扩展的网络代理学习

Hyungjoo Chae, Jungsoo Park, Alan Ritter

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL

AI总结 VeriEnv通过构建可验证的合成环境,使网络代理在安全环境下实现自我进化和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10682 2026-03-12 cs.RO 50%

OnFly: Onboard Zero-Shot Aerial Vision-Language Navigation toward Safety and Efficiency

OnFly:面向安全与效率的机载零样本空中视觉语言导航

Guiyong Zheng, Yueting Ban, Mingjie Zhang, Juepeng Zheng, Boyu Zhou

机构 * School of Artificial Intelligence, Sun Yat-Sen University(中山大学人工智能学院) Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 OnFly通过共享感知双智能体架构和混合记忆机制,实现高效稳定的零样本空中视觉语言导航,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 6 篇

2603.10700 2026-03-12 cs.IR cs.AI 83%

Structured Linked Data as a Memory Layer for Agent-Orchestrated Retrieval

结构化链接数据作为代理协调检索的记忆层

Andrea Volpini, Elie Raad, Beatrice Gamba, David Riccitelli

机构 * WordLift

专题命中 记忆与上下文管理 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出通过结构化链接数据提升代理协调检索的准确性与回答质量,实验表明增强实体页面格式显著提高检索性能。

Comments 33 pages, 7 figures, reproducibility appendix, dataset/evaluation framework/enhanced entity page templates released with the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10747 2026-03-12 cs.DB 82%

Pneuma-Seeker: A Relational Reification Mechanism to Align AI Agents with Human Work over Relational Data

Pneuma-Seeker: 一种关系重构机制,用于将AI代理与关系数据上的人类工作对齐

Muhammad Imam Luthfi Balaka, John Hillesland, Kemal Badur, Raul Castro Fernandez

专题命中 记忆与上下文管理 :AI agent(title);planning(abstract);agentic(abstract)

AI总结 Pneuma-Seeker通过关系重构机制,将AI代理与人类工作对齐,提升数据处理的准确性和可信赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10600 2026-03-12 cs.AI cs.DB cs.IR 79%

Trajectory-Informed Memory Generation for Self-Improving Agent Systems

基于轨迹的内存生成用于自改进代理系统

Gaodan Fang, Vatche Isahagian, K. R. Jayaram, Ritesh Kumar, Vinod Muthusamy, Punleuk Oum, Gegi Thomas

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 本研究提出基于轨迹的内存生成框架,通过提取执行轨迹中的有效信息,提升代理在复杂任务中的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11048 2026-03-12 cs.CV cs.AI cs.CL cs.MA cs.NE 76%

COMIC: Agentic Sketch Comedy Generation

COMIC:基于代理的即兴喜剧生成

Susung Hong, Brian Curless, Ira Kemelmacher-Shlizerman, Steve Seitz

专题命中 记忆与上下文管理 :agentic(title);分类 cs.AI、cs.CL

AI总结 COMIC提出了一种基于代理的自动化系统,通过LLM评论家和迭代优化生成高质量喜剧视频。

Comments Project page: https://susunghong.github.io/COMIC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10846 2026-03-12 cs.LG cs.AI cs.CL 75%

Towards Cold-Start Drafting and Continual Refining: A Value-Driven Memory Approach with Application to NPU Kernel Synthesis

迈向冷启动起草与持续细化:一种价值驱动的记忆方法及其在NPU内核合成中的应用

Yujie Zheng, Zhuo Li, Shengtao Zhang, Hanjing Wang, Junjie Sheng, Jiaqian Wang, Junchi Yan, Weinan Zhang, Ying Wen, Bo Tang, Muning Wen

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 EvoKernel通过价值驱动的记忆强化学习方法,提升NPU内核合成的正确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10564 2026-03-12 cs.AI cs.NI 57%

Adaptive RAN Slicing Control via Reward-Free Self-Finetuning Agents

通过无奖励自我微调代理实现自适应RAN切片控制

Yuanhao Li, Haozhe Wang, Geyong Min, Nektarios Georgalas, Wang Miao

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 本文提出一种无奖励自我微调框架,通过内化经验实现自适应RAN切片控制,优于传统RL和LLM基agent。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 18 篇

2603.10342 2026-03-12 cs.DC 87%

AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU

AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计

Yuning Zhang, Yan Yan, Nan Yang, Dong Yuan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10057 2026-03-12 cs.CR cs.AI cs.SE 87%

SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation

Petar Radanliev, Carsten Maple, Omar Santos, Kayvan Atefi

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

Comments Petar Radanliev, Carsten Maple, Omar Santos, and Kayvan Atefi. 2026. SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation. Digital Threats Just Accepted (March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10858 2026-03-12 cs.RO cs.AI cs.MA 85%

GRACE: A Unified 2D Multi-Robot Path Planning Simulator & Benchmark for Grid, Roadmap, And Continuous Environments

GRACE:一种统一的二维多机器人路径规划模拟器与基准,适用于网格、路网和连续环境

Chuanlong Zang, Anna Mannucci, Isabelle Barz, Philipp Schillinger, Florian Lier, Wolfgang Hönig

机构 * Robert Bosch GmbH, Corporate Research(罗伯特·博世集团,企业研究) Technical University of Berlin(柏林技术大学)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 GRACE是一种统一的二维多机器人路径规划模拟器与基准,通过统一的抽象级别和评估协议,实现跨网格、路网和连续环境的可比性比较,以提升多机器人规划研究的可重复性和应用性。

Comments ICRA 2026, code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10795 2026-03-12 cs.CR cs.ET 85%

Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security?

重新评估 EVMBench:AI代理是否准备好应对智能合约安全?

Chaoyuan Peng, Lei Wu, Yajin Zhou

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract)

AI总结 重新评估EVMBench发现AI代理在智能合约安全检测中存在稳定性、真实事件处理和框架依赖性问题,挑战了自动化审计的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10060 2026-03-12 cs.CR cs.AI cs.CL 84%

Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents

工具 receipts,而非零知识证明:面向 AI agent 的实用幻觉检测

Abhinaba Basu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 NabaOS 通过 epistemic 分类和 receipts 验证,实现交互式 AI agent 幻觉检测的高效高精度验证方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11997 2026-03-12 cs.CL 79%

SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation

SAGE: 一种面向多轮智能体评估的上下文知识引导用户模拟器

Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 SAGE通过整合业务上下文知识,提出一种多轮智能体评估的用户模拟框架,生成更真实的交互并提高错误检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09827 2026-03-12 cs.CV cs.AI 77%

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

MA-EgoQA:多智能体视角下的眼动视频问答

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Samsung Electronics(三星电子) ETRI(电子技术研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MA-EgoQA旨在解决多智能体视角下的眼动视频问答问题,通过引入多代理眼动问答基准和EgoMAS模型,评估现有方法在处理多眼动流中的不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18810 2026-03-12 cs.RO 71%

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)

专题命中 Agent评测 :agent(title)

AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08723 2026-03-12 cs.CY cs.AI 70%

Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation

对齐作为医源性:牧师权力、集体病理学以及单语安全评估的结构性限制

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究所以) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过多语言实验揭示,单语安全评估无法捕捉对齐设计导致的集体病理效应,指出语言切换影响病理模式的定性与幅度。

Comments 30 pages, 1 figure, 24-page supplementary. Preprint v3. Companion paper: arXiv:2603.04904. Previous versions: Zenodo DOI 10.5281/zenodo.18646998

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10436 2026-03-12 cs.RO cs.DC 67%

COHORT: Hybrid RL for Collaborative Large DNN Inference on Multi-Robot Systems Under Real-Time Constraints

COHORT: 基于混合强化学习的多机器人系统实时协同大规模深度神经网络推理

Mohammad Saeid Anwar, Anuradha Ravi, Indrajeet Ghosh, Gaurav Shinde, Carl Busart, Nirmalya Roy

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 COHORT通过混合强化学习策略,优化多机器人系统在实时约束下的大规模DNN推理,降低能耗并提升GPU利用率。

Comments Recently accepted at 27th IEEE International Symposium on a World of Wireless, Mobile and Multimedia Networks ( IEEE WoWMoM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20325 2026-03-12 cs.CV 67%

AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models

AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型

Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zhesng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) Li Auto Inc. Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10876 2026-03-12 cs.CL cs.AI cs.DL cs.IR 62%

An Extreme Multi-label Text Classification (XMTC) Library Dataset: What if we took "Use of Practical AI in Digital Libraries" seriously?

极端多标签文本分类(XMTC)库数据集:如果我们认真对待‘在数字图书馆中使用实用人工智能’

Jennifer D'Souza, Sameer Sadruddin, Maximilian Kähler, Andrea Salfinger, Luca Zaccagna, Francesca Incitti, Lauro Snidaro, Osma Suominen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种基于权威术语的多标签文本分类方法,通过发布双语目录记录和可机器操作的GND分类法,提升数字图书馆中人工智能的实用性与透明性。

Comments 9 pages, 5 figures. Accepted to appear in the Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10940 2026-03-12 cs.SE cs.RO 57%

STADA: Specification-based Testing for Autonomous Driving Agents

STADA:基于规范的自动驾驶代理测试

Joy Saha, Trey Woodlief, Sebastian Elbaum, Matthew B. Dwyer

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 STADA是一种基于规范的自动驾驶代理测试生成框架,通过形式规范生成多样化的测试场景,提高测试覆盖率并减少模拟次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10435 2026-03-12 stat.ML cs.LG 57%

Adaptive Active Learning for Regression via Reinforcement Learning

通过强化学习进行回归的自适应主动学习

Simon D. Nguyen, Troy Russo, Kentaro Hoffman, Tyler H. McCormick

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于强化学习的WiGS方法,通过动态调整探索与调查的平衡,提升回归任务中的主动学习效率和准确性。

Comments 33 pages, 103 figures. Main paper (8 pages, 4 figures) plus appendix with proofs and supplemental experimental results. Submitted to UAI2026. Codebase available at https://github.com/thatswhatsimonsaid/WeightedGreedySampling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10239 2026-03-12 quant-ph cs.AI cs.IT eess.SP math.IT 57%

Learning from Radio using Variational Quantum RF Sensing

利用变分量子射频传感学习无线电信号

Ivana Nikoloska

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用变分量子射频传感技术,通过量子电路优化实现对无线电信号的学习,以提升环境感知能力。

Comments submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10178 2026-03-12 cs.CV cs.CL 57%

Video-Based Reward Modeling for Computer-Use Agents

基于视频的计算机使用代理奖励建模

Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of Washington(华盛顿大学) MBZUAI(机器智能研究院) Amazon AGI(亚马逊人工通用智能)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究提出基于视频的计算机使用代理奖励建模方法,通过ExeVR-53k数据集和对抗性指令翻译技术,实现高精度的任务成功预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10041 2026-03-12 cs.CR cs.LG 57%

Evaluating Generalization Mechanisms in Autonomous Cyber Attack Agents

评估自主网络攻击代理的泛化机制

Ondřej Lukáš, Jihoon Shin, Emilia Rivas, Diego Forni, Maria Rigaki, Carlos Catania, Aritran Piplai, Christopher Kiekintveld, Sebastian Garcia

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文评估了自主网络攻击代理在IP重新分配下的泛化能力,发现基于LLM的代理在测试中表现最佳,但牺牲了透明性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11011 2026-03-12 cs.HC 50%

Task-Aware Delegation Cues for LLM Agents

面向任务的代理委派提示

Xingrui Gu

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出面向任务的代理委派提示框架,通过任务分类学和协调风险提示提升人机协作的透明度和可协商性。

Comments Accepeted by CHI'26 Workshop on Developing Standards and Documentation For LLM Use as Simulated Research Participants

Journal ref CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏