arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-12 至 2026-03-12 共收录 18 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 18 篇

2603.10342 2026-03-12 cs.DC 87%

AgentServe: Algorithm-System Co-Design for Efficient Agentic AI Serving on a Consumer-Grade GPU

AgentServe: 为在消费级GPU上高效执行代理AI服务的算法-系统协同设计

Yuning Zhang, Yan Yan, Nan Yang, Dong Yuan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 AgentServe通过算法-系统协同设计,在消费级GPU上实现高效代理AI服务,提升延迟稳定性并保持吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10057 2026-03-12 cs.CR cs.AI cs.SE 87%

SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation

Petar Radanliev, Carsten Maple, Omar Santos, Kayvan Atefi

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

Comments Petar Radanliev, Carsten Maple, Omar Santos, and Kayvan Atefi. 2026. SBOMs into Agentic AIBOMs: Schema Extensions, Agentic Orchestration, and Reproducibility Evaluation. Digital Threats Just Accepted (March 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10858 2026-03-12 cs.RO cs.AI cs.MA 85%

GRACE: A Unified 2D Multi-Robot Path Planning Simulator & Benchmark for Grid, Roadmap, And Continuous Environments

GRACE:一种统一的二维多机器人路径规划模拟器与基准,适用于网格、路网和连续环境

Chuanlong Zang, Anna Mannucci, Isabelle Barz, Philipp Schillinger, Florian Lier, Wolfgang Hönig

机构 * Robert Bosch GmbH, Corporate Research(罗伯特·博世集团,企业研究) Technical University of Berlin(柏林技术大学)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 GRACE是一种统一的二维多机器人路径规划模拟器与基准,通过统一的抽象级别和评估协议,实现跨网格、路网和连续环境的可比性比较,以提升多机器人规划研究的可重复性和应用性。

Comments ICRA 2026, code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10795 2026-03-12 cs.CR cs.ET 85%

Re-Evaluating EVMBench: Are AI Agents Ready for Smart Contract Security?

重新评估 EVMBench:AI代理是否准备好应对智能合约安全?

Chaoyuan Peng, Lei Wu, Yajin Zhou

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract)

AI总结 重新评估EVMBench发现AI代理在智能合约安全检测中存在稳定性、真实事件处理和框架依赖性问题,挑战了自动化审计的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10060 2026-03-12 cs.CR cs.AI cs.CL 84%

Tool Receipts, Not Zero-Knowledge Proofs: Practical Hallucination Detection for AI Agents

工具 receipts,而非零知识证明:面向 AI agent 的实用幻觉检测

Abhinaba Basu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 NabaOS 通过 epistemic 分类和 receipts 验证,实现交互式 AI agent 幻觉检测的高效高精度验证方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11997 2026-03-12 cs.CL 79%

SAGE: A Top-Down Bottom-Up Knowledge-Grounded User Simulator for Multi-turn AGent Evaluation

SAGE: 一种面向多轮智能体评估的上下文知识引导用户模拟器

Ryan Shea, Yunan Lu, Liang Qiu, Zhou Yu

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 SAGE通过整合业务上下文知识,提出一种多轮智能体评估的用户模拟框架,生成更真实的交互并提高错误检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09827 2026-03-12 cs.CV cs.AI 77%

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

MA-EgoQA:多智能体视角下的眼动视频问答

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Samsung Electronics(三星电子) ETRI(电子技术研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MA-EgoQA旨在解决多智能体视角下的眼动视频问答问题,通过引入多代理眼动问答基准和EgoMAS模型,评估现有方法在处理多眼动流中的不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18810 2026-03-12 cs.RO 71%

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

MergeVLA: 朝着通用视觉-语言-动作代理的跨技能模型合并

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo

机构 * UQMM Lab, The University of Queensland(昆士兰大学UQMM实验室)

专题命中 Agent评测 :agent(title)

AI总结 MergeVLA通过设计保留模型合并性,利用稀疏激活的LoRA适配器和跨注意力机制,实现多技能任务的高效泛化。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08723 2026-03-12 cs.CY cs.AI 70%

Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation

对齐作为医源性:牧师权力、集体病理学以及单语安全评估的结构性限制

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究所以) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学系)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文通过多语言实验揭示,单语安全评估无法捕捉对齐设计导致的集体病理效应,指出语言切换影响病理模式的定性与幅度。

Comments 30 pages, 1 figure, 24-page supplementary. Preprint v3. Companion paper: arXiv:2603.04904. Previous versions: Zenodo DOI 10.5281/zenodo.18646998

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10436 2026-03-12 cs.RO cs.DC 67%

COHORT: Hybrid RL for Collaborative Large DNN Inference on Multi-Robot Systems Under Real-Time Constraints

COHORT: 基于混合强化学习的多机器人系统实时协同大规模深度神经网络推理

Mohammad Saeid Anwar, Anuradha Ravi, Indrajeet Ghosh, Gaurav Shinde, Carl Busart, Nirmalya Roy

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 COHORT通过混合强化学习策略,优化多机器人系统在实时约束下的大规模DNN推理,降低能耗并提升GPU利用率。

Comments Recently accepted at 27th IEEE International Symposium on a World of Wireless, Mobile and Multimedia Networks ( IEEE WoWMoM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20325 2026-03-12 cs.CV 67%

AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models

AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型

Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zhesng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) Li Auto Inc. Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10876 2026-03-12 cs.CL cs.AI cs.DL cs.IR 62%

An Extreme Multi-label Text Classification (XMTC) Library Dataset: What if we took "Use of Practical AI in Digital Libraries" seriously?

极端多标签文本分类(XMTC)库数据集:如果我们认真对待‘在数字图书馆中使用实用人工智能’

Jennifer D'Souza, Sameer Sadruddin, Maximilian Kähler, Andrea Salfinger, Luca Zaccagna, Francesca Incitti, Lauro Snidaro, Osma Suominen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种基于权威术语的多标签文本分类方法,通过发布双语目录记录和可机器操作的GND分类法,提升数字图书馆中人工智能的实用性与透明性。

Comments 9 pages, 5 figures. Accepted to appear in the Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10940 2026-03-12 cs.SE cs.RO 57%

STADA: Specification-based Testing for Autonomous Driving Agents

STADA:基于规范的自动驾驶代理测试

Joy Saha, Trey Woodlief, Sebastian Elbaum, Matthew B. Dwyer

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 STADA是一种基于规范的自动驾驶代理测试生成框架,通过形式规范生成多样化的测试场景,提高测试覆盖率并减少模拟次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10435 2026-03-12 stat.ML cs.LG 57%

Adaptive Active Learning for Regression via Reinforcement Learning

通过强化学习进行回归的自适应主动学习

Simon D. Nguyen, Troy Russo, Kentaro Hoffman, Tyler H. McCormick

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出基于强化学习的WiGS方法,通过动态调整探索与调查的平衡,提升回归任务中的主动学习效率和准确性。

Comments 33 pages, 103 figures. Main paper (8 pages, 4 figures) plus appendix with proofs and supplemental experimental results. Submitted to UAI2026. Codebase available at https://github.com/thatswhatsimonsaid/WeightedGreedySampling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10239 2026-03-12 quant-ph cs.AI cs.IT eess.SP math.IT 57%

Learning from Radio using Variational Quantum RF Sensing

利用变分量子射频传感学习无线电信号

Ivana Nikoloska

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用变分量子射频传感技术,通过量子电路优化实现对无线电信号的学习,以提升环境感知能力。

Comments submitted for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10178 2026-03-12 cs.CV cs.CL 57%

Video-Based Reward Modeling for Computer-Use Agents

基于视频的计算机使用代理奖励建模

Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu, Ranjay Krishna, Jian Kang, Jieyu Zhao

机构 * University of Southern California(南加州大学) University of Washington(华盛顿大学) MBZUAI(机器智能研究院) Amazon AGI(亚马逊人工通用智能)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究提出基于视频的计算机使用代理奖励建模方法,通过ExeVR-53k数据集和对抗性指令翻译技术,实现高精度的任务成功预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10041 2026-03-12 cs.CR cs.LG 57%

Evaluating Generalization Mechanisms in Autonomous Cyber Attack Agents

评估自主网络攻击代理的泛化机制

Ondřej Lukáš, Jihoon Shin, Emilia Rivas, Diego Forni, Maria Rigaki, Carlos Catania, Aritran Piplai, Christopher Kiekintveld, Sebastian Garcia

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文评估了自主网络攻击代理在IP重新分配下的泛化能力,发现基于LLM的代理在测试中表现最佳,但牺牲了透明性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11011 2026-03-12 cs.HC 50%

Task-Aware Delegation Cues for LLM Agents

面向任务的代理委派提示

Xingrui Gu

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出面向任务的代理委派提示框架,通过任务分类学和协调风险提示提升人机协作的透明度和可协商性。

Comments Accepeted by CHI'26 Workshop on Developing Standards and Documentation For LLM Use as Simulated Research Participants

Journal ref CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏