arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-09 至 2026-04-09 共收录 118 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 9 篇

2501.16150 2026-04-09 cs.AI cs.HC cs.SY eess.SY 70%

A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions

用于计算机的代理全面综述:基础、挑战与未来方向

Pascal J. Sager, Benjamin Meyer, Peng Yan, Rebekka von Wartburg-Kottler, Layan Etaiwi, Aref Enayati, Gabriel Nobel, Ahmed Abdulkadir, Benjamin F. Grewe, Thilo Stadelmann

机构 * Zurich University of Applied Sciences(苏黎世应用科技大学) University of Zurich(苏黎世大学) ETH AI Center(苏黎世联邦理工学院人工智能中心) University of Fribourg(弗里堡大学) European Centre for Living Technology(欧洲生活技术中心)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文综述了用于计算机的代理(ACUs)的发展现状、趋势及研究空白,提出统一的分类体系,分析了六个主要研究缺口,并提出改进方向。

Journal ref Journal of Artificial Intelligence Research, vol. 85, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06204 2026-04-09 cs.CL cs.AI cs.HC 62%

SensorPersona: An LLM-Empowered System for Continual Persona Extraction from Longitudinal Mobile Sensor Streams

SensorPersona: 一种基于大语言模型的持续性人设提取系统,用于从长期移动传感器流中无感获取

Bufang Yang, Lilin Xu, Yixuan Li, Kaiwei Liu, Xiaofan Jiang, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SensorPersona系统,通过多模态长期传感器流持续提取稳定用户人设,提升LLM代理的个性化响应质量。系统通过上下文编码、分层人设推理和自适应更新,实现对物理行为、心理特质和生活经验的全面分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06240 2026-04-09 cs.CR cs.AI cs.MA 57%

The Art of Building Verifiers for Computer Use Agents

构建计算机使用代理验证器的艺术

Corby Rosset, Pratyusha Sharma, Andrew Zhao, Miguel Gonzalez-Fernandez, Ahmed Awadallah

机构 * Microsoft Research(微软研究院) Browserbase

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出通用验证器,通过四个原则减少噪声、分离奖励信号、区分可控不可控失败、并采用分治上下文管理,提升验证可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06182 2026-04-09 cs.HC cs.AI 57%

VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics

VenusBench-Mobile: 一个具有能力诊断的挑战性且以用户为中心的移动GUI代理基准测试

Yichen Gong, Zhuohan Cai, Sunhao Dai, Yuqi Zhou, Zhangxuan Gu, Changhua Meng, Shuheng Shen

机构 * Venus Team, Ant Group(蚂蚁集团金星团队)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出VenusBench-Mobile,通过用户意图驱动的任务设计和能力导向的标注方案,评估移动GUI代理在真实用户场景下的性能,揭示现有代理在感知和记忆方面的缺陷,为实际部署提供重要参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05529 2026-04-09 cs.AI cs.RO 57%

Before We Trust Them: Decision-Making Failures in Navigation of Foundation Models

在我们信任之前:基础模型导航决策中的失败

Jua Han, Jaeyoon Seo, Jungbin Min, Sieun Choi, Huichan Seo, Jihie Kim, Jean Oh

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 研究发现基础模型在导航任务中存在显著决策失败,需更细致评估以理解其局限性。

Comments Corrected author order in metadata; manuscript changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06693 2026-04-09 cs.CR cs.CY 50%

Aegon: Auditable AI Content Access with Ledger-Bound Tokens and Hardware-Attested Mobile Receipts

Aegon:基于账本绑定令牌和硬件认证移动收据的可审计AI内容访问

Amrish Baskaran, Nirbhay Pherwani, Raghul Krishnan

专题命中 GUI与网页智能体 :AI agent(abstract)

AI总结 Aegon通过扩展JWT令牌并维护证书透明度风格的Merkle树,实现可审计的AI内容许可,提供独立验证的交易记录,支持第三方审计和硬件认证的合规收据。

Comments 9 pages, 5 figures, 5 tables. Protocol design white paper. Submitted to arXiv for priority establishment; prototype implementation and evaluation are planned as future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18525 2026-04-09 cs.RO cs.CV 50%

Splatblox: Traversability-Aware Gaussian Splatting for Outdoor Robot Navigation

Splatblox:面向户外机器人导航的可通行性感知高斯点绘制

Samarth Chopra, Jing Liang, Gershom Seneviratne, Yonghan Lee, Jaehoon Choi, Jianyu An, Stephen Cheng, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 Splatblox通过融合RGB图像和LiDAR点云,构建了具有几何和语义信息的可通行性感知ESDF,实现户外复杂环境下的实时自主导航,实验表明其在可通行性判断和路径规划方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 6 篇

2604.06370 2026-04-09 cs.DC cs.LG 83%

ForkKV: Scaling Multi-LoRA Agent Serving via Copy-on-Write Disaggregated KV Cache

ForkKV: 通过写时复制的 disaggregated KV 缓存实现多LoRA代理服务的扩展

Shao Wang, Rui Ren, Lin Gui

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 记忆与上下文管理 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 ForkKV通过写时复制机制解耦KV缓存,解决多LoRA代理服务中的内存瓶颈问题,提升吞吐量3倍且不影响生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06300 2026-04-09 cs.CY 78%

The End of Human Judgment in the Kill Chain? Relocating Initiative and Interpretation with Agentic AI

人类判断在杀链中的终结?通过代理AI重新定位主动性和解释力

Jovana Davidovic

专题命中 记忆与上下文管理 :agentic(title,abstract)

AI总结 本文探讨了基于大语言模型的代理AI在杀链中取代人类判断的问题,指出其主动性和解释力导致人类控制失效,并提出国际治理框架需应对这一挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19576 2026-04-09 cs.RO cs.AI cs.LG cs.SY eess.SY 73%

LeLaR: The First In-Orbit Demonstration of an AI-Based Satellite Attitude Controller

LeLaR:首个基于AI的卫星姿态控制器在轨演示

Kirill Djebko, Tom Baumann, Erik Dilger, Frank Puppe, Sergio Montenegro

机构 * Center for Artificial Intelligence and Data Science, Julius-Maximilians-Universität Würzburg(朱利叶斯-马克西米利安-维尔茨堡大学人工智能与数据科学中心)

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个在轨演示的基于AI的卫星姿态控制器,通过仿真训练部署至InnoCube 3U卫星,验证了AI控制器在重复姿态 maneuver 中的鲁棒性,对比传统PD控制器表现优异。

Comments Accepted for publication in IEEE Access (DOI: 10.1109/ACCESS.2026.3678816). This is the author's version which has not been fully edited and content may change prior to final publication. 20 pages, 15 figures, 18 tables. The maneuver telemetry datasets are available in the GitHub repository under https://github.com/kdjebko/lelar-in-orbit-data

Journal ref IEEE Access, vol. 14, pp. 49348-49367, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07017 2026-04-09 cs.AI 57%

A-MBER: Affective Memory Benchmark for Emotion Recognition

A-MBER:情绪识别的情感记忆基准

Deliang Wen, Ke Sun, Yu Wang

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI

AI总结 A-MBER通过评估模型利用多会话交互历史解读用户当前情绪的能力,提出了一种新的情感记忆基准,支持判断、检索和解释任务,并测试模型在不同条件下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07016 2026-04-09 cs.LG 57%

Predictive Representations for Skill Transfer in Reinforcement Learning

强化学习中技能转移的预测表示

Ruben Vereecken, Luke Dickens, Alessandra Russo

机构 * Imperial College(帝国理工学院) UCL(伦敦大学学院)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出基于状态抽象的预测状态表示,用于提升强化学习中的技能转移能力,通过引入基于选项的抽象动作实现跨任务的知识迁移。

Comments esearch conducted: September 2018 to June 2021. This manuscript represents the work as of June 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06506 2026-04-09 cs.CR cs.SE 57%

Guiding Symbolic Execution with Static Analysis and LLMs for Vulnerability Discovery

通过静态分析和LLMs引导符号执行以发现漏洞

Md Shafiuzzaman, Achintya Desai, Wenbo Guo, Tevfik Bultan

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.SE

AI总结 SAILOR结合静态分析与LLM合成自动构建符号执行Harness,通过三个阶段发现内存安全漏洞,实验表明其在大规模代码库中显著提升漏洞检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 15 篇

2604.07007 2026-04-09 cs.MA cs.AI cs.CY 89%

AgentCity: Constitutional Governance for Autonomous Agent Economies via Separation of Power

AgentCity:通过权力分离实现自主代理经济的宪法治理

Anbang Ruan, Xing Zhang

机构 * NetX Foundation(NetX 基金会)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title);AI agent(abstract);planning(abstract)

AI总结 本文提出通过权力分离模型,在区块链上实现自主代理经济的宪法治理,通过智能合约、确定性软件和人类裁决三者分离,解决代理社会逻辑垄断问题,实现人类意图与集体行为的对齐。

Comments 111 pages, 11 figures, 19 tables, 67 references. Pre-registered experimental design

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03486 2026-04-09 cs.HC cs.AI cs.CV cs.LG cs.MA 86%

VisionClaw: Always-On AI Agents through Smart Glasses

VisionClaw:通过智能眼镜实现始终在线的AI代理

Xiaoan Liu, DaeHo Lee, Eric J Gonzalez, Mar Gonzalez-Franco, Ryo Suzuki

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Gwangju Institute of Science and Technology(光州科学技术院) Google(谷歌)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 VisionClaw通过智能眼镜实现始终在线的AI代理,结合实时第一视角感知与任务执行,支持语音驱动的任务启动与委托,提升任务完成效率和交互体验。

Comments 17 pages, 11 figures, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06696 2026-04-09 cs.AI 81%

AgentGate: A Lightweight Structured Routing Engine for the Internet of Agents

AgentGate: 一种轻量级的结构化路由引擎用于物联网代理

Yujun Cheng, Enfang Cui, Hao Qin, Zhiyuan Liang, Qi Xu

机构 * School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) China Telecom Research Institute(中国电信研究院) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出AgentGate,一种轻量级结构化路由引擎,用于在资源受限条件下高效且隐私友好的代理系统,通过分阶段决策和结构化接地提升路由效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02360 2026-04-09 cs.NI cs.AI cs.CY cs.ET cs.LG 81%

Fighting AI with AI: AI-Agent Augmented DNS Blocking of LLM Services during Student Evaluations

用AI对抗AI:AI代理增强的DNS阻断LLM服务以应对学生评估

Yonas Kassa, James Bonacci, Ping Wang

机构 * School of Data Intelligence and Technology, Robert Morris University(罗伯特莫里斯大学数据智能与技术学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AI-Sinkhole框架,利用AI代理和DNS阻断动态阻止考试期间出现的LLM聊天服务,通过量化LLM实现可解释分类,提升学术严谨性。

Comments accepted at ITNG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06209 2026-04-09 cs.CL 79%

TelcoAgent-Bench: A Multilingual Benchmark for Telecom AI Agents

TelcoAgent-Bench:电信AI代理的多语言基准测试

Lina Bariah, Brahim Mefgouda, Farbod Tavakkoli, Enrique Molero, Louis Powell, Merouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(哈利法大学数字未来研究所)

专题命中 Agent评测 :AI agent(title);agent(abstract);分类 cs.CL

AI总结 本文提出TelcoAgent-Bench和TelcoAgent-Metrics,用于评估多语言电信LLM代理,通过结构化指标评估意图识别、工具执行、解决正确性和稳定性,以量化LLM代理在电信环境中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06762 2026-04-09 cs.CR 78%

ARuleCon: Agentic Security Rule Conversion

ARuleCon:代理安全规则转换

Ming Xu, Hongtai Wang, Yanpei Guo, Zhengmin Yu, Weili Han, Hoon Wei Lim, Jin Song Dong, Jiaheng Zhang

专题命中 Agent评测 :agentic(title,abstract)

AI总结 ARuleCon通过自动化规则转换框架,解决跨平台安全规则复用难题,提升SIEM规则转换的准确性和效率,平均优于基线LLM模型15%。

Comments This paper has been accepted for publication at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06450 2026-04-09 quant-ph physics.bio-ph 78%

Agent Choice via Quantum Flux in Living Systems

生物系统中的量子流代理选择

R. E. Kastner

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一个将生物体的主动意图性选择置于物理基础的模型,通过量子态与代理选择的多对一关系,实现非预设但符合物理定律的选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15432 2026-04-09 cs.CV 78%

Gym-V: A Unified Vision Environment System for Agentic Vision Research

Gym-V: 一个统一的视觉环境系统用于代理视觉研究

Fanqing Meng, Lingxiao Du, Jiawei Gu, Jiaqi Liao, Linjie Li, Zijian Wu, Xiangyan Liu, Ziqi Zhao, Mengkang Hu, Zichen Liu, Jiaheng Zhang, Michael Qizhe Shieh

机构 * ModalMinds

专题命中 Agent评测 :agentic(title,abstract)

AI总结 Gym-V通过统一的179个程序生成视觉环境,解决了视觉代理研究中缺乏标准化基础设施的问题,发现观察支架比RL算法选择更关键,且跨领域迁移实验显示多样化训练能广泛泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07036 2026-04-09 cs.CL cs.LG cs.MA 62%

ReDAct: Uncertainty-Aware Deferral for LLM Agents

ReDAct:基于不确定性的延迟策略用于LLM代理

Dzianis Piatrashyn, Nikita Kotelevskii, Kirill Grishchenkov, Nikita Glazkov, Ivan Nasonov, Ilya Makarov, Timothy Baldwin, Preslav Nakov, Roman Vashurin, Maxim Panov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Ocapital National University of Science and Technology (NUST) MISIS(国立科技大学(NUST)MISIS) AXXX Ivannikov Institute for System Programming of the Russian Academy of Sciences(俄罗斯科学院伊万尼科夫系统编程研究所) Trusted AI Center, RAS(俄罗斯科学院可信人工智能中心)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ReDAct方法,通过在LLM代理中引入小规模和大规模模型,利用小模型的低成本和大模型的高可靠性,在不确定时延迟决策,从而在降低推理成本的同时保持决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22220 2026-04-09 cs.IR cs.AI cs.CL 62%

What Makes an Ideal Quote? Recommending "Unexpected yet Rational" Quotations via Novelty

什么使引用成为理想引用?通过新颖性的新型引用推荐

Bowei Zhang, Jin Xiao, Guanglei Yue, Qianyu He, Yanghua Xiao, Deqing Yang, Jiaqing Liang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence(上海市数据科学重点实验室,计算机科学与人工智能学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出通过新颖性推荐'意外却合理'的引用,通过多维深度意义标签和新颖性估计器提升引用推荐质量。

Comments Accepted to ACL 2026 main conference ; Code available at <https://github.com/Chang-pw/NoQuote>

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07240 2026-04-09 cs.MS cs.AI cs.LG 62%

$k$-server-bench: Automating Potential Discovery for the $k$-Server Conjecture

$k$-server-bench: 自动化潜在函数发现用于 $k$-server 猜想

Kirill Brilliantov, Etienne Bamas, Emmanuel Abbé

机构 * MDS Lab, EPFL(EPFL MDS实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于 $k$-server 猜想的代码挑战,旨在发现满足大规模图结构简单线性不等式的潜在函数,通过实验展示当前方法在 $k=3$ 和 $k=4$ 情况下的表现,为理论研究和代码发现代理提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06227 2026-04-09 cs.LG econ.EM 57%

A Benchmark of Classical and Deep Learning Models for Agricultural Commodity Price Forecasting on A Novel Bangladeshi Market Price Dataset

一种农业商品价格预测的经典与深度学习模型基准测试:基于一个新颖的孟加拉国市场价格数据集

Tashreef Muhammad, Tahsin Ahmed, Meherun Farzana, Md. Mahmudul Hasan, Abrar Eyasir, Md. Emon Khan, Mahafuzul Islam Shawon, Ferdous Mondol, Mahmudul Hasan, Muhammad Ibrahim

机构 * Southeast University, Dhaka, Bangladesh(东南大学(达卡)) University of Dhaka, Bangladesh(达卡大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文基于新颖的孟加拉国市场价格数据集,评估了七种预测方法,包括经典模型和深度学习架构,揭示了农业商品价格预测的异质性及不同模型的性能差异。

Comments 26 pages, 22 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05172 2026-04-09 cs.AI 57%

ClawsBench: Evaluating Capability and Safety of LLM Productivity Agents in Simulated Workspaces

ClawsBench: 评估LLM生产力代理在模拟工作区中的能力和安全性

Xiangyi Li, Kyoung Whan Choe, Yimin Liu, Xiaokun Chen, Chujun Tao, Bingran You, Wenbo Chen, Zonglin Di, Jiankai Sun, Shenghan Zheng, Jiajun Bao, Yuanli Wang, Weixiang Yan, Yiyuan Li, Han-chung Lee

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 ClawsBench通过高保真模拟服务和结构化任务评估LLM代理在真实生产力场景中的能力与安全性,揭示了代理在多服务协作和安全关键场景中的表现及潜在风险。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07176 2026-04-09 cs.NI cs.CL 57%

Graph Representation-based Model Poisoning on the Heterogeneous Internet of Agents

基于图表示的模型中毒攻击:异构物联网中的攻击

Hanlin Cai, Houtianfu Wang, Haofan Dong, Kai Li, Sai Zou, Ozgur B. Akan

机构 * Internet of Everything (IoE) Group, Department of Engineering, University of Cambridge(剑桥大学工程系万物互联组) CISTER Research Centre(CISTER研究中心) Guizhou University(贵州大学) Center for neXt-Generation Communications (CXC), Koç University(科奇大学下一代通信中心)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出一种基于图表示的模型中毒攻击,利用监听到的良性更新构建特征相关图,并利用变分图自编码器生成恶意更新,以降低不同LLM模型的准确性,逃避现有防御机制。

Comments This paper has been accepted by the IEEE 22nd International Wireless Communications & Mobile Computing Conference (IWCMC 2026, Shanghai, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07164 2026-04-09 math.OC 50%

Model-Free Aggregative Cooperative Optimization via Randomized Gradient-Free Minimization and Exploration Momentum

基于随机梯度自由最小化和探索动量的无模型聚合协作优化

Amir Mehrnoosh, Giuseppe Speciale, Riccardo Brumali, Giuseppe Notarstefano, Gianluca Bianchin

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出ARGFree算法,通过随机梯度近似和跟踪变量解决无梯度信息的聚合协作优化问题,并改进为ARGFree-EM以提升高维场景下的性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏