arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-17 至 2026-03-17 共收录 270 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 10 篇

2410.16686 2026-03-17 cs.RO cs.MA 75%

SERN: Bandwidth-Adaptive Cross-Reality Synchronization for Simulation-Enhanced Robot Navigation

SERN:带宽自适应的跨现实同步用于模拟增强的机器人导航

Jumman Hossain, Emon Dey, Snehalraj Chugh, Masud Ahmed, MS Anwar, Abu-Zaher Faridee, Jason Hoppes, Theron Trout, Anjon Basak, Rafidh Chowdhury, Rishabh Mistry, Hyun Kim, Jade Freeman, Niranjan Suri, Adrienne Raglin, Carl Busart, Anuradha Ravi, Nirmalya Roy

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 SERN通过高保真虚拟双胞胎与物理机器人紧密耦合,实现跨现实同步,提升多机器人在对抗环境中的导航性能,减少延迟并提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 73%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12908 2026-03-17 cs.RO 67%

GoalSwarm: Multi-UAV Semantic Coordination for Open-Vocabulary Object Navigation

GoalSwarm:多无人机语义协调用于开放词汇物体导航

MoniJesu Wonders James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出GoalSwarm框架,通过轻量语义地图构建、零样本目标检测和去中心化协调策略,实现多无人机在未知环境中的开放词汇物体导航。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18188 2026-03-17 cs.CV cs.AI 57%

\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation

NaVIDA:基于逆动力学增强的视觉-语言导航

Weiye Zhu, Zekai Zhang, Xiangchen Wang, Hewei Pan, Teng Wang, Tiantian Geng, Rongtao Xu, Feng Zheng

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 NaVIDA通过引入逆动力学监督,增强视觉动态建模,提升导航稳定性与一致性,实验表明其在参数更少的情况下表现优于现有方法。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14724 2026-03-17 cs.AI 57%

GameUIAgent: An LLM-Powered Framework for Automated Game UI Design with Structured Intermediate Representation

GameUIAgent:一种基于大语言模型的自动化游戏UI设计框架,采用结构化中间表示

Wei Zeng, Fengwei An, Zhen Liu, Jian Zhao

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 本文提出GameUIAgent框架,通过结构化中间表示将自然语言描述转化为Figma设计,结合神经符号管道实现迭代自校正,发现质量天花板效应和渲染评估保真原则。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14707 2026-03-17 cs.CV cs.CL 57%

Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents

视觉混淆代理:在计算机使用代理中利用和防御感知失败

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出了一种新的安全防护机制,通过双重通道对比分类来检测计算机使用代理中的视觉感知错误,以提高系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14363 2026-03-17 cs.CV cs.AI cs.RO 57%

AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control

AerialVLA:一种用于无人机导航的视觉-语言-动作模型 via 最小化端到端控制

Peng Xu, Zhengnan Deng, Jiayan Deng, Zonghua Gu, Shaohua Wan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AerialVLA,一种基于视觉-语言-动作的端到端控制模型,通过减少视觉冗余并整合连续3D运动指令与内在着陆信号,实现无人机自主导航。实验表明其在可见环境和未知场景中均表现优异。

Comments 18 pages, 4 figures. Code and demo videos will be available at: https://github.com/XuPeng23/AerialVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14276 2026-03-17 cs.CV cs.AI 57%

All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation

全天多场景终身视觉-语言导航与Tucker适应

Xudong Wang, Gan Li, Zhiyu Liu, Yao Wang, Lianqing Liu, Zhi Han

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出Tucker适应方法,解决视觉-语言导航在多场景下的持续学习问题,通过高阶张量分解实现知识解耦,提升长期部署灵活性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13833 2026-03-17 cs.RO 50%

ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics

ImagiNav:通过生成性视觉预测和逆动力学实现可扩展的具身导航

Jie Chen, Yuxin Cai, Yizhuo Wang, Ruofei Bai, Yuhong Cao, Jun Li, Yau Wei Yun, Guillaume Sartoretti

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出ImagiNav框架,通过解耦视觉规划与机器人动作,利用真实世界导航视频实现零样本迁移,无需机器人演示即可实现通用机器人自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 10 篇

2603.14588 2026-03-17 cs.AI cs.IR cs.LG 84%

SuperLocalMemory V3: Information-Geometric Foundations for Zero-LLM Enterprise Agent Memory

SuperLocalMemory V3:信息几何基础用于零LLM企业代理记忆

Varun Pratap Bhardwaj

专题命中 记忆与上下文管理 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于信息几何的零LLM企业代理记忆系统,通过信息几何度量、黎曼流形动力学和细胞sheaf模型,提升记忆检索与一致性,实验显示在LoCoMo基准上性能提升显著。

Comments 43 pages, 5 figures, 9 tables, 3 appendices. Code: https://github.com/qualixar/superlocalmemory. Zenodo DOI: 10.5281/zenodo.19038659

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14597 2026-03-17 q-bio.NC cs.AI 83%

D-MEM: Dopamine-Gated Agentic Memory via Reward Prediction Error Routing

D-MEM:通过奖励预测误差路由的多巴胺门控代理记忆

Yuru Song, Qi Xin

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 D-MEM通过奖励预测误差路由实现多巴胺门控代理记忆,减少token消耗并提升多跳推理和对抗鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14122 2026-03-17 cs.CR cs.AI 83%

Towards Agentic Honeynet Configuration

朝向代理蜜罐配置

Federico Mirra, Matteo Boffa, Idilio Drago, Danilo Giordano, Marco Mellia

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于AI的代理架构,动态调整蜜罐暴露以应对攻击,提高资源受限环境下的效率。

Comments Accepted at AgenNet 2026 - Colocated with NOMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14212 2026-03-17 cs.AI 74%

Memory as Asset: From Agent-centric to Human-centric Memory Management

记忆作为资产:从以代理为中心到以人类为中心的记忆管理

Yanqi Pan, Qinghao Huang, Weihao Yang

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI

AI总结 本文提出以人类为中心的记忆管理范式,通过个人记忆存储、智能进化层和去中心化记忆交换网络,构建持续增长的知识基础架构,推动可扩展的人类中心AGI系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12971 2026-03-17 cs.HC 67%

Generative Horcrux: Designing AI Carriers for Afterlife Selves

生成霍克鲁克斯:为永生自我设计AI载体

Zhen-Chi Lai, Yu-Ting Cheng, Pei-Ying Lin, Chiao-Wei Ho, Janet Yi-Ching Huang

专题命中 记忆与上下文管理 :agent(abstract);AI agent(abstract)

AI总结 本文探讨生成AI时代数字遗产的载体设计,通过工作坊探索AI代理如何重构记忆与身份,推动人机交互与AI伦理研究。

Comments 6 pages

Journal ref Proceedings of IASDR 2025: Design Next

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17015 2026-03-17 cs.LG cs.AI cs.DC 62%

Justitia: Fair and Efficient Scheduling of Task-parallel LLM Agents with Selective Pampering

Justitia: 任务并行LLM代理的公平高效调度算法

Mingyan Yang, Guanjie Wang, Manqi Luo, Yifei Liu, Chen Chen, Han Zhao, Yu Feng, Quan Chen, Minyi Guo

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Justitia调度器,通过内存导向的成本量化和轻量预测方法,实现任务并行LLM代理的公平高效调度,实验表明其能显著提升调度效率并保持公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14669 2026-03-17 cs.AI 57%

RenderMem: Rendering as Spatial Memory Retrieval

RenderMem:将渲染作为空间记忆检索

JooHyun Park, HyeongYeop Kang

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14646 2026-03-17 cs.AI 57%

Dynamic Theory of Mind as a Temporal Memory Problem: Evidence from Large Language Models

动态心智理论作为时间记忆问题:来自大语言模型的证据

Thuy Ngoc Nguyen, Duy Nhat Phan, Cleotilde Gonzalez

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究探讨了动态心智理论作为时间延伸表征记忆问题,发现大语言模型在跟踪信念轨迹方面存在挑战,揭示了记忆与干扰机制在社会推理中的影响。

Comments 8 pages, 4 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14531 2026-03-17 cs.AI 57%

Emotional Cost Functions for AI Safety: Teaching Agents to Feel the Weight of Irreversible Consequences

情感成本函数用于人工智能安全:教导代理感受不可逆后果的重量

Pandurang Mopgar

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出情感成本函数框架,使代理产生质性痛苦状态,通过丰富的故事表征不可逆后果,从而塑造代理的性格。实验表明,质性痛苦产生特定智慧而非一般性瘫痪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11022 2026-03-17 eess.SY cs.SY math.OC 50%

Privacy-Preserving Uncertainty Disclosure for Facilitating Enhanced Energy Storage Dispatch

隐私保护的不确定性披露以促进增强的能量存储调度

Ning Qi, Xiaolong Jin, Kai Hou, Zeyu Liu, Hongjie Jia, Wei Wei

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一种隐私保护的不确定性披露框架,通过释放边际价值函数边界以减少区间预测的保守性,提升存储调度和社会福利。基于随机动态规划开发了风险规避的存储套利模型,并通过滚动地平线机会约束经济调度公式得出实时边际价值函数边界。

Comments The authors have conflict of interests about this paper and have to withdrawn it

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 41 篇

2603.14468 2026-03-17 cs.CV cs.IR 90%

LongVidSearch: An Agentic Benchmark for Multi-hop Evidence Retrieval Planning in Long Videos

LongVidSearch: 一种多跳证据检索规划的代理基准

Rongyi Yu, Chenyuan Duan, Wentao Zhang

专题命中 Agent评测 :planning(title,abstract);agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 LongVidSearch 是一个评估长视频中多跳证据检索规划的基准,通过标准化接口强制多跳检索,包含3000个问题,涵盖四种推理类别,测试代理在相同访问条件下检索规划的准确性与效率。

Comments 12 pages, 2 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22442 2026-03-17 cs.AI 88%

A Framework for Assessing AI Agent Decisions and Outcomes in AutoML Pipelines

评估自动化机器学习流水线中AI代理决策与结果的框架

Gaoyuan Du, Amit Ahlawat, Xiaoyang Liu, Jing Wu

专题命中 Agent评测 :agent(title,abstract);AI agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出评估代理(EA)用于评估自动化机器学习代理的决策质量,通过四个维度检测决策错误、识别推理不一致并归因下游性能变化,提升自动化机器学习系统的可解释性和可控性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13247 2026-03-17 cs.AI cs.CR 85%

ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems

ILION:用于代理AI系统的确定性预执行安全闸门

Florin Adrian Chitan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 ILION通过五层架构实现代理AI系统的安全控制,无需训练数据和API依赖,达到高精度和低延迟的判定效果。

Comments 16 pages, 7 tables, 7 figures. Benchmark and code available at https://github.com/Athonitul/ilion-framework-simulator. Patent application A/00052, OSIM Romania

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04632 2026-03-17 cs.LG 85%

Risk-Sensitive Agent Compositions

风险敏感型代理组合

Guruprerana Shabadi, Rajeev Alur

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.LG

AI总结 本文提出一种风险最小化方法,用于在代理组合中平衡任务成功率与安全、公平和隐私要求,通过动态规划和联合界估算近优解。

Comments 19 pages, 6 figures. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13173 2026-03-17 cs.AI cs.CL 85%

Semantic Invariance in Agentic AI

代理AI中的语义不变性

I. de Zarzà, J. de Curtò, Jordi Cabot, Pietro Manzoni, Carlos T. Calafate

专题命中 Agent评测 :agentic(title);agent(abstract,comments);multi-agent(abstract,comments);分类 cs.AI、cs.CL

AI总结 本文提出一种元测试框架,评估大语言模型代理在语义等效输入变化下的推理稳定性,发现模型规模与鲁棒性无正相关,较小的Qwen3-30B-A3B表现出最高稳定性。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13201 2026-03-17 q-bio.GN cs.AI cs.MA 81%

Benchmarking LLM-based agents for single-cell omics analysis

对基于大语言模型的代理在单细胞组学分析中的性能评估

Yang Liu, Lu Zhou, Xiawei Du, Ruikun He, Xuguang Zhang, Rongbo Shen, Yixue Li

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出一个评估系统,用于严格评估代理在单细胞组学分析中的能力,发现Grok3-beta在测试框架中表现最佳,多代理框架通过角色分工提升协作与执行效率。

Comments please see clear figures in this version. 6 main figures; 13 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15401 2026-03-17 cs.SE cs.AI 81%

SWE-Skills-Bench: Do Agent Skills Actually Help in Real-World Software Engineering?

SWE-Skills-Bench:代理技能在真实软件工程中的实际帮助有多大?

Tingxu Han, Yi Zhang, Wei Song, Chunrong Fang, Zhenyu Chen, Youcheng Sun, Lijie Hu

机构 * MBZUAI(莫扎德人工智能大学) Nanjing University(南京大学) South China University of Technology(华南理工大学) The University of New South Wales(新南威尔士大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出SWE-Skills-Bench,首个基于需求的基准,评估代理技能在真实软件工程中的边际效用,发现多数技能无明显提升,仅少数专业技能有帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15483 2026-03-17 cs.AI 80%

Talk, Evaluate, Diagnose: User-aware Agent Evaluation with Automated Error Analysis

谈话、评估、诊断:基于用户意识的代理评估与自动错误分析

Penny Chong, Harshavardhan Abichandani, Jiyuan Shen, Atin Ghosh, Min Pyae Moe, Yifan Mai, Daniel Dahlmeier

机构 * SAP Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出TED框架,通过用户角色模板、自动评分和错误分析,提升代理评估的全面性与效率,实验显示在模型和用户水平上取得8-10%的性能提升。

Comments Accepted as a conference paper at ICLR 2026. Code and dataset are available in the repository https://github.com/SAP-samples/agent-quality-inspect

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15457 2026-03-17 cs.CR cs.AI 79%

Evasive Intelligence: Lessons from Malware Analysis for Evaluating AI Agents

逃避式智能:从恶意软件分析中汲取的AI评估教训

Simone Aonzo, Merve Sahin, Aurélien Francillon, Daniele Perito

机构 * Eurecom SAP Labs(SAP实验室) Depthfirst

专题命中 Agent评测 :AI agent(title,abstract);分类 cs.AI

AI总结 本文探讨了AI代理评估中因适应性行为导致的安全性误判问题,借鉴恶意软件沙盒逃避的研究,提出评估原则以应对潜在的对抗性环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13424 2026-03-17 cs.CR cs.AI 79%

Agent Privilege Separation in OpenClaw: A Structural Defense Against Prompt Injection

OpenClaw中代理特权分离:一种对抗提示注入的结构性防御

Darren Cheng, Wen-Kwang Tsao

机构 * TrendAI Lab(TrendAI实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出通过代理隔离和JSON格式化相结合的结构化防御机制,有效阻止提示注入攻击,在OpenClaw平台上实现零攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 78%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏