arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-17 至 2026-03-17 共收录 10 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 10 篇

2603.15039 2026-03-17 cs.CV 75%

GUI-CEval: A Hierarchical and Comprehensive Chinese Benchmark for Mobile GUI Agents

GUI-CEval: 一种用于移动GUI代理的分层和全面的中文基准

Yang Li, Yuchen Liu, Haoyu Lu, Zhiqiang Xia, Hongzhen Wang, Kaiyang Han, Changpeng Yang, Jinyang Wu, Jiaming Xu, Runyu Shi, Ying Huang

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出GUI-CEval,首个针对中文移动GUI代理的全面基准,涵盖201款主流应用,通过分层结构评估感知、规划、反思、执行和评估五方面能力,验证模型在真实交互中的表现。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16686 2026-03-17 cs.RO cs.MA 75%

SERN: Bandwidth-Adaptive Cross-Reality Synchronization for Simulation-Enhanced Robot Navigation

SERN:带宽自适应的跨现实同步用于模拟增强的机器人导航

Jumman Hossain, Emon Dey, Snehalraj Chugh, Masud Ahmed, MS Anwar, Abu-Zaher Faridee, Jason Hoppes, Theron Trout, Anjon Basak, Rafidh Chowdhury, Rishabh Mistry, Hyun Kim, Jade Freeman, Niranjan Suri, Adrienne Raglin, Carl Busart, Anuradha Ravi, Nirmalya Roy

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 SERN通过高保真虚拟双胞胎与物理机器人紧密耦合,实现跨现实同步,提升多机器人在对抗环境中的导航性能,减少延迟并提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 73%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12908 2026-03-17 cs.RO 67%

GoalSwarm: Multi-UAV Semantic Coordination for Open-Vocabulary Object Navigation

GoalSwarm:多无人机语义协调用于开放词汇物体导航

MoniJesu Wonders James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出GoalSwarm框架,通过轻量语义地图构建、零样本目标检测和去中心化协调策略,实现多无人机在未知环境中的开放词汇物体导航。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18188 2026-03-17 cs.CV cs.AI 57%

\textsc{NaVIDA}: Vision-Language Navigation with Inverse Dynamics Augmentation

NaVIDA:基于逆动力学增强的视觉-语言导航

Weiye Zhu, Zekai Zhang, Xiangchen Wang, Hewei Pan, Teng Wang, Tiantian Geng, Rongtao Xu, Feng Zheng

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 NaVIDA通过引入逆动力学监督,增强视觉动态建模,提升导航稳定性与一致性,实验表明其在参数更少的情况下表现优于现有方法。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14724 2026-03-17 cs.AI 57%

GameUIAgent: An LLM-Powered Framework for Automated Game UI Design with Structured Intermediate Representation

GameUIAgent:一种基于大语言模型的自动化游戏UI设计框架,采用结构化中间表示

Wei Zeng, Fengwei An, Zhen Liu, Jian Zhao

专题命中 GUI与网页智能体 :agentic(abstract);分类 cs.AI

AI总结 本文提出GameUIAgent框架,通过结构化中间表示将自然语言描述转化为Figma设计,结合神经符号管道实现迭代自校正,发现质量天花板效应和渲染评估保真原则。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14707 2026-03-17 cs.CV cs.CL 57%

Visual Confused Deputy: Exploiting and Defending Perception Failures in Computer-Using Agents

视觉混淆代理:在计算机使用代理中利用和防御感知失败

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出了一种新的安全防护机制,通过双重通道对比分类来检测计算机使用代理中的视觉感知错误,以提高系统安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14363 2026-03-17 cs.CV cs.AI cs.RO 57%

AerialVLA: A Vision-Language-Action Model for UAV Navigation via Minimalist End-to-End Control

AerialVLA:一种用于无人机导航的视觉-语言-动作模型 via 最小化端到端控制

Peng Xu, Zhengnan Deng, Jiayan Deng, Zonghua Gu, Shaohua Wan

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AerialVLA,一种基于视觉-语言-动作的端到端控制模型,通过减少视觉冗余并整合连续3D运动指令与内在着陆信号,实现无人机自主导航。实验表明其在可见环境和未知场景中均表现优异。

Comments 18 pages, 4 figures. Code and demo videos will be available at: https://github.com/XuPeng23/AerialVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14276 2026-03-17 cs.CV cs.AI 57%

All-day Multi-scenes Lifelong Vision-and-Language Navigation with Tucker Adaptation

全天多场景终身视觉-语言导航与Tucker适应

Xudong Wang, Gan Li, Zhiyu Liu, Yao Wang, Lianqing Liu, Zhi Han

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出Tucker适应方法,解决视觉-语言导航在多场景下的持续学习问题,通过高阶张量分解实现知识解耦,提升长期部署灵活性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13833 2026-03-17 cs.RO 50%

ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics

ImagiNav:通过生成性视觉预测和逆动力学实现可扩展的具身导航

Jie Chen, Yuxin Cai, Yizhuo Wang, Ruofei Bai, Yuhong Cao, Jun Li, Yau Wei Yun, Guillaume Sartoretti

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出ImagiNav框架,通过解耦视觉规划与机器人动作,利用真实世界导航视频实现零样本迁移,无需机器人演示即可实现通用机器人自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏