arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2955 篇

2401.16158 2024-04-19 cs.CL cs.CV 79%

Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception

Junyang Wang, Haiyang Xu, Jiabo Ye, Ming Yan, Weizhou Shen, Ji Zhang, Fei Huang, Jitao Sang

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL

Comments Accepted by ICLR 2024 Workshop in Large Language Model (LLM) Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12463 2024-03-20 cs.RO cs.AI 79%

Reinforcement learning based local path planning for mobile robot

Mehmet Gok, Mehmet Tekerek, Hamza Aydemir

专题命中 GUI与网页智能体 :planning(title,abstract);分类 cs.AI

Comments 5 Pages, 10 figures, Presented in; Interdisciplinary Conference on Mechanics, Computers and Electrics ANKARA/TURKEY 27-28 November 2021

Journal ref Interdisciplinary Conference on Mechanics, Computers and Electrics, 27-28 Nov. 2021, Ankara

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05770 2024-03-12 cs.CV cs.AI cs.RO 79%

Towards Deviation-Robust Agent Navigation via Perturbation-Aware Contrastive Learning

Bingqian Lin, Yanxin Long, Yi Zhu, Fengda Zhu, Xiaodan Liang, Qixiang Ye, Liang Lin

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

Comments Accepted by TPAMI 2023

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI,2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08172 2024-02-22 cs.CL 79%

LASER: LLM Agent with State-Space Exploration for Web Navigation

Kaixin Ma, Hongming Zhang, Hongwei Wang, Xiaoman Pan, Wenhao Yu, Dong Yu

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02559 2024-02-06 cs.CL 79%

NavHint: Vision and Language Navigation Agent with a Hint Generator

Yue Zhang, Quan Guo, Parisa Kordjamshidi

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05392 2023-12-12 cs.AI 79%

The logic of NTQR evaluations of noisy AI agents: Complete postulates and logically consistent error correlations

Andrés Corrada-Emmanuel

专题命中 GUI与网页智能体 :AI agent(title,abstract);分类 cs.AI

Comments 18 pages, 9 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06070 2023-12-12 cs.CL 79%

Mind2Web: Towards a Generalist Agent for the Web

Xiang Deng, Yu Gu, Boyuan Zheng, Shijie Chen, Samuel Stevens, Boshi Wang, Huan Sun, Yu Su

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL

Comments Website: https://osu-nlp-group.github.io/Mind2Web. Updated with supplementary material. NeurIPS'23 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.09230 2023-02-21 cs.CL 79%

VLN-Trans: Translator for the Vision and Language Navigation Agent

Yue Zhang, Parisa Kordjamshidi

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.13265 2021-03-01 cs.RO cs.LG 79%

Robot Navigation in a Crowd by Integrating Deep Reinforcement Learning and Online Planning

Zhiqian Zhou, Pengming Zhu, Zhiwen Zeng, Junhao Xiao, Huimin Lu, Zongtan Zhou

专题命中 GUI与网页智能体 :planning(title,abstract);分类 cs.LG

Comments 8 pages, 7 figures, and two tables. The paper is in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.12517 2019-04-01 cs.AI 79%

Towards Brain-inspired System: Deep Recurrent Reinforcement Learning for Simulated Self-driving Agent

Jieneng Chen, Jingye Chen, Ruiming Zhang, Xiaobin Hu

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.08565 2018-05-23 cs.LG stat.ML 79%

Global Navigation Using Predictable and Slow Feature Analysis in Multiroom Environments, Path Planning and Other Control Tasks

Stefan Richthofer, Laurenz Wiskott

专题命中 GUI与网页智能体 :planning(title);agent(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12460 2026-05-13 cs.LG cs.CL 79%

Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs

多流语言模型:通过并行思维、输入和输出流解除语言模型瓶颈

Guinan Su, Yanwu Yang, Xueyan Li, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院) University Hospital Tübingen(图宾根大学医院) University of Tübingen(图宾根大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过并行计算流替代顺序消息格式,提升语言模型的效率、安全性和可监控性,解决单流计算的局限性。

Comments Preprint, 37 pages. Code at https://github.com/seal-rg/streaming/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13318 2026-04-16 cs.AI cs.CL 79%

WebXSkill: Skill Learning for Autonomous Web Agents

WebXSkill:自主网页代理的技能学习

Zhaoyang Wang, Qianhui Wu, Xuchao Zhang, Chaoyun Zhang, Wenlin Yao, Fazle Elahi Faisal, Baolin Peng, Si Qin, Suman Nath, Qingwei Lin, Chetan Bansal, Dongmei Zhang, Saravan Rajmohan, Jianfeng Gao, Huaxiu Yao

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Microsoft(微软)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 WebXSkill通过可执行技能框架解决自主网页代理在长周期任务中的执行与适应问题,提升任务成功率。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26539 2025-10-01 cs.CV cs.CL cs.LG 79%

Ferret-UI Lite: Lessons from Building Small On-Device GUI Agents

Zhen Yang, Zi-Yi Dou, Di Feng, Forrest Huang, Anh Nguyen, Keen You, Omar Attia, Yuhao Yang, Michael Feng, Haotian Zhang, Ram Ramrakhya, Chao Jia, Jeffrey Nichols, Alexander Toshev, Yinfei Yang, Zhe Gan

机构 * Apple(苹果公司)

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract);tool-use(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16704 2025-07-23 cs.LG cs.AI cs.CV cs.HC 79%

Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation

Viktor Muryn, Marta Sumyk, Mariya Hirna, Sofiya Garkot, Maksym Shamrai

机构 * Ukrainian Catholic University(乌克兰天主教大学)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09073 2026-08-11 cs.RO 新提交 78%

Latent World Models with Monotone Planning Costs for Image-Goal Navigation

带有单调规划代价的潜在世界模型用于图像目标导航

Amirhosein Chahe, Siwei Cai, Lifeng Zhou

机构 * Drexel University(卓克索大学)

专题命中 GUI与网页智能体 :planning(title,abstract)

AI总结 本文提出基于冻结DINO编码器的潜在世界模型,通过自回归回退损失与单调代价排序损失优化,在GNM数据集上实现图像目标导航最优性能,方向误差较基线降低2.7倍,还可零样本部署于物理机器人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26041 2026-08-11 cs.CV 版本更新 78%

Where and How to Prune: An Empirical Study of Visual Token Pruning for GUI Agent Navigation

重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角

Daiqiang Li, Zihao Pan, Zeyu Zhang, Xuyang Liu, Shijia Xu, Ronghao Chen, Huacan Wang, Honggang Chen, Linfeng Zhang, Zhangquan Chen, Haiyun Jiang

机构 * Sichuan University(四川大学) Sun Yat-sen University(中山大学) Australian National University(澳大利亚国立大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00335 2026-08-04 cs.AI cs.CL cs.LG 新提交 78%

RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

RMSWeb:面向Web智能体强化学习的反思、失败模式挖掘与Salvage-DS

Chengbo Liu, Lifang Zhou, Ruijie Yan, Pei Tan, Ao Sun, Haojun Huang, Guichun Hua, Sining Wei, Yining Chen, Yingying He, Yutao Xie

专题命中 GUI与网页智能体 :agent(title);分类 cs.AI、cs.CL、cs.LG

AI总结 RMSWeb是针对Qwen3-VL-Instruct 8B和32B模型的Web智能体强化学习方案,通过三部分技术提升训练效率与性能,在多个Web基准数据集上较SFT取得显著提升,且8B模型获同规模开源模型最优Online-Mind2Web结果。

Comments 15 pages, 9 figures, and 6 tables. Includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14468 2026-07-17 cs.RO cs.MA cs.SY eess.SY 新提交 78%

Mixed-Agent Museum Tour Guide Design Improves Gendered Learning Outcomes and Visitor Preferences

混合智能体博物馆导游设计提升性别化学习成果及游客偏好

Annette M. Masterson, Wonse Jo, Helena C. Sieh, Lionel P. Robert,, Dawn Tilbury

机构 * University of Michigan(密歇根大学) Incheon National University(仁川国立大学)

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 研究博物馆中机器人导游,提出结合实体与虚拟智能体的混合导游系统,经30人受试者内研究验证,发现其提升女性学习表现,各条件下参与度和体验质量一致,且无论性别参与者都更偏好混合智能体团队。

Comments Accepted on IROS 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12050 2026-07-15 cs.RO 新提交 78%

EFLUX: Elastic Multi-Robot Formation Navigation and Adaptation with Agentic LLMs

EFLUX:基于智能语言模型的弹性多机器人编队导航与自适应

Jinyuan Zhang, Yuwei Wu, Guangyao Shi, Jonathan Diller, Gaurav S. Sukhatme, Vijay Kumar

机构 * GRASP Lab, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 GUI与网页智能体 :agentic(title,abstract)

AI总结 针对多机器人在受限环境中编队导航问题,提出EFLUX框架,基于几何和大语言模型,对变形与重新配置动作联合推理,经闭环管道转化为航点,实验证明其能实现安全弹性导航,减少死锁与导航失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09716 2026-07-14 cs.RO 新提交 78%

RoboNav-Arm: Agentic AI-Driven Navigation and Obstacle Avoidance for Robotic Manipulator in Cluttered Environments

RoboNav-Arm:杂乱环境中机器人操纵器的智能AI驱动导航与避障

Aachal Sharma, Narendra Kumar Dhar

机构 * Centre for Artificial Intelligence and Robotics (CAIR), Indian Institute of Technology Mandi(人工智能与机器人中心(CAIR),印度曼迪理工学院)

专题命中 GUI与网页智能体 :agentic(title);planning(abstract)

AI总结 针对杂乱环境中机器人操纵器面临的挑战,提出含环境、中央协调和规划模块的安全任务执行框架,能实时检测与定位障碍物,依环境选算法规划轨迹并优化,在Gazebo Classic中评估,展现动态场景鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24870 2026-06-24 cs.HC 新提交 78%

"Zooming In" on Agentic Web Browsers as Assistive Technologies: A Case Study with a Low-Vision Technology Expert

“放大”代理型网络浏览器作为辅助技术:一项低视力技术专家的案例研究

Laura Colazzo, Giuseppe Anzillotti

专题命中 GUI与网页智能体 :agentic(title,abstract)

AI总结 通过低视力专家案例研究,探讨基于大语言模型的代理型网络浏览器如何以对话方式辅助视障用户导航网页,发现其虽有限制但体验流畅灵活,有望提升无障碍性并减少交互障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01661 2026-06-16 cs.DC 版本更新 78%

HeRo: Adaptive Orchestration of Agentic RAG on Heterogeneous Mobile SoC

HeRo: 异构移动SoC上智能体RAG的自适应编排

Maoliang Li, Jiayu Chen, Zihao Zheng, Ziqian Li, Xinhao Sun, Guojie Luo, Chenchen Liu, Xiang Chen

专题命中 GUI与网页智能体 :agentic(title,abstract)

AI总结 提出HeRo框架,通过基于性能分析的在线调度器,结合形状感知子阶段划分、关键性加速器映射和带宽感知并发控制,在异构移动SoC上实现低延迟智能体RAG,端到端延迟降低达10.94倍。

Comments Will appear in DAC'2026, Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.01985 2026-06-04 cs.DC cs.SY eess.SY 78%

Cooperative Simultaneous Localization and Synchronization in Mobile Agent Networks

协同移动代理网络中的同时定位与同步

Bernhard Etzlinger, Florian Meyer, Franz Hlawatsch, Andreas Springer, Henk Wymeersch

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 本文提出基于时间飞行测量的协同定位与同步框架CoSLAS,采用分布式信念传播算法处理时变局部时钟参数,结合粒子实现与参数信息表示提升精度与效率。

Comments 13 pages, 6 figures, 3 tables; manuscript submitted to IEEE Transaction on Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
1408.3732 2026-06-04 eess.SY cs.SY 78%

Distributed Estimation with Information-Seeking Control in Agent Network

分布式网络中基于信息寻求控制的估计

Florian Meyer, Henk Wymeersch, Markus Fröhle, Franz Hlawatsch

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 本文提出了一种分布式协作框架,结合信念传播与共识进行联合状态估计,并通过梯度上升最大化后验联合熵以优化信息寻求控制,实现了非线性和非高斯问题中的高效估计与控制。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05765 2026-05-22 cs.CV 78%

X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction

X-OmniClaw 技术报告:一种统一的移动代理用于多模态理解和交互

Xiaoming Ren, Ru Zhen, Chao Li, Yang Song, Qiuxia Hou, Yanhao Zhang, Peng Liu, Qi Qi, Quanlong Zheng, Qi Wu, Zhenyi Liao, Binqiang Pan, Haobo Ji, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 本文提出X-OmniClaw,一种统一的移动代理,用于Android生态系统中的多模态理解和交互,通过统一的感知、记忆和行动架构,提升复杂移动任务的上下文感知能力,展示了其在多模态交互中的高效性和可靠性。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08533 2026-04-01 cs.CV 78%

SecAgent: Efficient Mobile GUI Agent with Semantic Context

SecAgent:基于语义上下文的高效移动GUI代理

Yiping Xie, Song Chen, Jingxuan Xing, Wei Jiang, Zekun Zhu, Yingyao Wang, Pi Bu, Jun Song, Yuning Jiang, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06190 2026-03-09 cs.RO 78%

DreamToNav: Generalizable Navigation for Robots via Generative Video Planning

DreamToNav: 通过生成式视频规划实现通用机器人导航

Valerii Serpiva, Jeffrin Sam, Chidera Simon, Hajira Amjad, Iana Zhura, Artem Lykov, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)

专题命中 GUI与网页智能体 :planning(title,abstract)

AI总结 DreamToNav通过生成式视频规划实现通用机器人导航,利用自然语言提示生成精确运动路径,实现目标导向的自主导航。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02772 2026-03-04 cs.RO 78%

Agentic Self-Evolutionary Replanning for Embodied Navigation

代理自进化重规划用于具身导航

Guoliang Li, Ruihua Han, Chengyang Li, He Li, Shuai Wang, Wenchao Ding, Hong Zhang, Chengzhong Xu

机构 * Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) SIAT, Chinese Academy of Sciences(中国科学院上海技术物理研究所) Department of Computer Science, University of Hong Kong(香港大学计算机科学系) Academy for Engineering & Technology, Fudan University(复旦大学工程与技术学院) Department of EEE, Southern University of Science and Technology(南方科技大学电子工程系)

专题命中 GUI与网页智能体 :agentic(title,abstract)

AI总结 SERP通过自进化动作模型和图链式思考重规划,提升具身导航在复杂环境中的鲁棒性和效率。

Comments 8 pages, 10 figures, 4 tables, submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02079 2026-03-03 cs.CV 78%

MMNavAgent: Multi-Magnification WSI Navigation Agent for Clinically Consistent Whole-Slide Analysis

MMNavAgent: 多倍率WSI导航代理用于临床一致的全滑片分析

Zhengyang Xu, Han Li, Jingsong Liu, Linrui Xie, Xun Ma, Xin You, Shihui Zu, Ayako Ito, Xinyu Hao, Hongming Xu, Shaohua Kevin Zhou, Nassir Navab, Peter J. Schüffler

机构 * Institute of Pathology, Technical University of Munich, Germany(慕尼黑技术大学病理研究所) Munich Data Science Institute (MDSI), Munich, Germany(慕尼黑数据科学研究所) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心) Computer Aided Medical Procedures (CAMP), TU Munich, Munich, Germany(计算机辅助医疗程序(CAMP),慕尼黑技术大学) Dalian University of Technology(大连理工大学) Cancer Hospital of Dalian University of Technology, Shenyang(大连理工大学肿瘤医院) Department of Human Pathology, Juntendo University Graduate School of Medicine(立命大学医学研究生院人类病理部门) University of Science and Technology of China(中国科学技术大学) Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) Northwest University of China(中国西北大学)

专题命中 GUI与网页智能体 :agent(title,abstract)

AI总结 MMNavAgent通过多倍率交互建模和自适应倍率选择,提升全滑片图像诊断性能,实验显示AUC和BACC均有所提升。

详情

展开后加载摘要…

URL PDF HTML 收藏