arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2955 篇

2603.22917 2026-03-25 cs.HC 67%

IntentWeave: A Progressive Entry Ladder for Multi-Surface Browser Agents in Cloud Portals

IntentWeave: 多表面浏览器代理在云门户中的渐进入口阶梯

Wanying Mo, Jijia Lai, Xiaoming Wang

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract)

AI总结 本文提出IntentWeave,一种多表面浏览器代理的渐进入口阶梯设计,通过不同介入策略提升用户控制与效率。

Comments chiea26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20238 2026-03-24 eess.SY cs.IT cs.SY math.IT 67%

Joint Trajectory, RIS, and Computation Offloading Optimization via Decentralized Model-Based PPO in Urban Multi-UAV Mobile Edge Computing

多无人机边缘计算中轨迹、RIS和计算卸载联合优化的去中心化模型基于PPO方法

Liangshun Wu, Jianbo Du, Junsuo Qu

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出去中心化模型基于PPO方法,解决密集城市区域多无人机边缘计算中计算卸载、轨迹和RIS相位配置的联合优化问题,提升吞吐量和能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12908 2026-03-17 cs.RO 67%

GoalSwarm: Multi-UAV Semantic Coordination for Open-Vocabulary Object Navigation

GoalSwarm:多无人机语义协调用于开放词汇物体导航

MoniJesu Wonders James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出GoalSwarm框架,通过轻量语义地图构建、零样本目标检测和去中心化协调策略,实现多无人机在未知环境中的开放词汇物体导航。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08800 2026-03-13 cs.CV cs.AI cs.CL cs.HC cs.LG 67%

NeuralOS: Towards Simulating Operating Systems via Neural Generative Models

NeuralOS: 通过神经生成模型实现操作系统的模拟

Luke Rivard, Sun Sun, Hongyu Guo, Wenhu Chen, Yuntian Deng

机构 * University of Waterloo(滑铁卢大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 GUI与网页智能体 :AI agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 NeuralOS通过神经生成模型模拟操作系统GUI,能准确预测用户交互并生成逼真界面,展示了合成数据在模拟未安装应用上的潜力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11662 2026-03-10 cs.AI cs.CL cs.LG cs.MA cs.RO 67%

Let's Think in Two Steps: Mitigating Agreement Bias in MLLMs with Self-Grounded Verification

两步思考:通过自我 grounded 验证缓解 MLLM 的同意偏差

Moises Andrade, Joonhyuk Cha, Brandon Ho, Vriksha Srihari, Karmesh Yadav, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出 SGV 方法,通过自我 grounded 验证缓解 MLLM 的同意偏差,提升验证准确性和任务完成率。

Comments ICLR 2026. Code, models, and data publicly available at https://mshalimay.github.io/agreement-bias-sgv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06918 2026-03-10 cs.RO 67%

T2Nav Algebraic Topology Aware Temporal Graph Memory and Loop Detection for ZeroShot Visual Navigation

T2Nav 基于代数拓扑的时序图记忆与循环检测用于零样本视觉导航

Quang-Anh N. D., Duc Pham, Minh-Anh Nguyen, Tung Doan, Tuan Dang

机构 * International School, Vietnam National University, Hanoi, Vietnam(越南国家大学河内国际学校) Hanoi University of Science, Vietnam National University, Hanoi, Vietnam(越南国家大学河内科学大学) Hanoi University of Science and Technology, Hanoi, Vietnam(河内科学技术大学) Cognitive Robotics Lab, Department of Electrical Engineering and Computer Science, University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校电气工程与计算机科学系认知机器人实验室) University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校)

专题命中 GUI与网页智能体 :autonomous agent(abstract);planning(abstract)

AI总结 T2Nav通过整合异构数据和基于图的推理,实现零样本视觉导航,具备高效探索和路径规划能力,适用于视觉相似但空间不同的目标实例导航。

Journal ref EEE International Conference on Robotics & Automation 2026 (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04364 2026-03-05 cs.LG cs.AI cs.CL 67%

Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks

双模多阶段对抗安全训练:增强多模态网络代理对跨模态攻击的鲁棒性

Haoyu Liu, Dingcheng Li, Lukas Rutishauser, Zeyu Zheng

机构 * UC Berkeley, IEOR & BAIR(伯克利大学) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 DMAST通过三阶段对抗训练提升多模态网络代理对跨模态攻击的鲁棒性,显著提高任务完成效率并优于现有防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19655 2026-03-05 cs.RO 67%

LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments

LaViRA: 语言-视觉-机器人动作翻译用于连续环境中的零样本视觉语言导航

Hongyu Ding, Ziming Xu, Yudong Fang, You Wu, Zixuan Chen, Jieqi Shi, Jing Huo, Yifan Zhang, Yang Gao

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

AI总结 LaViRA通过分解动作层次结构,利用多模态大语言模型的优势,实现连续环境中零样本视觉语言导航的高效导航与泛化能力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09082 2026-02-25 cs.CV cs.AI cs.CL cs.LG 67%

UI-Venus-1.5 Technical Report

UI-Venus-1.5 技术报告

Venus Team, Changlong Gao, Zhangxuan Gu, Yulin Liu, Xinyu Qiu, Shuheng Shen, Yue Wen, Tianyu Xia, Zhenyu Xu, Zhengwen Zeng, Beitong Zhou, Xingran Zhou, Weizhi Chen, Sunhao Dai, Jingya Dou, Yichen Gong, Yuan Guo, Zhenlin Guo, Feng Li, Qian Li, Jinzhen Lin, Yuqi Zhou, Linchao Zhu, Liang Chen, Zhenyu Guo, Changhua Meng, Weiqiang Wang

机构 * Ant Group(蚂蚁集团)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 UI-Venus-1.5通过统一的GUI代理和关键技术改进,在多个基准测试中实现了最先进的性能,展示了在现实世界应用中的强大导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12597 2026-02-16 cs.RO cs.HC 67%

PISHYAR: A Socially Intelligent Smart Cane for Indoor Social Navigation and Multimodal Human-Robot Interaction for Visually Impaired People

PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士

Mahdi Haghighat Joo, Maryam Karimi Jafari, Alireza Taheri

专题命中 GUI与网页智能体 :planning(abstract);agentic(abstract)

AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02250 2026-02-05 cs.AI cs.CL cs.CV cs.LG 67%

Scaling Agents for Computer Use

用于计算机使用的扩展代理

Gonzalo Gonzalez-Pumariega, Vincent Tu, Chih-Lun Lee, Jiachen Yang, Ang Li, Xin Eric Wang

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出BJudge方法,通过行为叙述比较提升CUAs在长周期任务中的鲁棒性和成功率,实现OSWorld新状态-of-the-art并超越人类水平。

Comments 21 pages, 7 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21751 2026-01-30 cs.CV 67%

Dynamic Topology Awareness: Breaking the Granularity Rigidity in Vision-Language Navigation

动态拓扑感知:突破视觉语言导航中的粒度刚性

Jiankun Peng, Jianyuan Guo, Ying Xu, Yue Liu, Jiashuang Yan, Xuanwei Ye, Houhua Li, Xiaoming Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

AI总结 DGNav通过动态拓扑导航框架,解决视觉语言导航中的粒度刚性问题,提升导航效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13273 2026-01-21 eess.SY cs.SY 67%

Safe Navigation in Cluttered Environments Via Spline-Based Harmonic Potential Fields

通过样条基础调和势场在杂乱环境中实现安全导航

Theodor-Gabriel Nicu, Florin Stoican, Daniel-Mihail Ioan, Ionela Prodan

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

AI总结 本文提出了一种基于样条调和势场的方法,用于在杂乱环境中安全导航,通过控制策略引导代理沿预设单元序列移动,确保目标跟踪和障碍回避。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV 67%

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract)

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22047 2025-12-29 cs.CV 67%

MAI-UI Technical Report: Real-World Centric Foundation GUI Agents

MAI-UI 技术报告:以现实为中心的基础 GUI 代理

Hanzhang Zhou, Xu Zhang, Panrong Tong, Jianan Zhang, Liangyu Chen, Quyu Kong, Chenglin Cai, Chen Liu, Yue Wang, Jingren Zhou, Steven Hoi

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract)

AI总结 MAI-UI 提出了一种基于现实的 GUI 代理框架,通过自演化数据管道、设备-云协作系统和在线 RL 框架,实现了 GUI 地基和移动导航的突破性进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18734 2025-12-16 cs.RO 67%

Learning Obstacle Avoidance using Double DQN for Quadcopter Navigation

使用双DQN学习避障以实现四旋翼导航

Nishant Doshi, Amey Sutavani, Sanket Gujar

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

AI总结 本文提出使用双DQN算法,通过深度相机实现四旋翼机器人在模拟城市环境中的避障导航学习。

Comments Fixed typo in second author's name throughout the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08084 2025-12-10 cond-mat.mtrl-sci 67%

Bayesian Co-Navigation of a Computational Physical Model and AFM Experiment to Autonomously Survey a Combinatorial Materials Library

基于计算物理模型和原子力显微镜实验的贝叶斯协同导航以自主调查组合材料库

Boris N. Slautin, Kamyar Barakati, Yu Liu, Reece Emery, Philip Rack, Sergei V. Kalinin

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract)

AI总结 本文提出通过贝叶斯协同导航框架,结合计算物理模型与AFM实验,自主调查组合材料库,实现理论模型与实验的动态整合与持续修正。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21432 2025-12-01 eess.SY cs.SY 67%

Multi-Hypotheses Navigation in Collaborative Localization subject to Cyber Attacks

协同定位中的多假设导航受网络攻击影响

Peter Iwer Hoedt Karstensen, Roberto Galeazzi

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

AI总结 本文提出了一种在多智能体系统中应对网络攻击的鲁棒协同定位方法,通过多假设管理和几何缩减实现鲁棒性,提升导航可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19838 2025-11-18 cs.HC 67%

LLM-Powered GUI Agents in Phone Automation: Surveying Progress and Prospects

Guangyi Liu, Pengxiang Zhao, Yaozhen Liang, Liang Liu, Yaxuan Guo, Han Xiao, Weifeng Lin, Yuxiang Chai, Yue Han, Shuai Ren, Hao Wang, Xiaoyu Liang, WenHao Wang, Tianze Wu, Zhengxi Lu, Siheng Chen, LiLinghao, Hao Wang, Guanjing Xiong, Yong Liu, Hongsheng Li

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

Comments Paper accepted to TMLR 2025, Project Homepage: https://github.com/PhoneLLM/Awesome-LLM-Powered-Phone-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10864 2025-11-17 cs.RO cs.SY eess.SY 67%

WetExplorer: Automating Wetland Greenhouse-Gas Surveys with an Autonomous Mobile Robot

Jose Vasquez, Xuping Zhang

机构 * Department of Mechanical and Production Engineering, Aarhus University(机械与生产工程系,奥胡斯大学)

专题命中 GUI与网页智能体 :planning(abstract);workflow(abstract)

Comments To be published in 2025 IEEE International Conference on Robotics and Biomimetics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00441 2025-10-22 cs.RO 67%

Seeing through Uncertainty: Robust Task-Oriented Optimization in Visual Navigation

Yiyuan Pan, Yunzhe Xu, Zhe Liu, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) School of Automation and Intelligent Sensing(自动化与智能感知学院) Key Laboratory of System Control and Information Processing(系统控制与信息处理重点实验室) Ministry of Education of China(中华人民共和国教育部) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)

专题命中 GUI与网页智能体 :autonomous agent(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13432 2025-10-20 cs.CV 67%

CoDS: Enhancing Collaborative Perception in Heterogeneous Scenarios via Domain Separation

Yushan Han, Hui Zhang, Honglei Zhang, Chuntao Ding, Yuanzhouhan Cao, Yidong Li

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education and School of Computer Science and Technology, Beijing Jiaotong University(大数据与人工智能交通实验室(北京交通大学)及计算机科学与技术学院,北京交通大学)

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

Comments Accepted by IEEE Transactions on Mobile Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11717 2025-10-20 cs.LG cs.AI cs.CL cs.CV 67%

WebInject: Prompt Injection Attack to Web Agents

Xilong Wang, John Bloch, Zedian Shao, Yuepeng Hu, Shuyan Zhou, Neil Zhenqiang Gong

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Appeared in EMNLP 2025 main conference. To better understand prompt injection attacks, see https://people.duke.edu/~zg70/code/PromptInjection.pdf

Journal ref The 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24183 2025-09-30 cs.CL cs.AI cs.LG 67%

Retrieval-augmented GUI Agents with Generative Guidelines

Ran Xu, Kaixin Ma, Wenhao Yu, Hongming Zhang, Joyce C. Ho, Carl Yang, Dong Yu

机构 * Emory University(埃默里大学) Tencent AI Lab(腾讯AI实验室)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07334 2025-09-10 cs.HC 67%

SpecifyUI: Supporting Iterative UI Design Intent Expression through Structured Specifications and Generative AI

Yunnong Chen, Chengwei Shi, Liuqing Chen

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21690 2025-09-01 cs.RO 67%

Can a mobile robot learn from a pedestrian model to prevent the sidewalk salsa?

Olger Siebinga, David Abbink

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18683 2025-08-27 cs.DS 67%

Graph Traversal via Connected Mobile Agents

Saswata Jana, Giuseppe F. Italiano, Partha Sarathi Mandal

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16293 2025-08-25 cs.PF 67%

Two-Timescale Dynamic Service Deployment and Task Scheduling with Spatiotemporal Collaboration in Mobile Edge Networks

Yang Li, Xing Zhang, Yunji Zhao, Wenbo Wang

专题命中 GUI与网页智能体 :agent(abstract);multi-agent(abstract)

Comments This paper is accepted by IEEE Globecom 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11574 2025-08-18 cs.NI 67%

Intelligent Edge Resource Provisioning for Scalable Digital Twins of Autonomous Vehicles

Mohammad Sajid Shahriar, Suresh Subramaniam, Motoharu Matsuura, Hiroshi Hasegawa, Shih-Chun Lin

专题命中 GUI与网页智能体 :agent(abstract);autonomous agent(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10833 2025-08-18 cs.CV 67%

UI-Venus Technical Report: Building High-performance UI Agents with RFT

Zhangxuan Gu, Zhengwen Zeng, Zhenyu Xu, Xingran Zhou, Shuheng Shen, Yunfei Liu, Beitong Zhou, Changhua Meng, Tianyu Xia, Weizhi Chen, Yue Wen, Jingya Dou, Fei Tang, Jinzhen Lin, Yulin Liu, Zhenlin Guo, Yichen Gong, Heng Jia, Changlong Gao, Yuan Guo, Yong Deng, Zhenyu Guo, Liang Chen, Weiqiang Wang

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏