arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 177 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 177 篇

2606.07244 2026-06-08 cs.RO cs.AI cs.CV 新提交 57%

Beyond Waypoints: A Trajectory-Centric Waypointing Paradigm for Vision-Language Navigation

超越航点:面向视觉语言导航的轨迹中心航点范式

Haoxiang Shi, Xiang Deng, Haoyu Zhang, Qiaohui Chu, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 提出轨迹航点范式,通过TSDF引导的扩散策略预测可执行轨迹,解决VLN-CE中航点不可达与规划控制不一致问题,在基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14531 2026-08-17 cs.RO eess.SY 新提交 50%

Spatiotemporal Tube-Based Safety-Certificate for Autonomous Navigation of Articulated Vehicles

铰接式车辆自主导航的基于时空管的安全证书

Mohd. Faizuddin Faruqui, Ratnangshu Das, Ravi Kumar L, Pushpak Jagtap

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对铰接式车辆自主导航的狭窄路线机动挑战,提出基于时空管的规划方法,确保挂车处于道路走廊内,经仿真验证可提供路线安全证书。

Comments Accepted for presentation at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14273 2026-08-17 cs.HC 新提交 50%

Designing Mobile and Wearable Sensor-Fused Conversational Agents for Health and Wellbeing

面向健康与福祉的移动及可穿戴传感器融合对话智能体设计

Hansoo Lee, Pablo Fonseca, Md Haseen Akhtar

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本教程面向健康领域,旨在教授参与者使用WSDWAS工具,将可穿戴传感器数据与LLM驱动的对话智能体结合,实现从被动监测到可操作福祉对话的转变。

Comments 6 pages, 3 figures. Accepted as a Tutorial at the 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 50%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11901 2026-08-13 cs.RO 新提交 50%

DaViNCi: A Dataset Towards Outdoor Vision-and-Language Navigation with Continuous Actions and Dynamic Elements

DaViNCi:面向包含连续动作与动态元素的户外视觉语言导航的数据集

Zihao Xie, Pingrui Lai, Yitong Wu, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出首个同时包含连续动作与动态元素的户外视觉语言导航数据集DaViNCi,通过实验验证其挑战性,为推动户外VLN向更真实环境发展提供实用支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09196 2026-08-11 cs.RO 新提交 50%

SAIN: Structure-Aware Interactive Navigation with Active Dialogue Grounding for Mobile Robot

SAIN:面向移动机器人的、结合主动对话 grounding 的结构感知交互式导航

Yuhao Cao, Xiao Liu, Yang Xie, Lu Liu, Haoyao Chen

机构 * School of Mechanical Engineering and Automation, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机械工程与自动化学院) Department of Mechanical Engineering, City University of Hong Kong(香港城市大学机械工程系)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SAIN零样本框架,将主动对话转化为持久导航状态,在VL-LN IIGN基准上提升了导航成功率与加权成功率,无需特定任务策略训练,验证了对话转状态机制的有效性。

Comments 8 pages, 4 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08981 2026-08-11 cs.DC 新提交 50%

Universal Rendezvous of Anonymous Agents with Footprints

带足迹的匿名智能体的通用会合算法

Bibhuti Das

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文针对带足迹模型中所有连通(有限或可数无限)底层图的会合实例,提出通用会合算法,解决了Das和Pelc提出的开放问题,给出该模型所有实例存在通用算法的肯定答案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08596 2026-08-11 cs.CV 新提交 50%

Goal-oriented Navigation Instruction Generation with Tour Video Priors

基于旅游视频先验的面向目标的导航指令生成

Fangdi Li, Juncheng Liao, Changxu Cheng, Jiazhi Wang, Senda Chen, Tao Wang, Wuyue Zhao

机构 * Uni-Ubi AI(优必爱人工智能) Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07797 2026-08-11 cs.RO cs.CV 新提交 50%

Drone-Assisted UAV-UGV Collaboration for Autonomous Navigation in Snow-Covered Terrain

无人机辅助的无人机-无人车协同积雪覆盖地形自主导航

Shreyam Gupta, P. Agrawal, Priyam Gupta, R. Gautam

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对积雪覆盖地形传统导航方法失效的问题,提出无人机-无人车协同导航框架,采用定制U-Net、EKF、YOLOv5等技术实现高分割精度与低定位误差,可在遮挡环境中完成自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06482 2026-08-10 cs.DC 新提交 50%

Rendezvous of Mobile Deterministic Automata in Graphs

图中移动确定自动机的会合问题

Bibhuti Das, Andrzej Pelc

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文研究图中移动确定自动机的会合问题,证明固定小卵石无法实现树的RV-通用DFA,而配备单个可移动小卵石的DFA可成为树的RV-通用DFA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07123 2026-08-10 cs.HC cs.PF physics.data-an 新提交 50%

Thermodynamic Human-Computer Interaction

热力学人机交互

Uzafir Ahmad Rafaq, Muaz Hassan, Ali Muzaffar

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出一种基于热力学的人机交互统一框架,可跨交互模态扩展、无需训练数据且评估时间为O(1),在网页预取任务中取得1.37的预取点击比和98.1%的目标预测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06065 2026-08-07 cs.CV 新提交 50%

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

下一张截图知晓:面向移动GUI智能体的门控事后蒸馏(Gated Hindsight Distillation)

Weiwei Li, Junzhuo Liu, Tong Chu, Hengfu Yu, Wen Li

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文针对移动GUI智能体训练中丢失动作依据的问题,提出门控事后蒸馏方法,利用下一张截图作为特权信息,在AndroidWorld等基准上相比GRPO提升了任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05078 2026-08-06 cs.RO 新提交 50%

SpikingNav: Robust Embodied Navigation with Spiking Neural Policies

SpikingNav:基于脉冲神经网络策略的鲁棒具身导航

Jiahong Zhang, Sijun Shen, Dehua Wu, Yifan Lin, Xuechen Xia, Xu Chu, Youhui Zhang, GuoqiLi

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SpikingNav脉冲导航框架,含SSE与SPN,在PointNav、ObjectNav任务中,其参数更少、计算量更低,鲁棒性优于匹配的ANN基线,且可部署于Thruster-V2芯片。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04825 2026-08-06 cs.RO 新提交 50%

Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation

飞行前深思熟虑:面向无人机“看见并到达”导航的视觉引导空间深思熟虑

Fanfu Xue, En Yu, Bohang Liu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对无人机“看见并到达”导航中语义-控制失配问题,提出视觉-语言航路点预测框架DBFly,通过空间机动决策链、隐式飞行走廊和感知终端收敛的停止策略,使成功率较SOTA基线平均提升25.07个百分点。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04755 2026-08-06 cs.CR 新提交 50%

"Allow" to Achieve, Over-Privileged Inadvertently: The Unintended Cost of Task-Completion-Driven Pop-up Decisions in Mobile GUI Agents

“允许”达成目标:移动GUI智能体中任务完成驱动的弹窗决策的意外代价

Dongsheng Chen, Yuxuan Li, Guanhua Chen, Jiaxin Zhang, Xiangyu Zhao, Lei Ma, Xin Yao, Xuetao Wei

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究移动GUI智能体的权限素养,发现其存在应用信任偏差、任务优先级覆盖等问题,提示干预效果不一,建议将任务执行与权限授权分离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04741 2026-08-06 cs.CR 新提交 50%

LoginTrap: Uncovering Task-Agnostic Phishing-Style Indirect Prompt Injection Attacks against LLM-based Web Agents

LoginTrap:针对基于大语言模型的Web智能体的任务无关型钓鱼式间接提示注入攻击的发现

Longtao Guo, Zelin Zhang, Kaifeng Huang, Yang Shi

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出LoginTrap攻击,是针对基于LLM的Web智能体的任务无关型登录诱导攻击,在黑盒威胁模型下可达到86%的平均端到端攻击成功率,揭示了登录诱导的认证边界风险并推动相关防御研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04530 2026-08-06 cs.CV 新提交 50%

FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory

FocusMem:对潜在GUI记忆中的内容、读出和信任进行因子分解

Zhuoran Zhang, Bowen Li, Jingcheng Ju, Yang Shi, Qixun Wang, Haotian Wang, Wei Chen, Tengjiao Wang

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 FocusMem将潜在GUI记忆的内容、读出和信任因子分解,解决现有固定记忆方法的细节丢失、阶段适配差和误导问题,在五个GUI智能体基准测试中性能优于基线与现有方法。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03313 2026-08-05 cs.NI cs.MM eess.IV 新提交 50%

ProCAVE: A Self-Adaptive, Full-Lifecycle Edge Caching Framework for Video Streaming via Predictive Bandwidth Estimation and Preference-Aware Deep Reinforcement Learning

ProCAVE:基于预测带宽估计与偏好感知深度强化学习的自适应全生命周期视频流边缘缓存框架

Yeganeh Chatri, Behzad Akbari, Foad Ghaderi, Pejman Goudarzi

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究针对现有边缘缓存方法在无线动态环境下响应与协调不足的问题,提出ProCAVE框架,结合轻量Transformer、PPO、DDPG实现预测带宽建模与偏好感知缓存控制,实验表明其在字节命中率、回传负载、QoE上优于FlyCache等基线。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03143 2026-08-05 cs.CV cs.RO 新提交 50%

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

从路线到步骤:在视觉语言导航中分离语义进展与局部执行

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本研究针对视觉语言导航中进展与执行错误难区分的问题,提出Route2Step框架,通过步骤级接口分离语义进展跟踪与动作生成,在R2R-CE数据集上显著提升了导航性能,且在真实环境中具备实用性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00721 2026-08-04 cs.RO 新提交 50%

OmniAI: A Surface-Adaptive Aerial Projection Interface for Human--Drone Interaction

OmniAI:一种面向人机交互的表面自适应空中投影界面

Nikita Kuzmin, Yuhua Jin, Georgii Demianchuk, Mariya Lezina, Fawad Mehboob, Ivan Valuev, Nikolai Lutsenko, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 OmniAI是一种具现化空中智能体,通过自适应投影实现人机交互,采用RGB-D与RANSAC检测投影表面,支持语音、手势控制,为情境感知人机交互提供移动空间AR界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28474 2026-07-31 cs.RO 新提交 50%

TEA-AgriVLN: Traversability Estimation Alarm for Agricultural Vision-and-Language Navigation

TEA-AgriVLN:面向农业视觉语言导航的可通行性估计告警

Xiaobei Zhao, Xingqi Lyu, Xin Chen, Xiang Li

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对农业场景可通行性模糊问题,提出TEA模块并集成至AgriVLN构建TEA-AgriVLN,在A2A基准上将SR提至0.54、NE降至2.70米,实现农业VLN-CE领域最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27812 2026-07-31 cs.NI 新提交 50%

Localization and Pursuit of a Mobile Target using Distance-only Measurements

仅利用距离测量的移动目标定位与追踪

Nabarupa Das, Suvadip Batabyal

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出一种无需GPS、角度传感或多锚节点的方法,通过距离测量实现二维平面内移动目标的定位与追踪,最多13步即可完成定位,智能体可从搜索顺利过渡到追踪并保持有界误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26460 2026-07-30 cs.RO 新提交 50%

RLMM-Flow: A Flow-based Mobile Manipulation Framework with Latent-Space Reinforcement Learning

RLMM-Flow:一种基于流的隐空间强化学习移动操作框架

Shuhang Wang, Ziming Li, Hui Cheng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 该研究提出RLMM-Flow框架,结合流策略预训练与隐空间强化学习,在移动操作基准上提升任务成功率等指标,同时保留流的快速推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26295 2026-07-30 physics.bio-ph cond-mat.stat-mech q-bio.NC 新提交 50%

A behavior-environment information loop drives sensory navigation

行为-环境信息回路驱动感官导航

Kevin S. Chen, Matthew P. Leighton, Damon A. Clark, Thierry Emonet

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 该研究提出基于传递熵的信息论框架,量化感官与行为的双向信息流,可预测生物与人工系统的导航效率,揭示了驱动导航的通用行为-环境反馈回路。

Comments 14 pages, 6 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24230 2026-07-28 cs.DL 新提交 50%

Umulsai: A Plain-Text Format and In-Browser Engraving System for Jeongganbo, Korean Mensural Notation

Umulsai:一种用于朝鲜正谱记谱法的纯文本格式和浏览器内排版系统

Danbinaerin Han

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 研究针对朝鲜正谱记谱法与西方排版系统不兼容且缺乏实用数字工具的问题,提出了Umulsai编辑器,其核心包含特定纯文本格式、排版引擎和无依赖实现,经专家主导的AI辅助工作流程开发并验证,可实现高质量输出与多种功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23181 2026-07-28 cs.CV 新提交 50%

Towards Dual-Brain Minimal Sufficient Representation for Vision-Language Navigation

迈向视觉语言导航的双脑最小充分表示

Yihao Wu, Chenyi Xu, Liqi Yan, Chenhuan Cai, Geyong Min, Bin Lin, Fangli Guan, Jianhui Zhang, Pan Li

机构 * Hangzhou Dianzi University(杭州电子科技大学) University of Zurich(苏黎世大学) University of Exeter(埃克塞特大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对视觉语言导航中存在的问题,提出BrainNav框架,包含逻辑锚定模型等三个组件,通过将语义意图与空间感知对齐,提升智能体在复杂任务中的表现,在实验中相比之前最优方法有改进,为鲁棒的视觉语言导航提供有效基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21025 2026-07-24 cs.RO 新提交 50%

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

ZONDA:多楼层环境中具有动态避障功能的零样本目标导航

Shaomin Liang, Xuanhong Liao, Shiyao Zhang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) South China University of Technology(华南理工大学) Great Bay University(大湾区大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17527 2026-07-21 cs.HC 新提交 50%

Sidekick: Designing Communication for Effective Multitasking with Computer Use Agents

Sidekick:与计算机使用代理进行有效多任务通信的设计

Ruei-Che Chang, Wenqian Xu, Dingzeyu Li, Bryan Wang, Anhong Guo

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究针对计算机使用代理文本反馈问题,开发Sidekick原型系统,在不同交互阶段用多模态反馈传达其状态,经30人参与的研究验证其能显著提升多任务性能,有效支持进度感知等,还展示了应用前景及对人机协作的意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16956 2026-07-21 cs.RO 新提交 50%

G2-Nav: Grounded and Guarded Vision-Language Costmaps for Robot Social Navigation

G2-Nav:用于机器人社交导航的基于视觉语言的地面与防护代价地图

Yuwen Liao, Yihang Lan, Yizhuo Yang, Ruimeng Liu, Xinhang Xu, Shenghai Yuan, Lihua Xie

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究针对机器人社交导航问题,提出G2-Nav框架,将VLM语义推理转化为视觉语言代价地图,经开放集感知评估区域和代理,结合语义验证与高频安全检查,实现非结构化环境下安全、高效且符合社会规范的自主导航。

Comments submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16806 2026-07-21 cs.RO 新提交 50%

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流

Tianshuai Hu, Yangyi Zhong, Zeying Gong, Lingdong Kong, Xiaodong Mei, Guoyang Zhao, Xiaolu Liu, Song Wang, Rong Li, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏