arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 2965 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2965 篇

2607.11739 2026-07-14 cs.RO 新提交 50%

AutoPath: Learning Transferable Goal-Conditioned Stochastic Path Prior for Safe Navigation Without Human Demonstrations

AutoPath:学习可转移的目标条件随机路径先验以实现无人类示范的安全导航

Ziyang Zhang, Boyang Zhou, Zesong Yang, Haocheng Peng, Zeming Gai, Xiao Liang, Yujun Shen, Danping Zou, Ruizhen Hu, Hujun Bao, Zhaopeng Cui

机构 * Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Shenzhen University(深圳大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究在复杂环境下的安全导航问题,提出学习可转移目标条件随机路径先验的方法,引入规范状态表示和结构化先验学习框架,实验证明该方法成功率高、效率有竞争力且可跨平台转移。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L). 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10374 2026-07-14 cs.RO cs.HC 新提交 50%

Navigating the Crowd: Non-linear MPC with Social Forces Dynamics for Human-Aware Robot Navigation

在人群中导航:用于人类感知机器人导航的具有社会力动力学的非线性模型预测控制

Stefano Trepella, Andrea Ostuni, Mauro Martini, Pablo Pueyo, Noé Pérez-Higueras, Marcello Chiaberge, Fernando Caballero, Luis Merino

机构 * Department of Electronics and Telecommunications, Politecnico di Torino(电子与电信系,都灵理工大学) School of Engineering, Pablo de Olavide University(工程学院,巴勃罗·德奥拉维德大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究针对自主机器人在人群中安全合规导航的挑战,提出基于社会力模型的非线性模型预测控制框架SFM-NMPC,将人类运动预测嵌入优化循环,能联合预测人机轨迹,经测试在社会合规性上优于基线,有效用于现实社会导航。

Comments 9 pages, 7 figures, accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10288 2026-07-14 cs.RO 新提交 50%

PIER-Flow: Physics-Informed Efficient Rectified Flow for Real-Time Mobile Robot Navigation

PIER-Flow:用于实时移动机器人导航的物理信息高效整流流

Shibo Li, Zhongcheng Wang, Jiahe Cao, Jianhua Yang, Ke Wu

机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究针对移动机器人在复杂环境下导航问题,提出PIER-Flow策略。通过将MPC专家知识融入常微分方程,利用并行潜在采样等实现单步动作生成,经物理信息训练目标及异步架构提升性能,在模拟和实际部署中均取得良好效果,显著加速规划并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13843 2026-07-14 cs.HC 版本更新 50%

Rethinking the UI of GenUI: A Tale of Two Designs

重新思考GenUI的用户界面:两种设计的故事

Xiang 'Anthony' Chen, Savvas Dimitrios Petridis, Tian Deng, Humad Bari, Ruofei Du, Yang Li

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 本研究通过对比两种GenUI设计(非结构化深度优先高保真 vs. 结构化广度优先低保真),探讨如何更好地支持早期0到1设计探索,发现结构化输入和广度优先工作流有优势但存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12842 2026-07-14 cs.RO 版本更新 50%

SmoothTurn: Learning to Turn Smoothly for Agile Navigation with Quadrupedal Robots

SmoothTurn: 为四足机器人敏捷导航学习平稳转向

Zunzhi You, Yunke Wang, Haolan Guo, Chang Xu

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出SmoothTurn框架,通过引入序列目标到达奖励、扩展观测空间和自动目标课程,使四足机器人在高速运行时实现平稳转向,提升敏捷导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09656 2026-07-14 cs.RO 版本更新 50%

ReMoSPLAT: Reactive Mobile Manipulation Control on a Gaussian Splat

ReMoSPLAT:高斯点云上的反应式移动操作控制

Nicolas Marticorena, Tobias Fischer, Niko Suenderhauf

机构 * QUT Centre For Robotics, School of Electrical Engineering and Robotics at the Queensland University of Technology(昆士兰理工大学机器人中心,电气工程与机器人学学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究移动操纵器在不涉及高成本规划下如何利用高斯点云表示避免碰撞,提出基于二次规划公式的ReMoSPLAT反应式控制器,通过模拟实验验证其可行性,性能可媲美依赖完美信息的控制器,并在真实机器人平台进一步验证。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04404 2026-07-14 cs.RO 50%

A Ground Mobile Robot for Autonomous Terrestrial Laser Scanning-Based Field Phenotyping

一种用于自主地面激光扫描的田间表型分析机器人

Javier Rodriguez-Sanchez, Kyle Johnsen, Changying Li

机构 * School of Electrical and Computer Engineering(电气与计算机工程学院) The University of Georgia(佐治亚大学) Bio-Sensing, Automation and Intelligence Laboratory(生物传感、自动化与智能实验室) Agricultural & Biological Engineering(农业与生物工程) The University of Florida(佛罗里达大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本研究开发了一种自主地面机器人系统,利用高分辨率三维激光扫描仪实现田间表型分析,提高了田间作物生长监测的自动化和准确性。

Comments Submitted to Journal of Field Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09130 2026-07-13 cs.RO 新提交 50%

Vascular Geometry Characterization for AI-Based Endovascular Navigation

基于人工智能的血管内导航的血管几何特征表征

Han-Ru Wu, Harry Robertshaw, Lisa Dwyer-Joyce, Thomas C Booth, Alejandro Granados

机构 * National Taiwan University Hospital(台湾大学附属医院) Chelsea & Westminster Hospital(切尔西和威斯敏斯特医院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究旨在识别与血管内导航难度相关的血管指标并开发自动化流程,通过分割血管树测量指标,用RL算法导航并分析结果,发现血管几何形状影响导航难度,所提流程为相关评估奠定基础。

Comments Int J CARS (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08430 2026-07-09 cs.MA math.DS q-bio.PE 版本更新 50%

A Hybrid ABM-PDE Framework for Real-World Infectious Disease Simulations

一种用于现实世界传染病模拟的混合 ABM-PDE 框架

Kristina Kehrer, Tim O. F. Conrad

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究提出将 ABM 与 PDE 模型结合的混合建模方法用于传染病模拟,以降计算复杂度。通过耦合机制保证一致性,用真实数据评估,该模型能捕捉核心动态且高效模拟,为传染病建模提供了强大且计算高效的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06134 2026-07-08 cs.CR 新提交 50%

Poster: Mind the Gap -- Characterizing the Temporal Blind Spot Between GSB and DNS Resolution

海报:注意差距——刻画谷歌安全浏览(GSB)与域名系统(DNS)解析之间的时间盲点

Tomer Gal, Fujiao Ji, Doowon Kim, Harel Israel Berger

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 研究刻画谷歌安全浏览与DNS解析间时间差距,通过数据包捕获分析发现约79%测量有正时间差距,DNS响应滞后,复杂解析中或有安全隐患,为研究浏览器安全机制中基于时间的风险及缓解措施奠定基础。

Comments To appear in the proceedings of the 23rd Conference on Detection of Intrusions and Malware & Vulnerability Assessment (DIMVA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03792 2026-07-07 cs.RO cs.CV 新提交 50%

From Region Arrival to Instance-Level Grounding in Vision-and-Language Navigation

从视觉语言导航中的区域到达到实例级定位

Xiangyu Shi, Ruoxi Yang, Wei Tao, Jiwen Zhang, Yanyuan Qiao, Qi Wu

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Ruyi Dynamics(如意动力) Fudan University(复旦大学) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究视觉语言导航中当前评估协议局限,提出‘最后3米定位差距’及指标,构建REALM模块和REVERIE - AIM数据集,可减少过早终止,提升定位精度和视觉定位成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08828 2026-07-07 cs.NI eess.SP 版本更新 50%

Mobile Base Station Optimal Tour in Wide Area IoT Sensor Networks

广域物联网传感器网络中的移动基站最优巡回

Sachin Kadam

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对广域物联网传感器网络,提出移动基站最优巡回(MOT)问题,通过形式化建模为组合优化问题,因计算难设计多项式时间贪婪启发式算法,模拟结果显示算法能低成本、全覆盖且快速执行。

Comments Accepted for publication at the Proceedings of SPCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01460 2026-07-03 cs.CY cs.SI 新提交 50%

Social-Annotate: Self-Healing Browser Extension to Annotate and Collect Social Media Data

Social-Annotate: 用于标注和收集社交媒体数据的自愈浏览器扩展

Ali Najafi, Ismail Uluturk, Onur Varol

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出Social-Annotate浏览器扩展,通过注入可定制表单实现在线平台直接数据收集,并集成大语言模型驱动的自愈代理以应对界面变化,支持12个平台,降低数据收集和维护成本。

Comments 13 pages, 3 figures, 1 SI-table, 2 SI-figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01454 2026-07-03 cs.RO 新提交 50%

SE(2) Navigation Mesh

SE(2)导航网格

Shuyang Shi, Kaixian Qu, Changan Chen, Ines Kast, Yuntao Ma, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich(苏黎世联邦理工学院机器人系统实验室)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出SE(2)导航网格,通过编码偏航依赖的可通行性,支持非圆形机器人在复杂多层环境中的高效路径规划,并开发了A*-拉绳-A*分层路径搜索策略。

Comments Project page: https://se2-navmesh.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18803 2026-07-03 cs.RO 版本更新 50%

Learning to Localize Reference Trajectories in Image-Space for Visual Navigation

学习在图像空间中定位参考轨迹用于视觉导航

Finn Lukas Busch, Matti Vahs, Quantao Yang, Jesús Gerardo Ortega Peimbert, Yixi Cai, Jana Tumova, Olov Andersson

机构 * Division of Robotics, Perception, and Learning(机器人、感知与学习 division) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出LoTIS模型,通过定位参考轨迹在机器人当前视图中的图像坐标,实现无需相机标定、位姿或机器人特定训练的跨实体视觉导航,在正向导航中成功率提升20-50个百分点,达到94-98%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00709 2026-07-02 cs.NI 新提交 50%

Mobile Base Station Positioning in Smart Ports Based on Kriged Sparse Measurements and Obstacle Inference

基于克里金稀疏测量与障碍推断的智慧港口移动基站定位

Paulo Furtado Correia, André Coelho, Manuel Ricardo

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 提出DOCKING框架,利用普通克里金法重建无线环境图并推断障碍物模型,实现移动集成接入与回传部署优化,在稀疏测量下达到高精度与容量增益。

Comments 15 pages, 14 figures. Submitted to IEEE Open Journal of the Communications Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29991 2026-06-30 cs.IR 50%

Behind the Content: Wikipedia Mobile Views and Tourism Activity

内容背后:维基百科移动端浏览量与旅游活动

Lucas Eustache, Paul Favier

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究利用维基百科移动端浏览量作为高频、可解释的旅游活动指标,发现其与当日酒店需求和景点访客量正相关,优于桌面端浏览量。

Journal ref 31e Conf{é}rence de l'Association Information et Management, Association Information et Management, May 2026, Neuch{â}tel, Switzerland

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29566 2026-06-30 cs.RO 50%

Analyzing Uncertainty in the Spatial Representation of the Kinematic Bicycle Model

分析运动学自行车模型空间表示中的不确定性

Shafayat Abrar, M. Zaeem Baig, Shahir Ul Islam Anzal, Abdul Basit Memon

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对车辆运动学模型中的不确定性,采用泰勒级数线性化三角函数,推导了协方差矩阵的闭式表达式,与蒙特卡洛模拟吻合,首次完整给出了协方差矩阵的闭式解。

Journal ref In 2025 International Conference on Emerging Technologies in Electronics, Computing, and Communication (ICETECC) (pp. 1-6). IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05377 2026-06-30 cs.RO cs.CV 50%

OpenFrontier: General Navigation with Visual-Language Grounded Frontiers

OpenFrontier: 基于视觉-语言基础的通用导航

Esteban Padilla-Cerdio, Boyang Sun, Marc Pollefeys, Hermann Blum

机构 * ETH Zurich(苏黎世联邦理工学院) Microsoft Spatial AI Lab(微软空间人工智能实验室) University of Bonn(波恩大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出OpenFrontier框架,通过稀疏子目标识别与到达问题实现高效导航,无需任务特定训练或微调,适用于多种视觉-语言先验模型,展示零样本性能和真实机器人部署效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10310 2026-06-30 cs.CV 50%

Efficient-VLN: A Simple yet Strong Baseline for Efficient Vision-Language Navigation

Efficient-VLN: 一种高效且强大的视觉语言导航基线

Duo Zheng, Shijia Huang, Yanyang Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13561 2026-06-30 cs.CR 50%

GuardianPWA: Enhancing Security Throughout the Progressive Web App Installation Lifecycle

GuardianPWA: 提升渐进式Web应用安装生命周期的安全性

Mengxiao Wang, Guofei Gu

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出GUARDIANPWA框架,基于CIA原则分析PWA安装机制,发现203处安全违规,揭示浏览器厂商在PWA安装生命周期中的隐私风险,并帮助开发者提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27871 2026-06-29 cs.RO 新提交 50%

LocalNav: Distilling Frontier VLMs and Embodied RL for On-Device Object Goal Navigation

LocalNav: 蒸馏前沿视觉语言模型与具身强化学习用于设备端物体目标导航

Nicolas Baumann, Liam Boyle, Pu Deng, Edoardo Ghignone, Boyang Sun, Marc Pollefeys, Luca Benini, Michele Magno

机构 * Center for Project-Based Learning(项目学习中心) Integrated Systems Laboratory(集成系统实验室)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出蒸馏策略将大型VLM的空间语义推理迁移至轻量级本地VLM,结合E-RLVR与令牌生成正则化,在嵌入式设备上实现低延迟物体目标导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09241 2026-06-29 cs.CV cs.RO 版本更新 50%

RAE-NWM: Navigation World Model in Dense Visual Representation Space

RAE-NWM:密集视觉表示空间中的导航世界模型

Mingkun Zhang, Wangtian Shen, Fan Zhang, Haijian Qin, Zihao Pei, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) University of Rochester(罗切斯特大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出RAE-NWM,在密集视觉表示空间中使用条件扩散Transformer建模导航动态,提升结构稳定性和动作精度,从而改善下游规划与导航。

Comments Code is available at: https://github.com/20robo/raenwm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12501 2026-06-26 cs.NI 版本更新 50%

Collaborative Charging Optimization for Wireless Rechargeable Sensor Networks via Heterogeneous Mobile Chargers

异构移动充电器协同优化无线可充电传感器网络充电

Jianhang Yao, Hui Kang, Geng Sun, Jiahui Li, Hongjuan Li, Jiacheng Wang, Yinqiu Liu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对无线可充电传感器网络能量受限问题,提出异构移动充电架构,结合无人机与地面智能车协同充电,并设计IHATRPO算法优化充电效率,显著降低节点死亡率。

Comments 16 pages, 52 figures, submitted to IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25119 2026-06-25 cs.RO 新提交 50%

SurveilNav: Collaborative Object Goal Navigation with Robot and Surveillance System

SurveilNav: 机器人与监控系统协同的目标导航

Ming-Ming Yu, Qunbo Wang, Rongtao Xu, Yanghong Mei, Yirong Yang, Longteng Guo, Wenjun Wu, Jing Liu

机构 * Beihang University(北京航空航天大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Jiaotong University(北京交通大学) ATeam University of Chinese Academy of Sciences(中国科学院大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出SurveilNav框架,通过主动摄像头调度、联合2D/3D建图、基于VLM的价值估计和协同目标验证,融合机器人动态局部感知与监控全局视图,在HM3D数据集上实现领先的探索效率和导航成功率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24525 2026-06-24 cs.CV 新提交 50%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08766 2026-06-24 physics.flu-dyn 版本更新 50%

Optimal navigation in two-dimensional flows: Control theory and reinforcement learning

二维流动中的最优导航:控制理论与强化学习

Vladimir Parfenyev

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究在二维流动中,受平流和自推进的智能体(如漂浮无人机)的最小时间路径问题,利用最优控制理论求解,并应用强化学习(Q学习和演员-评论家算法)设计鲁棒导航策略,在规则流中接近最优解,在湍流中偏差增大,且粗粒化训练可泛化至全流场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21216 2026-06-23 cs.RO 新提交 50%

A scalar per patch from pre-trained ViTs enables fast moving navigation in the real world

来自预训练ViT的每补丁标量实现现实世界快速移动导航

Steeven Janny, Leonid Antsfeld, Christian Wolf

机构 * NaverLabs Europe(NaverLabs欧洲)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 通过大规模真实世界导航实验,研究预训练视觉编码器在机器人导航中的关键组件,提出异构多教师蒸馏和瓶颈策略,发现可解释特征与可供性关联,并证明仅用RGB训练非最优。

Comments European Conference on Computer Vision -- ECCV 2026

Journal ref European Conference on Computer Vision -- ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20755 2026-06-23 cs.RO 新提交 50%

UNSEEN: Uncertainty-aware Navigation via Sparse Estimation in Unknown Environments

UNSEEN: 未知环境中基于稀疏估计的不确定性感知导航

Tommaso Faraci, Marco Camurri, Daniele Fontanelli, Luigi Palopoli

机构 * University of Trento(特伦托大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出UNSEEN框架,仅用前视相机通过稀疏地图与位姿不确定性估计,联合优化任务进度与估计精度,在未知环境中实现鲁棒导航,相比现有方法定位误差降低9.8%,估计精度提升45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22219 2026-06-23 physics.soc-ph 新提交 50%

Lost in Aggregation: A Multi-Scale Diagnostic Benchmark for LLM Spatial Navigation

迷失在聚合中:LLM空间导航的多尺度诊断基准

Yuhan jiang, Peng Luo, Liqiu Meng

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出多尺度诊断基准,将迷宫导航分解为局部、节点和全局三个认知层次,评估LLM在空间推理中的失败位置,发现跨尺度聚合是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏