arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3172 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 109 篇

2603.27577 2026-08-04 cs.CV cs.RO 版本更新 50%

Structured Observation Language for Efficient and Generalizable Vision-Language Navigation

结构化观察语言用于高效且通用的视觉-语言导航

Daojie Peng, Fulong Ma, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出SOL-Nav框架,通过将视觉观察转化为结构化语言描述,提升视觉-语言导航的效率和泛化能力,实验表明其在减少模型规模和训练数据依赖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20429 2026-08-03 stat.AP 版本更新 50%

Design and Validation of a Grid-based Home Detection via Stay-Time (GHOST) Software for Mobile Location Data

基于停留时间的网格化家庭检测(GHOST)软件的设计与验证:用于移动定位数据

Alessandra Recalde, Mustafa Sameen, Xiaojian Zhang, Xilei Zhao

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本研究提出了一种基于网格和停留时间的家庭检测算法GHOST,通过定制的空间和时间过滤器识别最频繁访问的夜间或周末白天网格单元,以推断代理家庭位置,并在大规模数据集上验证其在噪声数据中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18426 2026-07-30 cs.RO 版本更新 50%

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10348 2026-07-30 cs.RO 版本更新 50%

Semantic Evidence Regulation via Relational Bias for Zero-Shot Object Navigation

通过关系归纳偏差重新思考具身导航

Weitao An, Chenghao Xu, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) School of Information Science and Engineering, Hohai University(河海大学信息科学与工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出DB-Nav框架,利用激活偏置和抑制偏置双关系偏置重塑搜索空间,通过关系激活-抑制探索图调节前沿探索,显著提升目标导航成功率和路径效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15284 2026-07-30 cs.CV 版本更新 50%

Walk through Paintings: Egocentric World Models from Internet Priors

穿越绘画:来自互联网先验的自我中心世界模型

Anurag Bagchi, Zhipeng Bao, Homanga Bharadhwaj, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究机构)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21409 2026-07-29 cs.RO 版本更新 50%

DSCD-Nav: Dual-Stance Cooperative Debate for Object Navigation

DSCD-Nav: 双视角协作辩论用于物体导航

Weitao An, Qi Liu, Chenghao Xu, Jiayi Chai, Xu Yang, Kun Wei, Cheng Deng

机构 * School of Electronic Engineering, Xidian University, Xi' an 710071, China.(西安电子科技大学电子工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 DSCD-Nav通过双视角协作辩论机制提升机器人在部分可观测环境中的导航可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10577 2026-07-28 cs.RO 版本更新 50%

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav:零样本视觉与语言导航作为工具调用框架

Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 GUI与网页智能体 :agentic(abstract)

AI总结 提出AgenticNav,通过将动作、深度和记忆作为可调用工具暴露给VLM,实现零样本连续环境导航,在R2R-CE基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20801 2026-07-24 cs.RO quant-ph 版本更新 50%

Q-SpiRL: Quantum Spiking Reinforcement Learning for Adaptive Robot Navigation

Q-SpiRL:量子脉冲强化学习用于自适应机器人导航

Mohamed Khair Altrabulsi, Nouhaila Innan, Alberto Marchisio, Muhammad Kashif, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University Abu Dhabi (NYUAD)(eBRAIN实验室,工程系,纽约大学阿布扎比分校) Center for Quantum and Topological Systems (CQTS), NYUAD Research Institute(量子与拓扑系统中心(CQTS),NYUAD研究机构)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出Q-SpiRL框架,结合量子增强的脉冲神经网络,实现了在动态环境中高效稳定的机器人导航,通过实验验证了其在任务完成、轨迹效率和运动平滑度之间的最佳平衡。

Comments Accepted at the IEEE International Conference on Quantum Computing and Engineering (QCE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05442 2026-07-23 cs.DM 版本更新 50%

Broadcast via Mobile Agents in a Dynamic Network: Interplay of Graph Properties & Agents

动态网络中通过移动代理进行广播:图属性与代理的相互作用

William K. Moses, Amanda Redlich, Frederick Stock

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 重新审视动态网络中广播问题,原研究认为边密度是区分解决问题所需代理数量的关键属性,本文通过构造不同边密度的图及算法,表明边密度并非正确区分属性,揭示其与代理数量关系较弱。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23509 2026-07-21 cs.RO 版本更新 50%

Logic-Guided Socially-aware Robot Navigation World Model

逻辑引导的社会感知机器人导航世界模型

Weizheng Wang, Obi Ike, Soyun Choi, Sungeun Hong, Aniket Bera, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。

Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13154 2026-07-20 cs.RO 版本更新 50%

Worlds in One Demo: A Synthetic Data Engine for Learning Open-World Mobile Manipulation

世界合一演示:用于学习开放世界移动操作的合成数据引擎

Lingxiao Guo, Huanyu Li, Guanya Shi

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究如何通过合成数据引擎WANDA从单个演示学习开放世界移动操作策略,利用重建背景、重排交互片段、校正状态扩展等方法,实现长期鲁棒性、空间泛化和跨环境泛化,还支持跨实体数据生成。

Comments Project website: https://wanda.lecar-lab.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12630 2026-07-20 cs.RO cs.CV 版本更新 50%

Instance-Enriched Semantic Maps for Visual Language Navigation

用于视觉语言导航的实例增强语义地图

Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

机构 * Department of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程系) Advanced Institutes of Convergence Technology (AICT)(融合技术高级研究院) School of Mechanical Engineering, Kyungpook National University(庆北国立大学机械工程学院)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究视觉语言导航问题,提出实例增强语义地图框架,通过实例级二维半丰富信息映射、基于大语言模型的鲁棒查询处理和存储高效的语义表示,提升导航性能,在相关实验中取得优于基线的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20001 2026-07-16 econ.TH 版本更新 50%

Allocating Common-Value Goods

分配共同价值物品

Hiroto Sato, Ryo Shirakawa

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文研究了在无货币交易情况下最大化共同价值物品分配的问题,通过机制筛选代理人私有信息并影响其对物品价值的学习,最优机制由两个参数决定,可能排除部分代理人并导致即使所有代理人愿意接收时也 withholding 分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20652 2026-07-15 physics.soc-ph cs.SY eess.SY 版本更新 50%

Mobility-Informed Coupling of ABM, PDE, and ODE Models for Pandemic Simulation in Germany

面向德国大流行模拟的移动性信息耦合ABM、PDE和ODE模型

Kristina Kehrer, Tim O. F. Conrad

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出混合建模框架,耦合高分辨率ABM与PDE/ODE模型,利用手机移动数据实现跨区域个体转移,平衡精度与效率,并在全德仿真中评估旅行限制和防控策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13843 2026-07-14 cs.HC 版本更新 50%

Rethinking the UI of GenUI: A Tale of Two Designs

重新思考GenUI的用户界面:两种设计的故事

Xiang 'Anthony' Chen, Savvas Dimitrios Petridis, Tian Deng, Humad Bari, Ruofei Du, Yang Li

专题命中 GUI与网页智能体 :workflow(abstract)

AI总结 本研究通过对比两种GenUI设计(非结构化深度优先高保真 vs. 结构化广度优先低保真),探讨如何更好地支持早期0到1设计探索,发现结构化输入和广度优先工作流有优势但存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12842 2026-07-14 cs.RO 版本更新 50%

SmoothTurn: Learning to Turn Smoothly for Agile Navigation with Quadrupedal Robots

SmoothTurn: 为四足机器人敏捷导航学习平稳转向

Zunzhi You, Yunke Wang, Haolan Guo, Chang Xu

机构 * School of Computer Science, University of Sydney(悉尼大学计算机科学学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 本文提出SmoothTurn框架,通过引入序列目标到达奖励、扩展观测空间和自动目标课程,使四足机器人在高速运行时实现平稳转向,提升敏捷导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09656 2026-07-14 cs.RO 版本更新 50%

ReMoSPLAT: Reactive Mobile Manipulation Control on a Gaussian Splat

ReMoSPLAT:高斯点云上的反应式移动操作控制

Nicolas Marticorena, Tobias Fischer, Niko Suenderhauf

机构 * QUT Centre For Robotics, School of Electrical Engineering and Robotics at the Queensland University of Technology(昆士兰理工大学机器人中心,电气工程与机器人学学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 研究移动操纵器在不涉及高成本规划下如何利用高斯点云表示避免碰撞,提出基于二次规划公式的ReMoSPLAT反应式控制器,通过模拟实验验证其可行性,性能可媲美依赖完美信息的控制器,并在真实机器人平台进一步验证。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08430 2026-07-09 cs.MA math.DS q-bio.PE 版本更新 50%

A Hybrid ABM-PDE Framework for Real-World Infectious Disease Simulations

一种用于现实世界传染病模拟的混合 ABM-PDE 框架

Kristina Kehrer, Tim O. F. Conrad

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究提出将 ABM 与 PDE 模型结合的混合建模方法用于传染病模拟,以降计算复杂度。通过耦合机制保证一致性,用真实数据评估,该模型能捕捉核心动态且高效模拟,为传染病建模提供了强大且计算高效的替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08828 2026-07-07 cs.NI eess.SP 版本更新 50%

Mobile Base Station Optimal Tour in Wide Area IoT Sensor Networks

广域物联网传感器网络中的移动基站最优巡回

Sachin Kadam

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对广域物联网传感器网络,提出移动基站最优巡回(MOT)问题,通过形式化建模为组合优化问题,因计算难设计多项式时间贪婪启发式算法,模拟结果显示算法能低成本、全覆盖且快速执行。

Comments Accepted for publication at the Proceedings of SPCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18803 2026-07-03 cs.RO 版本更新 50%

Learning to Localize Reference Trajectories in Image-Space for Visual Navigation

学习在图像空间中定位参考轨迹用于视觉导航

Finn Lukas Busch, Matti Vahs, Quantao Yang, Jesús Gerardo Ortega Peimbert, Yixi Cai, Jana Tumova, Olov Andersson

机构 * Division of Robotics, Perception, and Learning(机器人、感知与学习 division) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出LoTIS模型,通过定位参考轨迹在机器人当前视图中的图像坐标,实现无需相机标定、位姿或机器人特定训练的跨实体视觉导航,在正向导航中成功率提升20-50个百分点,达到94-98%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09241 2026-06-29 cs.CV cs.RO 版本更新 50%

RAE-NWM: Navigation World Model in Dense Visual Representation Space

RAE-NWM:密集视觉表示空间中的导航世界模型

Mingkun Zhang, Wangtian Shen, Fan Zhang, Haijian Qin, Zihao Pei, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University(清华大学精密仪器系) University of Rochester(罗切斯特大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出RAE-NWM,在密集视觉表示空间中使用条件扩散Transformer建模导航动态,提升结构稳定性和动作精度,从而改善下游规划与导航。

Comments Code is available at: https://github.com/20robo/raenwm

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12501 2026-06-26 cs.NI 版本更新 50%

Collaborative Charging Optimization for Wireless Rechargeable Sensor Networks via Heterogeneous Mobile Chargers

异构移动充电器协同优化无线可充电传感器网络充电

Jianhang Yao, Hui Kang, Geng Sun, Jiahui Li, Hongjuan Li, Jiacheng Wang, Yinqiu Liu

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 针对无线可充电传感器网络能量受限问题,提出异构移动充电架构,结合无人机与地面智能车协同充电,并设计IHATRPO算法优化充电效率,显著降低节点死亡率。

Comments 16 pages, 52 figures, submitted to IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08766 2026-06-24 physics.flu-dyn 版本更新 50%

Optimal navigation in two-dimensional flows: Control theory and reinforcement learning

二维流动中的最优导航:控制理论与强化学习

Vladimir Parfenyev

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 研究在二维流动中,受平流和自推进的智能体(如漂浮无人机)的最小时间路径问题,利用最优控制理论求解,并应用强化学习(Q学习和演员-评论家算法)设计鲁棒导航策略,在规则流中接近最优解,在湍流中偏差增大,且粗粒化训练可泛化至全流场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17525 2026-06-23 cs.RO 版本更新 50%

HumanHalo -- Safe and Efficient 3D Navigation Among Humans via Minimally Conservative MPC

HumanHalo -- 通过最小保守MPC实现安全高效的三维人群导航

Simon Schaefer, Helen Oleynikova, Sandra Hirche, Stefan Leutenegger

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出HumanHalo框架,结合可达性安全保证与数据驱动人体运动预测,通过仅约束初始控制输入实现安全高效的3D MAV人群导航,在仿真和真实实验中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18313 2026-06-23 cs.CV 版本更新 50%

OmniNWM: Omniscient Driving Navigation World Models

OmniNWM:全知驾驶导航世界模型

Bohan Li, Zhuang Ma, Dalong Du, Baorui Peng, Zhujin Liang, Zhenqiang Liu, Xianda Guo, Zheng Zhu, Chao Ma, Yueming Jin, Xin Jin, Hao Zhao, Wenjun Zeng

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东部技术研究所) PhiGent National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Wuhan University(武汉大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出OmniNWM全知全景导航世界模型,在统一概率框架下处理状态、动作和奖励三个维度,实现多模态全景视频生成、零样本轨迹控制及内在奖励机制,在生成保真度和控制精度上达到SOTA。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16000 2026-06-23 cs.CV 版本更新 50%

SenseExpo: Spatial Exploration and Navigation via Scene Estimation from Expeditious Predictive Operators

SenseExpo: 通过快速预测算子的场景估计进行空间探索与导航

Haojia Gao, Haohua Que, Mingkai Liu, Jiayue Xie, Hoiian Au, Yusen Qin, Qian Zhang, Jiajun Sun, Weihao Shan, Tianle Zhu, Handong Yao, Fei Qiao

机构 * Tsinghua University(清华大学) University of Georgia(佐治亚大学) Peking University(北京大学) D-Robotics(D-机器人) Infinity Robotics(Infinity机器人)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出轻量级单机器人探索框架SenseExpo,结合紧凑地图预测网络与前沿策略,以709K参数实现优于U-Net和LaMa的预测性能,并在探索实验中显著加速目标覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02773 2026-06-16 cs.RO 版本更新 50%

Bimanual High-Density EMG Control for In-Home Mobile Manipulation by Users with Quadriplegia

用于四肢瘫痪用户居家移动操作的双侧高密度肌电控制

Jehan Yang, Eleanor Hodgson, Cindy Sun, Zackory Erickson, Doug Weber

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 针对颈椎脊髓损伤用户,提出双侧高密度肌电(HDEMG)前臂袖套,结合共享自主框架实现实时手势控制移动操作器,经12天居家研究验证日常任务有效性。

Comments 17 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15919 2026-06-16 cs.RO 版本更新 50%

ReMoBot: Retrieval-Based Few-Shot Imitation Learning for Mobile Manipulation with Vision Foundation Models

ReMoBot: 基于检索的少样本模仿学习用于移动操作与视觉基础模型

Yuying Zhang, Wenyan Yang, Francesco Verdoja, Ville Kyrki, Joni Pajarinen

机构 * School of Electrical Engineering, Aalto University, Espoo, Finland(艾尔沃大学电气工程学院,埃斯波,芬兰)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出ReMoBot,一种基于检索的少样本模仿学习框架,利用视觉基础模型从演示中检索信息,解决移动操作任务中的部分可观测性和数据有限问题,在真实世界任务中取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04988 2026-06-16 cs.RO cs.SY eess.SY 版本更新 50%

Intelligent Sailing Model for Open Sea Navigation

公海航行智能航行模型

Hanna Krasowski, Stefan Schärdinger, Murat Arcak, Matthias Althoff

机构 * University of California, Berkeley(加州大学伯克利分校) Technical University of Munich(慕尼黑技术大学)

专题命中 GUI与网页智能体 :planning(abstract)

AI总结 提出首个智能航行模型(ISM),模拟遵守海上交通规则的船舶,结合模型预测控制实现航点跟踪,在交互仿真中达到约97%的目标到达率且无碰撞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01621 2026-06-12 cs.CV cs.RO 版本更新 50%

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Goal2Pixel: 将目标锚定到像素以实现视觉语言导航

Muyi Bao, Yuxin Cai, Hang Xu, Zongtai Li, Jinxi He, Jingfan Tang, Chen Lv, Ji Zhang, Yaqi Xie, Wenshan Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 提出Goal2Pixel范式,通过将连续环境中的视觉语言导航(VLN-CE)重新定义为可导航像素锚定,利用图像平面作为统一空间接口,预测可见导航像素并反投影为3D航点,结合可见性感知关键帧记忆和坐标感知辅助损失,在减少VLM调用次数的同时实现竞争性性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏