arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 13974 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 13974 篇

2403.00076 2024-03-04 cs.RO 84%

Navigation and Control of Unconventional VTOL UAVs in Forward-Flight with Explicit Wind Velocity Estimation

Mitchell Cohen, James Richard Forbes

专题命中 具身导航 :navigation(title,abstract);robotics(abstract,comments);分类 cs.RO

Comments 8 pages, 7 figures, published in Robotics and Automation Letters

Journal ref IEEE Robotics and Automation Letters, vol. 5, no. 2, pp. 1151-1158, June 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09864 2023-09-20 cs.AI 84%

Learning Spatial and Temporal Hierarchies: Hierarchical Active Inference for navigation in Multi-Room Maze Environments

Daria de Tinguy, Toon Van de Maele, Tim Verbelen, Bart Dhoedt

专题命中 具身导航 :navigation(title,abstract);world model(abstract,comments);分类 cs.AI;robotics(comments)

Comments IROS 2023 Workshop World Models and Predictive Coding in Cognitive Robotics. arXiv admin note: text overlap with arXiv:2306.13546

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.12071 2022-08-03 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 84%

WayFAST: Navigation with Predictive Traversability in the Field

Mateus Valverde Gasparino, Arun Narenthiran Sivakumar, Yixiao Liu, Andres Eduardo Baquero Velasquez, Vitor Akihiro Hisano Higuti, John Rogers, Huy Tran, Girish Chowdhary

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV;robotics(comments)

Comments Project website with code and videos: https://mateusgasparino.com/wayfast-traversability-navigation/ Published in the IEEE Robotics and Automation Letters (RA-L, 2022) Accepted for presentation in the 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
1911.03098 2022-06-08 cs.RO 84%

Building an Aerial-Ground Robotics System for Precision Farming: An Adaptable Solution

Alberto Pretto, Stéphanie Aravecchia, Wolfram Burgard, Nived Chebrolu, Christian Dornhege, Tillmann Falck, Freya Fleckenstein, Alessandra Fontenla, Marco Imperoli, Raghav Khanna, Frank Liebisch, Philipp Lottes, Andres Milioto, Daniele Nardi, Sandro Nardi, Johannes Pfeifer, Marija Popović, Ciro Potena, Cédric Pradalier, Elisa Rothacker-Feder, Inkyu Sa, Alexander Schaefer, Roland Siegwart, Cyrill Stachniss, Achim Walter, Wera Winterhalter, Xiaolong Wu, Juan Nieto

专题命中 具身导航 :robotics(title,comments);navigation(abstract);robotic(abstract);分类 cs.RO

Comments Published in IEEE Robotics & Automation Magazine, vol. 28, no. 3, pp. 29-49, Sept. 2021

Journal ref IEEE Robotics & Automation Magazine, vol. 28, no. 3, pp. 29-49, Sept. 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05443 2022-05-03 cs.RO cs.HC 84%

A Protocol for Validating Social Navigation Policies

Sören Pirk, Edward Lee, Xuesu Xiao, Leila Takayama, Anthony Francis, Alexander Toshev

专题命中 具身导航 :navigation(title,abstract);robotics(abstract,comments);分类 cs.RO

Comments IEEE International Conference on Robotics and Automation; Workshop: Social Robot Navigation: Advances and Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.10331 2021-09-10 cs.RO 84%

A Self-Guided Approach for Navigation in a Minimalistic Foraging Robotic Swarm

Steven Adams, Daniel Jarne Ornia, Manuel Mazo

专题命中 具身导航 :navigation(title);robotic(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.11911 2020-10-23 cs.RO eess.SP 84%

Source localization using particle filtering on FPGA for robotic navigation with imprecise binary measurement

Adithya Krishna, André van Schaik, Chetan Singh Thakur

专题命中 具身导航 :navigation(title);robotic(title);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26839 2026-08-10 cs.RO cs.CV 版本更新 84%

Ordinal Neural Collapse as a Representation Prior for Visual Navigation

序数神经坍缩作为视觉导航的表征先验

E-In Son, Jung-Taak Kim, Seung-Woo Seo

机构 * Seoul National University(首尔大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对视觉模仿学习中编码器学习到模糊、动作无关表征的问题,提出ORION方法,利用导航动作的序数结构显式组织表征空间,在仿真和真实环境中显著提升导航成功率。

Comments 27 pages, 14 figures. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27577 2026-08-04 cs.CV cs.RO 版本更新 84%

Structured Observation Language for Efficient and Generalizable Vision-Language Navigation

结构化观察语言用于高效且通用的视觉-语言导航

Daojie Peng, Fulong Ma, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SOL-Nav框架,通过将视觉观察转化为结构化语言描述,提升视觉-语言导航的效率和泛化能力,实验表明其在减少模型规模和训练数据依赖方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16366 2026-07-21 cs.RO cs.AI 新提交 84%

PRISM: Multimodal Terrain Mapping for Rover Navigation in Unstructured Environments

PRISM:非结构化环境中用于漫游车导航的多模态地形映射

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * SnT, University of Luxembourg(卢森堡大学安全、可靠性和信任跨学科中心) Department of Automation and Systems Engineering, Universidad de Málaga, Andalucía Tech(马拉加大学自动化与系统工程系,安达卢西亚技术大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对非结构化环境中漫游车导航问题,提出PRISM多模态感知系统,利用定制传感器套件和OmniUnet网络,经新数据集验证及现场实验,可在资源受限设备上高效生成可通行性地图,实现漫游车自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12630 2026-07-20 cs.RO cs.CV 版本更新 84%

Instance-Enriched Semantic Maps for Visual Language Navigation

用于视觉语言导航的实例增强语义地图

Jiho Hong, Eunae Kang, Sanghyun Kim, Young-Sik Shin

机构 * Department of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程系) Advanced Institutes of Convergence Technology (AICT)(融合技术高级研究院) School of Mechanical Engineering, Kyungpook National University(庆北国立大学机械工程学院)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 研究视觉语言导航问题,提出实例增强语义地图框架,通过实例级二维半丰富信息映射、基于大语言模型的鲁棒查询处理和存储高效的语义表示,提升导航性能,在相关实验中取得优于基线的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13624 2026-07-16 cs.RO cs.AI 新提交 84%

From Language to Navigation Goals: A Vision-Language Approach for Semantic Navigation of Mobile Robots Using RGB-D Perception

从语言到导航目标:一种使用RGB-D感知的移动机器人语义导航的视觉-语言方法

Jose Martínez-Fajardo, Pablo Pueyo, Fernando Caballero, Luis Merino

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究如何让移动机器人根据自然语言请求进行语义导航,提出基于ROS 2组件的语言驱动导航框架,能识别目标、估计位置并生成导航目标,经仿真和实际场景评估,证明该框架可实现直观人机交互。

Comments 8 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13245 2026-07-16 cs.CV cs.RO 新提交 84%

Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics

即时场景图增长:应对长期机器人感知饱和

Yue Chang, Rufeng Chen, Yifan Tian, Dazhi Huang, Zhaofan Zhang, Yi Chen, Wenze Zhang, Li Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 具身导航 :robotics(title);embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对长期机器人任务中传统3D场景图构建方式导致感知饱和的问题,提出JITOMA闭环框架,利用任务热图过滤观察、大语言模型解析意图动态唤醒锚点,经JITOMA-Bench评估,该框架有效减小图大小和延迟,保持处理时间稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16806 2026-07-07 cs.AI cs.RO 版本更新 84%

Insect-inspired Visual Point-goal Navigation

一种高效的昆虫启发式方法用于视觉点目标导航

Yihe Lu, Barbara Webb

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于昆虫大脑结构的新型视觉点目标导航模型,通过模拟昆虫的联想学习和路径整合能力,实现高效导航。

Comments This work has been submitted for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31071 2026-07-01 cs.CV cs.RO 新提交 84%

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation

层次化3D场景图构建与基于信念的语义导航规划

Bing Wu, Zuyao Chen, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 提出零样本语义导航框架,通过在线维护层次化3D场景图(HSG)实现多粒度语义拓扑,并基于信念规划进行有限视野推演,在长距离导航中显著提升成功率与路径效率。

Comments Camera-ready version accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29908 2026-06-30 cs.RO cs.AI 84%

Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation

沉思之道:面向具身导航的空间感知世界动作模型

Hong Chen, Daqi Liu, Zehan Zhang, Haiguang Wang, Tianhao Lu, Longfei Yan, Haiyang Sun, Fangzhen Li, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Yihua Tan

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.AI

AI总结 提出SWAM,一种任务中心联合观测-动作生成框架,通过单次推理同时生成中间RGB-D序列和对应动作轨迹,解决现有世界模型规划器依赖候选、计算开销大和动作-视觉不一致的问题,在成功率、轨迹精度和推理效率上显著超越两阶段方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25206 2026-06-25 cs.RO cs.AI cs.CL 新提交 84%

RAVEN: Long-Horizon Reasoning & Navigation with a Visuo-Spatio-Temporal Memory

RAVEN: 基于视觉-空间-时间记忆的长期推理与导航

Yixun Hu, Zhicheng Zheng, Lihan Zha, Chunwei Xing, Rajdeep Singh, Omar Hossain, Antonio Loquercio, Dhruv Shah

机构 * Princeton University(普林斯顿大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出RAVEN记忆系统,通过存储视觉嵌入与位姿时间信息,实现长期机器人问答与导航,在多个基准上超越字幕记忆系统,以10倍更低检索成本匹配前沿VLM。

Comments Project website: https://ravenmem.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17473 2026-06-24 cs.CV cs.AI 版本更新 84%

Dual-Anchoring: Addressing State Drift in Vision-Language Navigation

双锚定:解决视觉语言导航中的状态漂移问题

Kangyi Wu, Pengna Li, Kailin Lyu, Xi Lin, Lin Zhao, Qingrong He, Jinjun Wang, Jianyi Liu

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Johns Hopkins University(约翰霍普金斯大学) Joy Future Academy, JD(京东探索研究院)

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 提出双锚定框架,通过指令进度锚定和记忆地标锚定分别解决进度漂移和记忆漂移,显著提升长场景导航成功率。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15505 2026-06-23 cs.RO cs.CV cs.HC 84%

Unveiling the Potential of iMarkers: Invisible Fiducial Markers for Advanced Robotics

揭示iMarkers的潜力:用于高级机器人的隐形标志物

Ali Tourani, Deniz Isinsu Avsar, Hriday Bavle, Jose Luis Sanchez-Lopez, Jan Lagerwall, Holger Voos

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组,安全、可靠性与信任跨学科中心(SnT),卢森堡大学) Faculty of Science, Technology, and Medicine, University of Luxembourg(科学、技术与医学学院,卢森堡大学) Department of Physics & Materials Science, University of Luxembourg(物理与材料科学系,卢森堡大学) Institute for Advanced Studies, University of Luxembourg(先进研究学院,卢森堡大学)

专题命中 具身导航 :robotics(title,abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出iMarkers,一种隐形标志物,可被机器人和AR设备检测,解决了传统标志物影响视觉美观的问题,展示了其在机器人应用中的灵活性和有效性。

Comments 19 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20045 2026-06-19 cs.CV cs.AI 新提交 84%

See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View

See-and-Reach: 视场内的精确视觉语言导航用于无人机

Fanfu Xue, En Yu, Yantian Shen, Zhikun Hu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

机构 * School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) School of Artificial Intelligence, Shandong University(山东大学人工智能学院) School of Computer Science and Artificial Intelligence, Shandong Normal University(山东师范大学计算机科学与人工智能学院) Interdisciplinary Research Center of General Artificial Intelligence, Shandong Normal University(山东师范大学通用人工智能跨学科研究中心)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 针对无人机视觉语言导航中目标可见后精确到达能力评估不足的问题,提出UAV-VLN-FOV任务和3DG-VLN框架,通过动态3D方向线索增强细粒度视觉定位与空间对齐,在基准和真实实验中显著提升成功率。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 84%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12603 2026-06-12 cs.RO cs.AI 新提交 84%

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

从模仿到对齐:面向长距离人行道导航的人类偏好流策略

Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03175 2026-06-04 cs.CV cs.RO 84%

Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation

在值得时询问:面向实例目标导航的成本感知开放式交互

Xunyi Zhao, Sihao Lin, Gengze Zhou, Zerui Li, Shijie Li, Wei Tao, Jiajun Liu, Qi Wu

机构 * Adelaide University(阿德莱德大学) Responsible AI Research Centre, Australian Institute for Machine Learning(负责任人工智能研究中心,澳大利亚机器学习研究所) Institute for Infocomm Research (I2R), A*STAR(信息与通信研究院(I2R),A*STAR) iMotion CSIRO Data61 Project Website(CSIRO Data61项目网站)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 针对实例目标导航中语言歧义问题,提出一种成本敏感的不确定性减少方法,通过信息增益分析确定有效问题类型,并构建基准测试和加权成功率指标,实现零样本MLLM导航器仅在预期收益大于成本时查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.05946 2026-06-04 cs.RO cs.CV cs.SY eess.SY 84%

Depth map estimation methodology for detecting free-obstacle navigation areas

用于自由障碍区域检测的深度图估计方法

Sergio Trejo, Karla Martinez, Gerardo Flores

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种基于视觉的方法,利用立体相机和一维LiDAR估计四旋翼导航中的自由障碍区域。通过加权最小二乘滤波器过滤深度图,并通过卡尔曼滤波算法融合信息,确定四旋翼可通过的足够大自由空间区域。整个过程在Jetson TX2嵌入式计算机上用ROS实现。

Journal ref ICUAS'19 The 2019 International Conference on Unmanned Aircraft Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01313 2026-06-02 cs.RO cs.AI 84%

PSG-Nav: Probabilistic Scene Graph Navigation via Multiverse Decision Making

PSG-Nav: 通过多元宇宙决策的概率场景图导航

Rufeng Chen, Yue Chang, Xiaqiang Tang, Hechang Chen, Sihong Xie

机构 * Tsinghua University(清华大学)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 提出PSG-Nav方法,通过构建3D概率场景图并利用多元宇宙决策从联合分布中采样最可能的世界设置,以处理开放词汇导航中的感知不确定性,并引入证据经验校准器实现在线终身适应,在多个基准上取得最新最优结果。

Comments 21 pages, 7 figures. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19634 2026-05-20 cs.CV cs.AI 84%

P2DNav: Panorama-to-Downview Reasoning for Zero-shot Vision-and-Language Navigation

P2DNav: 全景到俯视视角的零样本视觉-语言导航

Kai Sheng, Liuyi Wang, Haojie Dai, Jinlong Li, Yongrui Qin, Zongtao He, Chengju Liu, Qijun Chen

机构 * Department of Control Science and Engineering, Tongji University(控制科学与工程系,同济大学)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 本文提出P2DNav框架,通过全景到俯视视角的分解、滑动窗口对话记忆和反思重新定位机制,解决零样本视觉-语言导航中的方向推理与局部定位问题,实验表明其在R2R-CE基准上性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02759 2026-05-19 cs.RO cs.CV 84%

DynoSLAM: Dynamic SLAM with Generative Graph Neural Networks for Real-World Social Navigation

DynoSLAM:基于生成图神经网络的动态SLAM用于现实世界的社交导航

Danil Tokhchukov, Veronika Morozova, Gonzalo Ferrer

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出DynoSLAM,通过整合社交感知图神经网络,解决动态环境中SLAM的不确定性问题,提升机器人在拥挤环境中的导航能力。

Comments Code & Project page at https://github.com/makriot/dynoslam

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15964 2026-05-18 cs.RO cs.CV 84%

WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation

WorldVLN: 用于空域视觉-语言导航的自回归世界动作模型

Baining Zhao, Jiacheng Xu, Weicheng Feng, Xin Zhang, Zhaolu Wang, Haoyang Wang, Shilong Ji, Ziyou Wang, Jianjie Fang, Zhiheng Zheng, Weichen Zhang, Yu Shang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学) Shandong University(山东大学) Manifold AI Beijing Institute of Technology(北京理工大学) Northeastern University(东北大学)

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 WorldVLN提出一种自回归世界动作模型,通过预测潜在世界演变并生成可执行的航点动作,提升空域视觉-语言导航性能,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06223 2026-05-18 cs.AI cs.RO 84%

ProCompNav: Proactive Instance Navigation with Comparative Judgment for Ambiguous User Queries

ProCompNav:基于比较判断的主动实例导航

Junhyuk Kwon, Seungjoon Lee, Hyejin Park, Kyle Min, Jungseul Ok

机构 * GSAI, POSTECH(POSTECH人工智能研究所) CSE, POSTECH(POSTECH计算机科学与工程系) Oracle(Oracle公司)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 ProCompNav通过两阶段框架解决用户查询歧义问题,通过比较判断逐步缩小候选集,提升导航成功率并减少用户响应长度。

Comments Project page: https://tree-jhk.github.io/procompnav/ . Code: https://github.com/tree-jhk/procompnav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14253 2026-05-15 cs.CV cs.LG 84%

Towards Real-Time Autonomous Navigation: Transformer-Based Catheter Tip Tracking in Fluoroscopy

实时自主导航:基于变压器的导管尖端追踪在荧光摄影中

Harry Robertshaw, Yanghe Hao, Weiyuan Deng, Benjamin Jackson, S. M. Hadi Sadati, Nikola Fischer, Tom Vercauteren, Alejandro Granados, Thomas C. Booth

机构 * Surgical & Interventional Engineering School of Biomedical Engineering & Imaging Sciences Kings College London(生物医学工程与成像科学学院手术与介入工程系伦敦国王学院) School of Engineering & Materials Science Queen Mary London(工程与材料科学学院女王玛丽学院伦敦)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种实时导管尖端追踪方法,通过多线程管道和深度学习分割模型,在荧光摄影中实现高精度追踪,优于现有方法。

Comments Harry Robertshaw and Yanghe Hao contributed equally to this work. Published in the International Journal of Computer Assisted Radiology and Surgery

Journal ref Int J CARS (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏