arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 13974 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 13974 篇

1307.7494 2026-05-14 cs.AI cs.LO cs.RO 84%

ReAct! An Interactive Tool for Hybrid Planning in Robotics

ReAct! 一种用于机器人混合规划的交互工具

Zeynep Dogmus, Esra Erdem, Volkan Patoglu

机构 * Sabancı University(Sabanci大学)

专题命中 具身导航 :robotics(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 ReAct! 提供了一种交互式工具,使机器人研究人员能够在无需了解底层形式化细节的情况下,通过高级推理解决复杂规划问题,适用于服务机器人和认知工厂等动态领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06974 2026-04-27 cs.RO cs.CV 84%

FeudalNav: A Simple Framework for Visual Navigation

FeudalNav: 一种用于视觉导航的简单框架

Faith Johnson, Bryan Bo Cao, Shubham Jain, Ashwin Ashok, Kristin Dana

机构 * Rutgers University(罗格斯大学) Stony Brook University(石溪大学) Georgia State University(佐治亚州立大学)

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出FeudalNav框架,通过分层结构实现导航决策,利用视觉相似性构建隐空间记忆模块,无需地图即可在新环境中导航,并通过人机交互提升导航性能。

Comments 8 Pages, 6 figures and 4 tables. arXiv admin note: substantial text overlap with arXiv:2411.09893, arXiv:2402.12498

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15076 2026-04-17 cs.RO cs.AI cs.NE 84%

NEAT-NC: NEAT guided Navigation Cells for Robot Path Planning

NEAT-NC:基于生物导航细胞的NEAT引导机器人路径规划

Hibatallah Meliani, Khadija Slimani, Samira Khoulji

机构 * ISI Laboratory, National School of Applied Sciences (ENSA), Abdelmalek Essaadi University(阿德莱尔梅萨迪大学应用科学学院智能研究所) EsieaLab LDR, Higher School of Computer Science, Electronics and Automation (ESIEA)(高等计算机科学、电子与自动化学校)

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出NEAT-NC算法,利用导航细胞和递归神经网络提升动态环境中的路径规划性能,展示其在复杂环境中的适应性。

Comments To appear in short form in Genetic and Evolutionary Computation Conference (GECCO '26), 2026

Journal ref Genetic and Evolutionary Computation Conference (GECCO '26), July 13--17, 2026, San Jose, Costa Rica

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01728 2026-04-17 cs.RO cs.LG cs.LO 84%

Constrained Decoding for Safe Robot Navigation Foundation Models

安全机器人导航基础模型的约束解码

Parv Kapoor, Akila Ganlath, Michael Clifford, Changliu Liu, Sebastian Scherer, Eunsuk Kang

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出SafeDec框架,通过约束解码确保机器人导航基础模型满足信号时间逻辑规范,提升安全性和行动生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12626 2026-04-15 cs.RO cs.CV 84%

Habitat-GS: A High-Fidelity Navigation Simulator with Dynamic Gaussian Splatting

Habitat-GS:一种高保真导航仿真器与动态高斯点云

Ziyuan Xia, Jingyi Xu, Chong Cui, Yuanhong Yu, Jiazhao Zhang, Qingsong Yan, Tao Ni, Junbo Chen, Xiaowei Zhou, Hujun Bao, Ruizhen Hu, Sida Peng

机构 * Zhejiang University(浙江大学) Peking University(北京大学) XGRIDS UDeer AI Shenzhen University(深圳大学)

专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Habitat-GS,通过整合3D高斯点云渲染和可驾驶高斯化身,提升导航仿真的视觉真实性和动态人类建模能力,实验表明其在跨领域泛化和人类感知导航中表现优异。

Comments Project page: https://zju3dv.github.io/habitat-gs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02829 2026-04-06 cs.CV cs.RO 84%

STRNet: Visual Navigation with Spatio-Temporal Representation through Dynamic Graph Aggregation

STRNet:通过动态图聚合实现的时空表示视觉导航

Hao Ren, Zetong Bi, Yiming Zeng, Zhaoliang Wan, Lu Qi, Hui Cheng

机构 * Sun Yat-sen University(中山大学) Insta360 Research(Insta360 研究院) Wuhan University(武汉大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种统一的时空表示框架,通过融合图像序列和目标观测,提升机器人导航的视觉编码能力,改进导航性能并提供通用的视觉骨干网络。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10376 2026-03-18 cs.CV cs.RO 84%

MSGNav: Unleashing the Power of Multi-modal 3D Scene Graph for Zero-Shot Embodied Navigation

MSGNav: 释放多模态3D场景图在零样本具身导航中的潜力

Xun Huang, Shijia Zhao, Yunxiang Wang, Xin Lu, Wanfa Zhang, Rongsheng Qu, Weixin Li, Yunhong Wang, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建智能感知与计算重点实验室) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算重点实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 MSGNav通过多模态3D场景图实现零样本具身导航,引入关键子图选择模块、自适应词汇更新模块和闭环推理模块,解决开放词汇和视觉证据保留问题,实验表明其在GOAT-Bench和HM3D-ObjNav基准上表现优异。

Comments 18 pages, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18546 2026-03-18 cs.RO cs.AI 84%

EfficientNav: Towards On-Device Object-Goal Navigation with Navigation Map Caching and Retrieval

EfficientNav: 面向设备端目标物体导航的导航地图缓存与检索

Zebin Yang, Sunjian Zheng, Tong Xie, Tianshi Xu, Bo Yu, Fan Wang, Jie Tang, Shaoshan Liu, Meng Li

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Integrated Circuits, Peking University(北京大学集成电路学院) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进制造创新中心)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 本文提出EfficientNav,通过语义感知记忆检索和离散记忆缓存技术,在设备端实现零样本目标物体导航,提升成功率并降低规划延迟。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08475 2026-03-10 cs.RO cs.AI 84%

R2F: Repurposing Ray Frontiers for LLM-free Object Navigation

R2F:利用射线前沿进行无需大语言模型的对象导航

Francesco Argenziano, John Mark Alexis Marcelo, Michele Brienza, Abdel Hakim Drid, Emanuele Musumeci, Daniele Nardi, Domenico D. Bloisi, Vincenzo Suriani

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18041 2026-03-03 cs.CV cs.RO 84%

Openfly: A comprehensive platform for aerial vision-language navigation

Openfly:面向空中视觉-语言导航的综合性平台

Yunpeng Gao, Chenhui Li, Zhongrui You, Junli Liu, Zhen Li, Pengan Chen, Qizhi Chen, Zhonghan Tang, Liansheng Wang, Penghui Yang, Yiwen Tang, Yuhang Tang, Shuai Liang, Songyi Zhu, Ziqin Xiong, Yifei Su, Xinyi Ye, Jianan Li, Yan Ding, Dong Wang, Xuelong Li, Zhigang Wang, Bin Zhao

机构 * Shanghai AI Laboratory(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Beihang University(北航) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) East China University of Science and Technology(东华大学) Fudan University(复旦大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) TeleAI

专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 OpenFly平台通过整合多种渲染引擎和自动化工具链,构建大规模空中VLN数据集,并提出关键帧感知的VLN模型,提升户外空中视觉-语言导航的研究与应用。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23224 2026-02-27 cs.CV cs.RO 84%

UniScale: Unified Scale-Aware 3D Reconstruction for Multi-View Understanding via Prior Injection for Robotic Perception

UniScale:通过先验注入实现多视角理解的统一尺度感知3D重建

Mohammad Mahdavian, Gordon Tan, Binbin Xu, Yuan Ren, Dongfeng Bai, Bingbing Liu

专题命中 具身导航 :robotic(title,abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 UniScale通过整合几何先验实现多视角下的统一尺度感知3D重建,适用于机器人感知任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22548 2026-02-26 cs.CV cs.RO 84%

JanusVLN: Decoupling Semantics and Spatiality with Dual Implicit Memory for Vision-Language Navigation

JanusVLN: 通过双隐式记忆解耦语义与空间性用于视觉-语言导航

Shuang Zeng, Dekang Qi, Xinyuan Chang, Feng Xiong, Shichao Xie, Xiaolong Wu, Shiyi Liang, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 JanusVLN通过双隐式记忆解耦语义与空间性,提升视觉-语言导航的性能和效率。

Comments Accepted to ICLR 2026. Project page: https://miv-xjtu.github.io/JanusVLN.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18424 2026-02-23 cs.CV cs.RO 84%

CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation

CapNav:基于能力条件的室内导航基准测试

Xia Su, Ruiqi Chen, Benlin Liu, Jingwei Ma, Zonglin Di, Ranjay Krishna, Jon Froehlich

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 CapNav基准测试评估VLMs在不同移动约束下室内导航能力,发现其性能随约束增加而下降,且先进模型仍难以处理空间推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15864 2026-02-19 cs.RO cs.CV 84%

ReasonNavi: Human-Inspired Global Map Reasoning for Zero-Shot Embodied Navigation

ReasonNavi: 人类启发的全局地图推理用于零样本具身导航

Yuzhuo Ao, Anbang Wang, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Dartmouth College(达特茅斯学院)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 ReasonNavi通过结合多模态大语言模型与确定性规划器,实现人类启发的全局地图推理,提供无需微调的零样本具身导航解决方案。

Comments 18 pages, 6 figures, Project page: https://reasonnavi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01667 2026-02-04 cs.CV cs.RO 84%

What does really matter in image goal navigation?

图像目标导航中真正重要的什么?

Gianluca Monaci, Philippe Weinzaepfel, Christian Wolf

机构 * NAVER LABS Europe(NAVER欧洲实验室)

专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文研究图像目标导航中通过端到端强化学习训练智能体的可行性,并探讨了建筑选择对相对位姿估计器产生和导航性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00551 2026-02-03 cs.RO cs.CV 84%

APEX: A Decoupled Memory-based Explorer for Asynchronous Aerial Object Goal Navigation

APEX:一种解耦的记忆型探索者用于异步空中目标导航

Daoxuan Zhang, Ping Chen, Xiaobo Xia, Xiu Su, Ruichen Zhen, Jianqiang Xiao, Shuo Yang

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Singapore(新加坡国立大学) Central South University(中南大学) Meituan Academy of Robotics(美团机器人研究院)

专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 APEX通过分层异步架构实现高效空中目标导航,提升探索效率与目标识别精度。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13976 2026-01-26 cs.CV cs.RO 84%

FantasyVLN: Unified Multimodal Chain-of-Thought Reasoning for Vision-Language Navigation

FantasyVLN: 一种统一的多模态链式推理框架用于视觉-语言导航

Jing Zuo, Lingzhou Mu, Fan Jiang, Chengcheng Ma, Mu Xu, Yonggang Qi

机构 * Fantasy AIGC Team(幻想AIGC团队) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 FantasyVLN通过统一的隐式推理框架实现视觉-语言导航的实时高效推理,结合多模态信息提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09607 2026-01-16 cs.RO cs.CV 84%

UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories

UrbanNav: 从网络级人类轨迹学习语言引导的城市导航

Yanghong Mei, Yirong Yang, Longteng Guo, Qunbo Wang, Ming-Ming Yu, Xingjian He, Wenjun Wu, Jing Liu

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 UrbanNav通过大规模网络视频数据训练具身智能体,实现基于语言指令的复杂城市导航,展示了在多样城市场景中的高效导航能力。

Comments 9 pages, 5 figures, accepted to AAAI 2026. Project page:https://github.com/CASIA-IVA-Lab/UrbanNav

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08953 2026-01-15 cs.RO cs.AI 84%

Fairness risk and its privacy-enabled solution in AI-driven robotic applications

人工智能驱动机器人应用中的公平性风险及其隐私增强解决方案

Le Liu, Bangguo Yu, Nynke Vellinga, Ming Cao

专题命中 具身导航 :robotic(title,abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于效用的公平性度量标准,用于机器人决策,并分析公平性与隐私的联合关系,通过机器人导航任务验证了隐私预算对公平性的联合影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08665 2026-01-14 cs.RO cs.CV 84%

VLingNav: Embodied Navigation with Adaptive Reasoning and Visual-Assisted Linguistic Memory

VLingNav:基于适应性推理和视觉辅助语言记忆的具身导航

Shaoan Wang, Yuanfei Luo, Xingyu Chen, Aocheng Luo, Dongyue Li, Chang Liu, Sheng Chen, Yangang Zhang, Junzhi Yu

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 VLingNav通过引入适应性推理和视觉辅助语言记忆,实现了复杂具身导航任务中的高效导航与泛化能力。

Comments Project page: https://wsakobe.github.io/VLingNav-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03520 2026-01-08 cs.NE cs.AI cs.RO 84%

A Reinforcement Learning-Based Model for Mapping and Goal-Directed Navigation Using Multiscale Place Fields

基于强化学习的多尺度场所场映射与目标导向导航模型

Bekarys Dukenbaev, Andrew Gerstenslager, Alexander Johnson, Ali A. Minai

机构 * Department of Computer Science, University of Cincinnati(计算机科学系,辛辛那提大学) Department of Electrical and Computer Engineering, University of Cincinnati(电气与计算机工程系,辛辛那提大学)

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于强化学习的多尺度场所场模型,通过多尺度空间表示提升机器人在复杂环境中的导航效率与学习速度。

Comments 11 pages, 8 figures. Submitted to IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24851 2026-01-07 cs.CV cs.RO 84%

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

VLN-MME: 诊断MLLMs作为语言引导的视觉导航代理

Xunyi Zhao, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 VLN-MME通过统一评估框架揭示MLLMs在具身导航任务中的局限性,发现其3D空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18033 2025-12-29 cs.RO cs.AI 84%

OpenNav: Open-World Navigation with Multimodal Large Language Models

OpenNav: 基于多模态大语言模型的开放世界导航

Mingfeng Yuan, Letian Wang, Steven L. Waslander

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究 institute) University of Toronto Robotics Institute(多伦多大学机器人研究所)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 OpenNav利用多模态大语言模型实现开放世界导航,通过生成价值图增强机器人空间理解,并在真实场景中验证其鲁棒性。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05622 2025-12-29 cs.RO cs.AI 84%

CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory

CityNavAgent:基于层次语义规划和全局记忆的空中视觉-语言导航

Weichen Zhang, Chen Gao, Shiquan Yu, Ruiying Peng, Baining Zhao, Qian Zhang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 CityNavAgent通过层次语义规划和全局记忆模块,提升空中视觉-语言导航在复杂城市环境中的导航性能。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11006 2025-12-24 cs.CV cs.AI 84%

Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation

细粒度指令引导的图推理用于视觉-语言导航

Yaohua Liu, Xinyuan Song, Yunfu Deng, Yifan Xie, Binkai Ou, Yan Zhong

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Tsinghua University(清华大学) Innovation and Research and Development Department, BoardWare Information System Company(BoardWare信息系统公司创新与研发部) School of Mathematics, Peking University(北京大学数学学院)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 本文提出细粒度指令引导的图推理框架OIKG,通过解耦角度与视觉提示并增强空间表示,提升视觉-语言导航中指令理解和跨模态对齐能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19024 2025-12-23 cs.RO cs.AI 84%

IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments

IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试

Xu Liu, Yu Liu, Hanshuo Qiu, Yang Qirong, Zhouhui Lian

专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18028 2025-12-23 cs.RO cs.CV 84%

Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation

Embodied4C: 评估具身视觉-语言导航中至关重要的因素

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) UAS Esslingen(埃森嫩大学) TU Wien(维也纳技术大学) Dr. Ing. h.c. F. Porsche AG(保时捷股份有限公司) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 Embodied4C通过三种异构具身评估VLMs的具身能力,发现跨模态对齐和指令微调比规模更重要,而空间和时间推理是可靠具身能力的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14757 2025-12-18 cs.CV cs.RO 84%

SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning

SocialNav-MoE: 一种用于社交合规导航的混合专家视觉语言模型,结合强化微调

Tomohito Kawabata, Xinyu Zhang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 SocialNav-MoE通过混合专家模型和强化微调提升机器人社交合规导航的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09903 2025-12-11 cs.RO cs.CV 84%

YOPO-Nav: Visual Navigation using 3DGS Graphs from One-Pass Videos

YOPO-Nav: 基于单次视频的3DGS图进行视觉导航

Ryan Meegan, Adam D'Souza, Bryan Bo Cao, Shubham Jain, Kristin Dana

机构 * Rutgers University(罗格斯大学) Stony Brook University(石溪大学)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 YOPO-Nav通过单次视频生成3DGS图实现高效视觉导航,结合粗略定位与局部模型优化,适用于真实环境的机器人导航任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00041 2025-12-02 cs.RO cs.CV 84%

VISTAv2: World Imagination for Indoor Vision-and-Language Navigation

VISTAv2:室内视觉与语言导航的世界想象

Yanjia Huang, Xianshun Jiang, Xiangbo Gao, Mingyang Wu, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 具身导航 :navigation(title,abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 VISTAv2通过生成式世界模型实现室内视觉与语言导航的稳健规划,结合动作条件想象和在线价值图融合,提升导航效率与鲁棒性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏