arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-19 至 2026-03-19 共收录 80 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 3 篇

2603.17189 2026-03-19 cs.RO 84%

Influence of Gripper Design on Human Demonstration Quality for Robot Learning

夹具设计对机器人学习中人类示范质量的影响

Gina L. Georgadarellis, Natalija Beslic, Seonhun Lee, Frank C. Sup, Meghan E. Huber

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Department of Mechanical and Industrial Engineering(机械与工业工程系) Elaine Marieb Center for Nursing and Engineering Innovation(Elaine Marieb护理与工程创新中心) Center for Personalized Health Monitoring(个性化健康监测中心) Institute for Applied Life Sciences(应用生命科学研究所)

专题命中 机器人学习 :robot learning(title);robotics(abstract,comments);manipulation(abstract);分类 cs.RO

AI总结 研究评估了不同夹具设计对医疗包装打开任务示范效果的影响,发现集中负载夹具性能优于分散负载夹具,但不如双手,凸显了夹具人体工学和机械优化的重要性。

Comments To be published in proceedings of 2026 IEEE International Conference on Robotics & Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16195 2026-03-19 cs.CV cs.RO 73%

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型

Haodong Yan, Zhide Zhong, Jiaguan Zhu, Junjie He, Weilin Yuan, Wenxuan Song, Xin Gong, Yingjie Cai, Guanyi Zhao, Xu Yan, Bingbing Liu, Ying-Cong Chen, Haoang Li

机构 * The Hong Kong University of Science Technology (Guangzhou) Huawei Foundation Model Department

专题命中 机器人学习 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03818 2026-03-19 cs.LG cs.AI cs.RO 67%

Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning

预训练视觉-语言-动作模型在持续学习中出人意料地表现出遗忘抵抗性

Huihan Liu, Changyeon Kim, Bo Liu, Minghuan Liu, Yuke Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Superintelligence(微软超级智能)

专题命中 机器人学习 :robot policy(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究发现预训练的视觉-语言-动作模型在持续学习中表现出较强的遗忘抵抗性,简单经验回放在这些模型上效果显著,即使数据量小也能实现零遗忘。

Comments Project website: https://continual-vlas.github.io/forget-me-not/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 15 篇

2508.05186 2026-03-19 cs.RO cs.CV 87%

Learning to See and Act: Task-Aware Virtual View Exploration for Robotic Manipulation

学习感知与行动:面向机器人操作的任务感知虚拟视角探索

Yongjie Bai, Zhouxia Wang, Yang Liu, Kaijun Luo, Yifan Wen, Mingtong Dai, Weixing Chen, Ziliang Chen, Lingbo Liu, Guanbin Li, Liang Lin

机构 * Sun Yat-sen University(中山大学) Pengcheng Laboratory(鹏城实验室) Nanyang Technological University(南洋理工大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) X-Era AI Lab(X-Era AI实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.CV

AI总结 本文提出TVVE框架,通过动态选择任务相关虚拟视角和重构场景表示,提升机器人操作在遮挡和跨任务迁移中的性能,实验验证其鲁棒性。

Comments 24 pages, 15 figures, Project page: https://hcplab-sysu.github.io/TAVP, Code: https://github.com/HCPLab-SYSU/TAVP.git, Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17851 2026-03-19 cs.RO 83%

DexViTac: Collecting Human Visuo-Tactile-Kinematic Demonstrations for Contact-Rich Dexterous Manipulation

DexViTac:收集人类视觉-触觉-运动示范以实现富接触的灵巧操作

Xitong Chen, Yifeng Pan, Min Li, Xiaotian Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology(智能制造装备与技术国家重点实验室) Huazhong University of Science and Technology(华中科技大学) Wuhan Huaweike Intelligent Technology Co., Ltd.(武汉华为凯科技有限公司)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);分类 cs.RO

AI总结 DexViTac通过高保真采集第一人称视觉、高密度触觉感知、末端执行器姿态和手部运动学,构建了超过2400个视觉-触觉-运动学示范的多模态数据集,提升了接触丰富灵巧操作的学习效率和成功率。

Comments 9 pages, 9 figures.Project page: https://xitong-c.github.io/DexViTac/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12399 2026-03-19 cs.RO cs.SY eess.SY 83%

Push, Press, Slide: Mode-Aware Planar Contact Manipulation via Reduced-Order Models

推、按、滑:基于降阶模型的模式感知平面接触操作

Melih Özcan, Umut Orguner, Ozgur S. Oguz

机构 * Dept. of Electrical and Electronics Engineering, Middle East Technical University(电子工程系,中东技术大学) Dept. of Computer Engineering, Bilkent University(计算机工程系,比尔肯特大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于接触拓扑选择和降阶运动学建模的平面操作框架,通过将复杂力矩-扭动极限面力学抽象为物理直观的离散库,实现高效接触力分配与轨迹生成。

Comments 8 pages, 13 figures. Submitted to IEEE IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16270 2026-03-19 cs.RO 70%

MG-Grasp: Metric-Scale Geometric 6-DoF Grasping Framework with Sparse RGB Observations

MG-Grasp:基于稀疏RGB观测的度量尺度几何6自由度抓取框架

Kangxu Wang, Siang Chen, Chenxing Jiang, Shaojie Shen, Yixiang Dai, Guijin Wang

机构 * The Department of Electronic Engineering, Tsinghua University, Beijing 100084, China(清华大学电子工程系,北京100084,中国) The Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology, Hong Kong, China(香港科学与技术大学电子与计算机工程系,香港,中国)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出MG-Grasp框架,利用双视角3D基础模型实现高精度6自由度抓取,通过稀疏RGB图像重建密集点云并生成稳定抓取方案,实验证明其在RGB基抓取方法中达到SOTA水平。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22882 2026-03-19 cs.RO 61%

TwinTrack: Bridging Vision and Contact Physics for Real-Time Tracking of Unknown Objects in Contact-Rich Scenes

TwinTrack:通过视觉与接触物理弥合差距,实现实时跟踪未知物体

Wen Yang, Zhixian Xie, Yiting Wang, Abhijit Tadepalli, Heni Ben Amor, Shan Lin, Wanxin Jin

机构 * School for Engineering of Matter, Transport, and Energy(物质、运输与能量工程学院) School of Computing and Augmented Intelligence(计算与增强智能学院) School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学) Department of Robotics(机器人学系) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO;robotics(comments)

AI总结 TwinTrack通过结合视觉与接触物理,实现实时跟踪复杂场景中未知动态物体,利用接触物理线索提升鲁棒性和精度,实验表明其在20Hz以上的跟踪速度优于基线方法。

Comments Accepted by IEEE International Conference on Robotics & Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17914 2026-03-19 cs.CV 57%

Noise-Aware Misclassification Attack Detection in Collaborative DNN Inference

在协同DNN推理中考虑噪声的误分类攻击检测

Shima Yousefi, Saptarshi Debroy

机构 * City University of New York(纽约城市大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出一种半灰盒且噪声感知的异常检测框架,利用变分自编码器捕捉对抗操纵导致的偏差,提升检测准确率并降低误报率。

Comments This work has been accepted for publication in IEEE/ACM CCGrid 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17841 2026-03-19 cs.CV 57%

Omni-3DEdit: Generalized Versatile 3D Editing in One-Pass

Omni-3DEdit:一次通过的通用多功能三维编辑

Chen Liyi, Wang Pengfei, Zhang Guowen, Ma Zhiyuan, Zhang Lei

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 Omni-3DEdit通过统一学习模型实现一次通过的三维编辑,解决传统方法在任务通用性和计算效率上的不足,提升模型表征学习能力。

Comments accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17761 2026-03-19 cs.CV 57%

Evidence Packing for Cross-Domain Image Deepfake Detection with LVLMs

跨领域图像深度伪造检测中的证据打包与大视觉语言模型

Yuxin Liu, Fei Wang, Kun Li, Yiqi Nie, Junjie Chen, Zhangling Duan, Zhaohong Jia

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) IAI, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出SCEP框架,通过证据驱动推理提升跨领域图像深度伪造检测性能,无需微调大视觉语言模型,有效识别伪造线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17323 2026-03-19 cs.RO 57%

DexEXO: A Wearability-First Dexterous Exoskeleton for Operator-Agnostic Demonstration and Learning

DexEXO:一种以可穿戴性优先的灵活外骨骼,用于操作者无关的演示和学习

Alvin Zhu, Mingzhang Zhu, Beom Jun Kim, Jose Victor S. H. Ramos, Yike Shi, Yufeng Wu, Raayan Dhar, Fuyi Yang, Ruochen Hou, Hanzhang Fang, Quanyou Wang, Yuchen Cui, Dennis W. Hong

机构 * Department of Computer Science(计算机科学系) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Mechanical and Aerospace Engineering(机械与航空航天工程系)

专题命中 机器人操作 :robot learning(abstract);分类 cs.RO

AI总结 DexEXO通过硬件层面的外观、接触几何和运动学对齐,提升了可穿戴性,实现了跨操作者数据收集和简化端到端管道。

Comments https://dexexo-research.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17131 2026-03-19 cs.CV 57%

SMAL-pets: SMAL Based Avatars of Pets from Single Image

基于SMAL的宠物单图像生成高保真可编辑3D宠物化身

Piotr Borycki, Joanna Waczyńska, Yizhe Zhu, Yongqiang Gao, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) Huawei(华为)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出SMAL-pets框架,通过混合架构结合3D高斯溅射与SMAL参数模型,实现单图像生成高质量可编辑宠物3D化身,支持通过文本提示进行外观和行为编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17123 2026-03-19 cs.CR cs.AI 57%

Security Assessment and Mitigation Strategies for Large Language Models: A Comprehensive Defensive Framework

大型语言模型的安全性评估与缓解策略:一种全面的防御框架

Taiwo Onitiju, Iman Vakilinia

机构 * School of Computing University of North Florida(北弗罗里达大学计算学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在关键基础设施中的安全风险,提出了一种标准化的评估框架和多层次防御系统,通过测试五种主流模型对1万多个对抗性提示的响应,揭示了安全差异,并开发了高准确率的防御框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10496 2026-03-19 cs.HC cs.AI 57%

Personalized Motion Guidance Framework for Athlete-Centric Coaching

面向运动员中心的个性化运动指导框架

Ryota Takamido, Chiharu Suzuki, Hiroki Nakamoto

机构 * Sports Innovation Organization(体育创新组织) National Institute of Fitness and Sports in Kanoya(Kanoya体育健身国家研究所) Faculty of Physical Education(体育教育系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出PMGF框架,利用生成式AI技术为运动员生成个性化运动优化指导,通过垂直自编码器生成运动员特定的潜在表示,并通过两种策略生成有意义的指导动作,验证实验显示其能有效提升运动表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17619 2026-03-19 cond-mat.mtrl-sci cond-mat.mes-hall 50%

Polaron-mediated anisotropic exchange in 2D magnets

极子介导的二维磁体各向异性交换

Johanna P. Carbone, Jakob Baumsteiger, Cesare Franchini

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过极子调控二维磁体的磁交换相互作用,揭示极子可局部打破磁对称性并诱导各向异性交换耦合,为磁结构调控提供新机制。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17274 2026-03-19 cond-mat.mes-hall 50%

Phonon circular birefringence and polarization-filter in Magnetic Topological Insulators

声子圆双折射与磁拓扑绝缘体中的偏振滤波器

Abhinava Chatterjee, Chao-Xing Liu

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究磁拓扑绝缘体中声子圆双折射现象,提出声子偏振滤波机制,通过表面声子Hall黏性产生界面声子模,实现对声子偏振态的调控,为拓扑声学器件发展提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13628 2026-03-19 q-bio.NC 50%

Language modulates vision: Evidence from neural networks and human brain-lesion models

语言调节视觉:来自神经网络和人类脑损伤模型的证据

Haoyang Chen, Bo Liu, Shuyue Wang, Xiaosha Wang, Wenjuan Han, Yixin Zhu, Xiaochun Wang, Yanchao Bi

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过神经网络与脑损伤数据对比,揭示语言对视觉感知的调节作用,发现CLIP模型在VOTC活动解释上优于其他模型,且语言区域损伤影响模型与脑活动的一致性。

Journal ref Nat Hum Behav (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 27 篇

2603.15359 2026-03-19 cs.RO 88%

NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation

NavThinker: 用于社交导航中耦合预测与规划的行动条件世界模型

Tianshuai Hu, Zeying Gong, Lingdong Kong, XiaoDong Mei, Yiyi Ding, Qi Zeng, Ao Liang, Rong Li, Yangyi Zhong, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 NavThinker通过结合行动条件世界模型与on-policy强化学习,解决社交导航中机器人动作与人类运动相互影响的耦合预测-规划问题,实现未来感知的导航状态对齐与路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17670 2026-03-19 cs.RO 83%

AgentVLN: Towards Agentic Vision-and-Language Navigation

AgentVLN:迈向具有代理能力的视觉-语言导航

Zihao Xin, Wentong Li, Yixuan Jiang, Ziyuan Huang, Bin Wang, Piji Li, Jianke Zhu, Jie Qin, Shengjun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shandong University(山东大学) Zhejiang University(浙江大学)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO

AI总结 本文提出AgentVLN框架,通过部分可观测半马尔可夫决策过程建模视觉-语言导航,结合VLM-as-Brain范式和跨空间表示映射,解决多级表示不一致问题,实现高效轻量级导航部署。

Comments 19pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17712 2026-03-19 cs.RO cs.CV 81%

AERR-Nav: Adaptive Exploration-Recovery-Reminiscing Strategy for Zero-Shot Object Navigation

AERR-Nav:面向零样本物体导航的自适应探索-恢复-回忆策略

Jingzhi Huang, Junkai Huang, Haoyang Yang, Haoang Li, Yi Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出AERR-Nav框架,通过自适应探索-恢复-回忆策略和自适应探索状态,解决零样本物体导航中探索与利用的平衡问题,在HM3D和MP3D基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13698 2026-03-19 cs.RO cs.AI 81%

SAATT Nav: a Socially Aware Autonomous Transparent Transportation Navigation Framework for Wheelchairs

SAATT Nav:面向轮椅的社交感知自主透明交通导航框架

Yutong Zhang, Shaiv Y. Mehra, Bradley S. Duerstock, Juan P. Wachs

机构 * Edwardson School of Industrial Engineering, Purdue University(帕克大学工业工程学院) Weldon School of Biomedical Engineering, Purdue University(帕克大学生物医学工程学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出SAATT导航框架,通过整合大语言模型实现社交感知与决策透明,提升轮椅用户的导航安全性与信任度。

Comments 8 pages, 4 figures, 2 tables, 1 algorithm. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17236 2026-03-19 cs.RO cs.CV 81%

Neural Radiance Maps for Extraterrestrial Navigation and Path Planning

神经辐射图用于外星导航和路径规划

Adam Dai, Shubh Gupta, Grace Gao

机构 * Stanford University(斯坦福大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出利用神经辐射场构建地图,用于自主导航中的路径规划,通过整合局部和全局信息,实现更高效的路径规划。

Comments Published in the Proceedings of the ION GNSS+ 2023 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17229 2026-03-19 cs.RO cs.CV 81%

Visual SLAM with DEM Anchoring for Lunar Surface Navigation

基于数字高程模型锚定的月球表面视觉SLAM

Adam Dai, Guillem Casadesus Vila, Grace Gao

机构 * Stanford University(斯坦福大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种结合学习特征检测与DEM全局约束的视觉SLAM系统,用于月球表面长距离导航,通过引入高程和表面法线因素缓解长期漂移问题。

Comments Accepted to IEEE Aerospace Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17056 2026-03-19 cs.CV cs.LG 81%

DesertFormer: Transformer-Based Semantic Segmentation for Off-Road Desert Terrain Classification in Autonomous Navigation Systems

DesertFormer:基于Transformer的语义分割用于自动驾驶导航系统中的沙漠地形分类

Yasaswini Chebolu

机构 * Department of Computer Science \& Engineering (AI \& ML) Gayatri Vidya Parishad College of Engineering for Women Visakhapatnam, India

专题命中 具身导航 :navigation(title,abstract);分类 cs.CV、cs.LG

AI总结 DesertFormer基于SegFormer B2与层次化Mix Transformer(MiT-B2)架构,针对沙漠地形的低对比度、强光照变化和稀疏植被挑战,实现10类生态意义地形分类,提升地面机器人与自动驾驶车辆的安全路径规划能力。

Comments 10 pages, 6 figures, 3 tables. Preprint also available on Zenodo (DOI: 10.5281/zenodo.19053085)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09506 2026-03-19 cs.CV cs.RO 81%

Context-Nav: Context-Driven Exploration and Viewpoint-Aware 3D Spatial Reasoning for Instance Navigation

Context-Nav: 基于上下文的探索与视点感知的3D空间推理用于实例导航

Won Shik Jang, Ue-Hwan Kim

机构 * Department of AI Convergence(人工智能融合系)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 Context-Nav通过上下文驱动的探索和视点感知的3D空间推理,提升实例导航任务的性能,无需特定任务训练,实现最先进的结果。

Comments Accepted to CVPR 2026. Code is available at https://github.com/AutoCompSysLab/ContextNav

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24910 2026-03-19 cs.CV 79%

Learning Goal-Oriented Vision-and-Language Navigation with Self-Improving Demonstrations at Scale

基于大规模自改进演示的目标导向视觉-语言导航学习

Songze Li, Zun Wang, Gengze Zhou, Jialu Li, Xiangyu Zeng, Ziyang Gong, Limin Wang, Yu Qiao, Qi Wu, Mohit Bansal, Yi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) UNC Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The University of Adelaide(阿德莱德大学) Nanjing University(南京大学) Shanghai Jiaotong University(上海交通大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.CV

AI总结 本文提出SID方法,通过自改进演示提升导航能力,实现高效探索和泛化,显著提升导航性能,达到新状态的SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17459 2026-03-19 cs.RO 79%

P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation

P$^{3}$Nav: 端到端感知、预测与规划用于视觉-语言导航

Tianfu Li, Wenbo Chen, Haoxuan Xu, Xinhu Zheng, Haoang Li

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 P$^{3}$Nav提出端到端框架,整合感知、预测与规划,提升视觉-语言导航agent的场景理解与导航成功率,实验显示在REVERIE、R2R-CE和RxR-CE基准上取得新状态-of-the-art性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17437 2026-03-19 cs.RO 79%

FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation

FloorPlan-VLN: 一种新的基于平面图引导的视觉-语言导航范式

Kehan Chen, Yan Huang, Dong An, Jiawei He, Yifei Su, Jing Liu, Nianfeng Liu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences and School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院自动化研究所新型模式识别实验室,中国科学院人工智能学院) AMap, Alibaba Group(阿里巴巴集团高德地图) BAAI(北京人工智能研究院) Xiaomi Robotics Lab(小米机器人实验室) FiveAges

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出FloorPlan-VLN范式,利用结构化的语义平面图作为全局空间先验,通过FP-Nav方法实现仅需简洁指令的导航,实验表明其在导航成功率上优于现有方法,验证了平面图引导导航的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17351 2026-03-19 cs.RO 79%

OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms

OmniVLN:面向空和地面平台的全方位3D感知与高效token LLM推理的视觉语言导航

Zhongyuang Liu, Min He, Shaonan Yu, Xinhang Xu, Muqing Cao, Jianping Li, Jianfei Yang, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 OmniVLN结合全方位3D感知与高效token分层推理,提升空和地面机器人在复杂环境中的视觉语言导航能力,提升空间指认准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏