arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-09 至 2026-03-09 共收录 74 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 17 篇

2603.05783 2026-03-09 cs.RO 79%

Task-Level Decisions to Gait Level Control: A Hierarchical Policy Approach for Quadruped Navigation

任务级决策到步态级控制:一种用于四足机器人类导航的分层策略方法

Sijia Li, Haoyu Wang, Shenghai Yuan, Yizhuo Yang, Thien-Minh Nguyen

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出了一种分层策略架构,通过任务级决策与步态级控制的结合,提升四足机器人在复杂地形中的导航能力与鲁棒性。

Comments Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05748 2026-03-09 cs.RO 79%

Environment-Aware Path Generation for Robotic Additive Manufacturing of Structures

面向机器人增材制造结构的环境感知路径生成

Mahsa Rabiei, Reza Moini

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出了一种环境感知路径生成框架,通过四种路径规划算法在线设计结构,评估了不同障碍物排列下的性能指标,识别出适合挑战性环境的路径规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06247 2026-03-09 astro-ph.EP astro-ph.IM cs.SY eess.SY 78%

Star-based Navigation in the Outer Solar System

基于恒星的外太阳系导航

Vittorio Franzese

专题命中 具身导航 :navigation(title,abstract)

AI总结 本文提出了一种基于恒星视差位移的外太阳系航天器自主导航方法,通过多星观测和卡尔曼滤波器实现高精度轨道估计,适用于深空探测任务。

Comments Accepted for publication in the Journal of Guidance, Control, and Dynamics. This is the author's accepted manuscript. The final version of record will be published by AIAA and will be available at the JGCD website

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05686 2026-03-09 cs.CV 70%

OWL: A Novel Approach to Machine Perception During Motion

OWL:一种解决运动期间三维感知复杂挑战的新方法

Daniel Raviv, Juan D. Yepes

机构 * Electrical Engineering and Computer Science Department(电气工程与计算机科学系) Florida Atlantic University(佛罗里达亚特兰大大学)

专题命中 具身导航 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 OWL通过直接测量原始视觉运动图像序列,提供了一种基于时间的分析方法,用于实时重建运动中的3D场景并增强感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03869 2026-03-09 cs.CV cs.GR cs.LG cs.RO 67%

Bayesian Monocular Depth Refinement via Neural Radiance Fields

基于神经辐射场的贝叶斯单目深度细化

Arun Muthukkumar

机构 * Department of Computer Science Illinois Mathematics Science Academy Aurora, United States

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出MDENeRF,通过神经辐射场和贝叶斯融合改进单目深度估计,提升场景理解的精细几何细节。

Comments IEEE 8th International Conference on Algorithms, Computing and Artificial Intelligence (ACAI 2025)

Journal ref Proc. IEEE 8th International Conference on Algorithms, Computing and Artificial Intelligence (ACAI), pp. 488-492, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05511 2026-03-09 cs.HC cs.AI cs.GR cs.RO 62%

An Embodied Companion for Visual Storytelling

具身化伴侣:视觉叙事中的交互伙伴

Patrick Tresset, Markus Wulfmeier

机构 * Goldsmiths, University of London(伦敦大学金史密斯学院) DeepMind(深度Mind)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 Companion通过结合绘图机器人与大语言模型,实现人机协同创作,推动视觉叙事的创新与美学探索。

Comments 35 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14895 2026-03-09 cs.CV cs.AI 62%

SpatialMem: Metric-Aligned Long-Horizon Video Memory for Language Grounding and QA

SpatialMem: 用于语言定位和问答的度量对齐长周期视频记忆

Xinyi Zheng, Yunze Liu, Chi-Hao Wu, Fan Zhang, Hao Zheng, Wenqi Zhou, Walterio W. Mayol-Cuevas, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究院)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 SpatialMem通过构建度量对齐的空间支架,实现长周期视频记忆的可解释检索与问答,支持语言引导的检索和离线导航任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20739 2026-03-09 cs.RO cs.CV 62%

Decision-Driven Semantic Object Exploration for Legged Robots via Confidence-Calibrated Perception and Topological Subgoal Selection

通过置信度校准感知与拓扑子目标选择实现决策驱动的语义对象探索

Guoyang Zhao, Yudong Li, Weiqing Qi, Kai Zhang, Bonan Liu, Kai Chen, Haoang Li, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou), China(机器人与自主系统方向,香港科技大学(广州)) Department of Mechanical and Energy Engineering, Southern University of Science and Technology, China(机械与能源工程系,南方科技大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种基于视觉的决策驱动语义对象探索方法,通过置信度校准感知与拓扑子目标选择机制提升腿部机器人在开放环境中的探索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06501 2026-03-09 cs.RO 61%

CFEAR-Teach-and-Repeat: Fast and Accurate Radar-only Localization

CFEAR-Teach-and-Repeat:快速且准确的仅雷达定位

Maximilian Hilger, Daniel Adolfsson, Ralf Becker, Henrik Andreasson, Achim J. Lilienthal

机构 * Chair of Perception for Intelligent Systems, Munich Institute of Robotics and Machine Intelligence, Technical University of Munich(感知智能系统教授团,慕尼黑机器人与机器智能研究所,慕尼黑技术大学) Robot Navigation and Perception Lab of the AASS Research Center, Örebro University(AASS研究中心机器人导航与感知实验室,奥雷布罗大学) Bosch Rexroth, Germany(德国博世· Rexroth公司)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 CFEAR-TR利用单个雷达实现快速且准确的仅雷达定位,精度达0.117米和0.096度,比先前方法提升63%,在恶劣天气下表现优异。

Comments This paper has been accepted for publication in the IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13782 2026-03-09 cs.RO cs.SY eess.SY 61%

C*: A Coverage Path Planning Algorithm for Unknown Environments using Rapidly Covering Graphs

C*:一种基于快速覆盖图的未知环境覆盖路径规划算法

Zongyuan Shen, James P. Wilson, Shalabh Gupta

机构 * Dept. of Electrical and Computer Engineering, University of Connecticut(电气与计算机工程系,康涅狄格大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 C*是一种基于快速覆盖图的未知环境覆盖路径规划算法,通过高效采样和修剪技术实现最优覆盖,显著提升覆盖效率并防止覆盖孔形成。

Journal ref IEEE Transactions on Robotics, Vol 42, pg. 1233-1253, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00276 2026-03-09 cs.AI 57%

Localizing and Correcting Errors for LLM-based Planners

基于 LLM 的规划器的定位与错误修正

Aditya Kumar, William W. Cohen

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, US(语言技术研究所,卡内基梅隆大学,匹兹堡,美国) Machine Learning Department, Carnegie Mellon University, Pittsburgh, USA(机器学习系,卡内基梅隆大学,匹兹堡,美国)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 本研究提出 L-ICL 方法,通过局部上下文学习修正 LLM 规划器的错误,显著提升规划任务的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05993 2026-03-09 cs.RO 57%

Moving Through Clutter: Scaling Data Collection and Benchmarking for 3D Scene-Aware Humanoid Locomotion via Virtual Reality

穿行于杂乱之中:通过虚拟现实实现3D场景感知人类oid运动的 数据收集与基准测试

Beichen Wang, Yuanjie Lu, Linji Wang, Liuchuan Yu, Xuesu Xiao

机构 * George Mason University(乔治·马歇尔大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 MTC通过虚拟现实框架收集和评估3D场景感知的人oid运动数据,提供348条轨迹的145种杂乱场景数据集,用于研究几何适应性和开发场景感知的规划与控制方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 2 篇

2509.07945 2026-03-09 cs.LG 79%

One Model for All Tasks: Leveraging Efficient World Models in Multi-Task Planning

一个模型用于所有任务:利用高效的world models进行多任务规划

Yuan Pu, Yazhe Niu, Jia Tang, Junyu Xiong, Shuai Hu, Hongsheng Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong MMLab(香港中文大学 MMLab) University of Science and Technology of China(中国科学技术大学) Novosibirsk State University(新西伯利亚州立大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 ScaleZero通过混合专家架构和动态参数扩展策略,实现单一模型在多任务规划中的高效性能。

Comments 55 pages, 20 figures. Accepted as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05815 2026-03-09 cs.RO 72%

Hierarchical Latent Action Model

层次化潜在动作模型

Hanjung Kim, Lerrel Pinto, Seon Joo Kim

机构 * Yonsei University(延世大学) New York University(纽约大学)

专题命中 具身推理 :world model(abstract,comments);robotic(abstract);分类 cs.RO

AI总结 HiLAM通过建模长期时间信息,从无动作视频中发现高层次潜在技能,提升了动态技能发现的鲁棒性。

Comments ICLR 2026 Workshop - 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2511.06202 2026-03-09 cs.RO 72%

ExpReS-VLA: Specializing Vision-Language-Action Models Through Experience Replay and Retrieval

ExpReS-VLA: 通过经验回放和检索专门化视觉-语言-动作模型

Shahram Najam Syed, Yatharth Ahuja, Arthur Jakobsson, Jeff Ichnowski

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO;robotics(comments)

AI总结 ExpReS-VLA通过经验回放和检索增强,提升VLA模型在特定任务中的适应能力与性能。

Comments 8 pages, 4 figures, 3 tables, accepted to International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 4 篇

2509.13386 2026-03-09 cs.RO cs.LG 76%

VEGA: Electric Vehicle Navigation Agent via Physics-Informed Neural Operator and Proximal Policy Optimization

VEGA:基于物理信息神经算子和近端策略优化的电动汽车导航代理

Hansol Lim, Minhyeok Im, Jonathan Boyack, Jee Won Lee, Jongseong Brad Choi

机构 * Department of Mechanical Engineering, State University of New York(机械工程系,纽约州立大学) Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.RO、cs.LG

AI总结 VEGA通过结合物理信息神经算子和近端策略优化,为电动汽车提供高效的能耗感知导航方案,实现快速路径规划和充电站点选择。

Comments This work has been submitted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13459 2026-03-09 cs.RO 70%

Contact-Safe Reinforcement Learning with ProMP Reparameterization and Energy Awareness

具有ProMP重参数化和能量意识的接触安全强化学习

Bingkun Huang, Yuhe Gong, Zewen Yang, Tianyu Ren, Luis Figueredo

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出一种基于任务空间和能量安全的框架,结合PPO和运动原语,通过能量意识的笛卡尔阻抗控制器实现安全交互,提升复杂机器人任务的性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16050 2026-03-09 cs.RO 70%

Bi-AQUA: Bilateral Control-Based Imitation Learning for Underwater Robot Arms via Lighting-Aware Action Chunking with Transformers

Bi-AQUA:基于双侧控制的水下机器人臂模仿学习框架:通过光敏感动作分块与Transformer实现

Takeru Tsunoori, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(Kobe大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 Bi-AQUA通过显式光照建模与双侧控制结合,提升水下机器人操作的鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13406 2026-03-09 cs.RO cs.AI cs.SY eess.SY 62%

Generative Predictive Control: Flow Matching Policies for Dynamic and Difficult-to-Demonstrate Tasks

生成预测控制:用于动态和难以示范任务的流匹配策略

Vince Kurtz, Joel W. Burdick

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 本文提出生成预测控制方法,用于解决动态且难以示范任务中的快速动态问题,通过流匹配策略实现高效反馈和高频率控制。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 2 篇

2512.05270 2026-03-09 cs.RO cs.AI cs.HC cs.MA cs.SY eess.SY 62%

XR-DT: Extended Reality-Enhanced Digital Twin for Safe Motion Planning via Human-Aware Model Predictive Path Integral Control

XR-DT:增强现实增强型数字孪生用于通过人感知模型预测路径积分控制的安全运动规划

Tianyi Wang, Jiseop Byeon, Ahmad Yehia, Yiming Xu, Jihyung Park, Tianyi Zeng, Sikai Chen, Ziran Wang, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院) School of Civil and Construction Engineering, Purdue University(普渡大学土木与建设工程学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系)

专题命中 人机交互与遥操作 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 XR-DT通过结合增强现实与数字孪生技术,提出HA-MPPI控制模型,实现基于人类行为预测的安全高效人机交互。

Comments 8 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03550 2026-03-09 cs.RO cs.HC 61%

Indicating Robot Vision Capabilities with Augmented Reality

通过增强现实指示机器人视觉能力

Hong Wang, Ridhima Phatak, James Ocampo, Zhao Han

专题命中 人机交互与遥操作 :world model(abstract);分类 cs.RO;robotics(journal_ref)

AI总结 通过增强现实指示器提升人机协作中对机器人视觉能力的理解

Journal ref International Journal of Social Robotics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 20 篇

2510.11689 2026-03-09 cs.RO cs.AI 84%

Phys2Real: Fusing VLM Priors with Interactive Online Adaptation for Uncertainty-Aware Sim-to-Real Manipulation

Phys2Real: 融合视觉语言模型先验与交互在线适应以实现不确定性感知的仿真到现实操控

Maggie Wang, Stephen Tian, Aiden Swann, Ola Shorinwa, Jiajun Wu, Mac Schwager

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 Phys2Real通过融合视觉语言模型先验与交互适应,提升仿真到现实操控的不确定性感知与任务成功率。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06130 2026-03-09 cs.RO cs.AI 81%

A Hazard-Informed Data Pipeline for Robotics Physical Safety

面向机器人物理安全的危险信息数据管道

Alexei Odinokov, Rostislav Yavorskiy

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于危险信息的数据管道,整合传统安全工程与机器学习,实现机器人物理安全的系统性保障。

Comments 4th International Conference on Automation and Mechatronics Engineering (ICAME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00814 2026-03-09 cs.RO cs.LG cs.SY eess.SY 77%

Real-Time Learning of Predictive Dynamic Obstacle Models for Robotic Motion Planning

实时学习预测性动态障碍物模型用于机器人运动规划

Stella Kombo, Masih Haseli, Skylar X. Wei, Joel W. Burdick

机构 * Division of Engineering and Applied Science, California Institute of Technology(工程与应用科学分校,加州理工学院) Applied Intuition(应用直觉)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO、cs.LG;robotics(comments)

AI总结 本文提出一种实时学习动态障碍物预测模型的方法,通过改进的Hankel-DMD实现去噪和多步预测,适用于机器人运动规划。

Comments 10 pages, 6 figures, submitted to IEEE International Conference on Robotics and Automation (ICRA) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05932 2026-03-09 cs.CV cs.RO 73%

FTSplat: Feed-forward Triangle Splatting Network

FTSplat:前馈三角形散射网络

Xiong Jinlin, Li Can, Shen Jiawei, Qi Zhigang, Sun Lei, Zhao Dongyang

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 FTSplat通过前馈三角形生成网络实现高效的三维重建,无需每场景优化,直接生成可用于模拟的连续三角形表面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05807 2026-03-09 cs.CV 70%

EventGeM: Global-to-Local Feature Matching for Event-Based Visual Place Recognition

EventGeM:基于事件的视觉位置识别的全局到局部特征匹配

Adam D. Hines, Gokul B. Nair, Nicolás Marticorena, Michael Milford, Tobias Fischer

机构 * Queensland University of Technology(昆士兰理工大学)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 EventGeM通过全局到局部特征融合提升基于事件的视觉位置识别性能,实现高精度实时定位。

Comments 10 pages, 4 figures, 5 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19074 2026-03-09 cs.RO 70%

Sample-Based Hybrid Mode Control: Asymptotically Optimal Switching of Algorithmic and Non-Differentiable Control Modes

基于样本的混合模式控制:算法与非可微控制模式的渐近最优切换

Yilang Liu, Haoxiang You, Ian Abraham

机构 * Department of Mechanical Engineering and Material Science, Yale University(机械工程与材料科学系,耶鲁大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于样本的混合模式控制方法,通过整数优化实现算法与非可微控制模式的渐近最优切换,适用于机器人任务中的复杂行为合成与高效控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06512 2026-03-09 cs.RO cs.CV 62%

SG-DOR: Learning Scene Graphs with Direction-Conditioned Occlusion Reasoning for Pepper Plants

SG-DOR:基于方向条件遮挡推理的学习场景图用于Pepper植物

Rohit Menon, Niklas Mueller-Goldingen, Sicong Pan, Gokul Krishna Chenchani, Maren Bennewitz

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 SG-DOR通过方向条件遮挡推理,提升密集作物中果实遮挡预测与连接推断的准确性,为机器人采摘提供结构化关系信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06061 2026-03-09 cs.CV cs.RO 62%

Transforming Omnidirectional RGB-LiDAR data into 3D Gaussian Splatting

将全方位RGB-LiDAR数据转换为3D高斯散点

Semin Bae, Hansol Lim, Jongseong Brad Choi

机构 * Department of Computer Science, State University of New York(计算机科学系,纽约州立大学) Department of Mechanical Engineering, State University of New York(机械工程系,纽约州立大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种将全方位RGB-LiDAR数据转换为3D高斯散点的重用管道,解决数据处理中的非线性失真和计算开销问题,提升复杂场景的渲染保真度。

Comments This work has been submitted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10704 2026-03-09 cs.CV cs.RO 62%

(MGS)$^2$-Net: Unifying Micro-Geometric Scale and Macro-Geometric Structure for Cross-View Geo-Localization

(MGS)$^2$-Net:融合微几何尺度与宏几何结构的跨视角地理定位

Minglei Li, Mengfan He, Chunyu Li, Chao Chen, Xingyu Shao, Ziyang Meng

机构 * Department of Precision Instrument, Tsinghua University, Beijing 100084, China(精密仪器系,清华大学,北京100084,中国)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 (MGS)$^2$-Net通过融合微几何尺度与宏几何结构,解决跨视角地理定位中的几何错位问题,实现高精度和鲁棒性的定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏