arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-17 至 2026-03-17 共收录 178 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 38 篇

2601.00275 2026-03-17 cs.RO 79%

Pure Inertial Navigation in Challenging Environments with Wheeled and Chassis Mounted Inertial Sensors

在复杂环境中使用轮式和车架安装的惯性传感器实现纯惯性导航

Dusan Nemec, Gal Versano, Itai Savin, Vojtech Simak, Juraj Kekelak, Itzik Klein

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出WiCHINS系统,结合轮式和车架惯性传感器,通过三阶段框架提升纯惯性导航精度,实验表明平均位置误差为11.4米,有效提升复杂环境导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13459 2026-03-17 cs.RO cs.MA 79%

Multi-Robot Navigation in Social Mini-Games: Definitions, Taxonomy, and Algorithms

多机器人在社交迷你游戏中的导航:定义、分类和算法

Rohan Chandra, Shubham Singh, Wenhao Luo, Katia Sycara

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文定义了社交迷你游戏导航问题,提出统一的分类方法,并探讨了现有方法的特性与挑战,为未来研究提供指导。

Comments Accepted for publication in Autonomous Robots 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16686 2026-03-17 cs.RO cs.MA 79%

SERN: Bandwidth-Adaptive Cross-Reality Synchronization for Simulation-Enhanced Robot Navigation

SERN:带宽自适应的跨现实同步用于模拟增强的机器人导航

Jumman Hossain, Emon Dey, Snehalraj Chugh, Masud Ahmed, MS Anwar, Abu-Zaher Faridee, Jason Hoppes, Theron Trout, Anjon Basak, Rafidh Chowdhury, Rishabh Mistry, Hyun Kim, Jade Freeman, Niranjan Suri, Adrienne Raglin, Carl Busart, Anuradha Ravi, Nirmalya Roy

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 SERN通过高保真虚拟双胞胎与物理机器人紧密耦合,实现跨现实同步,提升多机器人在对抗环境中的导航性能,减少延迟并提高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13833 2026-03-17 cs.RO 79%

ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics

ImagiNav:通过生成性视觉预测和逆动力学实现可扩展的具身导航

Jie Chen, Yuxin Cai, Yizhuo Wang, Ruofei Bai, Yuhong Cao, Jun Li, Yau Wei Yun, Guillaume Sartoretti

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出ImagiNav框架,通过解耦视觉规划与机器人动作,利用真实世界导航视频实现零样本迁移,无需机器人演示即可实现通用机器人自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13313 2026-03-17 cs.RO 79%

MRPoS: Mixed Reality-Based Robot Navigation Interface Using Spatial Pointing and Speech with Large Language Model

基于混合现实的机器人导航接口:结合空间指针与语音及大语言模型

Eduardo Iglesius, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(Kobe大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出MRPoS接口,利用空间指针和语音交互替代传统手势,提升机器人导航的直观性和效率,实验表明任务完成时间与工作负荷显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15108 2026-03-17 cs.RO 70%

BodyGuards: Escorting by Multiple Robots in Unknown Environment under Limited Communication

BodyGuards:在未知环境中通过多机器人护送

Zhuoli Tian, Yanze Bao, Meng Guo

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出BodyGuards框架,通过整合协同探索、机器人与操作员通信和护送任务,减少操作员在对抗性环境中的导航时间与风险。

Comments Accept by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14998 2026-03-17 cs.CV cs.RO 62%

Thermal Image Refinement with Depth Estimation using Recurrent Networks for Monocular ORB-SLAM3

利用循环网络进行热成像细化的单目ORB-SLAM3深度估计

Hürkan Şahin, Huy Xuan Pham, Van Huyen Dang, Alper Yegenoglu, Erdal Kayacan

机构 * Automatic Control Group (RAT), Paderborn University(自动控制组(RAT),波恩大学) Department of Electrical and Computer Engineering, Aarhus University(电气与计算机工程系,阿arhus大学) Upteko ApS(Upteko公司)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出利用轻量级监督网络和循环块进行热成像细化,以提升无人机在低光环境下的实时深度估计和SLAM性能,实验表明其在非辐射热数据集上具有更高的精度和鲁棒性。

Comments 8 pages, 8 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14739 2026-03-17 cs.CV cs.AI 62%

TrajMamba: An Ego-Motion-Guided Mamba Model for Pedestrian Trajectory Prediction from an Egocentric Perspective

TrajMamba:一种基于自身运动的Mamba模型,用于从第一人称视角预测行人轨迹

Yusheng Peng, Gaofeng Zhang, Liping Zheng

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出基于Mamba模型的TrajMamba模型,通过提取行人和自身运动特征,结合自身运动引导解码器预测未来轨迹,实现在自动驾驶和机器人导航中的高性能表现。

Comments Accept by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12244 2026-03-17 cs.LG cs.AI 62%

Separable neural architectures as a primitive for unified predictive and generative intelligence

可分离神经架构作为统一预测与生成智能的原始构件

Reza T. Batley, Apurba Sarker, Rajib Mostakim, Andrew Klichine, Sourav Saha

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出可分离神经架构(SNA),通过约束交互阶数和张量秩,将高维映射分解为低 arity 组件,揭示了混沌时空动态与语言自回归的结构类比,并在多个领域展示了其统一预测与生成智能的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02289 2026-03-17 cs.RO cs.LG cs.MA 62%

Federated Multi-Agent Mapping for Planetary Exploration

联邦多智能体制图用于行星探索

Tiberiu-Ioan Szatmari, Abhishek Cauligi

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种联邦多智能体制图方法,通过隐式神经制图生成高效适应性表示,减少数据传输达93.8%,并利用元初始化加速地图收敛,实现火星地形和冰川数据集的高路径规划F1分数。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13298 2026-03-17 cs.LG cs.AI 62%

FusionCast: Enhancing Precipitation Nowcasting with Asymmetric Cross-Modal Fusion and Future Radar Priors

FusionCast: 通过不对称跨模态融合和未来雷达先验增强降水现在预报

Henan Wang, Shengwu Xiong, Yifang Zhang, Wenjie Yin, Chen Zhou, Yuqiang Zhang, Pengfei Duan

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Earth and Space Science and Technology, Wuhan University(武汉大学地球和空间科学与技术学院)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FusionCast框架,结合历史雷达QPE、PWV数据和预测雷达QPE,通过不对称融合和未来先验提升降水现在预报精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15374 2026-03-17 cs.CV 57%

Spectral Rectification for Parameter-Efficient Adaptation of Foundation Models in Colonoscopy Depth Estimation

光谱校正用于结肠镜深度估计中基础模型的参数高效适应

Xiaoxian Zhang, Minghai Shi, Lei Li

机构 * Department of Biomedical Engineering, National University of Singapore, Singapore(新加坡国立大学生物医学工程系) Department of Radiotherapy, The First Affiliated Hospital of Xi'an Jiaotong University, Xi'an, China(西安交通大学第一附属医院放疗科)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出SpecDepth框架,通过光谱校正模块提升结肠镜图像处理性能,实现参数高效适应,取得最佳性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14852 2026-03-17 cs.RO cs.SY eess.SY 57%

Surgical Robot, Path Planning, Joint Space, Riemannian Manifolds

手术机器人,路径规划,关节空间,黎曼流形

Yoshiki Yamamoto, Maina Sogabe, Shunichi Hirahara, Toshiki Kaisaki, Tetsuro Miyazaki, Kenji Kawashima

机构 * The University of Tokyo, Department of Information Physics and Computing(东京大学信息物理与计算系) The University of Tokyo, Department of Precision Engineering(东京大学精密工程系) National Institute of Informatics, Principles of Informatics Research Division(国家信息研究所信息原理研究部)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出在关节空间中利用黎曼流形进行路径规划,以解决手术机器人在非凹表面的运动限制问题,通过梯度下降法提高路径规划效率。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03987 2026-03-17 eess.SY cs.RO cs.SY 57%

On transferring safety certificates across dynamical systems

在动态系统间转移安全证书

Nikolaos Bousias, Charalampia Stamouli, Anastasios Tsiamis, George Pappas

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出一种转移控制屏障函数框架,用于在动态系统间转移安全保证,通过模拟函数和显式边距项系统地强制安全约束,适用于异构动态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14786 2026-03-17 cs.RO 57%

CORAL: COntextual Reasoning And Local Planning in A Hierarchical VLM Framework for Underwater Monitoring

CORAL:在分层视觉语言框架中实现上下文推理与局部规划用于水下监测

Zhenqi Wu, Yuanjie Lu, Xuesu Xiao, Xiaomin Lin

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 CORAL框架通过分离高层语义推理与底层反应控制,提升水下监测的覆盖率和安全性,减少碰撞并降低对VLM的调用次数。

Comments Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14457 2026-03-17 cs.RO 57%

Towards Versatile Opti-Acoustic Sensor Fusion and Volumetric Mapping

迈向多功能光学-声学传感器融合与体积分层映射

Ivana Collado-Gonzalez, John McConnell, Brendan Englot

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出融合立体声纳与单目相机的体积分层映射框架,以应对不同能见度条件下的安全导航问题,通过解决声纳视场重叠带来的垂直模糊问题,生成可靠的3D点云。

Comments To appear at ICRA 2026 in Vienna, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14341 2026-03-17 cs.CR cs.LG 57%

Generation of Human Comprehensible Access Control Policies from Audit Logs

从审计日志生成人类可理解的访问控制策略

Gautam Kumar, Ravi Sundaram, Shamik Sural

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 本文提出通过审计日志生成人类可理解的访问控制策略框架,利用大语言模型提升准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14308 2026-03-17 cs.RO 57%

Load-Aware Locomotion Control for Humanoid Robots in Industrial Transportation Tasks

面向工业运输任务的人形机器人负载感知运动控制

Lequn Fu, Yijun Zhong, Xiao Li, Yibin Liu, Zhiyuan Xu, Jian Tang, Shiqi Li

专题命中 具身导航 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种负载感知的运动框架,通过解耦但协调的运动- manipulation架构,实现人形机器人在负载变化和上身运动下的稳定运动控制。

Comments This work has been submitted to the IEEE Transactions on Industrial Electronics for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14244 2026-03-17 cs.RO 57%

Design of a Bio-Inspired Miniature Submarine for Low-Cost Water Quality Monitoring

基于生物启发的微型潜艇设计用于低成本水质监测

Quang Huy Vu, Quan Le, Manh Duong Phung

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种受章鱼喷射推进机制启发的微型潜艇,利用泵驱动水流实现推进与转向,结合泵控浮力控制机制实现深度调节与采样。系统采用低成本商用组件,硬件成本约122.5美元,实验验证了其稳定性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13699 2026-03-17 eess.IV cs.RO 57%

D-Compress: Detail-Preserving LiDAR Range Image Compression for Real-Time Streaming on Resource-Constrained Robots

D-Compress:面向资源受限机器人实时流媒体的细节保留激光雷达范围图像压缩

Shengqian Wang, Chang Tu, He Chen

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出D-Compress,一种面向资源受限机器人实时流媒体的细节保留激光雷达范围图像压缩框架,通过自适应离散小波变换和新的率失真优化算法,在高压缩比下保持几何精度和下游任务性能。

Comments To appear in IEEE ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13573 2026-03-17 cs.CV 57%

Analytical Logit Scaling for High-Resolution Sea Ice Topology Retrieval from Weakly Labeled SAR Imagery

高分辨率海冰拓扑结构分析:基于弱标签SAR影像的解析对数缩放方法

Reda Elwaradi, Julien Gimenez, Stéphane Hordoir, Mehdi Ait Hamma, Adrien Chan-Hon-Tong, Flora Weissgerber

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出一种弱监督深度学习方法,结合SAR与AMSR-2数据,通过解析对数缩放技术实现高分辨率海冰拓扑结构提取,准确率达78%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12679 2026-03-17 cs.RO 57%

Dribble Master: Learning Agile Humanoid Dribbling through Legged Locomotion

Dribble Master: 通过腿部运动学习敏捷的人形机器人控球

Zhuoheng Wang, Jinyin Zhou, Qi Wu

专题命中 具身导航 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种两阶段课程学习框架,使人形机器人无需显式动力学或预设轨迹即可掌握控球技能,通过模拟虚拟相机和启发式奖励提升球感知能力,实验证明其在多种环境中实现灵活美观的控球行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15602 2026-03-17 cond-mat.soft cond-mat.stat-mech 50%

Nonequilibrium energetics of sensing and actuation by a smart active particle

非平衡能学中智能活性粒子的感知与作动

Luca Cocconi, Benoît Mahault, Lorenzo Piro

专题命中 具身导航 :navigation(abstract)

AI总结 研究智能活性粒子在感知与作动间能量分配的非平衡能学机制,揭示其在简单导航中的能量账本结构及热力学约束。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15200 2026-03-17 physics.ao-ph 50%

Physically Motivated Knowledge Distillation for Blind Geometric Correction of Side-Scan Sonar Imagery

基于物理的知识蒸馏用于侧扫声呐图像的盲几何校正

Can Lei, Hayat Rajani, Valerio Franchi, Rafael Garcia, Nuno Gracias, Huigang Wang, Wei Qiang

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出基于物理的知识蒸馏框架,用于侧扫声呐图像的盲几何校正,通过教师网络学习几何差异并指导学生网络进行单幅图像校正,采用参数解码器和hallucination上下文模块提升变形估计的物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14777 2026-03-17 physics.atom-ph 50%

Closed-loop dual-channel atomic beam interferometry beyond the half-fringe limit

闭环双通道原子束干涉仪超越半条纹极限

Wei-Chen Jia, Yue Xin, Ke Shen, Zhi-Xin Meng, Xiang-Xiang Lu, Yi-Cheng Deng, Yuan-Xing Liu, Yan-Ying Feng

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出闭环双通道原子束干涉仪,通过分离反馈控制加速和旋转相位,克服半条纹限制,实现高对比度的旋转和加速度测量。

Comments 6 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14006 2026-03-17 cs.CL 50%

Beyond Explicit Edges: Robust Reasoning over Noisy and Sparse Knowledge Graphs

超越显式边:在噪声和稀疏知识图谱上的鲁棒推理

Hang Gao, Dimitris N. Metaxas

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出INSES框架,通过LLM引导导航和嵌入相似性扩展,提升噪声和稀疏知识图谱的推理能力,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01404 2026-03-17 cs.HC 50%

StereoMath: An Accessible and Musical Equation Editor

StereoMath:一个易于使用且音乐化的公式编辑器

Kenneth Ge, JooYoung Seo

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出一个专为视障和低视力用户设计的公式编辑器,通过空间音频提示、肌肉记忆和直观导航解决传统工具的认知负担和空间关系缺失问题,提升数学沟通和素养。

Comments 5 pages, 2 figures, accepted as demo paper at ASSETS '24

Journal ref ASSETS 2024: Proceedings of the 26th International ACM SIGACCESS Conference on Computers and Accessibility, Article No.: 129, Pages 1 - 5

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 15 篇

2602.01960 2026-03-17 cs.LG 85%

Grounding Generated Videos in Feasible Plans via World Models

通过世界模型将生成视频接地到可行计划中

Christos Ziakas, Amir Bar, Alessandra Russo

专题命中 具身推理 :world model(title,abstract);manipulation(abstract);navigation(abstract);分类 cs.LG

AI总结 本文提出GVP-WM方法,通过学习动作条件的世界模型,将生成视频计划接地为可行动作序列,解决视频生成计划在时间一致性和物理约束上的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08955 2026-03-17 cs.CL cs.AI cs.LG 81%

Imagine-then-Plan: Agent Learning from Adaptive Lookahead with World Models

想象后再计划:基于世界模型的自适应前瞻学习 agent 学习框架

Youwei Liu, Jian Wang, Hanlin Wang, Beichen Guo, Wenjie Li

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Imagine-then-Plan框架,通过自适应前瞻机制提升agent在复杂任务中的推理能力,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14948 2026-03-17 cs.CV 79%

Bridging Scene Generation and Planning: Driving with World Model via Unifying Vision and Motion Representation

弥合场景生成与规划:通过统一视觉与运动表示进行驾驶世界模型

Xingtai Gui, Meijie Zhang, Tianyi Yan, Wencheng Han, Jiahao Gong, Feiyang Tan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Afari Intelligent Drive(Afari智能驾驶)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出WorldDrive框架,通过统一视觉与运动表示弥合场景生成与规划之间的差距,利用轨迹感知驾驶世界模型和未来感知奖励器提升自动驾驶规划性能。

Comments 16 pages, 9 figures. The code is available at https://github.com/TabGuigui/WorldDrive

详情

展开后加载摘要…

URL PDF HTML 收藏