arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-06 至 2026-08-06 共收录 12 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 12 篇

2608.05078 2026-08-06 cs.RO 新提交 79%

SpikingNav: Robust Embodied Navigation with Spiking Neural Policies

SpikingNav:基于脉冲神经网络策略的鲁棒具身导航

Jiahong Zhang, Sijun Shen, Dehua Wu, Yifan Lin, Xuechen Xia, Xu Chu, Youhui Zhang, GuoqiLi

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出SpikingNav脉冲导航框架,含SSE与SPN,在PointNav、ObjectNav任务中,其参数更少、计算量更低,鲁棒性优于匹配的ANN基线,且可部署于Thruster-V2芯片。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04825 2026-08-06 cs.RO 新提交 79%

Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation

飞行前深思熟虑:面向无人机“看见并到达”导航的视觉引导空间深思熟虑

Fanfu Xue, En Yu, Bohang Liu, Hongjun Wang, Yang Yang, Xindi Wang, Jiande Sun

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对无人机“看见并到达”导航中语义-控制失配问题,提出视觉-语言航路点预测框架DBFly,通过空间机动决策链、隐式飞行走廊和感知终端收敛的停止策略,使成功率较SOTA基线平均提升25.07个百分点。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29123 2026-08-06 cs.RO 版本更新 79%

On the Identifiability of Aided Inertial Navigation Under Measurement Delays: A Geometric Approach

关于测量延迟下辅助惯性导航的可辨识性:一种几何方法

Jonathan Kelly

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对辅助惯性导航中未知恒定时间延迟问题,采用几何分析揭示了退化轨迹导致延迟与状态不可辨识的连续对称性。

Comments Technical Report STARS-2026-001, University of Toronto Institute for Aerospace Studies (26 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22014 2026-08-06 cs.MA cs.RO 版本更新 79%

DM$^3$-Nav: Decentralized Multi-Agent Multimodal Multi-Object Semantic Navigation

DM$^3$-Nav:去中心化多智能体多模态多目标语义导航

Amin Kashiri, Atharva Jamsandekar, Yasin Yazıcıoğlu

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Northeastern University(东北大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 DM$^3$-Nav是一种去中心化的多智能体语义导航系统,支持多模态开放词汇目标指定和多目标任务,通过局部通信实现自主协调,验证了在真实办公环境中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04732 2026-08-06 eess.SY cs.AI cs.RO cs.SY 新提交 62%

Toward Integrating Adaptive Experience Replay and Online Uncertainty Estimation in Safe Actor-Critic Optimal Control

在安全Actor-Critic最优控制中融合自适应经验回放与在线不确定性估计

Mahshad Rastegarmoghaddam, Davoud Nikkhouy, Shima Samadzadeh

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 该研究在安全Actor-Critic最优控制中提出融合自适应经验回放与在线不确定性估计的集成架构,在二维机器人导航任务的测试中,该集成配置在极端压力测试下实现零接触且全部种子到达目标,性能优于仅移除不确定性估计的配置。

Comments Code, deterministic seeds, data, figures, and protocol files are archived at https://doi.org/10.5281/zenodo.21515850 and https://github.com/SDNT8810/safe-actor-critic-aer-ue-reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04905 2026-08-06 cs.RO 新提交 57%

PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3

PRIMAL3:基于强化学习与模仿的多智能体路径规划——利用LaCAM3

Chengyang He, Tanishq Duhan, Gadiel Sznaier Camps, Fangyuan Wang, Yuhong Cao, Jiankai Sun, Ge Sun, Mac Schwager, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 PRIMAL3是整合强化学习、LaCAM3等的超大规模多智能体路径规划框架,性能优于现有基线,可扩展至10万智能体,能部署于物理机器人系统

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04723 2026-08-06 cs.RO 新提交 57%

A Vision-based Control Framework for Real-time Autonomous UUV Operations

用于实时自主水下航行器(UUV)作业的基于视觉的控制框架

Erik Tjærand Frøland, Marco Job, Md Ether Deowan, Eleni Kelasidi

机构 * NTNU(挪威科技大学) Oceaneering AS(奥星海洋公司)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 提出一种用于动态复杂水下环境中UUV的基于视觉的控制框架,可实现实时定位、导航与建图,经合成数据集验证及实船测试,性能实时且鲁棒,支持海洋机器人现场部署完成水下关键任务。

Comments Accepted to IFAC WC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04420 2026-08-06 cs.RO 新提交 57%

SCOPE: Field-of-View-Aware Path Planning in Unknown 3D Environments via Safety-Volume Certification

SCOPE:通过安全体积认证在未知三维环境中感知视场的路径规划

Junbin Yuan, Muqing Cao, Yunwoo Lee, Brady Moon, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Brigham Young University(杨百翰大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 SCOPE是一种在未知3D环境中规划路径的框架,通过安全体积认证实现视场感知,可到达所有目标、减少任务时间,真实机器人演示验证其有效性。

Comments Project website: https://yuanjunbin.github.io/scope-planner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17430 2026-08-06 cs.RO 版本更新 57%

SafeLand: Safe Autonomous Landing in Unknown Environments with Bayesian Semantic Mapping

SafeLand: 在未知环境中使用贝叶斯语义映射实现安全自主着陆

Markus Gross, Andreas Greiner, Sai Bharadhwaj Matha, Felix Soest, Daniel Cremers, Henri Meeß

机构 * Fraunhofer IVI Autonomous Aerial Systems(弗劳恩霍夫IVI自主航空系统) TU Munich Computer Vision Group(慕尼黑工业大学计算机视觉组) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出SafeLand系统,通过深度学习语义分割构建在线语义地面地图,结合贝叶斯概率过滤和行为树实现安全自主着陆,通过200次模拟和60次实地测试,展示零误报的人类检测率和亚秒响应延迟。

Journal ref ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04807 2026-08-06 cs.IR 新提交 50%

WatchLens: A Configurable Platform for Online Video Recommendation Experiments

WatchLens:用于在线视频推荐实验的可配置平台

Deogyong Kim, Dongha Lee

专题命中 具身导航 :navigation(abstract)

AI总结 WatchLens是一款开源可配置平台,可在单一工作流中关联在线视频推荐策略与用户播放等行为,通过模块化架构实现灵活配置,支持会话级效果比较,为在线视频推荐研究提供可复现的单服务器部署方案。

Comments 6 pages, 3 figures. Accepted to RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04574 2026-08-06 cs.CL 新提交 50%

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

当记忆“说谎”:VLM智能体中空间记忆过时的实证研究

Yushi Sun, Yanjie Zhang

机构 * Tencent LIGHTSPEED(腾讯光速工作室)

专题命中 具身导航 :navigation(abstract)

AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04670 2026-08-06 cs.HC 版本更新 50%

Who Responds When the Driver Is Gone? A Framework for Holistic Passenger Intent Understanding

当驾驶员离开时谁来做出反应?一种人类意图理解框架

Xuewen Luo, Ding Fan, Ruiqi Chen, Ye Cao, Xiujin Liu, Bo Yu, Fengze Yang, Chenxi Liu

专题命中 具身导航 :navigation(abstract)

AI总结 研究无人驾驶时谁理解并回应乘客,提出Intent2Drive框架,将意图建模为潜在认知状态,构建数据集和推理器,引入分层规划器,提升意图推理等能力,迈向响应乘客的自动驾驶系统。

详情

展开后加载摘要…

URL PDF HTML 收藏