arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-04 至 2026-05-04 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 1 篇

2605.00471 2026-05-04 cs.RO 57%

Stereo Multistage Spatial Attention for Real-Time Mobile Manipulation Under Visual Scale Variation and Disturbances

立体多阶段空间注意力用于在视觉尺度变化和干扰下的实时移动操作

Xianbo Cai, Hideyuki Ichiwara, Hyogo Hiruma, Masaki Yoshikawa, Hiroshi Ito, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(媒体艺术与科学系,早稻田大学) SB Intuitions Corp.(SB Intuitions公司) Research and Development Group, Hitachi, Ltd.(日立株式会社研发部) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出一种基于立体多阶段空间注意力的深度预测学习方法,用于实时移动操作,通过层次递归架构整合空间注意力点与机器人状态,提升在视觉尺度变化和干扰下的鲁棒性和任务成功率。

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏