arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-04 至 2026-05-04 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 1 篇

2605.00475 2026-05-04 cs.RO cs.CV 62%

MSACT: Multistage Spatial Alignment for Stable Low-Latency Fine Manipulation

MSACT:多阶段空间对齐用于稳定低延迟精细操控

Xianbo Cai, Hideyuki Ichiwara, Masaki Yoshikawa, Tetsuya Ogata

机构 * Department of Intermedia Art and Science, Waseda University(武藏大学多媒体艺术与科学系) National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MSACT,通过多阶段空间对齐模块提升低延迟精细操控的稳定性,结合预训练ResNet视觉先验,增强视觉到动作的映射稳定性,实验证明在模拟和真实任务中提升了定位稳定性和任务性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏