arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-22 至 2026-05-22 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 1 篇

2604.24681 2026-05-22 cs.RO 57%

Learning Human-Intention Priors from Large-Scale Human Demonstrations for Robotic Manipulation

从大规模人类示范中学习人类意图先验以用于机器人操作

Yifan Xie, YuAn Wang, Guangyu Chen, Jinkun Liu, Yu Sun, Wenbo Ding

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出MoT-HRA框架,通过大规模人类示范学习人类意图先验,用于机器人操作,通过构建HA-2.2M数据集和三个耦合专家提升动作合理性和鲁棒性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏