PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies
面向通用视觉-语言-动作策略的通用姿态预训练
机构 * Tencent Robotics X(腾讯机器人X) ; Futian Laboratory(福田实验室) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。
Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA
Journal ref Robotics: Science and Systems, 2026