Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models
动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造
机构 * Shanghai Qizhi Institute(上海期智研究院) ; The Chinese University of Hong Kong(香港中文大学) ; Hong Kong Embodied AI Lab(香港具身人工智能实验室) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。