VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis
VAG:用于具身数据合成的双流视频-动作生成
机构 * GigaAI ; Zhejiang University(浙江大学) ; Peking University(北京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 动作表示与策略 :robot foundation model(abstract);action model(abstract);分类 cs.RO、cs.CV
AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。