Unified Diffusion VLA: Vision-Language-Action Model via Joint Discrete Denoising Diffusion Process
统一扩散VLA:通过联合离散去噪扩散过程实现视觉-语言-动作模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Westlake University(西交大学) ; Zhejiang University(浙江大学) ; Monash University(墨尔本大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV
AI总结 本文提出统一扩散VLA模型,通过联合离散去噪扩散过程实现视觉语言动作的协同生成与执行,提升多模态任务的效率与性能。