Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models
让它简单:视觉-语言-动作模型的单步动作生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。
Comments 13 pages, 10 figures