One Token Per Frame: Reconsidering Visual Bandwidth in World Models for VLA Policy
每帧一个令牌:重新考虑世界模型中的视觉带宽
机构 * Zhejiang University(浙江大学) ; Central South University(中南大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) ; E-surfing Digital Life Technology Co., Ltd., China Telecom(亿联数字生活技术有限公司,中国电信)
AI总结 本文提出OneWM-VLA,通过自适应注意力池化将每帧视图压缩为一个语义令牌,以单一流匹配目标生成潜在流和动作轨迹,从而减少每帧视觉带宽而不影响长视界性能。