Coarse-to-Control: Action-Token Planning for Vision-Language-Action Models
粗到细控制:面向视觉-语言-动作模型的行动令牌规划
机构 * Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Tsinghua University(清华大学)
AI总结 提出Coarse-to-Control框架,在动作令牌空间中引入原生规划,通过先预测粗粒度动作令牌序列再生成可执行动作,提升长程任务性能。