VLA Foundry: A Unified Framework for Training Vision-Language-Action Models
VLA Foundry:一种统一训练视觉-语言-动作模型的框架
机构 * Toyota Research Institute(丰田研究院)
专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI
AI总结 VLA Foundry 提供了一个统一的训练框架,整合了大语言模型、视觉语言模型和视觉-语言-动作模型的训练,支持从头训练和预训练模型,并在 LBM Eval 模拟器上评估了闭合回路策略性能。
Comments 32 pages, 16 figures, technical report