LARY: A Latent Action Representation Yielding Benchmark for Generalizable Vision-to-Action Alignment
LARY:一种产生通用视觉到动作对齐基准的潜在动作表示
机构 * Meituan(美团)
专题命中 数据集与评测 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV
AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。
Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench