Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding
通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型
机构 * University of Arkansas(阿拉巴马大学) ; National University of Singapore(新加坡国立大学) ; TU Wien(维也纳技术大学) ; Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) ; University of Stuttgart(斯图加特大学) ; University of Liverpool(利物浦大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO
AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。
Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA