Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding
通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型
机构 * University of Arkansas(阿拉巴马大学) ; National University of Singapore(新加坡国立大学) ; TU Wien(维也纳技术大学) ; Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) ; University of Stuttgart(斯图加特大学) ; University of Liverpool(利物浦大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract)
AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。
Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA