SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance
SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance
机构 * Zhejiang University(浙江大学) ; Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)
专题命中 其他安全 :alignment(abstract,abstract_cn)
AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。