FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization
FOCUS: 通过视觉支持约束和策略优化强制上下文目标定位
机构 * Amazon, Seattle, USA(亚马逊(美国西雅图))
专题命中 图像编辑 :image editing(abstract);分类 cs.CV
AI总结 提出一种两阶段训练框架,通过优化支持框与查询图像间的上下文注意力并结合GRPO强化学习,实现无类别监督的类别无关上下文目标定位,7B模型性能超越72B模型。
Comments Accepted at ICML 2026. * Equal Contributions