Foveated Reasoning: Stateful, Action-based Visual Focusing for Vision-Language Models
聚焦推理:面向视觉语言模型的有状态、基于动作的视觉聚焦
机构 * AI Center -- Mountain View, Samsung Electronics(三星电子山景城人工智能中心)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出Foveated Reasoner,通过整合聚焦与推理机制,提升视觉语言模型在高分辨率图像下的效率与准确性,实验证明其在多种基准测试中表现优异。
Comments ECCV 2026