See2Think: Do Multimodal Models Really Use Intermediate Visual States?
See2Think:多模态模型是否真正利用中间视觉状态?
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出See2Think评估框架,通过See2ThinkBench和VAoT测试多模态模型对中间视觉状态的依赖,发现视觉推理具模型与环境依赖性,准确渲染是瓶颈,受损反馈会使模型准确率降超10个百分点。
Comments 10 pages, 5 figures, and 8 tables