Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens
链式视觉思维:通过连续视觉标记教学VLMs更好地看到和思考
机构 * UC Berkeley(加州大学伯克利分校) ; UCLA(洛杉矶大学) ; Panasonic AI Research(松下人工智能研究)
专题命中 视觉推理 :VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 COVT通过连续视觉标记提升VLMs的视觉推理能力,使模型在多个基准测试中性能提升3%-16%。
Comments Project page: https://wakalsprojectpage.github.io/covt-website/