Vision Verification Enhanced Fusion of VLMs for Efficient Visual Reasoning
视觉验证增强的VLMs融合以实现高效的视觉推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Cisco Systems(思科系统)
AI总结 本文提出V3Fusion方法,通过融合多种视觉语言模型,利用焦点误差多样性与CKA-focal度量来提升视觉推理性能,实验显示在多个基准上优于现有模型。
大厂专区
视觉验证增强的VLMs融合以实现高效的视觉推理
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Cisco Systems(思科系统)
AI总结 本文提出V3Fusion方法,通过融合多种视觉语言模型,利用焦点误差多样性与CKA-focal度量来提升视觉推理性能,实验显示在多个基准上优于现有模型。