VLM-Aware Meta-Optic Front-End Design for Frozen Vision-Language Models
面向冻结视觉语言模型的VLM感知元光学前端设计
机构 * Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系) ; School of Computational Science and Engineering, Georgia Institute of Technology(佐治亚理工学院计算科学与工程学院) ; Department of Electronic Engineering, Hanyang University(汉阳大学电子工程系)
专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title);分类 cs.CV
AI总结 提出CODA框架,通过可微成像和伴随梯度更新优化连续密度元光学前端,直接优化冻结CLIP分类器的交叉熵损失,在ImageNet-100上将零样本准确率从53.75%提升至65.41%,并跨模型和数据集泛化。
Comments 18 pages, 6 figures, 3 tables