Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models
Sim-CLIP: 无监督的孪生对抗微调用于鲁棒且语义丰富的视觉-语言模型
机构 * Florida Atlantic University(佛罗里达大西洋大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 Sim-CLIP通过无监督对抗微调提升CLIP视觉编码器的鲁棒性,同时保持语义表示。采用孪生架构和余弦相似度目标,避免大批次对比学习和额外动量编码器,实现低计算开销的鲁棒训练。
Comments Accepted at IJCNN 2026