Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation
基于有噪学生策略性自蒸馏的自增强视觉语言模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; ByteDance Inc.(字节跳动公司) ; Zhejiang University of Technology(浙江工业大学) ; Hong Kong Baptist University(香港浸会大学)
AI总结 研究针对视觉语言模型无外部监督难以改进的问题,提出NOPD自蒸馏方法,利用干净与损坏输入预测差异产生自监督信号,在多视觉推理任务中有效,能提升多个模型在多个基准测试中的表现。