VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation
VAD:为多模态在线策略蒸馏中的目标重建归因视觉证据
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xiaohongshu Inc.(小红书公司) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Southeast University(东南大学)
AI总结 该研究提出视觉归因蒸馏(VAD)算法,通过反事实目标重建分离教师校正中的视觉证据分量,在6个4B/9B规模的细粒度视觉基准上,性能优于现有蒸馏方法。
Comments The project is accessible at https://github.com/DeepExperience/VAD_Multimodal_OPD