SSL-R1: Self-Supervised Visual Reinforcement Post-Training for Multimodal Large Language Models
SSL-R1: 多模态大语言模型的自监督视觉强化后训练
机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) ; VIA Research Center(VIA研究中心) ; Google(谷歌)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract)
AI总结 SSL-R1通过自监督学习生成可验证奖励,提升多模态大语言模型的推理能力,无需人工或外部监督,有效增强视觉理解。