MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
MergeMix:一种用于视觉和多模态理解的统一增强范式
机构 * Westlake University(西拉克大学) ; Zhejiang University(浙江大学) ; College of Computer Science and Technology(计算机科学与技术学院)
专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)
AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。
Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/