InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models
InfiFPO:通过偏好优化实现大型语言模型的隐式模型融合
机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) ; Zhejiang University(浙江大学) ; PolyU-Daya Bay Technology and Innovation Research Institute(香港理工大学-大亚湾技术与创新研究院)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract)
AI总结 提出InfiFPO方法,通过将DPO中的参考模型替换为融合源模型,在序列级别合成多源概率,实现隐式模型融合,从而在偏好对齐阶段有效融合多个LLM并提升性能。
Journal ref NeurIPS 2025