Post-training Large Language Models for Diverse High-Quality Responses
在训练后为大型语言模型生成多样化高质量响应
机构 * Boston University(波士顿大学) ; University of Maryland, College Park(马里兰大学学院公园分校) ; University College London(伦敦大学学院) ; Boston University Broad Institute of MIT and Harvard(MIT和哈佛大学波士顿大学Broad研究所)
专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出DQO方法,通过确定性点过程优化大型语言模型的质量和语义多样性,提升输出多样性而不影响性能。
Comments ICLR 2026