Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity
质量约束的熵最大化策略优化用于LLM多样性
机构 * Zuoyebang Education Technology(左叶bang教育科技)
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出QEMPO框架,通过理论推导的闭式解在保证输出质量的同时最大化熵以提升LLM多样性,实验证明其在不牺牲质量的情况下提升多样性。