Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data
最大化提示与响应之间的互信息无需额外数据即可提升LLM性能
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出互信息偏好优化(MIPO)方法,通过对比数据增强构建偏好对,利用直接偏好优化最大化提示与响应间的点互信息,无需额外数据或外部监督即可提升LLM在个性化和可验证任务上的性能。
Comments International Conference on Machine Learning 2026