arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-07-02 至 2026-07-02 共收录 2
2603.19294 2026-07-02 cs.LG cs.AI cs.CL 版本更新

Maximizing Mutual Information Between Prompt and Response Improves LLM Performance With No Additional Data

最大化提示与响应之间的互信息无需额外数据即可提升LLM性能

Hyunji Nam, Haoran Li, Natasha Jaques

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出互信息偏好优化(MIPO)方法,通过对比数据增强构建偏好对,利用直接偏好优化最大化提示与响应间的点互信息,无需额外数据或外部监督即可提升LLM在个性化和可验证任务上的性能。

Comments International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06810 2026-07-02 q-bio.NC cs.LG 版本更新

Reward function compression facilitates goal-dependent reinforcement learning

奖励函数压缩促进目标依赖的强化学习

Gaia Molinaro, Anne G. E. Collins

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 本研究提出人类通过将复杂目标信息压缩为稳定的奖励函数来提高目标依赖强化学习的效率,实验表明目标空间大小损害学习但可压缩性改善学习,且奖励处理速度与学习正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏