Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users
你的鼠标和眼睛悄悄泄露你的偏好:利用用户隐式反馈进行LLM对齐
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) ; York University(约克大学)
AI总结 针对显式反馈稀缺的问题,提出利用鼠标轨迹和眼动数据等隐式反馈训练奖励模型,将文本奖励模型准确率从55%提升至64%,并显著提高DPO对齐后响应质量。