WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback
WildFeedback: 对齐大语言模型与实时用户交互与反馈
机构 * Microsoft Corporation(微软公司) ; Purdue University(普渡大学) ; Texas A&M University(德克萨斯农工大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of Southern California(南加州大学)
AI总结 本文提出WildFeedback框架,通过实时用户反馈自动创建偏好数据集,提升大语言模型对用户偏好的对齐能力,解决了现有方法的可扩展性、主观性和偏见问题。
Comments ACL 2026 Camera-ready. 25 pages, 6 figures, 9 tables