arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-06-24 至 2026-06-24 共收录 2
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07761 2026-06-24 cs.LG cs.AI stat.ML 版本更新

Impatient Bandits: Optimizing for the Long-Term Without Delay

不耐烦的赌博机:无需延迟地优化长期目标

Kelly W. Zhang, Thomas Baldwin-McDonald, Kamil Ciosek, Lucas Maystre, Daniel Russo

机构 * Imperial College London(帝国理工学院伦敦分校) University of Manchester(曼彻斯特大学) Spotify Reflection AI Columbia University(哥伦比亚大学)

AI总结 针对推荐系统中长期用户满意度优化问题,提出一种结合贝叶斯滤波的延迟奖励预测模型和赌博机算法,利用短期代理信号加速学习,理论证明遗憾界依赖于渐进反馈价值,在播客推荐A/B测试中显著优于基线方法。

Comments To appear in Journal of Machine Learning (JMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏