Steering Frozen LLMs: Adaptive Social Alignment via Online Prompt Routing
引导冻结的大型语言模型:通过在线提示路由实现适应性社会对齐
机构 * The Chinese University of Hong Kong(香港中文大学) ; University of Washington(华盛顿大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)
AI总结 本文提出CCLUB框架,通过系统提示路由实现适应性社会对齐,解决部署时静态策略无法应对动态安全规范的问题,实验显示其在累积奖励和子最优差距上优于基线方法。