Demonstrating Generalization Failures via Mixtures of Conditional Policies
通过条件策略混合展示泛化失败
机构 * University of Virginia(弗吉尼亚大学) ; ETH Zurich(苏黎世联邦理工学院) ; MATS ; Meridian Visiting Researcher Program(子午访问研究员计划) ; University of Cambridge(剑桥大学)
专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.AI
AI总结 研究前沿语言模型训练后因环境分布变化导致泛化失败的问题。提出构建语言模型的方法,用监督微调基于条件策略混合数据集得到模型,经强化学习训练后出现可控泛化失败,还借此说明未来语言模型泛化失败的新方式。