Can Safety Emerge from Weak Supervision? A Systematic Analysis of Small Language Models
安全能否从弱监督中涌现?小型语言模型的系统分析
机构 * Samsung Research Institute(三星研究院)
专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);large language model(abstract);preference optimization(abstract)
AI总结 Self-MOA通过弱监督实现小型语言模型的安全对齐,显著提升安全性的同时保持有用性,减少对人工标注数据的依赖。
Comments 19 pages, 10 tables, 7 figures, under Review