Operationalising the Superficial Alignment Hypothesis via Task Complexity
通过任务复杂度操作化浅层对齐假设
机构 * University of Maryland(马里兰大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Edinburgh(爱丁堡大学)
AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。
Comments ICML 2026