Decomposing Prediction Mechanisms for In-Context Recall
分解上下文召回中的预测机制
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 通过设计结合连续上下文学习与离散关联召回的新玩具问题,发现Transformer模型在上下文召回任务中存在两种具有不同学习动态的独立机制:一种依赖离散符号标签进行关联召回,另一种基于前一个token和上下文进行贝叶斯式预测。
Comments 45 pages, 47 figures, 2 tables