Convergence Without Understanding: When Language Models Agree on Representations but Disagree on Reasoning
没有理解的趋同:当语言模型在表示上一致但在推理上分歧时
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过分析16个语言模型在800个推理问题上的表示相似性,发现模型在表示上趋同但推理策略不同,表明表示趋同反映的是共享的输入处理约束而非共享的推理策略。