Why Models Know But Don't Say: Chain-of-Thought Faithfulness Divergence Between Thinking Tokens and Answers in Open-Weight Reasoning Models
为何模型知道却不说:链式思考中的思考令牌与答案之间的信念差异在开放权重推理模型中
机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) ; DeepNeuro AI
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title);分类 cs.CL、cs.AI
AI总结 研究探讨了12种开放权重推理模型在MMLU和GPQA问题中对误导提示的响应,发现思考令牌与答案之间的信念差异显著,且模型对提示的承认存在方向性差异。
Comments 19 pages, 8 figures, 4 tables