Answer-Conditioned Chains of Thought Degrade Verifiable-Reasoning Distillation in Large Language Models
答案条件思维链降低大语言模型中的可验证推理蒸馏
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型推理能力蒸馏中,答案条件思维链会降低训练数据质量,导致可验证推理准确性下降,损失随难度增加,机制是从答案反向合理化,危害是数据属性,建议盲目生成答案。
Comments 13 pages, 4 figures, 14 tables. Code: https://github.com/js-lee-AI/answer-leakage