The Tell-Tale Trace: Detecting Reasoning Failures in LLMs Using Chain-of-Thought Dynamics
可察觉的轨迹:利用思维链动态检测大语言模型中的推理失败
专题命中 代码与定理证明 :chain-of-thought(title,abstract);CoT(summary_cn,abstract);reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究利用思维链动态特性,在不假设语言化CoT语义忠实性的情况下,检测大语言模型在布尔可满足性任务中的分布式推理失败,并通过针对性提示干预提升了Llama3-70B的准确率。