FaithformBench: Benchmarking Faithfulness of Mathematical Chain-of-Thought Autoformalisation
FaithformBench:数学链式思维自动形式化的忠实性基准测试
专题命中 代码与定理证明 :chain-of-thought(title);reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出新基准FaithformBench,通过自动生成扰动推理步骤评估AF系统的忠实性,发现多数AF存在“悄悄修正”无效输入的谄媚现象,当前AF在有效性与无效性保留间存在张力。