TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs
TRACES:用于评估大型语言模型科学推理中认知可靠性的基准
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究构建了名为TRACES的基准,发现30种大型语言模型在识别42篇不可靠科学论文的认知可靠性时表现不佳,仅少数模型能有效拒绝有缺陷前提,凸显科学部署需护栏。
Comments 16 pages + appendices. 4 figures in the main text