Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers
论文重构评估:评估AI论文中的表现和幻觉
机构 * The University of Tokyo(东京大学)
专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出首个系统评估框架,用于量化现代编码代理生成论文的质量与风险。通过重构现有论文并生成完整论文进行比较,将评估分为表现和幻觉两个维度,基于PaperWrite-Bench基准测试,揭示ClaudeCode和Codex在表现与幻觉间的权衡。
Comments Project Page: https://agent4science-utokyo.github.io/PaperRecon_HP/