Capabilities and Evaluation Biases of Large Language Models in Classical Chinese Poetry Generation: A Case Study on Tang Poetry
大型语言模型在古典汉语诗歌生成中的能力与评估偏差:以唐诗为例
机构 * LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; University of Maryland, College Park(马里兰大学College Park分校)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文通过三步评估框架,分析了六个先进LLM在唐诗生成中的表现,揭示了LLM在模仿统计模式时对机器生成诗歌的系统性高估问题,强调了需要混合人类-模型验证框架的重要性。
Comments ACL 2026 Findings