When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications
当通用提示改进有害:LLM应用的评估驱动迭代
机构 * Daniel Commey
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。
Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking