Grading the Grader: Lessons from Evaluating an Agentic Data Analysis System
给评分者打分:评估智能数据分析系统的经验教训
机构 * Columbia University(哥伦比亚大学)
AI总结 针对智能数据分析系统输出复杂、难以评估的问题,提出三层人机评分级联(严格正则匹配、LLM宽松评分、基于片段的人工检查),在153个任务上实现100%精确率,宽松评分召回率97%,并通过迭代提示机制将评分成功率从36%提升至97%。