MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights
MADE:超越评分——通过多语言智能诊断引擎实现细粒度评估洞察
机构 * Huawei(华为)
专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.CL
AI总结 提出MADE多语言智能诊断引擎,将评估后分析分解为规划、聚合分析、实例检查、多语言文化反思和报告合成,在33个模型族、11个基准、26种语言等大规模设置下,诊断报告质量提升47%,专家偏好率达87.9%。