Evaluating Deep Research Agents on Expert Consulting Work: A Benchmark with Verifiers, Rubrics, and Cognitive Traps
评估深度研究代理在专家咨询工作中的表现:一个包含验证器、评分标准和认知陷阱的基准
机构 * Deccan AI Research(德克南人工智能研究所)
专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个基准,通过42个专家编写的任务,使用确定性验证器和五维度评分标准评估三个前沿深度研究代理(Claude、OpenAI o3、Gemini)在管理咨询类结构化分析交付物上的表现,并嵌入认知陷阱,发现所有代理的联合接受率均较低(最高21.4%),且各有独特失败模式。
Comments Updating the paper with more data. Will resubmit