Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback
深度研究智能体在过程级反馈下的多轮评估
机构 * Google DeepMind(谷歌DeepMind) ; OpenAI ; Perplexity AI ; LangChain AI
AI总结 针对深度研究智能体(DRA)在单轮输出评估的不足,提出研究缺口推断(RGI)方法提供过程级反馈,发现单轮过程反馈可提升8-15分,但多轮改进因回归问题难以持续。
Comments Published as a workshop paper at SCALE - ICML 2026 (Oral)