One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents
一次交互胜过千次猜测:深度研究代理的交互能力基准测试
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) ; Zhejiang University(浙江大学) ; State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)
AI总结 提出IDRBench基准,通过交互式框架和用户模拟器评估深度研究代理的交互能力,实验表明交互能提升研究质量和鲁棒性。
Comments 17 pages, 9 figures, 9 tables