LoHoSearch: Benchmarking Long-Horizon Search Agents Beyond the Human Difficulty Ceiling
LoHoSearch: 超越人类难度上限的长时域搜索代理基准测试
机构 * Meituan(美团)
AI总结 提出LoHoSearch基准,基于700万维基实体知识图谱自动构建544个复杂问题,评估显示最强模型仅34.74%准确率,远超人类难度上限。
大厂专区
LoHoSearch: 超越人类难度上限的长时域搜索代理基准测试
机构 * Meituan(美团)
AI总结 提出LoHoSearch基准,基于700万维基实体知识图谱自动构建544个复杂问题,评估显示最强模型仅34.74%准确率,远超人类难度上限。