TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning
TIDE-Bench:面向任务的工具整合推理评估
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)
专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 本文提出TIDE-Bench,一个高效全面的工具整合推理评估基准,通过多样任务设置、任务感知评估协议和高质量评价集,揭示工具整合推理中的持续瓶颈。
Comments 10 pages, 5 figures, 10 tables