Benchmarking on Tasks That Matter: Dataset Selection for Preserving Model Rankings
对重要任务的基准测试:用于保持模型排名的数据集选择
机构 * Applied AI Institute Moscow(莫斯科应用人工智能研究所)
AI总结 提出一个框架,通过评估不同选择策略如何保持全局模型排名,从大量数据集中选择代表性子集,并利用自举聚合提供置信区间。在时间序列分类和NLP基准上,简单策略如FAFI优于随机选择;在推荐系统中改进不显著。
Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)