The LLM Effect on IR Benchmarks: A Meta-Analysis of Effectiveness, Baselines, and Contamination
大型语言模型对信息检索基准的影响:有效性、基线和污染的元分析
AI总结 本文通过分析143篇论文,探讨了LLM对TREC Robust04和DL20基准的有效性影响,发现LLM系统在DL20上提升nDCG@10达8.8%,但存在数据污染问题,影响效果判断。
Comments Accepted at SIGIR 2026