A Standardized Re-evaluation of Conversational Recommender Systems on the ReDial Dataset
对ReDial数据集上对话推荐系统的一次标准化重新评估
AI总结 本文针对ReDial数据集上对话推荐系统的评估问题,通过标准化条件重新评估了三种架构家族中的七种主流方法,揭示了细粒度排名对实现细节的高度敏感性,以及重复捷径对准确性报告的显著影响,同时指出LLM基础能力对性能提升的影响大于架构创新,最后通过用户导向的指标证明传统召回率可能高估系统对话效果。
Comments Accepted to Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia