Additive Control Variates Dominate Self-Normalisation in Off-Policy Evaluation
加性控制变量化身自归一化在非策略评估中的主导地位
机构 * Microsoft(微软)
AI总结 本文证明加性控制变量化身自归一化在非策略评估中具有更优的均方误差性能,理论支持了从自归一化到最优基线修正的转变。
Comments Published at SIGIR 2026
期刊&会议
ACM SIGIR Conference on Research and Development in Information Retrieval · 会议 · Information Retrieval
加性控制变量化身自归一化在非策略评估中的主导地位
机构 * Microsoft(微软)
AI总结 本文证明加性控制变量化身自归一化在非策略评估中具有更优的均方误差性能,理论支持了从自归一化到最优基线修正的转变。
Comments Published at SIGIR 2026
实体作为检索信号:面向实体导向排序的系统研究
AI总结 研究探讨了实体导向排序中覆盖、监督与评估的系统性问题,发现实体通道限制导致覆盖与区分度难以兼得,强调需改进评估方法以区分条件与开放世界场景。
Comments v2: Corrects RelCov@20 in Table 6 (previously approximated from entity document frequencies; now computed exactly at document level). Reframes the evaluation axis as leaked vs. clean entity supervision rather than document-pool restriction. Adds discussion of Boudens et al. (SIGIR 2026), linking density statistics, and an OER-oracle diagnostic
TReB:评估大语言模型表格推理能力的综合基准
机构 * JIUTIAN Research(天研机构)
AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。
Comments published by SIGIR 2026
Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275
SQuTR:一种在语音噪声下 spoken query 到文本检索的鲁棒性基准
机构 * Huazhong University of Science and Technology(华中科技大学) ; The University of Hong Kong(香港大学) ; Soochow University(苏州大学) ; University of Science and Technology of China(中国科学技术大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学) ; The University of Tokyo(东京大学)
AI总结 SQuTR通过大规模数据集和统一评估协议,评估语音检索系统在复杂噪声环境下的鲁棒性,揭示了极端噪声下检索性能显著下降的问题。
Comments Accepted by SIGIR 2026
Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia
OpenCoderRank: 基于生成式AI的个性化技术评估
AI总结 OpenCoderRank是一种轻量级自托管平台,通过模拟真实世界限时技术评估,为资源受限环境提供定制化评估解决方案,结合BERTScore和LLM评估方法验证其有效性。
Comments Accepted to SynthIR Workshop (SIGIR 2026)
通过梯度多子空间调优统一大语言模型中的搜索与推荐
AI总结 针对搜索与推荐统一中全微调计算昂贵、参数高效微调存在梯度冲突和用户意图理解偏移的问题,提出梯度多子空间调优框架,通过多子空间分解和零空间投影缓解冲突并保持通用知识,在基准数据集上超越现有方法。
Comments Accepted by SIGIR 2026
重新审视深度研究中的文本排序
机构 * The University of Edinburgh(爱丁堡大学) ; University of Glasgow(格拉斯哥大学)
AI总结 本文通过复现实验,从检索单元、流水线配置和查询特性三个角度评估文本排序方法在深度研究中的有效性,并提出Q2Q方法缓解查询不匹配问题。
Comments Accepted at the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)
RecQuest:在对话推荐系统中估计用户领域知识
AI总结 提出RecQuest方法,通过游戏化数据收集协议从对话记录中估计用户领域知识,解决现有系统无法适应新手用户的问题,并发布数据集和基线方法。
Comments To appear in Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR)
桥接被动与主动:通过主动表达建模增强对话启动推荐
机构 * Bytedance Beijing China(字节跳动北京中国)
AI总结 针对LLM驱动的对话搜索中被动推荐陷入回声室的问题,提出PA-Bridge框架,通过对抗分布对齐器桥接被动推荐与主动表达之间的分布差异,并引入语义离散化器实现流行度去偏,在线实验显著提升特征渗透率和用户活跃天数。
Comments Accepted by SIGIR 2026
RoTRAG: 基于经验法则推理的检索增强生成对话有害内容检测
机构 * Peking University(北京大学) ; Enhans ; University of North Texas(北得克萨斯大学)
AI总结 提出RoTRAG框架,通过检索外部道德规范(RoTs)增强LLM的多轮对话有害内容检测,实现基于规范推理和分类,平均F1提升约40%,分布误差降低8.4%。
Comments Accepted by SIGIR-ICTIR 2026, Oral Presentation
Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR '26), July 25, 2026, Melbourne, VIC, Australia. ACM, New York, NY, USA, 12 pages
Orcheo: 一个用于对话式搜索的模块化全栈平台
机构 * University of Amsterdam(阿姆斯特丹大学) ; AI Colleagues(AI同事) ; WU Vienna University of Economics and Business(维也纳经济与商业大学)
AI总结 提出Orcheo开源平台,通过模块化架构、生产级基础设施和45+即用组件,解决对话式搜索研究中框架统一与原型部署的难题。
Comments Accepted to SIGIR 2026