arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM SIGIR Conference on Research and Development in Information Retrieval · 会议 · Information Retrieval

共收录 1420
2605.11433 2026-05-13 cs.IR

FedMM: Federated Collaborative Signal Quantization for Multi-Market CTR Prediction

FedMM: 联邦协作信号量化用于多市场CTR预测

Jun Zhang, Dugang Liu, Xing Tang, Xiuqiang He, Zhong Ming

AI总结 FedMM通过离散码本机制实现隐私保护传输,结合分层码本结构捕捉跨市场共享模式和特定市场特征,提升多市场CTR预测精度。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10530 2026-05-12 cs.IR

Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery

个性化深度研究:以用户为中心的框架、数据集和混合评估方法用于知识发现

Xiaopeng Li, Wenlin Zhang, Yingyi Zhang, Pengyue Jia, Yejing Wang, Yichao Wang, Yong Liu, Huifeng Guo, Xiangyu Zhao

AI总结 本文提出PDR框架,结合用户上下文动态调整检索深度和广度,通过混合评估方法提升检索效用和报告相关性,验证了个性化知识获取的可行性。

Comments Accepted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10323 2026-05-12 cs.IR

Every Preference Has Its Strength: Injecting Ordinal Semantics into LLM-Based Recommenders

每种偏好都有其强度:将序数语义注入基于LLM的推荐系统

Jiwon Jeong, Donghee Han, Sungrae Hong, Woosung Kang, Mun Yong Yi

AI总结 本文提出OSA框架,通过建模用户反馈来显式整合偏好强度,保留序数语义以提升推荐系统性能。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10097 2026-05-12 cs.IR

H-MAPS: Hierarchical Memory-Augmented Proactive Search Assistant for Scientific Literature

H-MAPS:用于科学文献的分层记忆增强主动搜索助手

Koji Nishikawa, Makoto P. Kato

AI总结 H-MAPS通过三层分层记忆解决文献阅读中的上下文模糊问题,利用隐含的阅读行为将用户潜在需求转化为自然语言问题,并在本地设备上进行神经检索以确保隐私。

Comments Accepted as a demonstration paper at SIGIR 2026. 6 pages, 2 figures. A video demonstration is available at https://qr1.jp/5A3icZ

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09338 2026-05-12 cs.IR

A General Framework for Multimodal LLM-Based Multimedia Understanding in Large-Scale Recommendation Systems

多模态大语言模型在大规模推荐系统中的通用框架

Yiming Zhu, Xu Liu, Ziyun Xu, Zheng Wu, Joena Zhang, Sirius Chen, Chenheli Hua, Silvester Yao, Qichao Que, Wentao Shi, Junfeng Pan, Linhong Zhu

AI总结 本文提出一个通用框架,利用多模态大语言模型提升多媒体内容理解,通过三部分架构实现内容解析、特征提取和系统集成,实验证明在推荐系统中提升了AUC和在线指标。

Comments Accepted by SIGIR 2026 short

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21675 2026-05-12 cs.IR

Counterfactual Multi-task Learning for Delayed Conversion Modeling in E-commerce Sales Pre-Promotion

反事实多任务学习用于电商销售预促销中的延迟转化建模

Xin Song, Kaiyuan Li, Jinxin Hu

AI总结 本文提出CM-DCM模型,通过多任务架构和反事实因果方法,提升预促销期间直接和延迟转化预测精度,实验表明在预促销场景中优于基线模型,显著提升广告收入和GMV。

Comments 6 pages, accepted by 49th International ACM SIGIR Conference on Research and Development in Information Retrieval(SIGIR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09933 2026-05-12 cs.IR

A Voronoi Cell Formulation for Principled Token Pruning in Late-Interaction Retrieval Models

基于Voronoi单元的原理化令牌修剪方法:用于晚期交互检索模型

Yash Kankanampati, Yuxuan Zong, Nadi Tomeh, Benjamin Piwowarski, Joseph Le Roux

AI总结 本文提出基于超空间几何的Voronoi单元方法,用于原理化修剪晚期交互检索模型中的令牌嵌入,通过保留检索质量的同时减少索引存储开销。

Comments Accepted at SIGIR 2026 Full Paper Track; 11 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13415 2026-05-12 cs.IR cs.CL cs.CV

Attention Grounded Enhancement for Visual Document Retrieval

基于注意力的视觉文档检索增强

Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。

Comments Published as a conference paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07314 2026-05-11 cs.IR cs.AI

DCGL: Dual-Channel Graph Learning with Large Language Models for Knowledge-Aware Recommendation

DCGL: 基于大语言模型的双通道图学习用于知识感知推荐

Xinchi Zou, Tongzhenzhi Su, Jianjun Li, Yuan Fu, Chang Liu, Zhiying Deng, Zhiwei Shen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) Laboratory for Artificial Intelligence and New Forms of Education, Central China Normal University(中央财经大学人工智能与新教育形式实验室)

AI总结 本文提出DCGL框架,通过双通道架构、多级对比学习和动态融合机制,解决知识图谱与大语言模型结合中的隐含语义建模、单通道融合和用户行为频率考虑不足问题,实验表明其在稀疏场景中表现优异。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06403 2026-05-08 cs.CL cs.IR

GATHER: Convergence-Centric Hyper-Entity Retrieval for Zero-Shot Cell-Type Annotation

GATHER:面向零样本细胞类型注释的收敛性超实体检索

Zhonghui Zhang, Feng Jiang, Shaowei Qin, Jiahao Zhao, Min Yang

机构 * Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) Software College, Northeastern University(东北大学软件学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 GATHER通过全局多源图遍历识别拓扑收敛点,以高信息超实体捕捉实体协同,无需LLM参与检索,提升零样本细胞类型注释效率。

Comments Accepted to SIGIR 2026. 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10468 2026-05-05 cs.IR cs.AI cs.CL

Learning Decomposed Contextual Token Representations from Pretrained and Collaborative Signals for Generative Recommendation

从预训练和协作信号中学习分解的上下文令牌表示以生成推荐

Yifan Liu, Yaokun Liu, Zelin Li, Zhenrui Yue, Gyuseok Lee, Ruichen Yao, Yang Zhang, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Miami University(迈阿密大学)

AI总结 本文提出DECOR框架,通过上下文化令牌组成和分解嵌入融合,提升推荐性能,实验证明其优于现有方法。

Comments Accepted to SIGIR 2026. Full author version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00597 2026-05-04 cs.IR

MUDY: Multi-Granular Dynamic Candidate Contextualization for Unsupervised Keyphrase Extraction

MUDY:面向无监督关键词提取的多粒度动态候选上下文化

Hyeongu Kang, Susik Yoon

AI总结 MUDY提出一种以上下文为核心的框架,通过多粒度注意力机制和候选感知加权,提升关键词提取的局部上下文重要性识别能力,实验证明其在多个数据集上优于现有方法。

Comments Accepted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00560 2026-05-04 cs.IR

When More Reformulations Hurt: Avoiding Drift using Ranker Feedback

当更多改写损害:通过排序器反馈避免漂移

V Venktesh, Mandeep Rathee, Avishek Anand

AI总结 本文提出ReformIR框架,通过预算感知的检索方法,在有限计算下优化改写查询的召回率并抑制漂移,实验表明其在MSMARCO和TREC DL基准上优于现有方法。

Comments Accepted to SIGIR 26 full paper track 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00400 2026-05-04 cs.IR cs.CL

FollowTable: A Benchmark for Instruction-Following Table Retrieval

FollowTable:一项指令遵循表格检索的基准测试

Rihui Jin, Yuchen Lu, Ting Zhang, Jun Wang, Kuicai Dong, Zhaocheng Du, Dongping Liu, Gang Wang, Yong Liu, Guilin Qi

机构 * Southeast University(东南大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室(东南大学)) Its Interdisciplinary Applications (Southeast University), Ministry of Education(交叉应用(东南大学),教育部)

AI总结 本文提出了一项新的表格检索任务IFTR,要求模型同时满足主题相关性和细粒度指令约束。通过引入FollowTable基准测试,评估模型在遵循指令方面的表现,发现现有检索模型在处理表格数据时存在系统性偏差。

Comments SIGIR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28142 2026-05-01 cs.IR cs.LG

Efficient Multivector Retrieval with Token-Aware Clustering and Hierarchical Indexing

高效多向量检索:基于令牌感知聚类与层次索引

Silvio Martinico, Franco Maria Nardini, Cosimo Rulli, Rossano Venturini

机构 * University of Pisa \& ISTI--CNR Pisa Italy University of Pisa Pisa Italy University of Pisa \& ISTI--CNR University of Pisa

AI总结 本文提出TACHIOM系统,通过令牌级结构加速聚类与检索,利用令牌分布优化聚类中心分配,实现高效文档评分,实验显示其聚类速度比k-means快247倍,检索速度提升9.8倍且效果相当。

Comments 6 pages, 2 figures, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27878 2026-05-01 cs.IR

SimEval-IR: A Unified Toolkit and Benchmark Suite for Evaluating User Simulators and Search Sessions

SimEval-IR:评估用户模拟器和搜索会话的统一工具包和基准测试套件

Saber Zerhoudi

AI总结 本文提出SimEval-IR,一个统一的工具包和基准测试套件,用于评估用户模拟器和搜索会话的行为真实性和测试者可靠性,通过三个可执行基准和四个真实数据集的基线结果展示其贡献。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27790 2026-05-01 cs.IR cs.AI cs.CL cs.CY cs.HC

How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews

生成式AI如何颠覆搜索:对谷歌搜索、吉米和AI概述的实证研究

Riley Grossman, Songjiang Liu, Michael K. Chen, Mike Smith, Cristian Borcea, Yi Chen

机构 * New Jersey Institute of Technology(新泽西理工学院) Nanyang Technological University(南洋理工大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

AI总结 本研究通过比较谷歌搜索、吉米和AI概述的搜索结果,发现生成式AI在信息检索中存在显著差异,影响网站可见性和内容质量。

Comments Paper Accepted to ACM SIGIR 2026 (49th International ACM SIGIR Conference on Research and Development in Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20122 2026-05-01 cs.CL cs.AI cs.IR cs.LG

NanoKnow: How to Know What Your Language Model Knows

NanoKnow: 如何了解你的语言模型知道什么

Lingwei Gu, Nour Jedidi, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学)

AI总结 通过NanoKnow基准数据集分析语言模型知识来源,发现预训练数据频率影响准确性,外部证据可缓解频率依赖,参数与外部知识互补,无关信息损害表现。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27306 2026-05-01 cs.IR

NuggetIndex: Governed Atomic Retrieval for Maintainable RAG

NuggetIndex:受控原子检索用于可维护的RAG

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

AI总结 NuggetIndex通过存储原子信息单元(nuggets)提升RAG系统的可维护性,通过时间有效性区间和生命周期状态管理,提高召回率和时间正确性,减少冲突率。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27037 2026-05-01 cs.IR cs.CL

Hypencoder Revisited: Reproducibility and Analysis of Non-Linear Scoring for First-Stage Retrieval

Hypencoder 重审:非线性评分在第一阶段检索中的可重复性与分析

Arne Eichholtz, Yongkang Li, Jutte Vijverberg, Tobias Groot, Mohammad Aliannejadi

机构 * University of Amsterdam(阿姆斯特丹大学)

AI总结 本文重审Hypencoder框架,验证其在领域内和领域外基准上的优越性,并分析非线性评分在检索中的表现及扩展应用。

Comments This paper has been accepted as a reproducibility paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15549 2026-05-01 cs.CL

M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets

M-DaQ:用于指令微调数据集的多语言多样性与质量样本检索

Chunguang Zhao, Yilun Liu, Pufan Zeng, Yuanchang Luo, Shimin Tao, Minggui He, Weibin Meng, Song Xu, Chen Liu, Hongxia Ma, Li Zhang, Boxing Chen, Daimeng Wei

机构 * Huawei Technologies Ltd.(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

AI总结 M-DaQ通过联合优化指令-响应质量与跨语言语义多样性,构建高质量平衡训练数据,验证了多语言设置下的Superficial Alignment Hypothesis,并在18种语言上展示出超过60%的胜率。

Comments Accepted by SIGIR 2026 Short

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13024 2026-05-01 cs.CL

WebMall -- A Multi-Shop Benchmark for Evaluating Web Agents

WebMall -- 多店铺评估网络代理的基准

Ralph Peeters, Aaron Steiner, Luca Schwarz, Julian Yuya Caspary, Christian Bizer

机构 * Data and Web Science Group(数据与网络科学组) University of Mannheim(曼海姆大学)

AI总结 WebMall是首个多店铺离线基准,用于评估网络代理在复杂比较购物任务中的性能,包含四个模拟店铺和复杂检索任务。

Comments Accepted for publication at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14541 2026-05-01 cs.CL

LLM-based User Profile Management for Recommender System

基于大语言模型的用户画像管理用于推荐系统

Seunghwan Bang, Hwanjun Song

机构 * Ulsan National Institute of Science and Technology(乌山国立科学研究院) Korea Advanced Institute of Science and Technology(韩国先进科学技术研究院)

AI总结 本文提出PURE框架,通过系统提取和总结用户评论中的关键信息,构建和维护动态用户画像,提升推荐系统的个性化能力。

Comments Accepted at SIGIR 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26653 2026-04-30 cs.IR

AgentSim: A Platform for Verifiable Agent-Trace Simulation

AgentSim:可验证代理跟踪模拟平台

Saber Zerhoudi, Michael Granitzer, Jelena Mitrovic

AI总结 本文提出AgentSim平台,通过多模型验证和主动人工参与流程,生成可验证的代理推理轨迹,构建了覆盖三个信息检索基准的Agent-Trace Corpus,并揭示了先进模型在信息检索中的系统性差异。

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26649 2026-04-30 cs.IR cs.AI cs.CL

When to Retrieve During Reasoning: Adaptive Retrieval for Large Reasoning Models

在推理中何时检索:面向大推理模型的自适应检索

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Brain Investing Limited(Brain Investing有限公司) Stellaris AI Limited(Stellaris AI有限公司)

AI总结 本文提出ReaLM-Retrieve框架,通过三方面创新解决推理模型与检索增强生成的不匹配问题,提升答案F1分数并减少检索调用次数。

Comments 12 pages, 3 figures, 9 tables. Accepted at SIGIR 2026 (49th International ACM SIGIR Conference on Research and Development in Information Retrieval), Melbourne, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25182 2026-04-30 cs.CL cs.IR

CroSearch-R1: Better Leveraging Cross-lingual Knowledge for Retrieval-Augmented Generation

CroSearch-R1: 更有效地利用跨语言知识进行检索增强生成

Rui Qi, Fengran Mo, Sijin Lu, Yufeng Chen, Jian-Yun Nie, Kaiyu Huang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)

AI总结 本文提出CroSearch-R1框架,通过多轮检索策略和多语言回放机制,提升跨语言知识在检索增强生成中的有效性。

Comments Accepted to SIGIR 2026 (Short Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08618 2026-04-30 cs.IR cs.AI cs.SE

SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support

SkillForge: 在云技术支持中锻造领域特定的自我进化代理技能

Xingyan Liu, Xiyue Luo, Linyu Li, Ganghong Huang, Jianfeng Liu, Honglin Qiao

机构 * Alibaba Group(阿里巴巴集团)

AI总结 SkillForge通过闭环创建-评估-改进机制,解决云技术支持中领域特定技能缺乏和持续优化的问题,实验表明其能显著提升技能质量。

Comments Accepted at ACM SIGIR 2026 Industry Track. 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26184 2026-04-30 cs.IR cs.AI cs.CL

Auto-ARGUE: LLM-Based Report Generation Evaluation

Auto-ARGUE:基于大语言模型的报告生成评估

William Walden, Marc Mason, Orion Weller, Laura Dietz, John Conroy, Neil Molino, Hannah Recknor, Bryan Li, Gabrielle Kaili-May Liu, Yu Hou, Dawn Lawrie, James Mayfield, Eugene Yang

机构 * Johns Hopkins University(约翰霍普金斯大学) University of New Hampshire(新罕布什尔大学) IDA Center for Computing Services(IDA计算服务中心) Google(谷歌) Yale University(耶鲁大学) University of Maryland(马里兰大学)

AI总结 本文提出Auto-ARGUE,一种基于大语言模型的报告生成评估工具,通过TREC 2024 NeuCLIR和RAG任务验证,展示了与人类判断的良好相关性,并发布ARGUE-Viz可视化工具。

Comments SIGIR 2026: Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26231 2026-04-30 cs.IR

ProMax: Exploring the Potential of LLM-derived Profiles with Distribution Shaping for Recommender Systems

ProMax:探索基于分布塑造的LLM衍生资料在推荐系统中的潜力

Yi Zhang, Yiwen Zhang, Kai Zheng, Tong Chen, Hongzhi Yin

AI总结 本文提出ProMax框架,通过分布塑造技术提升推荐系统性能,利用用户和物品资料的协同关系,改进推荐模型对未见物品的偏好学习。

Comments 11 pages, 8 figures, accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18112 2026-04-30 cs.CL cs.MM

Retrieval-Augmented Multimodal Model for Fake News Detection

增强检索的多模态模型用于虚假新闻检测

Yiheng Li, Weihai Lu, Hanyi Yu, Yue Wang

机构 * University of International Business and Economics(国际商务经济大学) Peking University(北京大学) University of Southern California(南加州大学) Upstart Holdings, Inc.(Upstart Holdings公司)

AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。

Comments Accepted to SIGIR 26

详情

展开后加载摘要…

URL PDF HTML 收藏