arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8561 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 4552 篇

2606.05182 2026-06-05 cs.CL cs.IR 62%

LANTERN: Layered Archival and Temporal Episodic Retrieval Network for Long-Context LLM Conversations

LANTERN: 用于长上下文LLM对话的分层存档与时间情节检索网络

Rahul Subramani

机构 * Cisco Systems, Inc.(思科系统公司)

专题命中 检索器与排序 :hybrid retrieval(abstract);分类 cs.IR、cs.CL

AI总结 提出LANTERN,一种轻量级记忆层,通过混合检索主动存档对话轮次并恢复压缩后丢失的细节,无需LLM调用且延迟低于25ms,在94个多轮对话中恢复78.3%的可验证事实,优于MemGPT基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04909 2026-06-04 cs.IR cs.CL 62%

BEATS: Bootstrapping E-commerce Attribute Taxonomies for Search through Iterative Human-AI Collaboration

BEATS: 通过迭代人机协作引导电商搜索属性分类

Yung-Yu Shih, Shang-Yu Su, Tzu-I Ho, Dongzhe Wang, Yun-Nung Chen

机构 * National Taiwan University(国立台湾大学) Rakuten Group, Inc.(拉肯集团) Taiwan Rakuten Ichiba, Inc.(台湾拉肯Ichiba公司) Rakuten Asia Pte. Ltd.(拉肯亚洲有限公司)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 针对新兴市场电商平台缺乏结构化属性模式的问题,提出BEATS框架,利用人机协作的LLM流水线从零构建产品属性分类,并通过属性标注提升搜索系统性能。

Comments 6 pages, 1 figure, 5 tables. Accepted to SIGIR 2026 Industry Track. Official version: https://doi.org/10.1145/3805712.3808520

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04194 2026-06-04 cs.LG cs.CL cs.IR 62%

Training-Free Lexical-Dense Fusion for Conversational-Memory Retrieval

免训练的词汇-稠密融合用于对话记忆检索

Christian Lysenstøen

机构 * Inland Norway University of Applied Sciences(内陆挪威应用科学大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL

AI总结 本文提出一种免训练、仅CPU的检索方法,通过分数级融合最大查询-轮次相似度(后期交互)与BM25,显著提升多会话对话记忆检索的命中率,并分析了不同编码器和池化策略的影响。

Comments 9 pages, 3 figures, 10 tables. Code, data, and per-table receipts: https://github.com/Chrislysen/opsem

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08948 2026-06-02 cs.IR cs.AI 62%

SHERLOCK: Towards Dynamic Knowledge Adaptation in LLM-enhanced E-commerce Risk Management

SHERLOCK:面向LLM增强电商风险管理的动态知识适应

Nan Lu, Yurong Hu, Jiaquan Fang, Yan Liu, Rui Dong, Yiming Wang, Rui Lin, Shaoyi Xu

机构 * Beijing Jiaotong University(北京交通大学) JD.com(京东公司) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 提出Sherlock框架,通过构建领域知识库、两阶段检索增强生成和自演化数据飞轮,将结构化知识与LLM推理结合,提升电商风险案例调查的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30529 2026-06-01 cs.CL cs.AI cs.LG 62%

Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages

通用嵌入还是特定嵌入,哪个更好?非英语语言临床编码搜索的实证研究

David Rey-Blanco, Roberto Cruz

机构 * TietAI

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过使用大型生成语言模型生成的合成数据微调双语编码器,构建两阶段检索器,解决了非英语语言临床编码检索中召回率下降的问题,并在多语言基准上取得了优于BioBERT-ST的性能。

Comments 24 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19806 2026-06-01 cs.CL cs.AI 62%

Chunking German Legal Code

德国法律文本的分块处理

Max Prior, Natalia Milanova, Andreas Schultz

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 研究针对德国成文法,以德国民法典为基准语料库,比较多种分块策略在检索增强生成中的性能,发现基于法律固有结构(如章节、小节)的分块方法在召回率和计算效率上优于语义增强方法。

Comments Accepted at the Eigth Workshop on Automated Semantic Analysis of Information in Legal Texts co-located with the 21th International Conference on Artificial Intelligence and Law (ICAIL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29712 2026-05-29 cs.CL cs.AI 62%

Teaching Language Models to Check Grounded Claim Factuality with Human Test-Taking Strategies

教会语言模型使用人类应试策略检查基于事实的声明真实性

Yuxuan Ye, Raul Santos-Rodriguez, Edwin Simpson

机构 * Intelligent Systems Laboratory(智能系统实验室) University of Bristol(布里斯托大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 将基于事实的声明真实性检查建模为真假阅读理解任务,通过提示语言模型使用明确的应试策略进行高效推理,并训练小语言模型以降低推理成本。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27380 2026-05-28 cs.CL cs.AI 62%

BioELX: Cross-lingual Biomedical Entity Linking via Alias-based Retrieval and LLM Ranking

BioELX: 基于别名的检索与LLM排序的跨语言生物医学实体链接

Yi Wang, Corina Dima, Liangyu Zhong, Steffen Staab

机构 * University of Stuttgart, Germany(斯图加特大学) Technical University of Berlin, Germany(柏林技术大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 提出BioELX两阶段框架,通过维基数据多语言别名增强SapBERT检索器,并利用预训练LLM排序器进行上下文感知消歧,无需标注数据即在多个基准上取得最佳性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01970 2026-05-28 cs.AI cs.CL 62%

Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies

原子技能是前提:当强化学习合成组合推理时,以及当它仅放大时

Sitao Cheng, Xunjian Yin, Ruiwen Zhou, Yuxuan Li, Xinyi Wang, Liangming Pan, William Yang Wang, Victor Zhong

机构 * University of Waterloo(滑铁卢大学) Duke University(杜克大学) National University of Singapore(新加坡国立大学) Princeton University(普林斯顿大学) Peking University(北京大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 通过互补推理任务,研究强化学习是合成新技能还是仅放大已有技能,发现强化学习在基础模型通过监督微调掌握独立原子技能后才能合成新组合策略。

Comments Work in Progress. Code and data are available at https://github.com/sitaocheng/from_atomic_to_composite

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26819 2026-05-27 cs.IR cs.AI 62%

RAGEAR: Retrieval-Augmented Graph-Enhanced Academic Recommender

RAGEAR: 检索增强的图增强学术推荐器

Francesco Granata, Lorenzo Lamazzi, Misael Mongiovì, Francesco Poggi, Valeria Secchini

机构 * Department of Mathematics and Computer Science, University of Catania, Italy(卡塔尼亚大学数学与计算机科学系,意大利) Institute for Cognitive Science and Technology, National Research Council, Italy(意大利国家研究委员会认知科学与技术研究所)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 提出RAGEAR,一种神经符号推荐系统,结合密集检索和知识图谱,通过图感知聚合函数将片段级证据传播到课程级推荐,在学术课程推荐中优于元数据基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26019 2026-05-26 cs.LG cs.AI cs.CL 62%

Retrieval-Augmented Detection of Potentially Abusive Clauses in Chilean Terms of Service

智利服务条款中潜在滥用条款的检索增强检测

Christoffer Loeffler, Tomás Rey Pizarro, Daniel Ignacio Miranda Vásquez, Andrea Martínez Freile

机构 * School of Computer Engineering, Pontificia Universidad Católica de Valparaíso(Pontificia Universidad Católica de Valparaíso计算机工程学院) Faculty of Law, Universidad Adolfo Ibáñez(Adolfo Ibáñez大学法学院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 提出检索增强生成框架,结合混合稠密-稀疏检索与提示增强,用于自动检测和分类智利服务条款中的潜在滥用条款,并引入包含100份合同和10,029条标注条款的语料库,实验表明该方法显著提升性能,使本地模型接近云端系统。

Comments 42 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23572 2026-05-25 cs.IR cs.AI cs.LG 62%

HARNESS-LM: A Three-Phase Training Recipe for Harnessing SLMs in Sponsored Search Retrieval

HARNESS-LM: 一种在赞助搜索中利用小语言模型的三阶段训练方案

Vipul Gupta, Shikhar Mohan, Lakshya Kumar, Pranjal Chitale, Nikit Begwani, Amit Singh, Manik Varma

机构 * Microsoft AI(微软人工智能)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 提出HARNESS-LM三阶段训练框架,通过知识蒸馏将大规模检索器能力迁移至紧凑模型,在Bing Ads上恢复98%以上精度并实现27倍延迟降低。

Comments 9 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22905 2026-05-25 cs.AI cs.CL 62%

EVE-Agent: Evidence-Verifiable Self-Evolving Agents

EVE-Agent: 证据可验证的自我进化智能体

Yamato Arai, Yuma Ichikawa

机构 * Fujitsu Limited(富士通株式会社) The University of Tokyo(东京大学) RIKEN center for AIP(理化学研究所AIP研究中心)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 提出EVE-Agent,通过证据可验证机制确保自我进化智能体生成的训练实例包含可审计的证据片段,从而提升答案的可靠性和可解释性。

Comments 23 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18915 2026-05-21 cs.CL cs.AI 62%

END: Early Noise Dropping for Efficient and Effective Context Denoising

END:早期噪声丢弃以实现高效有效的上下文去噪

Hongye Jin, Pei Chen, Jingfeng Yang, Zhengyang Wang, Fangran Mo, Jinghan Zhang, Meng Jiang, Yifan Gao, Binxuan Huang, Xinyang Zhang, Zheng Li, Tianyi Liu, Huasheng Li, Bing Yin

机构 * Amazon(亚马逊)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出END方法,通过在早期层对输入序列进行分割和线性探针,有效识别并丢弃噪声部分,从而提升LLM在不同任务上的性能和效率,同时加深了对LLM内部上下文推理机制的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18850 2026-05-20 cs.IR cs.AI 62%

KadiAssistant: A conversational AI Agent for information retrieval in Kadi4Mat

KadiAssistant: 一种用于Kadi4Mat研究数据生态中信息检索的对话式AI代理

Adrian Cierpka, Mohammad Shafiqul Islam, Johannes Steinhülb, Eric Dietriche Sesso Domtchoueng, Michael Selzer, Arnd Koeppe

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 本文提出KadiAssistant,一种集成了隐私设计的AI助手,旨在帮助研究人员高效访问、聚合和整合异构且敏感的研究数据,通过结合自托管的大语言模型和隐私保护的语义搜索,提升信息检索效率并满足复杂的访问控制需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18760 2026-05-20 cs.IR cs.AI 62%

DOTRAG: Retrieval-Time Reasoning Along Paths

DOTRAG: 路径上的检索时推理

Larnell Moore, Naihao Deng, Rada Mihalcea, Farnaz Jahanbakhsh

机构 * University of Michigan(密歇根大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 本文提出DOTRAG,一种无需训练的图检索增强生成框架,通过将检索过程转化为路径上的推理,提高了多跳任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12028 2026-05-13 cs.CL cs.IR 62%

Caraman at SemEval-2026 Task 8: Three-Stage Multi-Turn Retrieval with Query Rewriting, Hybrid Search, and Cross-Encoder Reranking

Caraman 在 SemEval-2026 任务 8:基于查询重写、混合搜索和交叉编码器重排序的三阶段多轮检索

David-Maximilian Caraman, Gheorghe Cosmin Silaghi

机构 * Babeş-Bolyai University(巴贝什-波雅伊大学)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 本文提出了一种三阶段多轮检索方法,结合查询重写、混合搜索和交叉编码器重排序,通过温度调优提升领域特定性能,达到nDCG@5 0.531的排名。

Comments Accepted at SemEval2026, task 8: MTRAGEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13415 2026-05-12 cs.IR cs.CL cs.CV 62%

Attention Grounded Enhancement for Visual Document Retrieval

基于注意力的视觉文档检索增强

Wanqing Cui, Wei Huang, Yazhi Guo, Yibo Hu, Meiguang Jin, Junfeng Ma, Keping Bi

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL

AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。

Comments Published as a conference paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05242 2026-05-08 cs.IR cs.AI 62%

Beyond Semantic Similarity: Rethinking Retrieval for Agentic Search via Direct Corpus Interaction

超越语义相似性:通过直接语料交互重新思考代理搜索的检索

Zhuofeng Li, Haoxiang Zhang, Cong Wei, Pan Lu, Ping Nie, Yi Lu, Yuyang Bai, Shangbin Feng, Hangxiao Zhu, Ming Zhong, Yuyu Zhang, Jianwen Xie, Yejin Choi, James Zou, Jiawei Han, Wenhu Chen, Jimmy Lin, Dongfu Jiang, Yu Zhang

机构 * Texas A&M University(德克萨斯A&M大学) University of Waterloo(滑铁卢大学) UC San Diego(圣地亚哥大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Verdent AI Lambda

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01591 2026-05-05 cs.IR cs.CL 62%

Led to Mislead: Adversarial Content Injection for Attacks on Neural Ranking Models

导致误导:针对神经排序模型的对抗性内容注入攻击

Amin Bigdeli, Amir Khosrojerdi, Radin Hamidi Rad, Morteza Zihayat, Charles L. A. Clarke, Ebrahim Bagheri

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Mila – Quebec AI Institute(魁北克AI研究院) Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 本文提出CRAFT框架,通过生成对抗性数据集、监督微调和偏好引导优化,提升对抗性攻击效果,验证了生成式AI在排序操纵中的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13969 2026-04-30 cs.AI cs.IR cs.LG 62%

Autonomous Knowledge Graph Exploration with Adaptive Breadth-Depth Retrieval

自主知识图谱探索与自适应广度-深度检索

Joaquín Polonuer, Lucas Vittor, Iñaki Arango, Ayush Noori, David A. Clifton, Luciano Del Corro, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Departamento de Computación, FCEyN, Universidad de Buenos Aires(布宜诺斯艾利斯大学计算机系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏州市先进研究中心) ELIAS Lab, Departamento de Ingeniería, Universidad de San Andrés(圣安德鲁大学工程系ELIAS实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Allston, MA, USA(自然与人工智能研究所,马萨诸塞州阿利斯顿) Broad Institute of MIT and Harvard, Cambridge, MA, USA(MIT和哈佛大学Broad研究所) Harvard Data Science Initiative, Cambridge, MA, USA(哈佛大学数据科学倡议)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 本文提出ARK工具,通过全局词搜索和邻域探索平衡知识图谱的广度与深度检索,提升多跳遍历效率,在STaRK上达到59.1%的平均Hit@1和67.4的平均MRR,优于其他方法。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23779 2026-04-28 cs.IR cs.AI 62%

GLIER: Generative Legal Inference and Evidence Ranking for Legal Case Retrieval

GLIER:生成式法律推理与证据排序用于法律案例检索

Minghan Li, Tianrui Lv, Chao Zhang, Guodong Zhou

机构 * Soochow University(苏州大学)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 GLIER通过生成式法律推理和证据排序框架,解决法律案例检索中非专业查询与专业文档间的语义鸿沟问题,提升检索的可解释性和准确性。

Comments Accepted to the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19772 2026-04-23 cs.CL cs.AI 62%

CoAuthorAI: A Human in the Loop System For Scientific Book Writing

CoAuthorAI:一种用于科学书籍写作的人机协作系统

Yangjie Tian, Xungang Gu, Yun Zhao, Jiale Yang, Lin Yang, Ning Li, He Zhang, Ruohua Xu, Hua Wang, Kewen Liao, Ming Liu

机构 * Kexin Technology, Beijing(凯欣科技,北京) Institute for Sustainable Industries and Liveable Cities, Victoria University(可持续产业与宜居城市研究所,维多利亚大学) School of Information Technology, Deakin University(信息科技学院,德坎大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 CoAuthorAI通过人机协作系统,结合检索增强生成、专家设计的层级大纲和自动参考链接,提升科学书籍写作的准确性和一致性,实现从文章到整本书的出版扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07849 2026-04-23 cs.SE cs.AI cs.IR 62%

SweRank: Software Issue Localization with Code Ranking

SweRank: 代码排名用于软件问题定位

Revanth Gangi Reddy, Tarun Suresh, JaeHyeok Doo, Ye Liu, Xuan Phi Nguyen, Yingbo Zhou, Semih Yavuz, Caiming Xiong, Heng Ji, Shafiq Joty

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Salesforce Research(Salesforce 研究) KAIST AI(韩国科学技术院人工智能研究所)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.AI

AI总结 本文提出SweRank框架,通过高效的检索与重排序方法提升软件问题定位的准确性,实验表明其在SWE-Bench-Lite和LocBench上优于现有方法。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16698 2026-04-21 cs.CL cs.AI 62%

Hierarchical Retrieval with Out-Of-Vocabulary Queries: A Case Study on SNOMED CT

具有词汇外查询的分层检索:一项SNOMED CT案例研究

Jonathon Dilworth, Hui Yang, Jiaoyan Chen, Yongsheng Gao, Ernesto Jimenez-Ruiz

机构 * The University of Manchester(曼彻斯特大学) SNOMED International(SNOMED国际) City St George’s, University of London(伦敦大学城圣乔治学院)

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了SNOMED CT中词汇外查询的分层概念检索问题,提出基于语言模型的本体嵌入方法,在双曲空间中实现高效子概念推理,优于基线方法。

Comments 21 pages, 5 figures, 8 tables, submission to the Transactions on Graph Data and Knowledge (TGDK) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13468 2026-04-21 cs.IR cs.CL 62%

From Relevance to Authority: Authority-aware Generative Retrieval in Web Search Engines

从相关性到权威性:面向网页搜索引擎的权威感知生成检索

Sunkyung Lee, Jihye Back, Donghyeon Jeon, Soonhwan Kwon, Moonkwon Kim, Inho Kang, Jongwuk Lee

机构 * Sungkyunkwan University(成均馆大学) Naver Corporation(Naver公司)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL

AI总结 本文提出权威感知生成检索框架AuthGR,通过多模态权威评分、三阶段训练和混合集成流程提升检索的权威性和准确性,在实际应用中显著提高用户参与度和可靠性。

Comments ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16318 2026-04-21 cs.IR cs.CL 62%

Diagnosing LLM-based Rerankers in Cold-Start Recommender Systems: Coverage, Exposure and Practical Mitigations

诊断基于大语言模型的重排器在冷启动推荐系统中的表现:覆盖、曝光与实际缓解措施

Ekaterina Lemdiasova, Nikita Zmanovskii

机构 * V. A. Trapeznikov ICS RAS Russian Biotechnological University (ROSBIOTECH)(Trapeznikov ICS 俄罗斯科学院俄罗斯生物技术大学) Russian Biotechnological University (ROSBIOTECH)(俄罗斯生物技术大学)

专题命中 检索器与排序 :hybrid retrieval(abstract);分类 cs.IR、cs.CL

AI总结 本文通过Serendipity-2018数据集研究冷启动电影推荐中交叉编码器重排器的表现,发现检索覆盖不足、曝光偏差和评分区分度低三大问题,并提出混合检索策略、候选池优化和评分校准等缓解措施。

Comments 12 pages, 7 figures. Code and data available at https://github.com/nikita-zmanovskiy/cold-start-algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03487 2026-04-17 cs.IR cs.CL 62%

ProRank: Prompt Warmup via Reinforcement Learning for Small Language Models Reranking

ProRank:通过强化学习进行小语言模型的提示预热以实现文档重排序

Xianming Li, Aamir Shakir, Rui Huang, Tsz-fung Andrew Lee, Julius Lipp, Benjamin Clavié, Jing Li

机构 * Mixedbread AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 本文提出ProRank方法,通过强化学习提升小语言模型对任务提示的理解,结合细粒度分数学习增强表示能力,实验证明其在文档重排序任务中优于现有模型,尤其在BEIR基准上表现突出。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12099 2026-04-15 cs.IR cs.CL 62%

The Effect of Document Selection on Query-focused Text Analysis

文档选择对查询导向文本分析的影响

Sandesh S Rangreji, Mian Zhong, Anjalie Field

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 检索器与排序 :hybrid retrieval(abstract);分类 cs.IR、cs.CL

AI总结 本文评估了七种文档选择策略对四种文本分析方法在两个数据集上的影响,发现语义或混合检索策略能有效避免弱策略的弊端,确立数据选择为方法学决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03174 2026-04-15 cs.CL cs.AI 62%

LLM as Attention-Informed NTM and Topic Modeling as long-input Generation: Interpretability and long-Context Capability

LLM作为具有注意力机制的NTM及话题建模作为长输入生成:可解释性与长上下文能力

Xuan Xu, Zhongliang Yang, Haolun Li, Beilin Chu, Rui Tian, Yu Li, Shaolin Tan, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology Beijing(北京科技大学) Beijing Value Simplex Technology Co. Ltd(北京价值简单科技有限公司) Zhongguancun Laboratory(中关村实验室)

专题命中 检索器与排序 :hybrid retrieval(abstract);分类 cs.CL、cs.AI

AI总结 本文从白盒和黑盒视角研究基于LLM的话题建模,提出注意力引导框架恢复可解释结构,并通过长输入任务和信号补偿方法提升性能,验证LLM与NTM的联系及长上下文LLM在话题建模中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏