arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-06-11 至 2026-06-11 共收录 10 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 10 篇

2606.11350 2026-06-11 cs.CL cs.IR 新提交 93%

When More Documents Hurt RAG: Mitigating Vector Search Dilution with Domain-Scoped, Model-Agnostic Retrieval

当更多文档损害RAG:利用领域限定、模型无关的检索缓解向量搜索稀释

Nabaraj Subedi, Ahmed Abdelaty, Shivanand Venkanna Sheshappanavar

机构 * Dept. of Electrical Engineering & Computer Science, University of Wyoming(怀俄明大学电气工程与计算机科学系) Dept. of Civil, Architectural Engineering & Construction Management, University of Wyoming(怀俄明大学土木、建筑工程与施工管理系)

专题命中 检索器与排序 :RAG(title,title_cn);vector search(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 针对检索增强生成在异构文档集合中因向量搜索稀释导致性能下降的问题,提出基于组织元数据的领域限定方法MASDR-RAG,显著提升P@10至0.86,并揭示多智能体编排的精度-忠实度悖论。

Comments 24 pages, 8 figures, 30 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22934 2026-06-11 cs.AI 版本更新 93%

ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning

ProGRank: 探针梯度重排序以防御密集检索器RAG免受语料投毒攻击

Xiangyu Yin, Yi Qi, Chih-Hong Cheng

机构 * Chalmers University of Technology, Sweden(瑞典查尔姆斯理工大学) University of Leeds, United Kingdom(英国利兹大学) Carl von Ossietzky University of Oldenburg, Germany(德国奥尔登堡卡尔·冯·奥西特齐大学)

专题命中 检索器与排序 :RAG(title,title_cn);retriever(title,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出ProGRank,一种无需训练的后处理检索器端防御方法,通过随机扰动下探针梯度提取不稳定信号并重排序,有效防御密集检索器RAG的语料投毒攻击。

Comments accepted by ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31506 2026-06-11 cs.IR cs.CL 版本更新 91%

Evaluating Factual Density in Multi-Source RAG: A Study in Medical AI Accuracy

评估多源RAG中的事实密度:医学AI准确性研究

Michael R. DeMarco

机构 * NexusAgentics

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 针对标准RAG管道因专家盲视效应而忽视高密度事实证据的问题,提出事实密度(FD*)作为检索优化信号,通过概率事实性分析预处理和Z-score归一化消除长度偏差,在HealthFC基准上实现100%系统综述覆盖率。

Comments 16 pages, 8 tables. Includes Experiment 3 results (n=11, Wilcoxon p=0.0619). Preliminary findings; powered Experiment 3 and Graph RAG extension identified as future work. Updated from v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11265 2026-06-11 cs.CR cs.AI 新提交 86%

When Poison Fails After Retrieval: Revisiting Corpus Poisoning under Chunking and Reranking Pipelines

当投毒在检索后失败:重新审视分块与重排序管道下的语料库投毒

Xi Nie, Hongwei Li, Shenghao Wu, Mingxuan Li, Jiachen Li, Wenbo Jiang

机构 * School of Computer Science, Shandong University(山东大学计算机学院) School of Information, Shandong University(山东大学信息学院) School of Software Engineering, Shandong University(山东大学软件学院)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);dense retrieval(abstract);分类 cs.AI

AI总结 针对RAG系统,提出CRCP框架,通过联合优化检索相关性、重排序一致性和分块边界鲁棒性,解决现有投毒方法在真实多阶段检索管道中因分块和重排序导致效果下降的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11945 2026-06-11 cs.CL cs.IR 新提交 86%

uva-irlab-conv at SemEval-2026 Task 8: Multi-Turn RAG with Learned Sparse Retrieval and Listwise Reranking

uva-irlab-conv 在 SemEval-2026 任务 8:基于学习型稀疏检索和列表式重排序的多轮 RAG

Simon Lupart, Kidist Amde Mekonnen, Zahra Abbasiantaeb, Mohammad Aliannejadi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 提出结合学习型稀疏检索与基于 LLM 的重排序和生成的多轮检索增强生成流水线,用于跨四个领域的对话系统,有效处理不可回答查询。

Comments SemEval-2026, The 20th International Workshop on Semantic Evaluation, collocated with ACL 2026, 9 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11907 2026-06-11 cs.IR 新提交 85%

Tail-Aware Adaptive-k: Query-Adaptive Context Selection for Retrieval-Augmented Generation

尾部感知自适应-k:面向检索增强生成的查询自适应上下文选择

Ziyu Song, Jiaming Fang, Kuangyu Li, Tuo Xia, Chuanpeng Wang

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR

AI总结 针对固定Top-K检索在查询依赖和重尾相似度分布下的失效问题,提出TAA-k框架,通过局部化极值理论验证策略实现高效、稳定的查询自适应截断,在三个数据集上达到接近最优的检索质量且效率大幅提升。

Comments First two authors contributed equally. Accepted at ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11198 2026-06-11 cs.CL cs.AI 新提交 79%

The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content

结构注意力税:检索格式如何劫持上下文学习而与内容无关

Yuqi Zhang, Di Zhang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 研究发现知识图谱三元组因其格式结构比自然语言吸引2-3倍注意力,压缩演示注意力达42%,并提出了分解注意力为语义与结构成分的框架及缓解策略。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11216 2026-06-11 cs.CY cs.SI 新提交 75%

Great Disappearance Acts Generative Search and Shadow Banning

消失的行为:生成式搜索与影子封禁

Danny Friedmann

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval augmented generation(abstract)

AI总结 本文研究生成式搜索和影子封禁对互联网开放生态的破坏,分析其法律与监管问题,并提出增强透明度与公平性的解决方案。

Journal ref 27 German Law Journal 1211 - 1234 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11780 2026-06-11 cs.IR cs.AI cs.IT math.IT 新提交 62%

What Limits Does Quantization Place on Dense Top-$k$ Retrieval? A Theoretical Study

量化对密集Top-$k$检索的限制是什么?一项理论研究

Koki Okajima, Tsukasa Yoshida

机构 * NTT, Inc.(日本电报电话株式会社)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.AI

AI总结 理论证明在有限精度下,完美Top-$k$检索所需维度随语料库大小对数增长,量化精度存在阈值,影响实际系统设计。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11700 2026-06-11 cs.IR 新提交 57%

CompRank: Efficient LLM Reranking via Token-Level Compression and Decoding-Free Scoring

CompRank: 通过令牌级压缩和无解码评分实现高效的LLM重排序

Xuan Lu, Haohang Huang, Yingqi Fan, Junlong Tong, Yuxuan Zhang, Ping Nie, Rui Meng, Xiaoyu Shen

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR

AI总结 提出CompRank框架,通过令牌级压缩和无解码注意力评分减少冗余计算,在BEIR数据集上仅保留10.2%文档令牌即达到接近全令牌的排序性能,并实现4.9-9.5倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏