arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-05-28 至 2026-05-28 共收录 18 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 18 篇

2605.27105 2026-05-28 cs.IR 92%

Lost in the Evidence? Reproducing Document Position and Context Size Effects in RAG

迷失在证据中?重现RAG中的文档位置和上下文大小效应

Jorge Gabín, Anxo Perez, Javier Parapar

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR

AI总结 本文通过系统可重复性研究,分析了检索增强生成中文档排序和上下文大小的影响,提出了主题采样校准方法,并揭示了理想设置与现实RAG管道之间的差异。

Comments Accepted at SIGIR 2026: 49th International ACM SIGIR Conference on Research and Development in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23959 2026-05-28 cs.CL cs.AI cs.LG 91%

HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling

HGMem:基于超图的工作记忆以改进长上下文复杂关系建模的多步RAG

Chulun Zhou, Chunkang Zhang, Guoxin Yu, Fandong Meng, Jie Zhou, Wai Lam, Mo Yu

机构 * The Chinese University of Hong Kong.(香港中文大学) Pengcheng Laboratory.(鹏城实验室) WeChat AI, Tencent(微信AI,腾讯) University of Chinese Academy of Sciences.(中国科学院大学)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 提出HGMem超图工作记忆系统,通过超边表示记忆单元并渐进形成高阶交互,增强多步RAG中的全局理解和复杂推理能力。

Comments ICML 2026; Code released at https://github.com/Encyclomen/HGMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27494 2026-05-28 cs.CR cs.AI cs.CL cs.IR cs.LG 87%

Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?

基于证据的缓存路由用于检索增强生成:何时可以安全地重用答案?

Syed Huma Shah

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI

AI总结 提出GroundedCache,一种通过四个廉价门控(查询相似性、检索证据重叠、源版本有效性和词汇支持)验证缓存答案安全性的路由方法,显著降低不安全服务率。

Comments 19 pages, 9 figures, 10 tables. Code: https://github.com/syedhumarahim/grounded-cache-router

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28522 2026-05-28 cs.IR 86%

Search for Coverage: Learning Coverage-Aware Retrieval with Augmented Sub-Question Answerability

搜索覆盖:学习基于增强子问题可回答性的覆盖感知检索

Jia-Huei Ju, Eugene Yang, Trevor Adriaanse, Suzan Verberne, Andrew Yates

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);dense retrieval(abstract);分类 cs.IR

AI总结 提出CoveR,一种通过覆盖对比和蒸馏目标训练的密集检索方法,结合LLM生成的子问题可回答性信号,在长文本RAG中提升覆盖度10%而不牺牲相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28120 2026-05-28 cs.CL cs.AI cs.MA 86%

LegalGraphRAG: Multi-Agent Graph Retrieval-Augmented Generation for Reliable Legal Reasoning

LegalGraphRAG:面向可靠法律推理的多智能体图检索增强生成

Zerui Chen, Qinggang Zhang, Zhishang Xiang, Zhimin Wei, Linfeng Gao, Xiao Huang, Zhihong Zhang, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出LegalGraphRAG框架,通过分层法律图和多智能体系统(研究员、审计员、裁决员)实现可靠的法律推理,在准确性和可信度上超越现有GraphRAG基线。

Comments 30 pages, 18 figures, ACL 2026 Main Conference. Project page: https://github.com/XMUDeepLIT/LegalGraphRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28112 2026-05-28 cs.CR cs.CL cs.IR 86%

A Wolf in Sheep's Clothing: Targeted Routing Hijacking in Federated RAG

披着羊皮的狼:联邦RAG中的目标路由劫持

Junjie Mu, Qiongxiu Li

机构 * Politecnico di Milano(米兰理工大学) Aalborg University(奥胡斯大学)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 本文提出路由劫持攻击,恶意客户端伪造语义配置文件以吸引目标查询,导致检索结果被篡改,并设计了一种基于信任的后路由框架来缓解该攻击。

Comments Under review. Code available at https://github.com/Junjie-Mu/routing-hijacking-fedrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28074 2026-05-28 cs.CR cs.CL cs.IR 86%

SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning

SilentRetrieval:通过语义保持的对抗性数据投毒劫持检索增强生成

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL

AI总结 提出SilentRetrieval两阶段数据投毒攻击,通过协调束搜索和上下文自适应触发生成,在保持文档流畅性的同时实现高检索命中率和攻击成功率,并评估了防御措施的有效性。

Comments 12 pages, 4 figures, KDD '26 camera-ready version

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27445 2026-05-28 cs.IR cs.AI 86%

RAGe: A Retrieval-Augmented Generation Evaluation Framework

RAGe:一种检索增强生成评估框架

Larissa Guder, João Pedro de Moura, Arthur Accorsi, Gustavo Losch do Amaral, Maurício Cecílio Magnaguagno, Felipe Meneguzzi, Marcio Sorraglia Pinho, Dalvan Griebler

机构 * School of Technology, Pontifical Catholic University of Rio Grande do Sul(里约格兰德杜斯-萨尔大学技术学院)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.AI

AI总结 提出模块化框架RAGe,通过资源遥测和组件推荐,评估检索增强生成应用在准确性、效率和可扩展性之间的权衡,支持领域特定数据集的最佳组件选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27444 2026-05-28 cs.IR cs.AI 86%

A Systematic Evaluation of Retrieval-Augmented Generation and Language Models for Space Operations

检索增强生成与语言模型在太空操作中的系统评估

Ruben Belo, Marta Guimarães, Cláudia Soares

机构 * NOVA LINCS Neuraspace Technical University of Munich(慕尼黑技术大学)

专题命中 检索器与排序 :retrieval-augmented generation(title);RAG(abstract,abstract_cn);retrieval augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 本文系统评估了结合大语言模型与信息检索技术的检索增强生成管道在太空操作中提取和综合领域知识的效果,比较了不同检索策略、嵌入模型和LLM回答对信息准确性、相关性和可靠性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11483 2026-05-28 cs.IR 81%

Uncertainty Quantification for Retrieval-Augmented Reasoning

检索增强推理的不确定性量化

Heydar Soudani, Hamed Zamani, Faegheh Hasibi

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR

AI总结 提出R2C方法,通过扰动多步推理过程来量化检索和生成的不确定性,在多个QA数据集上平均AUROC提升超5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28583 2026-05-28 cs.RO cs.AI cs.LG cs.SY eess.SY 77%

SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

SARAD:基于LLM的安全感知混合强化学习与碰撞预测在自动驾驶中的应用

Kangyu Wu, Peng Cui, Guoxi Chen, Ya Zhang

机构 * National Natural Science Foundation (NNSF) of China(中国国家自然科学基金委员会) National Science and Major Project(国家科学技术重大专项)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出SARAD框架,结合大语言模型和深度强化学习,通过检索增强生成和碰撞预测模块提升自动驾驶的安全性和效率。

Comments 7 pages, 4 figures, accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27951 2026-05-28 cs.IR 77%

Beyond Similarity: Task-Aligned Retrieval for Language Models

超越相似性:面向语言模型的任务对齐检索

Zhixing Sun, Shenghe Xu, Tao Li

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 提出任务对齐检索(TAG)框架,用基于适用性的规则选择替代基于相似性的检索,在规则驱动任务中显著提升性能并减少检索上下文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12824 2026-05-28 cs.IR cs.CV cs.LG 74%

NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval

NanoVDR:将20亿参数的视觉语言检索器蒸馏为7000万参数的纯文本编码器用于视觉文档检索

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 检索器与排序 :retriever(title);分类 cs.IR

AI总结 利用查询-文档不对称性,通过蒸馏将20亿参数的视觉语言模型教师蒸馏为7000万参数的纯文本学生编码器,采用点态余弦对齐目标,实现视觉文档检索的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27380 2026-05-28 cs.CL cs.AI 62%

BioELX: Cross-lingual Biomedical Entity Linking via Alias-based Retrieval and LLM Ranking

BioELX: 基于别名的检索与LLM排序的跨语言生物医学实体链接

Yi Wang, Corina Dima, Liangyu Zhong, Steffen Staab

机构 * University of Stuttgart, Germany(斯图加特大学) Technical University of Berlin, Germany(柏林技术大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 提出BioELX两阶段框架,通过维基数据多语言别名增强SapBERT检索器,并利用预训练LLM排序器进行上下文感知消歧,无需标注数据即在多个基准上取得最佳性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01970 2026-05-28 cs.AI cs.CL 62%

Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies

原子技能是前提:当强化学习合成组合推理时,以及当它仅放大时

Sitao Cheng, Xunjian Yin, Ruiwen Zhou, Yuxuan Li, Xinyi Wang, Liangming Pan, William Yang Wang, Victor Zhong

机构 * University of Waterloo(滑铁卢大学) Duke University(杜克大学) National University of Singapore(新加坡国立大学) Princeton University(普林斯顿大学) Peking University(北京大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 通过互补推理任务,研究强化学习是合成新技能还是仅放大已有技能,发现强化学习在基础模型通过监督微调掌握独立原子技能后才能合成新组合策略。

Comments Work in Progress. Code and data are available at https://github.com/sitaocheng/from_atomic_to_composite

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27865 2026-05-28 cs.CL 57%

MERIT: Matching Expertise via Rubric-Informed Training for Reviewer Assignment

MERIT: 通过基于评分标准的训练进行审稿人匹配的专业知识匹配

Zixuan Yang, Yibo Zhao, Weicong Liu, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(数据科学与工程学院,东华大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL

AI总结 提出MERIT两阶段框架,通过强化学习训练审稿人评估器并蒸馏为检索器,实现大规模审稿人分配中的专业知识匹配。

Comments 22pages, 8 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28169 2026-05-28 cs.AR 50%

FT-Pilot: Automated Fault-Tolerant RTL Rewriting via Vulnerability-Guided LLMs

FT-Pilot:通过漏洞引导的LLM实现自动化容错RTL重写

Weixing Liu, Zizhen Liu, Jing Ye, Naixing Wang, Cheng Liu, Huawei Li, Xiaowei Li

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 提出FT-Pilot框架,结合GNN和LLM实现RTL级自动软错误加固,通过漏洞分析和代码重写降低输出错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09449 2026-05-28 cs.CV 50%

RASR: Retrieval-Augmented Super Resolution for Practical Reference-based Image Restoration

RASR: 面向实际参考图像复原的检索增强超分辨率

Jiaqi Yan, Shuning Xu, Xiangyu Chen, Dell Zhang, Jiantao Zhou, Jie Tang, Gangshan Wu, Jie Liu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) State Key Laboratory of Internet of Things for Smart City(物联网智慧城市国家重点实验室) Department of Computer Science and Information Science, University of Macau(澳门大学计算机科学与信息科学系)

专题命中 检索器与排序 :retriever(abstract)

AI总结 提出检索增强超分辨率(RASR)范式,通过自动检索参考图像实现实际场景下的参考超分辨率,并构建基准数据集RASR-Flickr30及基线模型RASRNet。

Comments Accepted at ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏