arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-05-11 至 2026-05-11 共收录 11 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 11 篇

2605.07517 2026-05-11 cs.IR cs.AI 91%

LARAG: Link-Aware Retrieval Strategy for RAG Systems in Hyperlinked Technical Documentation

LARAG:超链接技术文档中基于链接的RAG系统检索策略

Giorgia Bolognesi, Claudio Estatico, Ulderico Fugacci, Isabella Mastroianni, Claudio Muselli, Luca Oneto

机构 * Rulex s.r.l.(Rulex公司) Department of Mathematics (DIMA), University of Genoa(热那亚大学数学系) Department of Computer Science, Bioengineering, Robotics, and Systems Engineering (DIBRIS), University of Genoa(热那亚大学计算机科学、生物工程、机器人学和系统工程系)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 LARAG通过利用HTML文档中已有的超链接结构,改进RAG系统检索效果,提升答案质量并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07158 2026-05-11 cs.IR cs.CL cs.LG 88%

Topic Is Not Agenda: A Citation-Community Audit of Text Embeddings

主题并非议程:文本嵌入的引用社区审计

Junseon Yoo

机构 * Pluto Labs(Pluto实验室)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);retriever(abstract);vector search(abstract)

AI总结 本文通过构建358万篇科学论文的增强引用图,发现文本嵌入的余弦相似性与研究议程的相关性在子领域层面合理,但在更高层次的议程层面失效,揭示了科学RAG系统中的关键缺陷。

Comments 16 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05967 2026-05-11 cs.IR cs.AI cs.CL cs.LG 87%

Enhancing Retrieval-Augmented Generation with Entity Linking for Educational Platforms

通过实体链接增强教育平台的检索增强生成

Francesco Granata, Francesco Poggi, Misael Mongiovì

机构 * Department of Mathematics and Computer Science, University of Catania, Italy(卡塔尼亚大学数学与计算机科学系) Institute of Cognitive Sciences and Technologies (ISTC), National Research Council of Italy (CNR)(意大利国家研究委员会认知科学与技术研究所(ISTC))

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出ELERAG架构,通过实体链接增强事实信号,提升教育问答系统在意大利语领域的准确性,实验显示其在专业领域表现优异,但通用领域效果不如交叉编码器。

Journal ref Big Data and Cognitive Computing, 10(4), 120. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07678 2026-05-11 cs.SE 83%

Characterizing and Mitigating False-Positive Bug Reports in the Linux Kernel

对Linux内核中虚假正例缺陷报告的特征分析与缓解

Jiashuo Tian, Dong Wang, Chen Yang, Haichi Wang, Zan Wang, Junjie Chen

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)

AI总结 本文研究Linux内核中虚假正例缺陷报告的问题,通过构建2006份报告数据集,发现虚假正例需与真实缺陷同等努力,主要出现在文件系统和驱动程序中,采用RAG策略可实现91%召回率和88%F1分数。

Comments Accepted in the Research Track in FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05806 2026-05-11 cs.LG 83%

Retrieval from Within: An Intrinsic Capability of Attention-Based Models

内部检索:基于注意力模型的内在能力

Elad Hoffer, Yochai Blau, Edan Kinderman, Ron Banner, Daniel Soudry, Boris Ginsburg

机构 * NVIDIA Department of Electrical Engineering, Technion, Haifa, Israel(技术学院电子工程系,以色列海法)

专题命中 检索器与排序 :retrieval-augmented generation(abstract,abstract_cn);RAG(abstract,abstract_cn);retriever(abstract)

AI总结 本文提出INTRA框架,通过注意力机制直接从内部表征检索证据,统一检索与生成流程,提升问答任务的召回与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05210 2026-05-11 cs.IR 81%

DisastRAG: A Multi-Source Disaster Information Integration and Access System Based on Retrieval-Augmented Large Language Models

DisastRAG:基于检索增强大语言模型的多源灾害信息整合与访问系统

Bo Li, Zhitong Chen, Kai Yin, Junwei Ma, Yiming Xiao, Ali Mostafavi

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.IR

AI总结 本文提出DisastRAG系统,整合结构化、非结构化和上下文灾害信息,通过多路径架构支持文档检索、结构化访问和外部网络回退,提升灾害管理信息获取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07132 2026-05-11 cs.HC 75%

From Standard English to Singlish: A Retrieval-Augmented Approach for Code-Switched Creole Generation in Large Language Models

从标准英语到新加坡英语:一种检索增强的方法用于大型语言模型中的克里奥尔生成

Foong Ming Lai, Yujin Tan, Han Meng, Yi-Chieh Lee

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 本文提出一种检索增强生成框架,通过外部化方言知识实现受控的克里奥尔语言生成,无需微调,通过稀疏词法替换指导生成,实验表明其在自然度和语义保留方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07068 2026-05-11 cs.CL cs.AI 73%

WiCER: Wiki-memory Compile, Evaluate, Refine Iterative Knowledge Compilation for LLM Wiki Systems

WiCER:维基内存编译、评估、细化迭代知识编译用于LLM维基系统

Juan M. Huerta

机构 * Zinnia Tech Solutions(Zinnia科技解决方案)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出WiCER算法,通过迭代编译、评估和细化维基内存,解决LLM维基系统中知识编译的差距问题,显著提升知识检索质量并减少灾难性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07249 2026-05-11 cs.IR 57%

MLAIRE: Multilingual Language-Aware Information Retrieval Evaluation Protocal

MLAIRE: 多语言语言感知信息检索评估协议

Youngjoon Jang, Seongtae Hong, Hyeonseok Moon, Heuiseok Lim

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR

AI总结 本文提出MLAIRE评估协议,用于评估多语言信息检索中语言感知维度,引入语言偏好率和Lang-nDCG等指标,分析语义检索与查询语言偏好之间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11162 2026-05-11 cs.CL 57%

Retrieval Heads are Dynamic

检索头是动态的

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Zoom Communications(Zoom公司) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文从动态视角研究LLM中的检索头,揭示其时间动态性、不可替代性及与隐藏状态的关联,通过实验验证动态检索头在生成任务中的优势。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23370 2026-05-11 cs.CV 50%

GRAPE: Let GRPO Supervise Query Rewriting by Ranking for Retrieval

GRAPE:通过检索排名监督查询重写

Zhaohua Zhang, Jianhuan Zhuo, Muxi Chen, Chenchen Zhao, Wenyu Jiang, Tianwen Jiang, Mingyang Chen, Yutang, Qiuyong Xiao, Jihong Zhang, Zhixun Su

机构 * Dalian University of Technology, Dalian, China(大连理工大学) Tencent HunYuan Data, Shenzhen, China(腾讯混元数据)

专题命中 检索器与排序 :retriever(abstract)

AI总结 GRAPE通过组相对策略优化提升检索排名,改进多语言、长文本和多模态查询的检索性能,平均提升Recall@10 4.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏