arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8553 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 4551 篇

2605.24556 2026-05-26 cs.IR cs.CL cs.LG 73%

The Multilingual Curse at the Retrieval Layer: Evidence from Amharic

多语言诅咒在检索层:来自阿姆哈拉语的证据

Yosef Worku Alemneh, Kidist Amde Mekonnen, Maarten de Rijke

机构 * Independent Researcher(独立研究者) University of Amsterdam(阿姆斯特丹大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL

AI总结 针对零样本多语言检索在低资源形态丰富语言(如阿姆哈拉语)上表现不佳的问题,通过对比实验发现单语检索器显著优于多语言检索器,并揭示了多语言基准测试的局限性。

Comments 10 pages, 4 tables. Accepted to the 1st Workshop on Multilinguality in the Era of Large Language Models (MeLLM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18812 2026-05-20 cs.LG cs.CL cs.IR 73%

PASC: Pipeline-Aware Conformal Prediction with Joint Coverage Guarantees for Multi-Stage NLP and LLM Pipelines

PASC:面向多阶段NLP和LLM流水线的管道感知置信区间

Varun Kotte

机构 * Independent Researcher(独立研究者)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL

AI总结 本文提出PASC,一种面向多阶段NLP和LLM流水线的管道感知置信区间方法,通过联合覆盖保证提升多阶段流水线的置信区间性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18763 2026-05-20 cs.IR cs.AI 73%

Query-Conditioned Graph Retrieval for Contextualized LLM Reasoning in Personalized Wearable Data

基于查询的图检索用于个性化可穿戴数据中的上下文化LLM推理

Zhenyu Lu, Mahyar Abbasian, Amir M. Rahmani

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Irvine(加州大学 Irvine 分校)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);分类 cs.IR、cs.AI

AI总结 本文提出WAG框架,通过图检索实现LLM在可穿戴数据中的上下文化推理,通过构建个性化知识图谱并检索查询条件子图,提高推理效率和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14478 2026-05-15 cs.SE cs.AI cs.CL 73%

When Retrieval Hurts Code Completion: A Diagnostic Study of Stale Repository Context

当检索伤害代码补全:对过时仓库上下文的诊断研究

Haojun Weng, Qianqian Yang, Hao Fu, Haobin Pan, Xinwei Lv

机构 * Independent Researcher, California, USA(加利福尼亚独立研究员) Independent Researcher, Beijing, China(北京独立研究员)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文研究过时仓库片段是否对代码生成造成影响,通过对比不同检索条件发现,仅使用过时片段会显著增加错误引用,而加入当前证据可缓解问题。

Comments 31 pages, 2 tables. Submitted to Information and Software Technology (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07068 2026-05-11 cs.CL cs.AI 73%

WiCER: Wiki-memory Compile, Evaluate, Refine Iterative Knowledge Compilation for LLM Wiki Systems

WiCER:维基内存编译、评估、细化迭代知识编译用于LLM维基系统

Juan M. Huerta

机构 * Zinnia Tech Solutions(Zinnia科技解决方案)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出WiCER算法,通过迭代编译、评估和细化维基内存,解决LLM维基系统中知识编译的差距问题,显著提升知识检索质量并减少灾难性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05538 2026-05-08 cs.AI cs.IR 73%

AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases

AgenticRAG:企业知识库中的代理检索

Susheel Suresh, Hazel Mak, Shangpo Chou, Fred Kroon, Sahil Bhatnagar

机构 * Microsoft Corporation(微软公司)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);分类 cs.IR、cs.AI

AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01582 2026-05-05 cs.IR cs.AI 73%

KG-First, LLM-Fallback: A Hybrid Microservice for Grounded Skill Search and Explanation

基于知识图谱与大语言模型的混合微服务:面向 grounded skill search 和解释的 hybrid 方法

Ngoc Luyen Le, Marie-Hélène Abel, Bertrand Laforge

机构 * UTC(UTC大学) LPNHE(LPNHE研究所)

专题命中 检索器与排序 :vector search(abstract);hybrid retrieval(abstract);分类 cs.IR、cs.AI

AI总结 本文提出 SkillGraph-Service 微服务,通过统一权威能力框架资源构建知识图谱,结合符号严谨与子符号灵活,实现教育者查询中的词汇不匹配处理,并利用大语言模型进行约束排序和受众感知解释,实验证明其在多语言数据集上具有高检索效果和低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14488 2026-04-29 cs.IR cs.CL 73%

Controlling Authority Retrieval: A Missing Retrieval Objective for Authority-Governed Knowledge

控制权威检索:一种缺失的权威治理知识检索目标

Andre Bacellar

专题命中 检索器与排序 :RAG(abstract,abstract_cn);分类 cs.IR、cs.CL

AI总结 本文提出CAR目标,用于检索当前活跃的权威前沿,与传统相关性检索不同。通过定理和命题分析,证明了TCA的上界,并在多个数据集上验证了方法有效性。

Comments 23 pages, 13 tables; code and data at https://github.com/andremir/car-retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16576 2026-04-21 cs.IR cs.CL 73%

On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability

基于LLM的密集检索器的鲁棒性:通用性和稳定性系统分析

Yongkang Li, Panagiotis Eustratiadis, Yixing Fan, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学) Chinese Academy of Sciences(中国科学院)

专题命中 检索器与排序 :retriever(abstract);dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 本文系统分析了基于LLM的密集检索器的通用性和稳定性,发现指令微调模型在复杂推理任务中存在'专业化税',而嵌入几何结构对鲁棒性有预测作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10426 2026-04-14 cs.CL cs.AI 73%

CodaRAG: Connecting the Dots with Associativity Inspired by Complementary Learning

CodaRAG: 通过互补学习启发的关联性连接点

Cheng-Yen Li, Xuanjun Chen, Claire Lin, Wei-Yu Chen, Wenhua Nie, Hung-Yi Lee, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 CodaRAG通过互补学习系统启发,提出了一种将碎片化信息整合为稳定记忆基础,通过多维路径遍历图结构,消除超关联噪声,提升检索和生成精度的框架。

Comments Preprint, Submitted to ACM TIST

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09550 2026-04-14 cs.IR cs.DB 73%

HyEm: Query-Adaptive Hyperbolic Retrieval for Biomedical Ontologies via Euclidean Vector Indexing

HyEm:通过欧几里得向量索引实现查询自适应的双曲检索用于生物医学本体

Ou Deng, Shoji Nishimura, Atsushi Ogihara, Qun Jin

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.DB

AI总结 HyEm通过结合双曲本体嵌入与欧几里得ANN基础设施,解决生物医学本体中层次感知的检索问题,提升实体中心查询和混合意图查询性能,保持索引可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06666 2026-04-09 cs.CL cs.AI 73%

A Graph-Enhanced Defense Framework for Explainable Fake News Detection with LLM

一种基于图的增强防御框架用于可解释的假新闻检测与大语言模型

Bo Wang, Jing Ma, Hongzhan Lin, Zhiwei Yang, Ruichao Yang, Yuan Tian, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Hong Kong Baptist University(香港浸会大学) Guangdong Institute of Smart Education, Jinan University(暨南大学广东智慧教育研究院) University of Science and Technology Beijing(北京科技大学) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence(知识驱动人机智能教育部工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出G-Defense框架,通过构建以声明为中心的图,利用检索增强生成技术获取证据并生成竞争性解释,以提高假新闻检测的准确性和解释质量。

Comments Accepted by TOIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05268 2026-04-09 cs.CV cs.AI cs.CL 73%

Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking

Region-R1: 增强多模态重排序的查询侧区域裁剪

Chan-Wei Hu, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 Region-R1通过在重排序阶段引入区域裁剪机制,提升多模态重排序的鲁棒性,实验表明其在E-VQA和InfoSeek基准上显著提升召回率。

Comments 12 pages, 4 figures, accepted to ACL 2026 Findings, code available at https://github.com/taco-group/Region-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02554 2026-04-06 cs.CL cs.IR 73%

Principled and Scalable Diversity-Aware Retrieval via Cardinality-Constrained Binary Quadratic Programming

基于卡数约束二元二次规划的原理化可扩展多样性检索

Qiheng Lu, Nicholas D. Sidiropoulos

机构 * University of Virginia(弗吉尼亚大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

AI总结 本文提出基于卡数约束二元二次规划的多样性检索方法,通过可解释的权衡参数平衡相关性和语义多样性,并在组合优化最新进展基础上,开发了非凸紧连续松弛和基于Frank-Wolfe的算法,实验表明在相关性-多样性帕累托前沿上优于基线方法且效率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17677 2026-04-06 cs.CL cs.AI cs.LG 73%

Adaptive Guidance for Retrieval-Augmented Masked Diffusion Models

适应性引导的检索增强掩码扩散模型

Jaemin Kim, Jong Chul Ye

机构 * KAIST(韩国科学技术院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ARAM框架,通过动态校准引导尺度提升检索增强扩散模型在知识密集型问答中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25944 2026-03-30 cs.CL cs.AI 73%

Can Small Models Reason About Legal Documents? A Comparative Study

小型模型能否对法律文件进行推理?一项比较研究

Snehit Vaddi

机构 * Independent Researcher(独立研究员)

专题命中 检索器与排序 :RAG(abstract);dense retrieval(abstract);分类 cs.CL、cs.AI

AI总结 本文通过测试九种模型在三个法律基准上的表现,发现3B参数的混合专家模型在法律持有识别上优于GPT-4o-mini,且提示策略影响显著,few-shot提示效果最佳。

Comments 17 pages, 9 models, 5 prompting strategies, 3 legal benchmarks, 405 experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21524 2026-03-24 cs.CL cs.AI 73%

CatRAG: Functor-Guided Structural Debiasing with Retrieval Augmentation for Fair LLMs

CatRAG:基于检索增强生成的 functor 引导的结构去偏方法用于公平大语言模型

Ravi Ranjan, Utkarsh Grover, Mayur Akewar, Xiaomin Lin, Agoritsa Polyzou

机构 * Florida International University(佛罗里达国际大学) University of South Florida(佛罗里达州立大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 CatRAG 通过整合 functor 与检索增强生成,实现结构去偏,提升公平性。在三个开源 LLM 上,其准确率提升达 40%,偏见分数降至接近零。

Comments 9 pages, 4 figures, and accepted in IJCNN 2026 (part of IEEE WCCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21193 2026-03-24 cs.CL cs.AI cs.DL 73%

Context Selection for Hypothesis and Statistical Evidence Extraction from Full-Text Scientific Articles

上下文选择用于从全文科学文章中提取假设和统计证据

Sai Koneru, Jian Wu, Sarah Rajtmajer

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Old Dominion University(旧 Dominion 大学)

专题命中 检索器与排序 :retrieval augmented generation(abstract);retriever(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了从全文科学文章中提取假设及其支持统计证据的挑战,通过两阶段检索与提取框架,发现针对性上下文选择能提升假设提取效果,但统计证据提取仍面临较大困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20034 2026-03-23 cs.IR cs.AI 73%

CoverageBench: Evaluating Information Coverage across Tasks and Domains

CoverageBench:跨任务和领域的信息覆盖评估

Saron Samuel, Andrew Yates, Dawn Lawrie, Ian Soboroff, Trevor Adriaanse, Benjamin Van Durme, Eugene Yang

机构 * Johns Hopkins University(约翰霍普金斯大学) National Institute of Standards and Technology(国家标准与技术研究院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

AI总结 本文提出CoverageBench,通过现有数据集构建多任务多领域的统一测试平台,评估信息覆盖能力,释放话题、 nuggets、相关性标签及基线排名至Hugging Face Datasets。

Comments 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19008 2026-03-20 cs.CL cs.AI cs.LG 73%

Hypothesis-Conditioned Query Rewriting for Decision-Useful Retrieval

基于假设的查询重写用于决策有用的检索

Hangeol Chang, Changsun Lee, Seungjoon Rho, Junho Yeo, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) School of Electrical Engineering, KAIST, Republic of Korea(韩国科学技术院电气工程学院) Department of Industrial Engineering, Yonsei University, Republic of Korea(延世大学工业工程系)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HCQR框架,通过重写查询获取证据支持假设、区分替代方案和验证关键线索,提升检索与答案选择的对齐度,实验表明在MedQA和MMLU-Med上优于传统RAG方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14541 2026-03-17 cs.AI cs.IR 73%

Expert Mind: A Retrieval-Augmented Architecture for Expert Knowledge Preservation in the Energy Sector

专家思维:一种用于能源领域专家知识保留的检索增强架构

Diego Ezequiel Cervera

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

AI总结 本文提出Expert Mind系统,通过RAG、大语言模型和多模态技术,解决能源领域专家知识流失问题,提升知识传递效率与入职效率。

Comments 6 pages, 1 figure, conceptual architecture paper on retrieval-augmented expert knowledge systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01241 2026-03-03 cs.IR cs.AI 73%

TARSE: Test-Time Adaptation via Retrieval of Skills and Experience for Reasoning Agents

TARSE: 通过检索技能和经验进行测试时适应以实现推理代理

Junda Wang, Zonghai Tao, Hansi Zeng, Zhichao Yang, Hamed Zamani, Hong Yu

机构 * University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校) University of Massachusetts Lowell, MA, USA(马萨诸塞大学洛厄尔分校)

专题命中 检索器与排序 :RAG(abstract);retriever(abstract);分类 cs.IR、cs.AI

AI总结 TARSE通过检索技能和经验实现测试时适应,提升医疗推理代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00267 2026-03-03 cs.AI cs.IR cs.SI 73%

Multi-Sourced, Multi-Agent Evidence Retrieval for Fact-Checking

多源多智能体证据检索用于事实核查

Shuzhi Gong, Richard O. Sinnott, Jianzhong Qi, Cecile Paris, Preslav Nakov, Zhuohan Xie

机构 * The University of Melbourne(墨尔本大学)

专题命中 检索器与排序 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

AI总结 WKGFC通过多智能体证据检索和知识图谱增强,提升事实核查的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21598 2026-02-26 cs.IR cs.AI 73%

Retrieval Challenges in Low-Resource Public Service Information: A Case Study on Food Pantry Access

低资源公共信息服务中的检索挑战:食品储藏室访问案例研究

Touseef Hasan, Laila Cure, Souvika Sarkar

机构 * Wichita State University(威斯科州立大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

AI总结 本文提出了一种基于AI的对话式检索系统,用于解决低资源环境下食品储藏室信息检索的挑战,通过RAG流程提升自然语言查询的准确性与可靠性。

Comments 3 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17450 2026-02-20 cs.IR cs.AI 73%

Beyond Pipelines: A Fundamental Study on the Rise of Generative-Retrieval Architectures in Web Research

超越流水线:生成-检索架构在网页研究中的崛起根本研究

Amirereza Abbasi, Mohsen Hooshmand

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

AI总结 本文研究了生成-检索架构在网页研究中的崛起,探讨了LLMs通过RAG对网页研究和行业的影响,分析了关键进展、挑战及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16715 2026-02-20 cs.AI cs.CL cs.SY eess.SY 73%

Retrieval Augmented (Knowledge Graph), and Large Language Model-Driven Design Structure Matrix (DSM) Generation of Cyber-Physical Systems

检索增强(知识图谱),以及由大型语言模型驱动的面向网络系统的设计结构矩阵(DSM)生成

H. Sinan Bank, Daniel R. Herber

机构 * Department of Systems Engineering, Colorado State University(系统工程系,科罗拉多州立大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了利用大型语言模型、检索增强生成和图基RAG生成面向网络系统的设计结构矩阵,通过两个具体案例评估其在组件关系识别和生成方面的性能。

Comments 26 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16136 2026-02-19 cs.IR cs.AI 73%

Retrieval Collapses When AI Pollutes the Web

当AI污染网络时检索崩溃

Hongyeon Yu, Dongchan Kim, Young-Bum Kim

机构 * NAVER Corp.(NAVER公司)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.AI

AI总结 研究发现AI生成内容污染导致检索系统崩溃,需引入检索意识策略以防止质量下降。

Comments 4 pages, Proceedings of The Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06438 2026-02-18 cs.CL cs.AI 73%

Don't Let It Hallucinate: Premise Verification via Retrieval-Augmented Logical Reasoning

不要让它幻觉:通过检索增强的逻辑推理进行前提验证

Yuehan Qin, Shawn Li, Yi Nian, Xinyan Velocity Yu, Yue Zhao, Xuezhe Ma

机构 * University of Southern California(南加州大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于检索增强的逻辑推理方法,用于在生成前验证用户查询中的前提,从而减少幻觉并提高事实准确性。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15518 2026-02-17 cs.IR cs.CL cs.LG 73%

DS@GT at TREC TOT 2025: Bridging Vague Recollection with Fusion Retrieval and Learned Reranking

DS@GT在TREC TOT 2025中:通过融合检索与学习重排序弥合模糊回忆

Wenxin Zhou, Ritesh Mehta, Anthony Miyaguchi

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 检索器与排序 :dense retrieval(abstract);hybrid retrieval(abstract);分类 cs.IR、cs.CL

AI总结 DS@GT在TREC TOT 2025中结合混合检索与学习重排序,通过融合检索方法提升模糊回忆任务的检索效果。

Comments Paper submitted to TREC 2025 (34th Text REtrieval Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12458 2026-02-13 cs.IR cs.CG cs.DB cs.LG 73%

Breaking the Curse of Dimensionality: On the Stability of Modern Vector Retrieval

突破维度诅咒:现代向量检索的稳定性研究

Vihan Lakshman, Blaise Munyampirwa, Julian Shun, Benjamin Coleman

机构 * MIT CSAIL, USA(麻省理工学院计算机科学与人工智能实验室) Argmax, Inc., USA(Argmax公司) Google DeepMind, USA(谷歌深Mind)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);vector search(abstract);分类 cs.IR、cs.DB

AI总结 本研究通过稳定性理论分析,揭示了现代向量检索在高维空间中克服维度诅咒的机制,并提出了三种检索场景下的稳定性条件与实验验证。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏