arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-04-27 至 2026-04-27 共收录 14 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 8 篇

2604.22217 2026-04-27 cs.SE 92%

RAG-Reflect: Agentic Retrieval-Augmented Generation with Reflections for Comment-Driven Code Maintenance on Stack Overflow

RAG-Reflect:基于反思的代理检索增强生成用于Stack Overflow的评论驱动代码维护

Mehedi Hasan Shanto, Muhammad Asaduzzaman, Alioune Ngom

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(title)

AI总结 本文提出RAG-Reflect框架,通过检索增强推理和自我反思机制,实现精确的评论-编辑预测,提升代码维护效率。

Comments 27 pages, submitted to the TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22661 2026-04-27 cs.IR cs.CL 91%

Can QPP Choose the Right Query Variant? Evaluating Query Variant Selection for RAG Pipelines

QPP能否选择正确的查询变体?评估RAG流水线中的查询变体选择

Negar Arabzadeh, Andrew Drozdov, Michael Bendersky, Matei Zaharia

机构 * UC Berkeley(伯克利大学) Databricks(Databricks公司)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 本文研究了在RAG流水线中如何选择最佳查询变体,通过大规模实验评估了预检索和后检索预测器的性能,发现检索相关性与生成保真度之间存在'效用差距',但QPP能有效提升端到端质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22095 2026-04-27 cs.CL 89%

An End-to-End Ukrainian RAG for Local Deployment. Optimized Hybrid Search and Lightweight Generation

端到端的乌克兰RAG系统用于本地部署。优化的混合搜索和轻量级生成

Mykola Trokhymovych, Yana Oliinyk, Nazarii Nyzhnyk

机构 * Pompeu Fabra University(庞皮乌斯·法布拉大学) Independent Researcher(独立研究者)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出一个高效的检索增强生成系统,用于乌克兰文档问答,在UNLP 2026共享任务中获第二名。系统包含定制的两阶段搜索流程和针对乌克兰语言的微调模型,最终通过模型压缩实现轻量级部署。

Comments To appear at UNLP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18734 2026-04-27 cs.CL cs.AI 86%

Rethinking Retrieval-Augmented Generation as a Cooperative Decision-Making Problem

重新思考检索增强生成作为协作决策问题

Lichang Song, Ting Long, Yi Chang

机构 * Jilin University(吉林大学)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出CoRAG框架,将检索器与生成器视为平等决策者,通过共同优化任务目标提升生成稳定性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22678 2026-04-27 cs.CL 85%

BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering

BERAG:基于贝叶斯集成的检索增强生成用于基于知识的视觉问答

Jinghong Chen, Jingbiao Mei, Guangyu Yang, Bill Byrne

机构 * Department of Engineering(工程系)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.CL

AI总结 BERAG通过将语言模型条件于单个检索文档而非单一上下文,解决检索增强生成中文档贡献不明和长上下文中的信息丢失问题,提升视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22061 2026-04-27 cs.CL cs.AI cs.LG 81%

Lightweight Retrieval-Augmented Generation and Large Language Model-Based Modeling for Scalable Patient-Trial Matching

轻量级检索增强生成与基于大语言模型的建模用于可扩展的患者试验匹配

Xiaodi Li, Yang Xiao, Munhwan Lee, Konstantinos Leventakos, Young J. Juhn, David Jones, Terence T. Sio, Wei Liu, Maria Vassilaki, Nansu Zong

机构 * Department of Artificial Intelligence and Informatics, Mayo Clinic(人工智能与信息学系,梅奥诊所) Computer Science Department, University of Tulsa(图兰大学计算机科学系) Mayo Clinic Comprehensive Cancer Center, Mayo Clinic(梅奥诊所综合癌症中心,梅奥诊所) Division of Community Pediatric and Adolescent Medicine, Department of Pediatrics, Mayo Clinic(社区儿科与青少年医学分会,儿科部,梅奥诊所) Department of Neurology, Mayo Clinic(神经病学部,梅奥诊所) Department of Radiation Oncology, Mayo Clinic(放射肿瘤学部,梅奥诊所) Department of Quantitative Health Sciences, Mayo Clinic(定量健康科学部,梅奥诊所)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出轻量级框架,结合检索增强生成和大语言模型建模,解决患者试验匹配中长异构电子健康记录和复杂资格标准的可扩展性、泛化性和计算效率问题。

Comments 31 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22571 2026-04-27 physics.comp-ph 50%

LARA: Validation-Driven Agentic Supercomputer Workflows for Atomistic Modeling

LARA:面向原子模拟的验证驱动代理超级计算机工作流

William Dawson, Louis Beal, Yoann Curé, Giuseppe Fisicaro, Dorian Rolland, Luigi Genovese

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 本文提出LARA-HPC框架,通过验证驱动方法提升原子模拟工作流的可靠性,结合控制执行层、干运行验证和多阶段代理流程,有效解决计算资源交互中的不一致性和物理配置问题。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14287 2026-04-27 cs.LG 50%

Chain-of-Memory: Lightweight Memory Construction with Dynamic Evolution for LLM Agents

链式记忆:轻量级记忆构建与动态演化用于大语言模型代理

Xiucheng Xu, Bingbing Xu, Xueyun Tian, Zihe Huang, Rongxin Chen, Yunfan Li, Huawei Shen

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 本文提出CoM框架,通过轻量级记忆构建与动态演化机制,提升LLM代理的持久知识维护与长周期决策能力,实验显示在LongMemEval和LoCoMo基准上准确率提升7.5%-10.4%,计算开销降低2.7%-6.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识库问答 3 篇

2604.16915 2026-04-27 cs.CV 83%

KIRA: Knowledge-Intensive Image Retrieval and Reasoning Architecture for Specialized Visual Domains

KIRA:面向专业视觉领域的知识密集型图像检索与推理架构

Parthaw Goswami, Jaynto Goswami Deep

机构 * University of Missouri(密苏里大学) SAP Prague(SAP 布拉格)

专题命中 知识库问答 :RAG(summary_cn,abstract);retrieval augmented generation(abstract)

AI总结 KIRA提出一种五阶段框架,解决视觉RAG中的核心问题,包括多粒度知识库构建、领域自适应对比编码、双路径跨模态检索、多跳视觉推理及证据条件生成,通过四个专业领域实验验证其有效性。

Journal ref CVPR 2026 2nd Workshop on Knowledge-Intensive Multimodal Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22239 2026-04-27 cs.CL cs.AI 82%

Navigating Large-Scale Document Collections: MuDABench for Multi-Document Analytical QA

在大规模文档集合中导航:MuDABench用于多文档分析问答

Zhanli Li, Yixuan Cao, Lvzhou Luo, Ping Luo

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Wenlan School of Business, Zhongnan University of Economics and Law(中南财经政法大学文澜商学院)

专题命中 知识库问答 :RAG(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出在大规模半结构化文档集合上进行分析问答的任务,介绍了MuDABench多文档分析问答基准,要求跨多个文档提取和综合信息以进行定量分析,实验发现标准RAG系统表现不佳,提出多代理工作流以提升性能。

Comments Findings of ACL 2026. The camera-ready version corrects some labeling errors. The accompanying repository is continuously updated based on community feedback; for the most up-to-date implementation and results, please refer to the repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10695 2026-04-27 cs.CL cs.AI cs.IR 80%

Learning from Natural Language Feedback for Personalized Question Answering

通过自然语言反馈学习实现个性化问答

Alireza Salemi, Hamed Zamani

机构 * Center for Intelligent Information Retrieval(智能信息检索中心) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 知识库问答 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出VAC框架,利用自然语言反馈替代标量奖励,提升个性化问答效果,实验表明其在LaMP-QA基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长文档RAG 2 篇

2604.15583 2026-04-27 cs.DB 77%

SAGE: Selective Attention-Guided Extraction for Token-Efficient Document Indexing

SAGE:基于选择性注意力的令牌高效文档索引提取

Xinzhi Wang, Peter Baile Chen, Gerardo Vitagliano, Matthew Russo, Jun Chen, Michael Cafarella, Samuel Madden, Chunwei Liu

专题命中 长文档RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.DB

AI总结 本文提出SAGE方法,通过轻量本地LLM进行单次预填充,将语言模型注意力信号转化为查询特定的相关热图,从而在可控粒度下选择高相关单元,减少上下文并提升问答性能。

Comments 12 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22193 2026-04-27 cs.CL 70%

How Large Language Models Balance Internal Knowledge with User and Document Assertions

大型语言模型如何在内部知识与用户和文档断言之间取得平衡

Shuowei Li, Haoxin Li, Wenda Chu, Yi Fang

机构 * Santa Clara University(圣克拉拉大学) Nanyang Technological University(南洋理工大学) California Institute of Technology(加州理工学院)

专题命中 长文档RAG :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了大型语言模型在处理内部知识与外部信息时的平衡问题,提出三源交互框架,评估27个模型,发现模型更依赖文档断言,且通过微调可提升其区分能力。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图谱与结构化RAG 1 篇

2604.22261 2026-04-27 cs.CL 84%

Bridging the Long-Tail Gap: Robust Retrieval-Augmented Relation Completion via Multi-Stage Paraphrase Infusion

弥合长尾差距:通过多阶段 paraphrase 注入实现鲁棒的检索增强关系完成

Fahmida Alam, Mihai Surdeanu, Ellen Riloff

机构 * Department of Computer Science University of Arizona, USA(计算机科学系亚利桑那大学)

专题命中 图谱与结构化RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出RC-RAG框架,通过多阶段paraphrase注入提升稀有关系完成性能,无需微调即可在长尾场景下显著提升精确匹配指标。

详情

展开后加载摘要…

URL PDF HTML 收藏