arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-07-29 至 2026-07-29 共收录 20 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 9 篇

2607.24791 2026-07-29 cs.IR cs.AI cs.CL 新提交 90%

From Naive RAG to Deep Agentic Retrieval: An Evolving Context Engineering Pipeline for Regulatory Compliance

从朴素检索增强生成到深度智能检索:用于合规监管的不断演进的上下文工程管道

Mishca de Costa, Muhammad Saleh Anwar, Dave Mercier, Issam Hammad

专题命中 检索器与排序 :RAG(title,summary_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究针对RAG朴素实现的局限,追溯安大略发电公司检索管道演变,历经多阶段形成PEA-CAE架构,表明上下文工程对监管语料库更具优势,深度智能检索进展反映经典思想,迭代证据获取等渐成企业问答基础。

Comments Accepted at the 2026 IEEE the 14th International Conference on Smart Energy Grid Engineering (SEGE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24781 2026-07-29 cs.IR cs.AI 新提交 90%

Three Sides of Retrieval: Factorial Evidence for Document-Side, Query-Side, and Answer-Side Complementarity in RAG

检索的三个方面:RAG中文档侧、查询侧和答案侧互补性的因子证据

Ng S. T. Chong

专题命中 检索器与排序 :RAG(title,title_cn);分类 cs.IR、cs.AI

AI总结 研究RAG系统中检索问题,提出目录引导的页面检索新算法,通过实验发现该算法对答案质量有显著影响,与答案侧验证结合优于查询侧分解+验证,证明文档、查询、答案侧增强互补,且默认设置接近最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24776 2026-07-29 cs.IR cs.LG 新提交 90%

JKO-RAG: Distributional Retrieval as Wasserstein Free-Energy Gradient Flow

JKO-RAG:作为瓦瑟斯坦自由能梯度流的分布检索

Levi Segal, Murari Ambati

专题命中 检索器与排序 :RAG(title,title_cn);分类 cs.IR

AI总结 研究针对RAG管道排名列表与下游语言模型集合条件设定的不匹配问题,提出JKO方法,将重新排序视为在瓦瑟斯坦-2梯度流下最小化自由能泛函,通过线性响应理论解释优势,经实验验证,扩展方法并在BEIR基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24799 2026-07-29 cs.IR cs.AI 新提交 90%

Multimodal Hybrid Retrieval-Augmented Generation for Scientific Document Understanding using Open-Source SLMs

使用开源语言模型进行科学文档理解的多模态混合检索增强生成

Alexandru-Andrei Saucă, Ana-Luiza Rusnac

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);hybrid retrieval(title);RAG(abstract);dense retrieval(abstract)

AI总结 针对科学文档理解中大型语言模型的问题,提出多模态混合检索增强生成系统。利用开源视觉语言模型生成摘要,结合多种检索方法并优化,采用查询压缩器确保连贯性。经评估,该系统提高了检索质量,验证了开源模型与先进策略结合的竞争力。

Comments 7 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24817 2026-07-29 cs.IR cs.AI cs.CL 新提交 89%

Retrieval-Augmented Generation in LLMs for Mental Health: Quantifying the Incremental Contribution of Retrieval Within a Layered Safety Architecture

大语言模型在心理健康领域的检索增强生成:量化分层安全架构中检索的增量贡献

Anand Gupta, Akshat Surolia, Shubham Mishra, Shakil Imtiaz, Chaitali Sinha

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(title);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究数字心理健康干预中,通过在名为Wysa的DMHI里对比启用和禁用检索增强生成(RAG)模式,评估六个大语言模型,计算相关指标并测试差异,发现RAG虽致误报增加,但符合安全原则,是提升LLM驱动的DMHIs相关性能的有前景方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24800 2026-07-29 cs.IR cs.AI cs.CL 新提交 67%

When Thinking Before Retrieval Hurts: TraceBound Diagnostics for Adaptive Knowledge-Graph Retrieval

当检索前思考有害时:用于自适应知识图谱检索的TraceBound诊断

Partha Sarathi Purkayastha

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究知识图谱自适应检索中“检索前思考”有害问题,引入TraceBound诊断协议,它能暴露查询配置文件等。实验表明虽改善可检查性,但降低检索质量,通过分析定位退化原因,指出应将其作为动作选择控制问题评估。

Comments 11 pages, 4 figures, 15 tables. Accepted at the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25614 2026-07-29 cs.LG cs.CL 新提交 57%

MemSFT: Mitigating Alignment Tax with an External Parametric Memory

MemSFT:使用外部参数内存减轻对齐代价

Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi Wang, Zhiqi Yang, Qipeng Guo, Bowen Zhou, Zhouhan Lin

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL

AI总结 研究针对大语言模型应用于特定领域产生的对齐代价问题,提出MemSFT方法,通过参数内存解耦领域专业化与主干参数更新,经多领域多模型评估,能提升领域性能且通用性能下降小,实现通用与专业能力解耦。

Comments 33 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24826 2026-07-29 cs.IR cs.MA 新提交 57%

Aethel: A Reproducible Graph-Retrieval Framework for Multi-Hop Financial Diligence

Aethel:用于多跳金融尽职调查的可重现图检索框架

Krish Sapru

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR

AI总结 针对二级私募股权交易中财务披露信息综合难题,Aethel框架结合二分个性化PageRank图检索等技术,将语料库建模为实体-段落图。在多跳金融尽职调查任务中,该框架在特定数据集上有较好表现,优势依赖语料库规模和实体索引质量,且发布相关工件保证可重现性。

Comments 11 pages, 3 figures, 2 tables. Includes evaluations on MuSiQue, 2WikiMultiHopQA, and a 4,123-chunk financial-disclosure corpus. Code and evaluation artifacts are available for reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24759 2026-07-29 cs.AI cs.CY cs.DL 新提交 57%

Beyond Memory: A Templated Substrate for Heterogeneous Collaborative Knowledge Work with LLM Agents

超越记忆:一种用于异构协作知识工作的带大语言模型代理的模板化基础架构

Priscila Saboia Moreira, Christopher R. Sweet

机构 * University of Notre Dame(圣母大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究指出知识工作成果难传承,大语言模型代理无持久记忆。提出llm-wiki-memory-template,它是异构协作知识工作基础架构,沿多人类、多代理、多领域三个轴,通过案例研究展示其能保留失败路径等,解决负面结果丢失问题。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长文档RAG 2 篇

2607.24767 2026-07-29 cs.IR cs.AI cs.CL 新提交 87%

The Effect of Text Chunk Size on Retrieval-Augmented Generation Performance

文本块大小对检索增强生成性能的影响

German Garrido-Lestache Belinchon, Hugo Garrido-Lestache Belinchon

专题命中 长文档RAG :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI

AI总结 研究文本块大小对检索增强生成性能的影响,评估其与检索段数量如何影响生成质量和检索效果,通过比较配置,以更好理解文档分割对检索增强生成系统性能和效率的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24760 2026-07-29 cs.IR 新提交 77%

CHaystack: Benchmarking Chinese Document Retrieval and VQA

CHaystack:中文文档检索与视觉问答基准测试

Hanxi Li

专题命中 长文档RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 本文介绍了CHaystack中文文档检索与视觉问答基准测试,涵盖四类文档。提出CDocRAG系统,用VLM相关性过滤器验证文档图像。评估开源模型发现Qwen系列在文本丰富文档表现佳,中文大规模DocumentVQA在文本编码方面有挑战,仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图谱与结构化RAG 4 篇

2607.24838 2026-07-29 cs.IR cs.AI 新提交 85%

MedJudgeRAG: Option-Wise Evidence Judgment with Dynamic Knowledge Graphs for Medical MCQA

MedJudgeRAG:用于医学多项选择题问答的基于动态知识图谱的选项级证据判断

Seongwon Seo, Seung Hwan Cho, Young-Min Kim

专题命中 图谱与结构化RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 针对医学MCQA中普通RAG降低LM性能的问题,提出MedJudgeRAG框架,将检索文档表示为动态知识图谱,为选项判断证据裁决并确定知识利用策略,经监督微调训练,实验证明其性能优于基线,且动态知识图谱在训练时作用更有效。

Comments 16 pages, 2 figures, Accepted at The Workshop on Graph Foundation Models at the 43 rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25135 2026-07-29 cs.AI cs.LG 新提交 83%

ScalableRAG: High-Quality RAG at Zero Ingestion Cost

ScalableRAG:零摄入成本下的高质量检索增强生成

Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

机构 * Cohesity(科赫思)

专题命中 图谱与结构化RAG :RAG(title,abstract);分类 cs.AI

AI总结 研究提出零摄入成本的ScalableRAG及有限摄入的改进版本,通过维护工作区实现即时聚合推理,在六个语料库测试中表现出色,平均准确率大幅超越基线,还通过固定LLM调用次数等进一步提升大规模时的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24984 2026-07-29 physics.geo-ph cs.AI cs.LG 新提交 77%

Automatic Knowledge Graph Construction and Query for Earthquake Catalogs

地震目录的自动知识图谱构建与查询

Yuxin Zhou, Huai Zhang, S. Mostafa Mousavi

专题命中 图谱与结构化RAG :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);分类 cs.AI

AI总结 研究针对地震目录中开放性问题解答受限的情况,应用GraphRAG直接处理原始表格记录,构建可查询知识图谱,经评估改进并识别陷阱,提供实用查询接口,确保结果准确可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25182 2026-07-29 cs.CL cs.AI cs.IR 新提交 67%

TabRank: Chain-of-Thought Distillation for Table Re-Rankers

TabRank:表格重排器的思维链蒸馏

Adarsh Singh, Kushal Raj Bhandari, Jianxi Gao, Soham Dan, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院) Scale AI

专题命中 图谱与结构化RAG :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究针对表格检索训练推理重排器的问题,提出TabRank框架,通过构建数据集并探索两种训练紧凑推理模型的变体,经压力测试,该方法在多表格检索数据集上显著提升性能,有效推广到多表格推理。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态RAG 5 篇

2607.24748 2026-07-29 cs.IR cs.AI cs.CL 新提交 93%

VLD-RAG: Agentic Vision-Language Retrieval-Augmented Generation for Long, Visually-Rich Multi-Page Documents

VLD-RAG:用于长的、视觉丰富的多页文档的智能视觉语言检索增强生成

Seonok Kim

专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(title,abstract);hybrid retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究针对视觉丰富的长文档问答的多模态检索增强生成,提出VLD-RAG框架,构建多模态索引并采用混合检索策略,经智能体工作流程协调,在相关基准上提升了证据页面检索及问答表现,凸显协调验证与混合检索的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24875 2026-07-29 cs.LG 新提交 87%

FinAbstain: Uncertainty-Calibrated Multimodal RAG for Selective Financial Forecasting

FinAbstain:用于选择性金融预测的不确定性校准多模态检索增强生成模型

Dorothy Torres, Wei Cheng, Henan Huang

专题命中 多模态RAG :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract)

AI总结 研究针对大语言模型在金融预测中证据不足时高置信度的问题,提出FinAbstain框架,通过多模态检索增强生成及选择性预测,经多种不确定性评估方法和指标评估,贡献了时间安全架构、复合不确定性公式和可重复评估蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25041 2026-07-29 cs.IR cs.CR cs.CV cs.LG 新提交 77%

ScoreShield: Differentially Private Release of Similarity Scores

ScoreShield:相似度分数的差分隐私发布

Behrooz Razeghi, Parsa Rahimi

专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 研究生物识别等应用中相似度分数隐私保护问题,提出ScoreShield先扰动后投影机制,添加校准高斯噪声并投影到可行性集,满足(ε,δ)-DP,给出效用保证,在多任务中评估,改进了风险的n依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24861 2026-07-29 cs.IR cs.AI 新提交 76%

HVM-GraphRAG: Holistic-View Multimodal Graph Retrieval-Augmented Generation on Complex Document

HVM-GraphRAG:复杂文档上的整体视图多模态图检索增强生成

Xin He, Yili Wang, Wenqi Fan, Qing Li, Qinggang Zhang, Yi Chang, Xin Wang

专题命中 多模态RAG :retrieval-augmented generation(title);分类 cs.IR、cs.AI

AI总结 针对复杂文档问答中跨模态证据索引不可靠和图遍历昂贵的问题,提出HVM-GraphRAG框架,用整体视图指导图构建,检索时在概念级图上搜索并通过索引访问证据,实验证明其能提升答案性能和检索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25422 2026-07-29 cs.AI 新提交 57%

Salient Knowledge Pathways: Sparse Cross-Modal Routing for Efficient Knowledge-Intensive Multimodal Question Answering

显著知识路径:用于高效知识密集型多模态问答的稀疏跨模态路由

Noor Islam S. Mohammad, Uluğ Bayazıt

专题命中 多模态RAG :dense retrieval(abstract);分类 cs.AI

AI总结 研究知识密集型多模态问答,提出SKIP架构,通过问题引导视觉令牌修剪等方法,沿稀疏路径计算路由,结合自适应预算控制器,在五个基准测试中,以更少计算量和更低延迟达到或超越密集基线准确性。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026) Workshop on Efficient Multimodal Question Answering (EMM-QA), Seoul, South Korea. Copyright 2026 by the author(s). (Archival)

详情

展开后加载摘要…

URL PDF HTML 收藏