arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 4558 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 4558 篇

2608.13050 2026-08-14 cs.CR cs.AI 新提交 81%

Operationalizing Cyber Threat Intelligence with GraphRAG

用GraphRAG实现网络威胁情报的操作化

Atul Kabra, Prakhar Paliwal, Manjesh K. Hanawal

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 本研究对比微软GraphRAG与Naive RAG,发现GraphRAG生成的网络威胁情报检测方案,在攻击线索轮换后保持率远高于后者,能依赖更难规避的持久线索,为自动生成SOC狩猎方案提供了架构基础。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11584 2026-08-13 cs.AI 新提交 81%

EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval

EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试

Huiqi Miao, Xinbao Sun, Bo Wang, Fanyu Meng, Lijun Mei, Na Wu, Di Jin, Chao Deng, Junlan Feng

机构 * Jiutian Research, China Mobile(中国移动九天研究院)

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 研究针对企业RAG部署的可靠性问题,推出含983个样本的EnterpriseRAG基准,评估13个LLM发现其指令遵循崩溃,为生产级RAG提供可复现的评估基础

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12727 2026-08-12 cs.IR 版本更新 81%

Training Dense Retrievers with Multiple Positive Passages

利用多正例段落训练密集检索器

Benben Wang, Minghao Tang, Hengran Zhang, Jiafeng Guo, Keping Bi

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR

AI总结 本文提出利用多正例段落训练检索器,通过统一对比学习框架分析不同优化目标,发现LSEPair在鲁棒性和性能上表现优异,同时揭示了不同目标对正样本质量的敏感性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24352 2026-07-28 cs.CL 新提交 81%

Retrieval-Augmented Large Language Models as Components of Cognitive Computing architecture for Regulatory Knowledge Management

作为监管知识管理认知计算架构组件的检索增强大语言模型

Dariusz Nowak-Nova

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);knowledge retrieval(abstract);分类 cs.CL

AI总结 研究探讨将大语言模型与检索增强生成架构集成用于监管知识管理,提出本地部署LLMs的架构方法,经实验验证,此集成提升了生成文本质量,引入可审计性等,增强后的LLMs可作为认知计算基础设施的语义处理模块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21625 2026-07-27 cs.AI 新提交 81%

Trajectory-Aware Retrieval Agents for Temporal Decision- Making

用于时间决策的轨迹感知检索代理

Jing Wang, Jie Shen, Xing Niu

机构 * Amazon(亚马逊)

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 研究用大语言模型代理从长篇时间结构化文本中决策的问题,针对标准RAG丢弃时间结构缺陷,引入闭环代理框架TLM,其关键技术是LGCM,在医学问答、收益电话会议惊喜预测和隔夜股票缺口预测任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18039 2026-07-21 cs.IR 新提交 81%

Evidence-in-the-Loop: Trace-Driven Optimization for Customer-Service LLM Agents

循证优化:面向客户服务语言模型代理的跟踪驱动优化

Chunming Wu, Dafei Qiu, Congde Yuan, Charles Quan, Jun Wu, Suipeng Li, Mo Wu, Gavin Xie, Hope Chen, Max Yao

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR

AI总结 研究面向客户服务语言模型代理的优化,提出循证客户服务代理工作流程,通过多种技术构建证据,结合政策引导编排。贡献混合RAG证据构建、循证问题/行动决策、跟踪驱动的RAG和重排器改进三种部署模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17108 2026-07-21 cs.AI 新提交 81%

Evidence Interfaces Shape How Retrieval-Augmented Readers Use Support

证据接口塑造了检索增强型读者使用支持信息的方式

Junchi Liao, Jiawen Deng, Fuji Ren

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 研究多跳 RAG 评估中前 k 答案分数隐藏的问题,通过对比不同训练方式的适配读者,区分支持可用性失败与读者接口效应,并指出在支持标注评估中应同时报告前 k 答案分数与完整支持覆盖率,黄金支持优先等方法可改进读者。

Comments 18 pages; includes references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08877 2026-07-17 cs.AI 81%

Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search

量化预算约束下代理LLM搜索中的准确性与成本影响

Kyle McCleary, James Ghawaly

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);dense retrieval(abstract);分类 cs.AI

AI总结 本研究探讨了预算约束下代理LLM搜索中搜索深度、检索策略和完成预算对准确性和成本的影响,并提供了可重复的评估方法和实验结果。

Comments Accepted in 2026 Language Resources and Evaluation Conference (LREC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12334 2026-07-15 cs.CL cs.ET 新提交 81%

QUBO-Optimized Evidence Selection for Retrieval-Augmented Question Answering with Unconventional Solvers

使用非常规求解器的QUBO优化证据选择用于检索增强问答

Rahul Singh, Madhav Vadlamani

机构 * University of California Santa Barbara(加利福尼亚大学圣巴巴拉分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 研究针对检索增强问答中证据选择问题,将其转化为QUBO问题构建能量函数,平衡多种因素选择证据段落,再由下游语言模型生成答案。在HotpotQA上评估,该方法性能与基于LLM的选择器相当,为RAG管道提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11362 2026-07-14 cs.IR 新提交 81%

Boolean queries are all you need?

布尔查询就足够了吗?

Charles L. A. Clarke, Mark D. Smucker

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR

AI总结 研究在TREC 2024 RAG赛道任务中,为基于大语言模型的搜索代理配备布尔检索引擎,仅依据语料库子串与查询匹配密度排名,无需监督学习等,结果表明简单模式匹配或足以用于智能搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03367 2026-06-19 cs.IR 版本更新 81%

Automating Information Extraction and Retrieval for Industrial Spare Parts Pooling

自动化信息提取与检索用于工业备件池化

Dyuman Bulloni, Rocco Felici, Oliver Avram, Anna Valente

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.IR

AI总结 提出PhRAG混合检索增强生成框架,通过命名实体识别结构化异构备件描述并构建虚拟库存池,结合生成式语言模型处理数据稀缺和查询变异性,实现可解释的备件检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17468 2026-06-17 cs.IR 新提交 81%

RSRank: Learning Relevance from Representational Shifts

RSRank: 从表示偏移中学习相关性

Archit Gupta, Sai Sundaresan, Debabrata Mahapatra

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR

AI总结 针对RAG系统中重排序依赖启发式阈值和语言模型logit信号的问题,提出基于表示偏移(RS)的相关性信号,通过轻量级训练框架学习映射,在零阈值下过滤无关内容,超越现有重排序器。

Comments Under Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17076 2026-06-17 physics.ao-ph cs.AI 新提交 81%

CMIP-Forge: An Agentic System that Retrieves, Computes, and Self-Reviews Climate Science

CMIP-Forge:一个检索、计算和自我审查气候科学的智能体系统

Dmitrii Pantiukhin, Boris Shapkin, Ivan Kuznetsov, Thomas Jung, Nikolay Koldunov

机构 * Alfred Wegener Institute, Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格ener研究所,极地与海洋研究中心)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.AI

AI总结 提出CMIP-Forge系统,结合检索增强生成与自主分析,通过多层级防御架构和独立审查机制,实现从文献到实时气候数据的端到端自主研究。

Comments 28 pages, 9 figures. Code available at https://github.com/CliDyn/cmip6_gpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19697 2026-06-16 cs.SE cs.AI 版本更新 81%

AlignCoder: Aligning Retrieval with Target Intent for Repository-Level Code Completion

AlignCoder: 为目标意图对齐检索以实现仓库级代码补全

Tianyue Jiang, Yanli Wang, Yanlin Wang, Daya Guo, Ensheng Shi, Yuchi Ma, Jiachi Chen, Zibin Zheng

机构 * School of Software, Sun Yat-sen University(中山大学软件学院) Sun Yat-sen University(中山大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.AI

AI总结 针对仓库级代码补全中检索与目标代码不匹配及无法利用推理信息的问题,提出AlignCoder框架,通过查询增强和基于强化学习的检索器训练,在CrossCodeEval上EM分数提升18.1%。

Comments To appear at ASE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10389 2026-06-12 cs.CL 版本更新 81%

BLUEmed: Retrieval-Augmented Multi-Agent Debate for Clinical Error Detection

BLUEmed: 基于检索增强的多智能体辩论用于临床错误检测

Saukun Thika You, Nguyen Anh Khoa Tran, Wesley K. Marizane, Hanshu Rao, Qiunan Zhang, Xiaolei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.CL

AI总结 提出BLUEmed框架,结合混合检索增强生成与多智能体辩论,通过分解临床笔记、检索证据、专家辩论及安全层过滤,在术语替换错误检测中达到最优性能。

Comments Accepted to the IEEE International Conference on Healthcare Informatics (ICHI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11483 2026-05-28 cs.IR 81%

Uncertainty Quantification for Retrieval-Augmented Reasoning

检索增强推理的不确定性量化

Heydar Soudani, Hamed Zamani, Faegheh Hasibi

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR

AI总结 提出R2C方法,通过扰动多步推理过程来量化检索和生成的不确定性,在多个QA数据集上平均AUROC提升超5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19113 2026-05-26 cs.AI 81%

Hybrid Deep Searcher: Scalable Parallel and Sequential Search Reasoning

混合深度搜索器:可扩展的并行与顺序搜索推理

Dayoon Ko, Jihyuk Kim, Haeju Park, Sohyeon Kim, Dahyun Lee, Yongrae Jo, Gunhee Kim, Moontae Lee, Kyungjae Lee

机构 * Seoul National University(首尔国立大学) LG AI Research(LG AI研究) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Seoul(首尔大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);knowledge retrieval(abstract);分类 cs.AI

AI总结 提出混合搜索策略HybridDeepSearcher,通过并行查询扩展与显式证据聚合结合顺序推理,在多个基准上显著提升性能并实现测试时搜索扩展。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05210 2026-05-11 cs.IR 81%

DisastRAG: A Multi-Source Disaster Information Integration and Access System Based on Retrieval-Augmented Large Language Models

DisastRAG:基于检索增强大语言模型的多源灾害信息整合与访问系统

Bo Li, Zhitong Chen, Kai Yin, Junwei Ma, Yiming Xiao, Ali Mostafavi

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.IR

AI总结 本文提出DisastRAG系统,整合结构化、非结构化和上下文灾害信息,通过多路径架构支持文档检索、结构化访问和外部网络回退,提升灾害管理信息获取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26483 2026-04-30 cs.IR 81%

Efficient Listwise Reranking with Compressed Document Representations

高效列表级重排序与压缩文档表示

Hervé Déjean, Stéphane Clinchant

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR

AI总结 本文提出RRK方法,通过压缩文档为多token固定大小嵌入表示,实现高效有效的列表级重排序,在参数较少的情况下提升了效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18424 2026-04-21 cs.IR cs.IT math.IT 81%

Context-Aware Search and Retrieval Under Token Erasure

基于上下文的token擦除下的搜索与检索

Sara Ghasvarianjahromi, Joshua Barr, Yauhen Yakimenka, Jörg Kliewer

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR

AI总结 本文研究了在token擦除情况下,基于RAG系统的搜索与检索模型,通过信息论分析,探讨了查询表示部分保留时的远程文档检索问题,提出基于术语频率的特征表示和语义自适应冗余分配方法,采用TF-IDF加权相似度进行检索,并通过数值结果验证了相似度边际向量收敛于多元高斯分布的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13101 2026-04-16 cs.SE cs.AI 81%

Building Trust in the Skies: A Knowledge-Grounded LLM-based Framework for Aviation Safety

在天空中建立信任:一种基于知识的LLM框架用于航空安全

Anirudh Iyengar, Alisa Tiselska, Dumindu Samaraweera, Hong Liu

机构 * Senior Member, IEEE(IEEE高级会员) IEEE

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.AI

AI总结 本文提出结合LLM和知识图谱的框架,提升航空安全分析的可信度,通过双阶段流程构建和验证安全知识,提高准确性和可追溯性。

Comments Initial version of a conference publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17919 2025-10-22 cs.CR cs.AI 81%

ParaVul: A Parallel Large Language Model and Retrieval-Augmented Framework for Smart Contract Vulnerability Detection

Tenghui Huang, Jinbo Wen, Jiawen Kang, Siyong Chen, Zhengtao Li, Tao Zhang, Dongning Liu, Jiacheng Wang, Chengjun Cai, Yinqiu Liu, Dusit Niyato

机构 * School of Automation, Guangdong University of Technology(广东科技大學自動化學院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大學計算機科學與技術學院) School of Cyberspace Science and Technology, Beijing Jiaotong University(北京交通大學網絡空間科學與技術學院) School of Computer Science and Technology, Guangdong University of Technology(廣東科技大學計算機科學與技術學院) College of Computing and Data Science, Nanyang Technological University(南洋理工大學計算與數據科學學院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);dense retrieval(abstract);hybrid retrieval(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15851 2026-08-18 cs.IR cs.CL 新提交 81%

Dense Expands, Sparse Anchors: Channel-Asymmetric Query Expansion for Hybrid Retrieval

密集扩展,稀疏锚点:用于混合检索的通道非对称查询扩展

Chunran Zhang

专题命中 检索器与排序 :hybrid retrieval(title,abstract);分类 cs.IR、cs.CL

AI总结 本研究提出DESA通道非对称查询扩展方法,在7个BEIR数据集上提升检索指标,同时降低访问深度,为生成段落的通道特定整合及检索效果与访问深度的联合评估提供支撑。

Comments 13 pages, 4 figures. Code and artifacts: https://github.com/ln-one/dense-expands-sparse-anchors

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14838 2026-08-18 cs.SE cs.CL cs.IR 新提交 81%

The Recall Trap: A Recall-Maximizing Retriever Configuration Reduces Issue Resolution in Fixed-Budget Code Context

召回陷阱:固定预算代码上下文下,最大化召回率的检索器配置会降低问题解决效率

Alexander Adkins, Teimuraz Trapaidze

专题命中 检索器与排序 :retriever(title,abstract);分类 cs.IR、cs.CL

AI总结 该研究发现,最大化召回率的检索器配置会降低代码修复的问题解决率,建议固定预算下不要按文件硬去重,应针对任务而非检索指标优化打包策略。

Comments 24 pages, 2 figures. Reproducibility artifact: Zenodo DOI 10.5281/zenodo.21879550

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14221 2026-08-17 cs.AI cs.CL 新提交 81%

MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement

MathForm:结合知识检索与验证引导的迭代优化实现数学自动形式化的规模化

Lushi Pu, Weiming Zhang, Xinheng Xie, Zixuan Fu, Bingxiang He, Hengyu Zhao, Hongya Lyu, Xin Li, Jie Zhou, Yudong Wang

机构 * ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学)

专题命中 检索器与排序 :knowledge retrieval(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MathForm框架,结合Mathlib知识检索与验证引导迭代优化构建Lean 4数据集,训练的MathForm-8B在多项基准测试中超越同类模型,实现了数学自动形式化的性能提升。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10636 2026-08-12 cs.IR cs.CL cs.CV 新提交 81%

DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

DistilVDR:通过双学生蒸馏实现的紧凑端到端视觉文档检索器

Zhuchenyang Liu, Ziyi Wang, Yao Zhang, Yu Xiao

专题命中 检索器与排序 :retriever(title,abstract);分类 cs.IR、cs.CL

AI总结 本研究提出DistilVDR,通过双学生蒸馏从80亿参数视觉-语言教师模型得到5.24亿参数的紧凑端到端VDR系统,在多个基准上性能接近教师模型且索引速度更快、体积更小。

Comments 15 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29648 2026-06-30 cs.CL cs.AI cs.LG cs.MA 81%

Hybrid Retriever Evolution for Multimodal Document Reasoning Agents

混合检索器演化:面向多模态文档推理代理

Bohan Yao, Shruthan Radhakrishna, Vikas Yadav

机构 * ServiceNow University of Washington(华盛顿大学)

专题命中 检索器与排序 :retriever(title,abstract);分类 cs.CL、cs.AI

AI总结 提出失败驱动的演化框架,让元代理自动学习任务代理如何协调多种检索器进行多步文档问答,实现自适应检索路由,在MMLongBench-Doc和DocBench上提升高达19.6分。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28330 2026-06-30 cs.IR cs.AI 81%

High-Dimensional Concentration and Retrieval Instability in Embedding Spaces: Implications for Retrieval-Augmented Generation

嵌入空间中的高维浓度与检索不稳定性:对检索增强生成的影响

Ernesto Lopez Fune

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);分类 cs.IR、cs.AI

AI总结 研究高维嵌入空间中距离和余弦浓度的现象,通过数值实验揭示其对最近邻检索稳定性的影响,并表明这些效应可能削弱检索增强生成中的基础可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01070 2026-06-02 cs.IR cs.AI cs.LG 81%

Test-Time Training for Zero-Resource Dense Retrieval Reranking

零资源稠密检索重排的测试时训练

Shiyan Liu, Yichen Li

机构 * Huazhong University of Science and Technology(华中科技大学) ByteDance(字节跳动)

专题命中 检索器与排序 :dense retrieval(title,abstract);分类 cs.IR、cs.AI

AI总结 提出 DART 方法,通过测试时自适应双线性评分矩阵,利用伪正负样本进行少量梯度更新,在零资源下提升稠密检索重排性能。

Comments Accepted at KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28837 2026-05-29 cs.CL cs.AI 81%

SERC: LDPC-Inspired Semantic Error Correction for Retrieval-Augmented Generation

SERC: 受LDPC启发的检索增强生成语义纠错方法

Gyumin Kim, Juhwan Park, Jaeha Kim, Seunggyun Han, Kyungrak Son, Ikbeom Jang

机构 * Department of Information Communications Engineering, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学信息通信工程系) Division of Computer Engineering, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学计算机工程系) Department of Statistics, Hankuk University of Foreign Studies, Republic of Korea(韩国外国语大学统计学系)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型幻觉问题,提出受LDPC码启发的语义纠错框架SERC,通过稀疏验证策略高效检测和纠正生成文本中的错误。

Comments 15 pages, 2 figures, 6 tables. To appear in the Proceedings of the 28th International Conference on Pattern Recognition (ICPR 2026). Code available at https://github.com/labhai/SERC

详情

展开后加载摘要…

URL PDF HTML 收藏