arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 349 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 349 篇

2607.12334 2026-07-15 cs.CL cs.ET 新提交 81%

QUBO-Optimized Evidence Selection for Retrieval-Augmented Question Answering with Unconventional Solvers

使用非常规求解器的QUBO优化证据选择用于检索增强问答

Rahul Singh, Madhav Vadlamani

机构 * University of California Santa Barbara(加利福尼亚大学圣巴巴拉分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 研究针对检索增强问答中证据选择问题,将其转化为QUBO问题构建能量函数,平衡多种因素选择证据段落,再由下游语言模型生成答案。在HotpotQA上评估,该方法性能与基于LLM的选择器相当,为RAG管道提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11362 2026-07-14 cs.IR 新提交 81%

Boolean queries are all you need?

布尔查询就足够了吗?

Charles L. A. Clarke, Mark D. Smucker

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR

AI总结 研究在TREC 2024 RAG赛道任务中,为基于大语言模型的搜索代理配备布尔检索引擎,仅依据语料库子串与查询匹配密度排名,无需监督学习等,结果表明简单模式匹配或足以用于智能搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17468 2026-06-17 cs.IR 新提交 81%

RSRank: Learning Relevance from Representational Shifts

RSRank: 从表示偏移中学习相关性

Archit Gupta, Sai Sundaresan, Debabrata Mahapatra

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR

AI总结 针对RAG系统中重排序依赖启发式阈值和语言模型logit信号的问题,提出基于表示偏移(RS)的相关性信号,通过轻量级训练框架学习映射,在零阈值下过滤无关内容,超越现有重排序器。

Comments Under Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17076 2026-06-17 physics.ao-ph cs.AI 新提交 81%

CMIP-Forge: An Agentic System that Retrieves, Computes, and Self-Reviews Climate Science

CMIP-Forge:一个检索、计算和自我审查气候科学的智能体系统

Dmitrii Pantiukhin, Boris Shapkin, Ivan Kuznetsov, Thomas Jung, Nikolay Koldunov

机构 * Alfred Wegener Institute, Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格ener研究所,极地与海洋研究中心)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.AI

AI总结 提出CMIP-Forge系统,结合检索增强生成与自主分析,通过多层级防御架构和独立审查机制,实现从文献到实时气候数据的端到端自主研究。

Comments 28 pages, 9 figures. Code available at https://github.com/CliDyn/cmip6_gpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14221 2026-08-17 cs.AI cs.CL 新提交 81%

MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement

MathForm:结合知识检索与验证引导的迭代优化实现数学自动形式化的规模化

Lushi Pu, Weiming Zhang, Xinheng Xie, Zixuan Fu, Bingxiang He, Hengyu Zhao, Hongya Lyu, Xin Li, Jie Zhou, Yudong Wang

机构 * ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学)

专题命中 检索器与排序 :knowledge retrieval(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MathForm框架,结合Mathlib知识检索与验证引导迭代优化构建Lean 4数据集,训练的MathForm-8B在多项基准测试中超越同类模型,实现了数学自动形式化的性能提升。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10636 2026-08-12 cs.IR cs.CL cs.CV 新提交 81%

DistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student Distillation

DistilVDR:通过双学生蒸馏实现的紧凑端到端视觉文档检索器

Zhuchenyang Liu, Ziyi Wang, Yao Zhang, Yu Xiao

专题命中 检索器与排序 :retriever(title,abstract);分类 cs.IR、cs.CL

AI总结 本研究提出DistilVDR,通过双学生蒸馏从80亿参数视觉-语言教师模型得到5.24亿参数的紧凑端到端VDR系统,在多个基准上性能接近教师模型且索引速度更快、体积更小。

Comments 15 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11277 2026-08-13 cs.CR cs.SE 新提交 80%

Knowledge-Graph-Guided Retrieval-Augmented LLMs for Explainable Root Cause Analysis in Automotive HiL Validation

知识图谱引导的检索增强大语言模型用于汽车在环(HiL)验证中的可解释根本原因分析

Hamza Ouarrad, Mohammad Abboush, Andreas Rausch

专题命中 检索器与排序 :RAG(summary_cn,abstract)

AI总结 该研究提出KG引导的RAG-LLM框架,用于汽车HiL数据的RCA与故障定位,在ASM汽油发动机和电动车系统案例中分别获90%、94% Top-1准确率,可实现可解释且泛化的故障分析。

Comments 10 pages, 3 figures, 5 tables. Accepted for publication and oral presentation at the 10th International Conference on System Reliability and Safety (ICSRS 2026), Rome, Italy, November 23--25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20517 2026-07-24 cs.LG 新提交 80%

Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

多模态CoLRAG-TF:复杂PDF的三重过滤检索

Takato Yasuno

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract)

AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。

Comments 18 pages, 8 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24725 2026-07-03 physics.ins-det physics.comp-ph 新提交 80%

A Reproducible Benchmark and Evidence-Retrieval Software Framework for Silicon Detector R&D Literature

硅像素探测器研发的基于证据的检索基准与混合RAG框架

Tianqi Gao, Ruobing Jiang, Dawei Fu, Qiang Li, Matthew Kenzie

专题命中 检索器与排序 :RAG(title_cn);dense retrieval(abstract);hybrid retrieval(abstract)

AI总结 针对硅像素探测器文献检索瓶颈,提出首个基于证据的检索基准和混合检索框架,结合稀疏、密集、混合检索和图探索,实验表明混合稀疏-密集检索在证据恢复上最可靠。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22909 2026-06-23 cs.DB cs.AI cs.IR 新提交 80%

Graph-Enhanced Large Language Models for Spatial Search

用于空间搜索的图增强大型语言模型

Nicole R. Schneider, Kent O'Sullivan, Hanan Samet

机构 * University of Maryland(马里兰大学) University of Sydney(悉尼大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);分类 cs.IR、cs.AI、cs.DB

AI总结 针对大语言模型空间推理能力不足的问题,提出图增强方法,将空间数据以图形式存储并与检索增强生成结合,提升复杂空间问题回答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15734 2026-06-16 cs.CL cs.AI cs.IR cs.LG 新提交 80%

Retrievable Gradients: Continual Post-Training Without Cumulative Weight Drift

可检索梯度:无累积权重漂移的持续后训练

Weihang Su, Jiacheng Kang, Jingyan Xu, Qingyao Ai, Jianming Long, Hanwen Zhang, Bangde Du, Xinyuan Cao, Min Zhang, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出ReGrad范式,将梯度作为可检索知识单元,通过元学习重塑文档梯度为通用适应信号,实现无权重漂移的可扩展参数知识注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14107 2026-08-17 cs.AI 新提交 79%

Retrieval Grounding Latent Reasoning for Dense Retrieval

用于密集检索的检索 grounding 潜在推理

Gang Zhou, Xiongxi Yu, Hu Tian, Yang Wei, Lu Pan, Ke Zeng, Shibiao Xu, Xiaolong Zheng

机构 * Meituan(美团)

专题命中 检索器与排序 :dense retrieval(title,abstract);分类 cs.AI

AI总结 本文提出用于密集检索的 RGLT 框架,结合过程监督蒸馏与检索 grounding 监督优化潜在推理轨迹,在推理密集型检索基准上优于基线且保持高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11465 2026-07-14 cs.IR 新提交 79%

Score-Only Distillation for Compact Dense Retrieval

用于紧凑密集检索的仅分数蒸馏

Kirill Dubovikov, Martin Takac, Salem Lahlou

专题命中 检索器与排序 :dense retrieval(title);retriever(abstract);分类 cs.IR

AI总结 研究紧凑检索器能否从分数向量学教师排序行为,用行中心分数向量目标训练,在固定评估面板上蒸馏协议可弥补部分基础与教师模型差距,蒸馏后学生模型编码加速,外部迁移性能有好有坏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01244 2026-07-03 cs.IR cs.CY 新提交 79%

Retrieval-Augmented Generation to Support Railways Engineering Tasks: A Case Study

检索增强生成支持铁路工程任务:案例研究

Andrea Gerardo Russo, Federico Ruggeri, Ivan Tomarchio, Davide Bombini, Nicolò Donati, Gianmarco Pappacoda, Paolo Torroni, Giuseppe-Emiliano La Cara

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);分类 cs.IR

AI总结 本文通过案例研究,展示了从设计到部署构建检索增强生成系统,用于铁路领域复杂技术法规的咨询,平衡技术能力与领域专业知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23911 2026-06-24 cs.IR 新提交 79%

Scaling Dense Retrieval with LLM-Annotated Training Data: Structured Mining and Progressive Curriculum for E-Commerce Sponsored Search

使用LLM标注的训练数据扩展稠密检索:面向电商赞助搜索的结构化挖掘与渐进式课程

Md Omar Faruk Rokon, Shasvat Desai, Jhalak Nilesh Acharya, Isha Shah, Kumar Priyam, Brahanyaa Somasundaram, Vamsee Tangirala, Minuteresa Thomas, Vivek Arora, Vijay Manchi, Hong Yao, Kuang-chih Lee

专题命中 检索器与排序 :dense retrieval(title,abstract);分类 cs.IR

AI总结 针对电商搜索中点击信号偏差和人工标注成本高的问题,提出利用多通道检索挖掘、校准的LLM级联标注和五级渐进式课程训练,在Walmart搜索中实现NDCG@10提升5.1%,尾查询提升显著。

Comments Accepted at E-Commerce Workshop, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04281 2026-07-07 cs.CL cs.AI 新提交 79%

Risk-Constrained Freshness-Aware Semantic Caching for Open-Web Retrieval-Augmented LLMs

面向开放网络检索增强语言模型的风险约束新鲜度感知语义缓存

Muhammad Mansoor, Tahir Ahmad, Yeo-Chan Yoon

机构 * Jeju National University(济州国立大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 研究针对开放网络证据时变新鲜度,提出三层语义缓存FreshCache,将缓存重用视为风险约束时间推理问题,给出评估方法并引入基准测试,实验表明其在节省搜索API及降低陈旧错误率方面效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00023 2026-07-02 cs.IR cs.AI 新提交 79%

Aligning Sentence Embeddings to Human Concepts via Sparse Autoencoders

通过稀疏自编码器将句子嵌入与人类概念对齐

Wonseok Shin, Songkuk Kim

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 提出使用Top-k稀疏自编码器解耦句子嵌入,使其特征与语义、句法等人类概念对齐,并通过激活引导机制实现可解释的检索重排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26157 2026-06-26 cs.IR cs.AI 新提交 79%

Reducing Redundancy in Whole-Slide Image Patching for Scalable Indexing and Retrieval

减少全切片图像分块冗余以实现可扩展索引与检索

Jialiang Geng, Ghazal Alabtah, Saghir Alfasly, Wataru Uegami, H. R. Tizhoosh

机构 * KIMIA Lab Dept. of Artificial Intelligence & Informatics(KIMIA实验室 人工智能与信息学系)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 提出ARReST框架,通过识别并剪除跨类别判别贡献小的对立块,在保持检索精度的同时显著压缩WSI索引存储(3%-60%),实现可扩展、低成本的病理图像检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15591 2026-06-16 cs.AI cs.CL cs.MA 新提交 79%

Agentic Retrieval and Reinforcement Learned Equation Chains: A Controlled Generation Framework for Complex and Novel Physics Word Problems

智能检索与强化学习方程链:面向复杂新颖物理文字题的可控生成框架

Tirthankar Mittra

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 提出ARVRE两阶段框架,通过离线时序差分学习构建有效物理方程链,结合智能检索增强生成控制问题结构与难度,再由大语言模型生成自然语言问题,实现复杂、新颖且可解的物理文字题生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11198 2026-06-11 cs.CL cs.AI 新提交 79%

The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content

结构注意力税:检索格式如何劫持上下文学习而与内容无关

Yuqi Zhang, Di Zhang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 研究发现知识图谱三元组因其格式结构比自然语言吸引2-3倍注意力,压缩演示注意力达42%,并提出了分解注意力为语义与结构成分的框架及缓解策略。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05967 2026-08-07 cs.MM 新提交 78%

M$^3$Prune: Hierarchical Collaborative Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

M³Prune:面向高效多模态多智能体检索增强生成的分层协同剪枝

Taolin Zhang, Weizi shao, Zijie Zhou, Chen Chen, Daiyang Yu, Tingyuan Hu, Chengyu Wang, Xiaofeng He

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract)

AI总结 M³Prune是优化多模态多智能体检索增强生成的分层协同剪枝框架,通过剪枝冗余通信边提升性能与token效率,实验中优于单智能体及多智能体基准系统。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27918 2026-07-31 math.OC 新提交 78%

OptGraph: Large Language Models Enhanced Evolutionary Optimization Via Graph Retrieval-Augmented Generation

OptGraph:基于图检索增强生成的大语言模型增强进化优化

Xianchao Xiu, Jianhao Li, Huangyue Chen, Wanquan Liu

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract)

AI总结 针对现有LLM自动化进化优化的局限,提出引入GraphRAG的OptGraph工作流,通过类型化图复用经验等方法,在基准数据集上较现有框架平均精确准确率提升8.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15963 2026-07-20 cs.HC 新提交 78%

A Human-Centric Evaluation of a Retrieval-Augmented Generation System for Explaining Quebec Insurance Contracts

以用户为中心对用于解释魁北克保险合同的检索增强生成系统的评估

David Beauchemin, Richard Khoury

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract)

AI总结 研究针对在线保险销售中消费者面临的‘建议差距’问题,对用于解释魁北克汽车保险合同的检索增强生成系统进行以用户为中心的评估,通过用户研究得出系统被视为‘认知均衡器’,但也有局限性,凸显人在回路框架在高风险消费金融中实施AI的重要性。

Comments Accepter to HCII 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29459 2026-08-03 cs.LG cs.AI 新提交 77%

TFGformer: Multivariate Time Series Forecasting via Time-Frequency Graph Learning and Covariate Fusion

TFGformer:基于时频图学习与协变量融合的多变量时间序列预测

Yu Sun, Yuan Chang, Xiaohou Shi, Yan Sun

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 针对异构IoT传感器多变量时间序列预测问题,提出CrossRAG框架,结合SAM、FCC学习与CATF,在7个基准上性能优于仅参数化基线及现有检索增强预测方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22781 2026-07-28 cs.LG cs.AI 新提交 77%

What Softmax Throws Away: Mass-Aware Attention for Evidence Accumulation

Softmax丢弃的信息:用于证据积累的质量感知注意力

Minwoo Yu, Young-guk Ha

机构 * Smart Computing Laboratory, Department of Computer Science & Engineering, Konkuk University(智能计算实验室,计算机科学与工程系,建国大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究探讨模型内部表示中预测相关结构信息保留问题,提出质量感知注意力(MAA),将标准L1归一化推广到Lp族,在多模型和数据集上提升未来链接AUC等,定位为通用归一化原则提高表示信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21936 2026-07-27 cs.CL 新提交 77%

Leveraging External Knowledge for Historical Document Restoration via Retrieval-Augmented Large Language Models

通过检索增强大语言模型利用外部知识进行历史文献修复

Gabeen Kim, Kyeongpil Kang

机构 * Kangwon National University(江原国立大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 针对历史文献因物理损坏难以辨认及现有修复方法在恢复命名实体上的局限,提出利用检索增强大语言模型的修复框架,结合预训练模型隐含知识与外部上下文,实验表明该方法性能优于基线,是历史记录分析实用工具。

Comments Accepted to Findings of ACL 2026

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 43290-43304, 2026

URL PDF HTML 收藏
2607.21677 2026-07-27 cs.SE cs.AI 新提交 77%

Enhancing SLMs for Sustainable Code Optimization in Radio-Astronomy

增强小型语言模型以实现射电天文学中的可持续代码优化

Elisa Chiarotto, Jingbo Li, P. Chris Broekema, Rob V. van Nieuwpoort

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);分类 cs.AI

AI总结 研究利用小型语言模型(SLMs)优化射电天文学代码,通过多采样生成策略和纳入编译器反馈两种方式增强SLMs,提高代码生成质量和性能,用更少计算资源匹配或超越大型单生成模型,且使所有测试模型持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16209 2026-07-21 cs.AI 新提交 77%

Shapley Context Pruning: A Cooperative Game Perspective for Context Reranking and Pruning

Shapley上下文剪枝:一种用于上下文重排和剪枝的合作博弈视角

Yanqiao Chen, Dongsheng Hou, Yuhan Rui, Zhen Cao, Yepang Liu

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文针对检索增强生成系统上下文重排和剪枝缺乏可解释统一框架的问题,提出Shapley上下文剪枝框架,用合作博弈视角归因重要性,采用深度集架构和蒙特卡罗采样,经多实验验证,模型在下游问答性能上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03615 2026-07-13 cs.IR 新提交 77%

The Powerless Noise: How Experimental Settings Shape the Reported Power of Noise

无作用的噪声:实验设置如何塑造报告的噪声能力

Michał Mazuryk, Fleur Dolmans, Louis Gehringer, Ina Klaric, Jia-Huei Ju, Mohammad Aliannejadi

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 研究重现Cuconasu等人关于噪声对检索增强生成系统问答性能影响的发现,在扩展实验设置下评估其稳健性,发现该效应受推理配置影响大,强调审视推理设计的重要性。

Comments SIGIR 26 Repro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08495 2026-07-10 cs.CY cs.AI 新提交 77%

The Context Access Divide: Interaction-Level Architecture as a Complementary Dimension of Agentic Inequality

上下文访问鸿沟:交互级架构作为智能不平等的补充维度

Masahiro Fujita

机构 * Faculty of Sociology, Kansai University(京都产业大学社会科学学部)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究智能不平等中未被关注的个体交互层面的上下文访问鸿沟,提出上下文性作为补充维度,用概率模型形式化CAD,分析其在相关架构中的技术基础及对知识工作分层和平台治理的影响。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏