arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8561 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 4552 篇

2305.17080 2023-05-29 cs.CL 70%

Expand, Rerank, and Retrieve: Query Reranking for Open-Domain Question Answering

Yung-Sung Chuang, Wei Fang, Shang-Wen Li, Wen-tau Yih, James Glass

专题命中 检索器与排序 :retriever(abstract);dense retrieval(abstract);分类 cs.CL

Comments ACL 2023 long paper (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15469 2023-03-30 cs.CL 70%

Zero-Shot Retrieval with Search Agents and Hybrid Environments

Michelle Chen Huebscher, Christian Buck, Massimiliano Ciaramita, Sascha Rothe

专题命中 检索器与排序 :retriever(abstract);hybrid retrieval(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03754 2023-02-09 cs.CL 70%

Augmenting Zero-Shot Dense Retrievers with Plug-in Mixture-of-Memories

Suyu Ge, Chenyan Xiong, Corby Rosset, Arnold Overwijk, Jiawei Han, Paul Bennett

专题命中 检索器与排序 :retriever(abstract);dense retrieval(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.04873 2022-11-02 cs.CL 70%

CORE: A Retrieve-then-Edit Framework for Counterfactual Data Generation

Tanay Dixit, Bhargavi Paranjape, Hannaneh Hajishirzi, Luke Zettlemoyer

专题命中 检索器与排序 :retrieval-augmented generation(abstract);dense retrieval(abstract);分类 cs.CL

Comments Findings EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08707 2021-11-30 cs.IR 70%

Contextualized Query Embeddings for Conversational Search

Sheng-Chieh Lin, Jheng-Hong Yang, Jimmy Lin

专题命中 检索器与排序 :dense retrieval(abstract);hybrid retrieval(abstract);分类 cs.IR

Comments Published in EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.10739 2021-09-23 cs.IR 70%

Predicting Efficiency/Effectiveness Trade-offs for Dense vs. Sparse Retrieval Strategy Selection

Negar Arabzadeh, Xinyi Yan, Charles L. A. Clarke

专题命中 检索器与排序 :dense retrieval(abstract);hybrid retrieval(abstract);分类 cs.IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.07812 2021-09-17 cs.CL 70%

Transductive Learning for Unsupervised Text Style Transfer

Fei Xiao, Liang Pang, Yanyan Lan, Yan Wang, Huawei Shen, Xueqi Cheng

专题命中 检索器与排序 :retriever(abstract);dense retrieval(abstract);分类 cs.CL

Comments Accepted at EMNLP 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.03938 2021-05-11 cs.IR 70%

Passage Retrieval for Outside-Knowledge Visual Question Answering

Chen Qu, Hamed Zamani, Liu Yang, W. Bruce Croft, Erik Learned-Miller

专题命中 检索器与排序 :retriever(abstract);dense retrieval(abstract);分类 cs.IR

Comments Accepted to SIGIR'21 as a short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.10073 2021-02-22 cs.IR 70%

Pyserini: An Easy-to-Use Python Toolkit to Support Replicable IR Research with Sparse and Dense Representations

Jimmy Lin, Xueguang Ma, Sheng-Chieh Lin, Jheng-Hong Yang, Ronak Pradeep, Rodrigo Nogueira

专题命中 检索器与排序 :dense retrieval(abstract);hybrid retrieval(abstract);分类 cs.IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17205 2026-08-03 cs.IR cs.AI cs.CL cs.LG 版本更新 69%

OPERA: Online Data Pruning for Efficient Retrieval Model Adaptation

OPERA:面向高效检索模型适应的在线数据剪枝

Haoyang Fang, Shuai Zhang, Yifei Ma, Hengyi Wang, Cuixiong Hu, Katrin Kirchhoff, Bernie Wang, George Karypis

机构 * Amazon Web Services(亚马逊云服务)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI;RAG(comments)

AI总结 OPERA通过在线数据剪枝提升检索模型适应效果,SP在标准微调基础上提升NDCG,DP在多个领域数据集上取得最佳排名和召回效果,且训练时间减少50%。

Comments Code is released at: https://github.com/autogluon/autogluon-rag/tree/main/projects/opera

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15790 2025-12-19 cs.CR 69%

Bilevel Optimization for Covert Memory Tampering in Heterogeneous Multi-Agent Architectures (XAMT)

针对异构多智能体架构中的隐蔽内存篡改的双层优化

Akhil Sharma, Shaikh Yaser Arafat, Jai Kumar Sharma, Ken Huang

专题命中 检索器与排序 :RAG(abstract,comments);retrieval-augmented generation(abstract)

AI总结 XAMT通过双层优化方法针对异构多智能体架构中的隐蔽内存篡改问题,提出了一种新的训练时威胁模型,以提升系统安全性。

Comments 10 pages, 5 figures, 4 tables. Conference-style paper (IEEEtran). Proposes unified bilevel optimization framework for covert memory poisoning attacks in heterogeneous multi-agent systems (MARL + RAG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18905 2025-02-27 cs.SE cs.LG 69%

Automated Code Generation and Validation for Software Components of Microcontrollers

Sebastian Haug, Christoph Böhm, Daniel Mayer

专题命中 检索器与排序 :RAG(abstract,comments);retrieval-augmented generation(abstract)

Comments Sebastian Haug: This paper, spanning 12 pages with 5 figures, presents my work on automated code generation and validation for STM32F407 microcontroller software components. Developed as part of a research project at Munich University of Applied Sciences and AGSOTEC GmbH, it leverages AST and RAG to streamline embedded development. Includes glossary and bibliography as supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08994 2026-08-11 cs.IR cs.AI cs.CL cs.LG 新提交 67%

Guardian Crawler: Retrieval-First Knowledge Discovery with Bounded LLM Augmentation for Noisy Web Intelligence

Guardian Crawler:面向噪声网络智能的、结合受限大语言模型增强的检索优先型知识发现方法

Joshua Castillo, Santosh Nukavarapu, Ravi Mukkamala

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 Guardian Crawler是面向噪声网络智能的检索优先型测试平台,结合BM25与风险感知重排序等技术,在合成语料库实验中取得较高检索分数,可用于知识发现与证据摘要生成。

Comments 8 pages, 2 figures. Accepted as a Short Paper at KDIR 2026 (International Conference on Knowledge Discovery and Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02751 2026-08-06 cs.IR cs.AI cs.CL 版本更新 67%

Search, Inspect, Fetch: Exploiting Structure-Aware Boolean Retrieval for Deep-Research Agents

搜索、检查、获取:利用布尔检索构建深度研究智能体

Shuai Wang, Haodong Chen, Yu Yin, Shengyao Zhuang, Bevan Koopman, Guido Zuccon

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本研究针对现有深度研究智能体的缺陷,提出基于BQL的SIEVE接口,在三个问答数据集上实现更高准确率且token用量显著减少,验证了BQL过滤的有效性。

Comments added statistical test, restructure appendix etc

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25600 2026-07-30 cs.IR cs.AI cs.CL 版本更新 67%

Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs

超越自我认知:在语言模型中跨推理与检索传播不确定性

Chandan Kumar Sah, Li Zhang, Xiaoli Lian

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究在知识密集型问答中,利用黑盒语言模型的置信度指导检索路由。核心方法是BeyondUncertainty,先得临时答案和置信度,依阈值决定检索策略。该方法提升了平均词元级F1,减少检索段落,在多数设置中优于随机分配,揭示了证据获取与词元效率的权衡。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24800 2026-07-29 cs.IR cs.AI cs.CL 新提交 67%

When Thinking Before Retrieval Hurts: TraceBound Diagnostics for Adaptive Knowledge-Graph Retrieval

当检索前思考有害时:用于自适应知识图谱检索的TraceBound诊断

Partha Sarathi Purkayastha

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究知识图谱自适应检索中“检索前思考”有害问题,引入TraceBound诊断协议,它能暴露查询配置文件等。实验表明虽改善可检查性,但降低检索质量,通过分析定位退化原因,指出应将其作为动作选择控制问题评估。

Comments 11 pages, 4 figures, 15 tables. Accepted at the Failure Modes in Agentic AI (FAGEN) Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10994 2026-07-14 cs.LG 新提交 67%

A Multi-Agent Framework for Zero-Dimensional Reduced-Order Model Planning

用于零维降阶模型规划的多智能体框架

Bingteng Sun, Hao Yin, Yiling Chen, Renjie Xiao, Lei Xie, Shanyou Wang, Ruonan Wang, Shubao Chen, Qingzong Xu, Lin Lu, Qiang Du, Junqiang Zhu

机构 * Institute of Engineering Thermophysics, Chinese Academy of Sciences(中国科学院工程热物理研究所) National Key Laboratory of Science and Technology on Advanced Light-duty Gas-turbine(先进轻型燃气轮机技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Qingdao Institute of Aeronautical Technology(青岛航空技术研究院) Nanjing Future Energy System Research Institute(南京未来能源系统研究院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文针对复杂零维降阶模型规划中依赖人工、传统方法局限等问题,提出多智能体架构Z-COPA,其核心是专用图表示法,将规划转化为图结构优化问题,经多基准测试验证,该框架性能卓越且打破传统范式,提供新规划技术方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07383 2026-07-09 cs.CV 新提交 67%

MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG

MMAgent-R$^2$:用于智能mRAG的重排与拒绝学习

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Yang, Bing Li, Chunfeng Yuan, Kang Rong, Fengyun Rao, Jing Lyu, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) PeopleAI Inc.(人智公司) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 检索器与排序 :retrieval augmented generation(abstract);retriever(abstract)

AI总结 针对KB-VQA中现有mRAG方法在处理视觉相似实体时的不足,提出MMAgent-R$^2$框架,集成视觉重排和主动拒绝机制,设计复合奖励函数,经GRPO训练实现联合优化,实验证明其在多任务中性能达最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05968 2026-07-08 cs.CL cs.AI cs.IR 新提交 67%

InfluMatch: Frontier-Quality KOL Search at 4B-Model Cost

InfluMatch:以4B模型成本实现前沿质量的关键意见领袖搜索

Krittanon Kaewtawee, Petmongkon Pornpichitsuwan, Natchaya Temyingyong, Nutnicha Laplamoon, Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究如何将关键意见领袖与泰国营销标准匹配,提出低成本三阶段级联InfluMatch,由小型开放权重模型构建,能以低得多的成本达到前沿模型效果,是可部署、可解释的KOL搜索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02964 2026-07-08 cs.CR 版本更新 67%

External Data Extraction Attacks against Retrieval-Augmented Large Language Models

针对检索增强型大语言模型的外部数据提取攻击

Yu He, Yifei Chen, Yiming Li, Shuo Shao, Leyi Qi, Boheng Li, Dacheng Tao, Zhan Qin

专题命中 检索器与排序 :RAG(abstract,abstract_cn)

AI总结 研究针对检索增强型大语言模型的外部数据提取攻击,提出统一框架并开发SECRET攻击方法,该方法含自适应优化与聚类聚焦触发策略,实验显示其显著优于先前攻击,能有效提取数据,呼吁关注此新兴威胁。

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00798 2026-07-02 cs.CV 新提交 67%

ClinRAG-GRAPH: Clinical-prior Retrieval-Augmented Graph Model with Domain Adversarial Learning for Breast pCR Prediction

ClinRAG-GRAPH: 基于临床先验的检索增强图模型与领域对抗学习用于乳腺癌pCR预测

Yaofei Duan, Yuhao Huang, Tianyu Zhang, Yuan Gao, Luyi Han, Xin Wang, Xinyu Xie, Xinglong Liang, Chunyao Lu, Muzhen He, Patrick Pang, Yue Sun, Ning Mao, Tao Tan, Ritse Mann

机构 * Department of Medical Imaging, Radboud University Medical Center, Nijmegen, The Netherlands(拉德堡德大学医学中心医学影像科,奈梅亨,荷兰) The Netherlands Cancer Institute, Amsterdam, The Netherlands(荷兰癌症研究所,阿姆斯特丹,荷兰) Faculty of Applied Sciences, Macao Polytechnic University, Macau, China(澳门理工大学应用科学学院,澳门,中国) Boston Children’s Hospital, Harvard Medical School, Boston, USA(波士顿儿童医院,哈佛医学院,波士顿,美国) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong, China(中国科学院香港创新研究院人工智能与机器人创新中心,香港,中国) Imaging Division, University Medical Center Utrecht, Utrecht, The Netherlands(乌得勒支大学医学中心影像部,乌得勒支,荷兰) Department of Radiology, Fuzhou University Affiliated Provincial Hospital, Fuzhou, China(福州大学附属省立医院放射科,福州,中国) Department of Radiology, Yantai Yuhuangding Hospital, Shandong, China(烟台毓璜顶医院放射科,山东,中国)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 提出ClinRAG-GRAPH框架,通过构建患者内临床先验图、双分支领域对抗学习和大语言模型驱动的子图检索增强模块,实现术前pCR预测,在内部和外部测试集上取得良好性能。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19911 2026-06-19 cs.AI cs.CL cs.IR 新提交 67%

Multi-Agent Transactive Memory

多智能体交互记忆

To Eun Kim, Xuhong He, Dishank Jain, Ambuj Agrawal, Negar Arabzadeh, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出MATM框架,通过共享存储和检索智能体轨迹,实现异构智能体群体间的知识复用,提升下游任务性能并减少交互步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18467 2026-06-18 stat.ML cs.LG 新提交 67%

ToolChain-CRC: Conformal Risk Control for Agentic AI Under Retrieval and Tool-Use Drift

ToolChain-CRC: 检索与工具使用漂移下代理型AI的共形风险控制

Jeffery Opoku, David Banahene

机构 * The University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校) Florida International University(佛罗里达国际大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn)

AI总结 针对检索增强和工具使用代理在漂移下的风险控制问题,提出ToolChain-CRC方法,通过构建轨迹级风险评分并校准接受或干预规则,实现可证明的轨迹级风险控制。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17910 2026-06-17 cs.IR cs.AI cs.CL 新提交 67%

Non-negative Elastic Net Decoding for Information Retrieval

非负弹性网络解码用于信息检索

Koki Okajima, Yasutoshi Ida, Tsukasa Yoshida, Yasuaki Nakamura

机构 * NTT, Inc(NTT公司)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出非负弹性网络(NNN)解码方法,将检索视为联合解码问题,通过稀疏非负线性组合重构查询嵌入,在理论上严格优于稠密检索,实验表明在多个基准上取得一致改进。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02737 2026-06-03 cs.IR cs.AI cs.CL 67%

Attention Calibration for Position-Fair Dense Information Retrieval

面向位置公平的密集信息检索的注意力校准

Andrianos Michail, Elias Schuhmacher, Juri Opitz, Simon Clematide, Rico Sennrich

机构 * Department of Computational Linguistics University of Zurich(计算语言学系苏黎世大学)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 针对密集检索模型的位置偏差问题,提出在推理时通过注意力校准(引入强度系数λ插值原始与完全校准分布)来提升位置公平性,无需重新训练且不牺牲整体检索效果,在多个数据集和模型上验证了部分校准优于完全校准,并提供了默认配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02584 2026-06-03 cs.CL cs.AI cs.IR 67%

IdiomX A Multilingual Benchmark for Idiom Understanding, Retrieval, and Interpretation

IdiomX:习语理解、检索和解释的多语言基准

Ayman Ali Sharara

专题命中 检索器与排序 :hybrid retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出IdiomX,一个大规模多语言习语基准,通过可复现的多阶段流水线构建,涵盖190K+上下文示例和12K+习语,定义四项任务(检测、上下文-习语检索、阿拉伯语-英语习语检索、习语解释),实验表明上下文Transformer模型提升检测,混合检索重排序增强单语和跨语言检索,习语解释可建模为语义检索任务。

Comments 12 pages, 21 figures. Includes dataset and code. Resources available on HuggingFace, Kaggle, and GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00408 2026-06-02 cs.CL cs.AI cs.IR 67%

Masking Stale Observations Helps Search Agents -- Until It Doesn't: A Regime Map and Its Mechanism

掩盖过时观察帮助搜索智能体——直到适得其反:一个机制图谱及其机制

Haoxiang Zhang, Qixin Xu, Zhuofeng Li, Lei Zhang, Pengcheng Jiang, Yu Zhang, Julian McAuley

机构 * UC San Diego(加州大学圣地亚哥分校) UC Berkeley(加州大学伯克利分校) Texas A&M University(德克萨斯大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文通过系统实验发现,在长时域搜索智能体中掩盖过时观察的效果呈现非对称倒U型曲线,取决于检索器召回率与模型隐式过滤能力的交互,并揭示了其背后的令牌-轮次权衡机制。

Comments 47 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11336 2026-06-01 cs.IR cs.AI cs.CL cs.HC 67%

Much of Geospatial Web Search Is Beyond Traditional GIS

大部分地理空间网络搜索超越了传统GIS

Ilya Ilyankou, Stefano Cavazzi, James Haworth

机构 * SpaceTimeLab(空间时间实验室) Department of Civil, Environmental, and Geomatic Engineering(土木、环境与测绘工程系) UCL(伦敦大学学院)

专题命中 检索器与排序 :hybrid retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 通过密集句子嵌入、SetFit分类器和密度聚类,在MS MARCO语料库中发现18%的查询具有地理空间性质,并构建了88类分类体系,揭示地理搜索以事务性和实用性查询为主,多数超出传统GIS和知识图谱范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29630 2026-05-29 cs.CL cs.AI cs.IR 67%

Entity-Collision: A Stratified Protocol for Attributing Retrieval Lift in Agent Memory

实体碰撞:一种用于归因智能体记忆检索提升的分层协议

Youwang Deng

机构 * Independent Researcher(独立研究员)

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出实体碰撞协议,通过控制实体重叠和标签分层,将BM25基线固定,从而将检索提升归因于嵌入器,并在多维度实验中揭示编码器容量并非唯一约束。

Comments 48 pages with appendix; 6-page body, mandatory Limitations, References, and 7 appendices. Code, benchmarks, and 37 reproduce scripts: https://github.com/youwangd/engram (see paper/REPRODUCIBILITY.md). Apache 2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24764 2026-05-26 cs.IR cs.AI cs.CL 67%

Spectral Retrieval: Multi-Scale Sinc Convolution over Token Embeddings for Localized Retrieval in LLM Multi-Agent Systems

光谱检索:基于多尺度sinc卷积的令牌嵌入局部化检索在LLM多智能体系统中的应用

Andrea Morandi

机构 * Cisco(思科)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 提出光谱检索方法,通过多尺度sinc卷积对令牌嵌入进行重排序,在无需重新训练的情况下显著提升局部化检索性能,并自然适配于LLM多智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏