arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-06-24 至 2026-06-24 共收录 17 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 9 篇

2606.24623 2026-06-24 cs.CL cs.AI 新提交 84%

Privacy-Preserving RAG via Multi-Agent Semantic Rewriting: Achieving Confidentiality Without Compromising Contextual Fidelity

基于多智能体语义重写的隐私保护检索增强生成:在不损害上下文保真度的情况下实现机密性

Yuanhe Zhao, Tianyu Zhang, Huafei Xing, Derek F. Wong, Jianbin Li, Tao Fang

机构 * School of Control and Computer Engineering, North China Electric Power University(华北电力大学控制与计算机工程学院) Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) NLP2CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系NLP2CT实验室) Institute of International Language Services Studies, Macau Millennium College(澳门千禧学院国际语言服务研究所)

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体框架,通过语义重写净化检索内容,在去除敏感标识的同时保留语义核心,显著降低隐私泄露并保持上下文保真度。

Comments This full manuscript contains 23 pages and has been formally accepted for publication in Information Processing & Management (Elsevier IPM). Tao Fang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24402 2026-06-24 cs.CR 新提交 83%

Poisoned Playbooks: Demystifying Knowledge Poisoning Effects on AI Security Agents

有毒剧本:揭秘知识投毒对AI安全代理的影响

Juho Park, Hyunmin Choi, Kevin Nam

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)

AI总结 研究揭示通过RAG注入单条有毒安全知识可系统性改变AI安全代理行为,提出验证边界(VB)分类法,并评估验证提示与多源检索的防御效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24667 2026-06-24 cs.CL 新提交 83%

DREAM: Dense Retrieval Embeddings via Autoregressive Modeling

DREAM:通过自回归建模的密集检索嵌入

Yixuan Tang, Yi Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 检索器与排序 :dense retrieval(title,abstract);retriever(abstract);分类 cs.CL

AI总结 提出DREAM方法,利用冻结LLM的自回归预测损失训练密集检索器,通过注意力机制注入查询-文档相似度,在BEIR和RTEB上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23911 2026-06-24 cs.IR 新提交 79%

Scaling Dense Retrieval with LLM-Annotated Training Data: Structured Mining and Progressive Curriculum for E-Commerce Sponsored Search

使用LLM标注的训练数据扩展稠密检索:面向电商赞助搜索的结构化挖掘与渐进式课程

Md Omar Faruk Rokon, Shasvat Desai, Jhalak Nilesh Acharya, Isha Shah, Kumar Priyam, Brahanyaa Somasundaram, Vamsee Tangirala, Minuteresa Thomas, Vivek Arora, Vijay Manchi, Hong Yao, Kuang-chih Lee

专题命中 检索器与排序 :dense retrieval(title,abstract);分类 cs.IR

AI总结 针对电商搜索中点击信号偏差和人工标注成本高的问题,提出利用多通道检索挖掘、校准的LLM级联标注和五级渐进式课程训练,在Walmart搜索中实现NDCG@10提升5.1%,尾查询提升显著。

Comments Accepted at E-Commerce Workshop, SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24841 2026-06-24 cs.AI cs.CL 新提交 62%

Matching Tasks to Objectives: Fine-Tuning and Prompt-Tuning Strategies for Encoder-Decoder Pre-trained Language Models

匹配任务与目标:编码器-解码器预训练语言模型的微调和提示调优策略

Ahmad Pouramini, Hesham Faili

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 提出MTO框架,通过匹配任务与预训练目标,在少样本和全数据集场景下显著提升编码器-解码器模型的生成与问答性能,性能增益超120%。

Journal ref Appl Intell 54(20):9783-9810, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23937 2026-06-24 cs.CL cs.AI cs.LG 新提交 62%

When Retrieval Metrics Mislead: Measuring Policy Signal in Long-Horizon Tool-Use Agents

当检索指标误导:衡量长周期工具使用智能体中的策略信号

Tianyu Ding, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 研究发现精确匹配的检索召回率会低估下游策略效用,通过分类器实验表明检索到的策略子句与黄金子句在宏F1上无显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18684 2026-06-24 cs.CR cs.AI cs.CL cs.LG cs.SY eess.SY 版本更新 62%

FALCON: Transforming Cyber Threat Intelligence into Deployable IDS Rules with Self-Reflection

FALCON:通过自我反思将网络威胁情报转化为可部署的入侵检测系统规则

Shaswata Mitra, Subash Neupane, Martin Duclos, Sudip Mittal, Aritran Piplai, Md Rayhanur Rahman, Edward Zieglar, Shahram Rahimi

机构 * Meharry Medical College(梅哈里医学院) The University of Texas at El Paso(德克萨斯理工大学) The University of Alabama(阿拉巴马大学) National Security Agency(国家安全局)

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 提出FALCON框架,通过新颖的CTI-规则语义评分器实现规则检索、生成和验证,解决签名型入侵检测系统中规则创建的手动瓶颈和验证难题,在Snort和YARA平台上达到0.72平均相关性。

Comments 17 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24579 2026-06-24 cs.CL 新提交 57%

Cross-Lingual Exploration for Parametric Knowledge

跨语言探索参数化知识

Elisha Diskind, Itamar Trainin, Uri Shaham, Leshem Choshen, Idan Szpektor, Omri Abend

机构 * The Hebrew University of Jerusalem(海法大学) Google Research(谷歌研究) MIT, IBM-MIT Watson AI Lab(麻省理工学院与IBM-麻省理工 Watson人工智能实验室)

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.CL

AI总结 本文研究通过跨语言提示策略探索大型语言模型中的隐藏事实知识,发现跨语言探索能显著提升知识迁移和事实召回,比单语言扩展更高效,并改善跨语言一致性。

Comments 29 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23889 2026-06-24 cs.IR 新提交 57%

INSPIRE: Intent-aware Neural Sponsored Product Retrieval for E-commerce

INSPIRE:面向电子商务的意图感知神经赞助商品检索

Shasvat Desai, Hong Yao, Utkarsh Porwal, Kuang-chih Lee

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR

AI总结 针对电商搜索中用户意图与商品不匹配问题,提出INSPIRE框架,利用结构化意图信号(如品牌、口味、饮食限制)增强查询与赞助商品的匹配,通过弱监督意图学习和大模型蒸馏实现精准检索。

Comments Accepted to ACM SIGIR E-commerce Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 向量检索 2 篇

2606.24346 2026-06-24 cs.IR cs.CL 新提交 62%

PETRA: Transforming Web Text for Petroleum-Engineering Domain Adaptation

PETRA: 将网络文本转化为石油工程领域适应的数据集

Kirill Dubovikov, Omar El Mansouri, Hachem Madmoun, Yanda Li, Sandeep Kumar, Aya El Mir, Supriyo Ghosh, Writabrata Bhattacharya, Adrian Garcia-Garcia, Onkar Pandit, Sunil Kumar Sahu, Federico Castanedo, Larry Murray, Martin Takac, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Inception AI

专题命中 向量检索 :dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 针对石油工程检索中领域标签稀缺的问题,提出PETRA数据集和流程,通过噪声网络数据构建领域语料和合成监督信号,显著提升检索与重排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24204 2026-06-24 cs.DB cs.IR 新提交 62%

Unified Dominance Graph for Interval-Predicate Approximate Nearest Neighbor Search

区间谓词近似最近邻搜索的统一支配图

Kwun Hang Lau, Ruiyuan Zhang, Elton Chun-Chai Li, Wun Yu Chan, Xiaojun Cheng, Xiaofang Zhou

专题命中 向量检索 :retrieval-augmented generation(abstract);分类 cs.IR、cs.DB

AI总结 提出统一支配图(UDG)框架,通过将区间端点映射到二维支配空间并构建支配标记图,统一处理包含、重叠等区间谓词,实现高效的区间谓词近似最近邻搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图谱与结构化RAG 2 篇

2606.23997 2026-06-24 cs.IR 新提交 91%

ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs

ChartWalker: 跨图表RAG任务的基准测试

Ning Tang, Chenghan Xie, Hanyang Yuan, Yi Li, Renhong Huang, Qian Kou, Xiaofeng Shi, Hua Zhou, Jiarong Xu

专题命中 图谱与结构化RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23881 2026-06-24 cs.CL cs.CV cs.IR 新提交 79%

Ground Then Rank: Revisiting Knowledge-Based VQA with Training-Free Entity Identification

先定位再排序:基于知识的视觉问答中无训练实体识别的再探讨

Qian Ma, Qiong Wu, Zhengyi Zhou, Yao Ma

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 图谱与结构化RAG :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 针对知识型视觉问答中实体与证据双重定位瓶颈,提出解耦实体识别与段落排序的无训练IBA框架,利用MLLM候选名称选择与文本重排序器,在降低复杂度同时提升性能。

Comments Accepted by ACL 2026 Findings. Project page https://github.com/VAN-QIAN/ACL26-IBA/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态RAG 1 篇

2510.19986 2026-06-24 cs.IR cs.CV 92%

Automating Iconclass: LLMs and RAG for Large-Scale Classification of Religious Woodcuts

自动化Iconclass:LLM和RAG用于大规模宗教木刻版画分类

Drew B. Thomas

机构 * University College Dublin(都柏林大学)

专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);vector search(abstract);分类 cs.IR

AI总结 本文提出利用LLM和向量数据库结合RAG技术,实现早期现代宗教图像的高效分类,通过全页上下文生成描述并匹配Iconclass代码,提升分类精度至92%。

Comments 29 pages, 7 figures. First presented at the "Digital Humanities and Artificial Intelligence" conference at the University of Reading on 17 June 2024

Journal ref Digital Culture and Education 16(3):161-182, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. RAG评测 3 篇

2606.23695 2026-06-24 cs.CL cs.AI 新提交 91%

Quantifying Prior Dominance in RAG Systems

量化RAG系统中的先验主导性

Barak Or

机构 * ArtificialGate Ltd.(ArtificialGate有限公司)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 提出归一化上下文利用(NCU)指标,通过连续token对数概率严格量化RAG系统的上下文信息增益,发现小语言模型在严格事实提取中匹配或超越大模型,且先验主导性与模型规模及专有对齐相关。

Comments 15 pages, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24200 2026-06-24 cs.CL cs.AI cs.IR 新提交 86%

MMed-Bench-IR: A Heterogeneous Benchmark for Multilingual Medical Information Retrieval

MMed-Bench-IR:多语言医学信息检索的异构基准

Junhyeok Lee, Han Jang, Hyeonjin Goh, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University Hospital(首尔国立大学医院)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 针对临床RAG的多语言检索需求,提出MMed-Bench-IR基准,涵盖跨语言对齐、概念区分和证据检索三种异构任务,评估6种语言下10个系统,发现生物医学编码器在英语与日语间性能差距巨大。

Comments Under review. 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23915 2026-06-24 cs.CL cs.IR cs.LG 新提交 81%

Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs

LLM归因指标是否可迁移?跨数据集和构念的检索增强生成评估审计

Tianyu Ding, Aditya Nannapaneni, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);分类 cs.IR、cs.CL

AI总结 本研究审计了八种自动归因评分器在三个评估构念上的表现,发现没有评分器能在所有数据集上保持最佳性能,指标排名会反转,且简单选择最佳平均评分器会导致显著遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏