Mitigating the Privacy Issues in Retrieval-Augmented Generation (RAG) via Pure Synthetic Data
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(title,abstract)
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(title,abstract)
专题命中 检索器与排序 :RAG(title,abstract);retrieval augmented generation(title);分类 cs.IR、cs.CL、cs.AI
Comments 26 pages, 12 figures, 6 tables
专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(title);分类 cs.IR、cs.CL、cs.AI
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(title,abstract)
专题命中 检索器与排序 :RAG(title,abstract);retrieval augmented generation(title);分类 cs.IR、cs.CL、cs.AI
Comments 5 pages, 4 figures
让Nemotron学习希腊语:针对专业领域现代希腊语的语料库挖掘、检索适配与生成落地
专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);dense retrieval(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对现代希腊语缺失于Nemotron检索模型及主流多语言基准的问题,提出Nemotron检索栈的端到端适配方案,含语料库挖掘等步骤,推出首个希腊语RAG基准HERA,适配后的模型在多项指标上显著提升。
Comments 15 pages, 10 figures, 7 tables. Includes release of the HERA benchmark and Sophea Nemo RAG models
面向联邦检索增强生成的私有任意时刻选择性风险认证:保证与经验极限
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(summary_cn,abstract_cn);分类 cs.AI
AI总结 本研究提出Fed-SRC这一适用于联邦RAG的私有任意时刻选择性风险认证方法,经实验验证其在多数场景下可满足风险保证,性能优于对比方法。
SentAttack:一种用于密集检索模型的句子级黑盒对抗攻击方法
专题命中 检索器与排序 :dense retrieval(title,abstract);RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 针对密集检索模型对抗攻击问题,提出SentAttack句子级黑盒攻击方法。先通过与黑盒系统交互收集训练代理模型数据,再用代理模型聚类相关文档生成对抗候选句,经优化提升攻击效果。
利用基于实时检索增强生成(RAG)的系统改善对历史档案的访问
专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 研究针对数字化历史档案访问难题,提出集成大语言模型的端到端框架,含OCR优化模块和语义检索重排管道,实验表明能减少OCR错误并提升检索效果,使档案系统更具交互性和语义可搜索性。
Hybrid-IR: 面向复杂医学问答的双路径混合检索与迭代推理
机构 * College of Artificial Intelligence, Nanjing Agricultural University(南京农业大学人工智能学院) ; School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
专题命中 检索器与排序 :hybrid retrieval(title);RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);dense retrieval(abstract)
AI总结 提出Hybrid-IR框架,结合图检索与稠密检索的双路径检索机制,并通过迭代检索-推理循环逐步优化推理轨迹,有效解决复杂医学问答中知识碎片化和静态检索不足的问题。
面向数据敏感检索增强生成的隐私策略执行护栏
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(title);分类 cs.AI
AI总结 针对RAG系统中上下文数据泄露问题,提出基于双单类密度估计器与融合文本嵌入的隐私策略执行框架,在医学、金融和法律领域实现高AUROC和低误报率。
Memento: 面向Meta广告推荐的个性化RAG式长期数据扩展
专题命中 检索器与排序 :RAG(title,title_cn);分类 cs.IR
AI总结 提出Memento框架,通过个性化检索增强生成(RAG)方式,利用最大边际相关性(MMR)从用户历史行为中检索相关交互,解决长历史数据建模中的注意力稀释、系统效率和灾难性遗忘问题,在广告推荐中提升点击率1%和转化率1.2%。
LIT-RAGBench:大型语言模型检索增强生成能力的基准测试
机构 * neoAI Inc.(neoAI公司) ; Tokyo Metropolitan University(东京 Metropolitan 大学) ; The University of Tokyo(东京大学)
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);retriever(abstract);分类 cs.CL
AI总结 LIT-RAGBench通过五个类别评估生成器的整合、推理、逻辑、表格和回避能力,提供统一的基准测试框架,用于评估多方面能力并指导模型选择与改进。
Comments Published as a conference paper at LREC 2026
机构 * Department of ECE University of Minnesota(电子工程系明尼苏达大学) ; Data Science Institute University of Chicago(数据科学研究所芝加哥大学) ; Carlson School of Management University of Minnesota(卡尔森管理学院明尼苏达大学) ; Department of Surgery University of Minnesota(外科系明尼苏达大学) ; Cisco Research(思科研究) ; School of Statistics University of Minnesota(统计学学院明尼苏达大学)
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract);retriever(abstract);分类 cs.IR、cs.CL、cs.AI
Comments Accepted by ICML 2025
专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract);dense retrieval(abstract);hybrid retrieval(abstract)
Comments 10 pages, 2 figures
专题命中 检索器与排序 :retrieval augmented generation(title,abstract);retrieval-augmented generation(abstract);RAG(abstract);knowledge retrieval(abstract)
Comments Update results, add more analysis, and fix typos
用Argus之眼:通过不确定性评分评估检索缺口以检测并弥补检索盲区
机构 * Lucerne University of Applied Sciences and Arts (HSLU)(卢塞恩应用科学与艺术大学) ; Center for Information and Language Processing (CIS), Ludwig Maximilian University of Munich (LMU)(信息与语言处理中心(CIS),慕尼黑路德维希-马克西米利安大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.AI
AI总结 ARGUS通过文档增强技术提升检索器对高风险实体的检索能力,有效减少检索盲区,提高RAG系统的可靠性。
Comments 8 pages
基于LLM的检索排名学习检索器
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR、cs.CL
AI总结 本文提出LTRR框架,通过动态选择检索器提升RAG性能,实验表明基于路由的RAG在多种基准上优于单一检索器,尤其在使用AC目标和成对排名时效果显著。
Comments SIGIR 2026; SIGIR 2025 LiveRAG Spotlight; Code: https://github.com/kimdanny/Starlight-LiveRAG
专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(title);分类 cs.IR、cs.CL
专题命中 检索器与排序 :retriever(title,abstract);dense retrieval(title);分类 cs.IR、cs.CL
通过强化学习优化RAG重排序器与LLM反馈
机构 * Nanjing University of Science and Technology(南京理工大学) ; Nanjing University(南京大学)
专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI
AI总结 本文提出RRPO框架,通过强化学习将重排序与LLM生成质量对齐,消除了对昂贵人工标注的依赖,实验显示其在知识密集型基准上优于基线模型。
Comments 17 pages
RAVEN:用于自动化漏洞修复的智能体检索增强生成框架
机构 * University of Duisburg-Essen(杜伊斯堡- Essen大学)
专题命中 检索器与排序 :RAG(title,summary_cn);retrieval-augmented generation(abstract)
AI总结 提出RAVEN框架,集成智能体RAG管道与可控迭代修复,利用开源LLM实现跨类型、跨语言的自动化漏洞修复,在160个真实CVE上达到83.13%修复成功率。
Comments 17 Pages, 4 figures. Under review
Ricci-Filtration:通过离散Ricci流提升检索增强生成重排序器在查询-答案任务中的性能
机构 * Tian Qin(田琴) ; Wei-Min Huang(黄伟民)
专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(title)
AI总结 提出基于离散曲率和Ricci流的几何重排序增强方法Ricci-Filtration,通过建模查询与检索块为网络并利用曲率过滤噪声块,显著提升RAG生成性能。
UniversalRAG: 在多样模态和粒度的语料库上实现检索增强生成
机构 * KAIST(韩国科学技术院)
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI
AI总结 本文提出UniversalRAG,一种能够处理多种模态和粒度的检索增强生成框架,通过动态路由机制和多粒度组织,提升跨模态知识检索的有效性,实验表明其在多个模态基准上的优越性。
Comments ACL 2026. Project page : https://universalrag.github.io
DiscourseFlip: 面向黑盒检索增强生成的非直述式语篇级观点操纵攻击
机构 * Wuhan University(武汉大学) ; East China Normal University(华东师范大学) ; Nanyang Technological University(南洋理工大学) ; Worcester Polytechnic Institute(沃思堡理工学院)
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI
AI总结 提出一种基于图引导的代理攻击方法DiscourseFlip,通过语义查询网络中的协同影响在有限预算下最大化语篇级观点偏差,实验证明其有效性和隐蔽性,并揭示现有防御的不足。
基于证据的缓存路由用于检索增强生成:何时可以安全地重用答案?
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI
AI总结 提出GroundedCache,一种通过四个廉价门控(查询相似性、检索证据重叠、源版本有效性和词汇支持)验证缓存答案安全性的路由方法,显著降低不安全服务率。
Comments 19 pages, 9 figures, 10 tables. Code: https://github.com/syedhumarahim/grounded-cache-router
RADAR: 通过动态防御对抗RAG的检索腐败
机构 * School of Intelligence Science and Technology, Nanjing University, Suzhou, China(南京大学智能科学与技术学院,中国,苏州) ; City University of Hong Kong, Hong Kong, China(香港城市大学,中国,香港) ; Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所,北京,中国)
专题命中 检索器与排序 :RAG(title,title_cn)
AI总结 RADAR通过将可靠的上下文选择建模为图基能最小化问题,利用最大流最小割算法进行精确求解,采用贝叶斯记忆节点递归更新信念状态,以平衡稳定性和对抗性攻击,同时适应真实知识变化,在动态数据集上实现了比基线方法更优越的鲁棒性和响应质量,且存储开销小。
ClusterRAG: 基于聚类的协同过滤用于个性化检索增强生成
机构 * University of Arkansas(阿肯色大学) ; Walmart Inc.(沃尔玛公司)
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI
AI总结 ClusterRAG通过聚类用户轮廓文档,利用相似用户的协同信号提升当前用户的个性化生成性能,通过在集群和文档层面进行检索,实现了高效的个性化检索增强生成。
Comments 17 pages, 2 figures, to be published in the proceedings of ACL 2026
通过实体链接增强教育平台的检索增强生成
机构 * Department of Mathematics and Computer Science, University of Catania, Italy(卡塔尼亚大学数学与计算机科学系) ; Institute of Cognitive Sciences and Technologies (ISTC), National Research Council of Italy (CNR)(意大利国家研究委员会认知科学与技术研究所(ISTC))
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI
AI总结 本文提出ELERAG架构,通过实体链接增强事实信号,提升教育问答系统在意大利语领域的准确性,实验显示其在专业领域表现优异,但通用领域效果不如交叉编码器。
Journal ref Big Data and Cognitive Computing, 10(4), 120. 2026
面向职业发展的简历定制:通过多源检索增强生成与溯源的多源检索增强生成:案例研究
专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI
AI总结 本文提出Resume Tailor系统,通过多源检索增强生成与溯源技术,利用纵向职业档案提升简历定制效果,实验显示在相关经验存在时,ATS匹配分数提升,但领域知识不足时分数下降。
Comments 6 pages, 1 figure, 5 tables. Also available on SSRN