arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 8503 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 4528 篇

2408.01107 2024-08-15 cs.CL cs.AI cs.IR 85%

BioRAG: A RAG-LLM Framework for Biological Question Reasoning

Chengrui Wang, Qingqing Long, Meng Xiao, Xunxin Cai, Chengjun Wu, Zhen Meng, Xuezhi Wang, Yuanchun Zhou

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21059 2024-08-01 cs.CL cs.AI cs.IR 85%

Modular RAG: Transforming RAG Systems into LEGO-like Reconfigurable Frameworks

Yunfan Gao, Yun Xiong, Meng Wang, Haofen Wang

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06211 2024-06-18 cs.CL cs.AI cs.IR 85%

A Survey on RAG Meeting LLMs: Towards Retrieval-Augmented Large Language Models

Wenqi Fan, Yujuan Ding, Liangbo Ning, Shijie Wang, Hengyun Li, Dawei Yin, Tat-Seng Chua, Qing Li

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments This is the long version of the corresponding survey paper accepted by KDD2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18150 2024-06-13 cs.CL cs.AI cs.IR 85%

Unsupervised Information Refinement Training of Large Language Models for Retrieval-Augmented Generation

Shicheng Xu, Liang Pang, Mo Yu, Fandong Meng, Huawei Shen, Xueqi Cheng, Jie Zhou

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments ACL 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00083 2024-06-07 cs.CR cs.AI cs.CL cs.IR cs.LG 85%

BadRAG: Identifying Vulnerabilities in Retrieval Augmented Generation of Large Language Models

Jiaqi Xue, Mengxin Zheng, Yebowen Hu, Fei Liu, Xun Chen, Qian Lou

专题命中 检索器与排序 :retrieval augmented generation(title);retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07530 2024-05-14 cs.SE 85%

Prompt-based Code Completion via Multi-Retrieval Augmented Generation

Hanzhuo Tan, Qi Luo, Ling Jiang, Zizheng Zhan, Jing Li, Haotian Zhang, Yuqun Zhang

专题命中 检索器与排序 :retrieval augmented generation(title,abstract);RAG(abstract);retriever(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05915 2023-07-27 cs.LG 85%

Prompt Generate Train (PGT): Few-shot Domain Adaption of Retrieval Augmented Generation Models for Open Book Question-Answering

C. S. Krishna

专题命中 检索器与排序 :retrieval augmented generation(title,abstract);RAG(abstract);retriever(abstract)

Comments 10

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.06169 2022-04-28 cs.CL cs.AI cs.IR cs.LG 85%

LaPraDoR: Unsupervised Pretrained Dense Retriever for Zero-Shot Text Retrieval

Canwen Xu, Daya Guo, Nan Duan, Julian McAuley

专题命中 检索器与排序 :retriever(title,abstract);dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

Comments ACL 2022 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22858 2026-07-07 cs.CL cs.IR 84%

RAG System for Supporting Japanese Litigation Procedures: Faithful Response Generation Complying with Legal Norms

基于RAG的日本诉讼程序支持系统:符合法律规范的忠实响应生成

Yuya Ishihara, Atsushi Keyaki, Hiroaki Yamada, Ryutaro Ohara, Mihoko Sumida

机构 * Hitotsubashi University, Japan(早稻田大学,日本) Institute of Science Tokyo, Japan(东京科学研究所,日本) Nakamura, Tsunoda & Matsumoto, Japan(日本纳卡拉、藤田与松本事务所)

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL

AI总结 本文设计了一种基于RAG的LLM系统,用于支持日本医疗诉讼程序,确保响应符合法律规范,通过检索模块检索相关外部知识并保持响应的忠实性。

Comments This is a preprint version of a paper reviewed and accepted at BREV-RAG 2025: Beyond Relevance-based EValuation of RAG Systems, a SIGIR-AP 2025 workshop

Journal ref Proceedings of the International Workshop on Beyond Relevance-based EValuation of RAG Systems (BREV-RAG) 2025 (pp. 59-65)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03452 2026-01-01 cs.CL cs.AI cs.LG 84%

An Analysis of Hyper-Parameter Optimization Methods for Retrieval Augmented Generation

检索增强生成方法的超参数优化分析

Matan Orbach, Ohad Eytan, Benjamin Sznajder, Ariel Gera, Odellia Boni, Yoav Kantor, Gal Bloch, Omri Levy, Hadas Abraham, Nitzan Barzilay, Eyal Shnarch, Michael E. Factor, Shila Ofek-Koifman, Paula Ta-Shma, Assaf Toledo

专题命中 检索器与排序 :retrieval augmented generation(title);RAG(abstract,comments);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了RAG超参数优化方法,通过五种算法和五种数据集的实验,发现贪婪或随机搜索能高效提升RAG性能,且优先优化模型选择优于传统流程顺序。

Comments AAAI 2026 Workshop on New Frontiers in Information Retrieval. For associated results, see https://github.com/IBM/rag-hpo-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16581 2025-03-24 cs.CL cs.AI cs.LG 84%

Investigating Retrieval-Augmented Generation in Quranic Studies: A Study of 13 Open-Source Large Language Models

Zahra Khalila, Arbi Haza Nasution, Winda Monika, Aytug Onan, Yohei Murakami, Yasir Bin Ismail Radi, Noor Mohammad Osmani

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.CL、cs.AI

Comments 11 pages, keywords: Large-language-models; retrieval-augmented generation; question answering; Quranic studies; Islamic teachings

Journal ref International Journal of Advanced Computer Science and Applications(IJACSA), 16(2), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13178 2024-02-26 cs.CL cs.AI 84%

Benchmarking Retrieval-Augmented Generation for Medicine

Guangzhi Xiong, Qiao Jin, Zhiyong Lu, Aidong Zhang

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,comments);分类 cs.CL、cs.AI

Comments Homepage: https://teddy-xionggz.github.io/benchmark-medical-rag/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01189 2026-08-17 cs.AI 版本更新 84%

NEURON: A Neuro-symbolic System for Grounded Clinical Explainability

NEURON:一种面向临床可解释性的神经符号系统

Anuradha Chandrasekaran, Dimitrios Zikos, Mutlu Mete, Alan Pang, Brady D. Lund, Kewei Sha

机构 * University of North Texas(北卡罗来纳大学达顿分校) Texas Tech University Health Sciences Center(德克萨斯农工大学健康科学中心)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 NEURON结合医学本体和机器学习模型,提升预测可靠性与临床可解释性,通过RAG层生成自然语言解释,在MIMIC-IV数据集上提升AUC至0.84-0.88。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12820 2026-08-14 cs.IR 新提交 84%

Query Translation vs. Cross-Lingual Embeddings for Sinhala-Tamil E-Government Information Retrieval

僧伽罗语-泰米尔语电子政务信息检索的查询翻译与跨语言嵌入对比

Dharshi Balasubramaniyam, Tiroshan Madushanka

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 本文对比僧伽罗语-泰米尔语电子政务信息检索的CLIR方法,发现多语言嵌入模型BGE-M3性能最优,优于查询翻译方法,可作为低资源政务领域RAG的有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08163 2026-08-11 cs.AI 新提交 84%

Agentic AI-driven Immersive Simulation: A Knowledge-Aware Virtual Training Platform forHigh Dose Rate (HDR) Brachytherapy

智能体AI驱动的沉浸式模拟:用于高剂量率(HDR)近距离放射治疗的知识感知虚拟训练平台

Ronghua Xu, Kepha Barasa, Manoj Kumal, Xinyun Liu, Weihua Zhou, Xin Qian

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 该研究提出一款智能体AI驱动的沉浸式模拟平台,用于HDR阴道圆柱近距离放射治疗虚拟训练,集成VR、移动计算与RAG技术,经原型验证可提供高保真无风险训练环境,具备合适延迟与高RAG支持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08100 2026-08-11 cs.CR cs.AI cs.LG 新提交 84%

Defending Retrieval-Augmented Intrusion Detection Against Knowledge Poisoning and Prompt Injection

防御检索增强型入侵检测系统免受知识投毒与提示注入攻击

Kaysarul Anas Apurba, Md. Hasibul Hasan, Mahedee Zaman Moon, Sk. Md. Mizanur Rahman, Atsuo Inomata

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出RAG-IDS三层多智能体入侵检测框架,通过软信任评分、LECC和提示净化的检索边界防御,可在知识投毒与提示注入攻击下恢复分类质量,在CIC-UNSW-NB15数据集上表现出良好的防御效果。

Comments 14 pages with Appnedix, 11 figures. Submitted to IEEE CIC 2026, Research Track (double-blind review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05076 2026-08-06 cs.LG cs.AI eess.SP 新提交 84%

MultiPathFormer: Towards a Foundation Model for Multipath Wireless Propagation

MultiPathFormer:迈向多径无线传播的基础模型

Blessed Guda, Kayley Sze, Carlee Joe-Wong

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 该研究提出MultiPathFormer,以多径传播为预训练对象,结合Environmental RAG机制,在27种环境预训练后,在多项无线通信下游任务中超越SOTA模型,验证了路径级预训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02472 2026-08-04 cs.CL 新提交 84%

CTRAG: An In-Context Retrieval-based Framework for Automated Compliance Checking using LLMs

CTRAG:一种基于上下文检索的大语言模型自动化合规检查框架

Muhammad Roman, Karen Rafferty, Barry Devereux

机构 * Bristol Research and Innovation Laboratory (BRIL)(布里斯托尔研究与创新实验室(BRIL)) Toshiba Europe Ltd.(东芝欧洲有限公司) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出基于RAG的CTRAG框架,通过自适应分块、动态检索配置等策略实现自动化合规检查,在四大会计师事务所POC中F1达78%、召回85%,可减少手动工作量并提升监管信任。

Comments 10 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22625 2026-07-28 cs.AI cs.LG 新提交 84%

TokenMem: Faithful Knowledge Injection for Frozen LLMs

TokenMem:为冻结的语言模型进行忠实的知识注入

Chengzhang Yu, Chenyang Zheng, Zening Lu, Yingru He, Yutong Huang, Yiming Zhang, Yue Xu, Zhanpeng Jin

机构 * South China University of Technology(华南理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究针对RAG增强LLMs时的知识冲突问题,提出TokenMem轻量级记忆系统,通过专用通道向冻结LLMs注入知识,经两阶段课程训练薄门控适配器,实验显示其在反事实基准上知识一致性远超普通RAG,两阶段课程关键,门控适配器能自主学习策略。

Comments 15 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13038 2026-07-16 cs.CY cs.AI 新提交 84%

Designing Safety-Constrained LLM Systems for Public Health Information Access

设计用于公共卫生信息访问的安全约束大语言模型系统

Ben Torkian, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval augmented generation(abstract);分类 cs.AI

AI总结 针对公共卫生信息访问,尤其是母婴健康资源导航,设计实现安全约束大语言模型系统。采用多层架构,含领域受限RAG等,通过可控数据管道确保回复基于精选资源。经场景验证,系统安全约束执行一致、性能稳定,为相关领域部署LLM系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07846 2026-07-10 cs.AI cs.CY 新提交 84%

VectorizationLLM: Smart Vectorization Based AI Assistant

向量化语言模型:基于智能向量化的人工智能助手

Ryan Duke

机构 * New York Institute of Technology(纽约理工学院)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval augmented generation(abstract);分类 cs.AI

AI总结 研究旨在设计基于谷歌开放权重语言模型的VectorizationLLM,用于辅助学生学习MATLAB相关知识。采用RAG知识库和系统提示架构,不直接给答案,通过课堂笔记示例详细解释概念,为课程应用提供有指导意义的智能助手。

Comments 44 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13397 2026-06-12 cs.HC cs.AI cs.CY 新提交 84%

Mod-Guide: An LLM-based Content Moderation Feedback System to Address Insensitive Speech toward Indigenous Ethnic and Religious Minority Communities

Mod-Guide:一种基于LLM的内容审核反馈系统,用于解决针对原住民及少数族裔宗教群体的不敏感言论

Dipto Das, Achhiya Sultana, Ankit Singh Chauhan, Saadia Binte Alam, Mohammad Shidujaman, Shion Guha, Sunandan Chakraborty, Syed Ishtiaque Ahmed

机构 * Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) Independent University Bangladesh(孟加拉国独立大学) Indiana University(印第安纳大学) Faculty of Information, University of Toronto(信息学院,多伦多大学)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval augmented generation(abstract);分类 cs.AI

AI总结 本文研究LLM审核系统对孟加拉国印度教和查克玛社区不敏感言论的认知局限,通过共同构建文化语料库和检索增强生成(RAG)方法开发Mod-Guide工具,提升模型对少数群体观点的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26445 2026-05-27 cs.CL 84%

Curation and Extraction of Drug-Related Entities from Reddit Platform

从Reddit平台策划和提取药物相关实体

Zewei Wang, Zihan Xu, Yishu Wei, Michael Chary, Yifan Peng

机构 * Population Health Sciences, Weill Cornell Medicine, New York City, USA(威立·科恩医学中心人口健康科学系,纽约市,美国) School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(墨尔本大学计算机与信息系统学院,墨尔本,澳大利亚) Emergency Medicine, Weill Cornell Medicine, New York City, USA(急诊医学,威立·科恩医学中心,纽约市,美国)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 为解决医生对非法药物真实使用情况了解有限的问题,本文构建了ReDose数据集(6435条Reddit帖子),并采用BERT、LLM和RAG模型进行药物、剂量和效果实体提取,其中BiomedBERT在药物实体上F1达0.843,Llama-3 70B优于GPT-4,但效果提取仍具挑战。

Comments Accepted by IEEE International Conference on Healthcare Informatics (ICHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22099 2026-05-22 cs.CL 84%

A Comparative Study of Language Models for Khmer Retrieval-Augmented Question Answering

一种用于柬埔寨检索增强问答的语言模型比较研究

Sereiwathna Ros, Phannet Pov, Ratanaktepi Chhor, Kimleang Ly, Wan-Sup Cho, Saksonita Khoeurn

机构 * Department of Computer Science, Chungbuk National University(Chungbuk National University 计算机科学系) Department of Big Data, Chungbuk National University(Chungbuk National University 大数据系) General Department of Information and Communication Technology, Ministry of Post and Telecommunications(邮电部信息和通信技术总局) Department of Management Information Systems, Chungbuk National University(Chungbuk National University 管理信息系统系) BigDatalabs Co., Ltd(BigDatalabs 公司)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);dense retrieval(abstract)

AI总结 本文针对低资源非拉丁语种柬埔寨语言,比较了多种语言模型在检索增强问答任务中的性能,发现检索器选择是影响效果的关键因素,生成器在不同指标上表现各异。

Comments 14 pages, 1 figure,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12012 2026-05-19 cs.AI 84%

LegalCheck: Retrieval- and Context-Augmented Generation for Drafting Municipal Legal Advice Letters

LegalCheck: 基于检索和上下文增强的生成方法用于起草市政法律建议信

Virgill van der Meer, Julien Rossi

机构 * Municipality of Amsterdam(阿姆斯特丹市) University of Amsterdam(阿姆斯特丹大学)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出LegalCheck系统,通过检索增强生成(RAG)和上下文增强生成(CAG)技术,自动起草市政法律回应信,提高法律部门在人员短缺、案件量增加和合规压力下的工作效率,确保法律一致性和准确性。

Comments Accepted at ICAIL 2026 as Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27096 2026-05-01 cs.AI 84%

Think it, Run it: Autonomous ML pipeline generation via self-healing multi-agent AI

思考并运行:通过自我修复多智能体AI实现自主ML流水线生成

Adela Bara, Gabriela Dobrita, Simona-Vasilica Oprea

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出一种统一的多智能体架构,实现从数据集和自然语言目标自动生成端到端机器学习流水线,提升效率、鲁棒性和可解释性。通过五智能体系统处理数据剖析、意图解析、微服务推荐、DAG构建与执行,并结合代码基础的RAG、可解释混合推荐、自我修复机制和自适应学习,实现了84.7%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05838 2024-12-10 cs.AI 84%

A Collaborative Multi-Agent Approach to Retrieval-Augmented Generation Across Diverse Data

Aniruddha Salve, Saba Attar, Mahesh Deshmukh, Sayali Shivpuje, Arnab Mitra Utsab

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,comments);分类 cs.AI

Comments 16 pages, 3 figures. This preprint introduces a multi-agent framework for Retrieval-Augmented Generation (RAG), enhancing Large Language Models (LLMs) for efficient integration of diverse data sources. Relevant for researchers in AI, ML, generative AI, and database systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13326 2024-10-18 cs.CY cs.IR 84%

Comparing the Utility, Preference, and Performance of Course Material Search Functionality and Retrieval-Augmented Generation Large Language Model (RAG-LLM) AI Chatbots in Information-Seeking Tasks

Leonardo Pasquarelli, Charles Koutcheme, Arto Hellas

专题命中 检索器与排序 :retrieval-augmented generation(title);RAG(title);分类 cs.IR

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02189 2026-08-04 cs.IR cs.CL 新提交 84%

Disentangled Contrastive Learning for Zero-Shot Multilingual Dense Retrieval

用于零样本多语言密集检索的解耦对比学习

Chao Huang, Yufeng Chen, Changhao Guan, Guang Yang, Dongze Chen, Kaiyu Huang

专题命中 检索器与排序 :dense retrieval(title,abstract);retriever(abstract);分类 cs.IR、cs.CL

AI总结 本文针对低资源语言检索数据稀缺问题,提出解耦对比学习方法,将多语言表示分离为语义与语言子空间,在mMARCO、MIRACL上的零样本多语言密集检索性能优于多个强基线。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27976 2026-07-15 cs.CR cs.AI cs.IR 版本更新 84%

SHARD: cell-keyed residual splitting for alignment-resistant private dense retrieval

SHARD: 基于单元格密钥分割的抗对齐私有密集检索

Sergey Kurilenko

机构 * Moscow Institute of Physics and Technology(莫斯科物理技术学院)

专题命中 检索器与排序 :dense retrieval(title,abstract);RAG(abstract_cn);分类 cs.IR、cs.AI

AI总结 提出SHARD方法,通过将嵌入拆分为公开前缀和按单元格密钥分割的私有残差,结合CKKS重排序,抵御对齐攻击,在保持检索质量的同时大幅提高攻击难度。

详情

展开后加载摘要…

URL PDF HTML 收藏