arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-04-14 至 2026-04-14 共收录 21 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 21 篇

2510.11217 2026-04-14 cs.CL cs.AI 86%

Domain-Specific Data Generation Framework for RAG Adaptation

面向RAG适应的领域特定数据生成框架

Chris Xing Tian, Weihao Xie, Zhen Chen, Zhengyuan Yi, Hui Liu, Haoliang Li, Shiqi Wang, Siwei Ma

机构 * Peng Cheng Laboratory(鹏城实验室) City University of Hong Kong(香港城市大学) Peking University(北京大学)

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RAGen框架,通过识别文档中的关键概念生成领域相关的问答对,支持多种RAG适应策略,提升领域适应效果。

Comments To appear in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16326 2026-04-14 cs.IR 85%

ARK: Answer-Centric Retriever Tuning via KG-augmented Curriculum Learning

ARK:通过知识图谱增强课程学习实现答案导向的检索器调优

Hang Ding, Jiawei Zhou, Haiyun Jiang

专题命中 检索器与排序 :retriever(title,abstract);retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR

AI总结 本文提出一种基于知识图谱增强课程学习的答案导向检索器调优框架,通过生成增强查询和逐步挑战的硬负样本,提升检索器区分关键证据的能力,实验表明在多个基准数据集上性能优于基线模型。

Comments ACL 2026 accepted as main. For source code, see https://github.com/valleysprings/ARK/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07794 2026-04-14 cs.CL cs.AI cs.LG 81%

HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation

HiPRAG:分层过程奖励用于高效代理检索增强生成

Peilin Wu, Mian Zhang, Kun Wan, Wentian Zhao, Kaiyu He, Xinya Du, Zhiyu Chen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe Inc.(Adobe公司)

专题命中 检索器与排序 :retrieval augmented generation(title);RAG(abstract);分类 cs.CL、cs.AI

AI总结 HiPRAG通过引入细粒度的知识引导过程奖励,优化代理检索增强生成的推理过程,提升搜索效率并减少无效搜索。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09430 2026-04-14 cs.IR cs.AI quant-ph 79%

On the Representational Limits of Quantum-Inspired 1024-D Document Embeddings: An Experimental Evaluation Framework

关于量子启发式1024维文档嵌入表示的限制:一个实验评估框架

Dario Maio

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);hybrid retrieval(abstract);分类 cs.IR、cs.AI

AI总结 本文提出一个实验框架,用于构建基于重叠窗口和多尺度聚合的量子启发式1024维文档嵌入,通过诊断工具评估混合检索性能,发现BM25仍为强基线,而量子启发式嵌入在排名信号上表现不稳定。

Comments 44 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11290 2026-04-14 cs.IR cs.AI cs.CL cs.LG 75%

An Iterative Utility Judgment Framework Inspired by Philosophical Relevance via LLMs

一种受哲学相关性启发的迭代效用判断框架

Hengran Zhang, Keping Bi, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出ITEM框架,通过迭代提升信息检索中相关性排序、效用判断和答案生成的性能,实验表明在多个数据集上均优于基线模型。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11092 2026-04-14 cs.IR 74%

ARHN: Answer-Centric Relabeling of Hard Negatives with Open-Source LLMs for Dense Retrieval

ARHN: 基于开源大语言模型的密集检索中以答案为中心的困难负样本重标定

Hyewon Choi, Jooyoung Choi, Hansol Jang, Hyun Kim, Chulmin Yun, ChangWook Jun, Stanley Jungkyu Choi

专题命中 检索器与排序 :dense retrieval(title);分类 cs.IR

AI总结 ARHN通过利用开源大语言模型对困难负样本进行重标定,结合重标定与过滤策略提升检索效果,提供更清洁的监督信号。

Comments Accepted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10426 2026-04-14 cs.CL cs.AI 73%

CodaRAG: Connecting the Dots with Associativity Inspired by Complementary Learning

CodaRAG: 通过互补学习启发的关联性连接点

Cheng-Yen Li, Xuanjun Chen, Claire Lin, Wei-Yu Chen, Wenhua Nie, Hung-Yi Lee, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 CodaRAG通过互补学习系统启发,提出了一种将碎片化信息整合为稳定记忆基础,通过多维路径遍历图结构,消除超关联噪声,提升检索和生成精度的框架。

Comments Preprint, Submitted to ACM TIST

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09550 2026-04-14 cs.IR cs.DB 73%

HyEm: Query-Adaptive Hyperbolic Retrieval for Biomedical Ontologies via Euclidean Vector Indexing

HyEm:通过欧几里得向量索引实现查询自适应的双曲检索用于生物医学本体

Ou Deng, Shoji Nishimura, Atsushi Ogihara, Qun Jin

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.DB

AI总结 HyEm通过结合双曲本体嵌入与欧几里得ANN基础设施,解决生物医学本体中层次感知的检索问题,提升实体中心查询和混合意图查询性能,保持索引可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10504 2026-04-14 cs.AI 70%

CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation

CARO:用于鲁棒内容审核的类比推理优化

Bingzhe Wu, Haotian Lu, Yuchen Mou

机构 * National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 CARO通过两阶段训练框架提升LLM的类比推理能力,有效缓解内容审核中的误导性决策短路问题,实验显示其在模糊审核基准上平均F1得分提升24.9%。

Comments Accepted to ACL 2026 findings; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09747 2026-04-14 cs.CR cs.AI 70%

ADAM: A Systematic Data Extraction Attack on Agent Memory via Adaptive Querying

ADAM:通过自适应查询对代理记忆进行系统性数据提取攻击

Xingyu Lyu, Jianfeng He, Ning Wang, Yidan Hu, Tao Li, Danjue Chen, Shixiong Li, Yimin Chen

机构 * University of Massachusetts Lowell, USA(马萨诸塞大学洛厄尔分校) Amazon, USA(亚马逊) University of South Florida, USA(南佛罗里达大学) Rochester Institute of Technology, USA(罗切斯特理工学院) Purdue University, USA(普渡大学) North Carolina State University, USA(北卡罗来纳州立大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出ADAM攻击,通过估计受害者代理内存的数据分布和熵引导查询策略,提升隐私泄露效果,实验显示其攻击成功率高达100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11699 2026-04-14 cs.CL cs.AI cs.LG 62%

Legal2LogicICL: Improving Generalization in Transforming Legal Cases to Logical Formulas via Diverse Few-Shot Learning

Legal2LogicICL: 通过多样少量样本学习提升将法律案例转换为逻辑公式的一般化能力

Jieying Xue, Phuong Minh Nguyen, Ha Thanh Nguyen, May Myo Zin, Ken Satoh

机构 * Center for Juris-Informatics, ROIS-DS(法信息学中心,ROIS-DS) Japan Advanced Institute of Science and Technology(日本先端科学技术大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Legal2LogicICL框架,通过检索增强生成实现有效上下文学习,构建信息丰富且稳定的少量样本演示,提升法律案例转逻辑表示的准确性与稳定性。

Comments Accepted at ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11229 2026-04-14 eess.SP cs.AI cs.CL 62%

RECIPER: A Dual-View Retrieval Pipeline for Procedure-Oriented Materials Question Answering

RECIPER:一种面向材料问题回答的双视角检索流程

Zhuoyu Wu, Wenhui Ou, Pei-Sze Tan, Wenqi Fang, Sailaja Rajanala, Raphaël C. -W. Phan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RECIPER双视角检索流程,通过结合段落上下文和紧凑的LLM提取的工艺摘要,提升材料科学论文中工艺细节的检索效果,实验表明在多个检索模型上均取得显著提升。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10114 2026-04-14 cs.CL cs.AI 62%

CircuitSynth: Reliable Synthetic Data Generation

CircuitSynth:可靠的合成数据生成

Zehua Cheng, Wei Dai, Jiahao Sun, Thomas Lukasiewicz

机构 * University of Oxford(牛津大学) TU Wien(维也纳工业大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 CircuitSynth提出了一种新的神经符号框架,通过将语义推理与表层实现解耦,结合概率句法决策图和凸优化机制,实现高保真合成数据生成,确保逻辑约束和分布目标。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09548 2026-04-14 cs.IR cs.AI 62%

Retrieval-Augmented Large Language Models for Evidence-Informed Guidance on Cannabidiol Use in Older Adults

基于检索增强的大型语言模型用于指导老年人使用大麻二酚的证据支持

Ali Abedi, Charlene H. Chu, Shehroz S. Khan

机构 * Lawrence Bloomberg Faculty of Nursing, University of Toronto(多伦多大学劳伦斯·布隆伯格护理学院) KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(大学健康网络多伦多康复研究所KITE研究所) College of Engineering and Technology, American University of the Middle East(中东美国大学工程与技术学院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 本文提出一种结合结构化提示工程与大麻二酚证据的检索增强型大型语言模型框架,用于为老年人提供安全指导,同时开发了无标注评估框架以评估AI在敏感健康场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10502 2026-04-14 cs.AI 57%

CHAIRO: Contextual Hierarchical Analogical Induction and Reasoning Optimization for LLMs

CHAIRO:面向LLMs的上下文分层类比归纳与推理优化

Haotian Lu, Yuchen Mou, Bingzhe Wu

机构 * National Engineering Laboratory for Big Data System Computing Technology(国家大数据系统计算技术工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 检索器与排序 :RAG(abstract);分类 cs.AI

AI总结 本文提出CHAIRO框架,通过类比示例提升规则归纳和决策可靠性,在内容审核中实现更准确和可解释的规则生成。

Comments Accepted to ACL 2026 main conference; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10481 2026-04-14 cs.SE cs.CL 57%

PatchRecall: Patch-Driven Retrieval for Automated Program Repair

PatchRecall: 基于补丁的检索用于自动化程序修复

Mahir Labib Dihan, Faria Binta Awal, Md. Ishrak Ahsan

专题命中 检索器与排序 :hybrid retrieval(abstract);分类 cs.CL

AI总结 PatchRecall通过结合代码库检索与历史检索策略,在提升召回率的同时保持简洁,实验表明其在SWE-Bench上实现了更高的召回率且不显著增加检索文件数量,从而提升自动化程序修复效果。

Comments Code is available at https://www.kaggle.com/code/mahirlabibdihan/swe-bench-pag

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04457 2026-04-14 cs.IR 57%

Retrieval Augmented Conversational Recommendation with Reinforcement Learning

基于强化学习的检索增强对话推荐

Zhenrui Yue, Honglei Zhuang, Zhen Qin, Zhankui He, Huimin Zeng, Julian McAuley, Dong Wang

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR

AI总结 本文提出RAR框架,通过动态结合检索与生成提升推荐性能与事实性,构建大规模电影语料库并引入强化学习方法优化候选集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09588 2026-04-14 cs.AI cs.ET cs.LG 57%

Persistent Identity in AI Agents: A Multi-Anchor Architecture for Resilient Memory and Continuity

人工智能代理中的持久身份:一种多锚架构用于健壮的记忆和连续性

Prahlad G. Menon

机构 * The Menon Lab(Menon实验室)

专题命中 检索器与排序 :RAG(abstract);分类 cs.AI

AI总结 本文提出多锚架构解决AI代理身份问题,通过分离组件实现持久身份,引入混合RAG+RLM检索系统,提出身份锚点概念,提供身份在部分记忆故障下的持续性方案。

Comments 18 pages, 2 figures. Submitting to arXiv cs.ET (Emerging Technologies)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08190 2026-04-14 cs.SE 50%

Human-AI Collaboration for Scaling Agile Regression Testing: An Agentic-AI Teammate from Manual to Automated Testing

人类与AI协作扩大敏捷回归测试:从手动到自动化测试的智能体AI队友

Moustapha El Outmani, Manthan Venkataramana Shenoy, Ahmad Hatahet, Andreas Rausch, Tim Niklas Kniep, Thomas Raddatz, Benjamin King

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 本文探讨了通过智能体AI系统生成系统级回归测试脚本,提升自动化测试效率,并强调持续的人机协作对敏捷测试的重要性。

Comments Accepted at the XP 2026 Workshop on Human-AI Collaboration in Agile Teams. To appear in proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09952 2026-04-14 cs.LG 50%

SLM Finetuning for Natural Language to Domain Specific Code Generation in Production

为生产环境中的自然语言到领域特定代码生成进行SLM微调

Renjini R. Nair, Damian K. Kowalczyk, Marco Gaudesi, Chhaya Methani

专题命中 检索器与排序 :retrieval augmented generation(abstract)

AI总结 本文研究了通过微调小型语言模型提升自然语言到领域代码生成的性能与效率,展示了在生产环境中优于大模型的延迟和成本效益。

Comments 11 pages (including appendix), 5 tables, 1 figure. Submitted to arXiv as a preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16044 2026-04-14 cs.SE 50%

MultiMend: Multilingual Program Repair with Context Augmentation and Multi-Hunk Patch Generation

MultiMend: 多语言程序修复与上下文增强及多补丁补丁生成

Reza Gharibi, Mohammad Hadi Sadreddini, Seyed Mostafa Fakhrahmad

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 MultiMend通过上下文增强和多补丁生成技术,提升多语言程序修复效率,修复了2227个bug,其中1545个与开发者补丁一致,121个为多补丁bug。

Journal ref Autom Softw Eng 33, 69 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏