arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-04-20 至 2026-04-20 共收录 13 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 13 篇

2601.04377 2026-04-20 cs.CL cs.AI cs.LG 93%

Disco-RAG: Discourse-Aware Retrieval-Augmented Generation

Disco-RAG: 语篇意识的检索增强生成

Dongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang, Jian Li, Jiangning Zhang, Yabiao Wang

机构 * Saarland University(萨尔兰大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(title,abstract);分类 cs.CL、cs.AI

AI总结 Discourse-aware RAG框架通过构建篇章内结构树和跨篇章修辞图,提升知识整合能力,在问答和长文档摘要任务中取得最佳效果。

Comments ACL 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15958 2026-04-20 cs.CR cs.CL 91%

A Case Study on the Impact of Anonymization Along the RAG Pipeline

RAG流水线中匿名化影响的案例研究

Andreea-Elena Bodea, Stephen Meisenbacher, Florian Matthes

机构 * Technical University of Munich School of Computation, Information(慕尼黑技术大学计算、信息与技术学院)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文通过实证研究分析RAG流水线中匿名化位置对隐私-效用权衡的影响,探讨匿名化在数据集和生成答案处的不同效果。

Comments 7 pages, 1 figure, 6 tables. Accepted to IWSPA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15802 2026-04-20 cs.CL 91%

CHOP: Chunkwise Context-Preserving Framework for RAG on Multi Documents

CHOP:多文档RAG中的分块上下文保留框架

Hyunseok Park, Jihyeon Kim, Jongeun Kim, Dongsik Yoon

机构 * HDC LABS(HDC实验室)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract,abstract_cn);retriever(abstract);分类 cs.CL

AI总结 CHOP通过分块相关性评估和上下文连续性决策模块,有效解决多文档检索中相似文档导致的检索混淆问题,提升检索准确性和知识库质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00052 2026-04-20 cs.IR cs.AI cs.CL cs.LG 86%

AI-assisted Protocol Information Extraction For Improved Accuracy and Efficiency in Clinical Trial Workflows

人工智能辅助的协议信息提取以提高临床试验工作流程的准确性和效率

Ramtin Babaeipour, François Charest, Madison Wright

机构 * Banting Health AI(巴丁健康AI)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文研究了利用AI系统进行临床试验协议信息提取,通过比较RAG方法与传统LLM的准确性,发现AI能显著提升提取效率和准确性,降低工作负担。

Comments Updated to accepted manuscript. Published in Journal of Biomedical Informatics, Volume 179, July 2026, 105036

Journal ref Journal of Biomedical Informatics, Volume 179, July 2026, 105036

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15621 2026-04-20 cs.IR cs.AI cs.CL 85%

Rethinking the Necessity of Adaptive Retrieval-Augmented Generation through the Lens of Adaptive Listwise Ranking

重新审视通过适应性列表排序视角的适应性检索增强生成的必要性

Jun Feng, Jiahui Tang, Zhicheng He, Hang Lv, Hongchao Gu, Hao Wang, Xuezhi Yang, Shuai Fang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文通过适应性列表排序视角重新审视适应性检索增强生成的必要性,提出AdaRankLLM框架,通过零样本提示和段落dropout机制验证适应性排序的必要性,并通过两阶段渐进蒸馏提升小模型的精确排序与适应过滤能力。

Comments 7pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13660 2026-04-20 cs.CV 80%

VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection

VRAG-DFD: 可验证检索增强的基于大语言模型的深度伪造检测

Hui Han, Shunli Wang, Yandan Zhao, Taiping Yao, Shouhong Ding

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);knowledge retrieval(abstract)

AI总结 本文提出VRAG-DFD框架,通过结合检索增强生成和强化学习,解决深度伪造检测中专业伪造知识不足的问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15484 2026-04-20 cs.IR 79%

vstash: Local-First Hybrid Retrieval with Adaptive Fusion for LLM Agents

vstash:基于自适应融合的本地优先混合检索LLM代理

Jayson Steffens

专题命中 检索器与排序 :hybrid retrieval(title,abstract);分类 cs.IR

AI总结 vstash通过自适应融合和自监督嵌入优化,提升LLM代理在多数据集上的检索性能,实现NDCG@10的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12858 2026-04-20 cs.LG cs.AI 77%

Information-Consistent Language Model Recommendations through Group Relative Policy Optimization

通过群体相对策略优化实现信息一致的语言模型推荐

Sonal Prabhune, Balaji Padmanabhan, Kaushik Dutta

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出基于群体相对策略优化的强化学习框架,旨在提升语言模型在等效提示下的信息一致性,通过熵基帮助性和稳定性奖励优化模型稳定性。

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15485 2026-04-20 cs.SE 75%

LLM4C2Rust: Large Language Models for Automated Memory-Safe Code Transpilation

LLM4C2Rust: 利用大型语言模型实现自动内存安全代码转译

Sarah Bedell, Nazanin Siavash, Armin Moin

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 本文提出基于检索增强生成的框架,利用大型语言模型与小型语言模型结合,实现C/C++到Rust的转译,提升内存安全性。实验表明该方法能有效提高代码正确性和安全性,减少原始指针解引用和不安全类型转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19339 2026-04-20 cs.IR cs.AI cs.CL 67%

Spectral Tempering for Embedding Compression in Dense Passage Retrieval

光谱温控用于密集路径检索中的嵌入压缩

Yongkang Li, Panagiotis Eustratiadis, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出Spectral Tempering方法,通过分析语料库的光谱特性,自适应调整光谱缩放参数γ,实现高效的嵌入压缩,无需标注数据或验证搜索。

Comments This paper has been accepted as a short paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07930 2026-04-20 cs.IR 57%

Unified Supervision for Walmart's Sponsored Search Retrieval via Joint Semantic Relevance and Behavioral Engagement Modeling

通过联合语义相关性和行为参与建模实现沃尔玛赞助搜索检索的统一监督

Shasvat Desai, Md Omar Faruk Rokon, Jhalak Nilesh Acharya, Isha Shah, Hong Yao, Utkarsh Porwal, Kuang-chih Lee

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR

AI总结 本文提出一种基于语义相关性和行为参与的统一监督框架,通过结合语义标签、检索先验分数和用户参与信号,提升沃尔玛电子商务赞助搜索检索性能。

Comments Accepted to SIGIR 2026, Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03746 2026-04-20 cs.CL 57%

Whose Facts Win? LLM Source Preferences under Knowledge Conflicts

谁的事实获胜?在知识冲突下LLM的来源偏好

Jakob Schuster, Vagrant Gautam, Katja Markert

机构 * Heidelberg University(海德堡大学) Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 研究探讨了LLM在知识冲突中的来源偏好,发现其更倾向于机构证实的信息,但可通过重复低可信度来源信息逆转。提出方法减少重复偏差,同时保持大部分偏好。

Comments Data and code: https://github.com/JaSchuste/llm-source-preference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15385 2026-04-20 cs.SE cs.LG 50%

Prompt-Driven Code Summarization: A Systematic Literature Review

基于提示的代码摘要:系统文献综述

Afia Farjana, Zaiyu Cheng, Antonio Mastropaolo

机构 * William & Mary(威廉玛丽学院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 本文综述了基于提示的代码摘要方法,分析了不同提示策略的有效性及评估挑战,旨在为未来研究和实际应用提供指导。

Comments 42 pages, 9 figures, 10 tables. Systematic Literature Review. This work is currently under review at ACM TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏