arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-04-20 至 2026-04-20 共收录 23 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 13 篇

2601.04377 2026-04-20 cs.CL cs.AI cs.LG 93%

Disco-RAG: Discourse-Aware Retrieval-Augmented Generation

Disco-RAG: 语篇意识的检索增强生成

Dongqi Liu, Hang Ding, Qiming Feng, Xurong Xie, Zhucun Xue, Chengjie Wang, Jian Li, Jiangning Zhang, Yabiao Wang

机构 * Saarland University(萨尔兰大学) Shanghai Jiaotong University(上海交通大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(title,abstract);分类 cs.CL、cs.AI

AI总结 Discourse-aware RAG框架通过构建篇章内结构树和跨篇章修辞图,提升知识整合能力,在问答和长文档摘要任务中取得最佳效果。

Comments ACL 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15958 2026-04-20 cs.CR cs.CL 91%

A Case Study on the Impact of Anonymization Along the RAG Pipeline

RAG流水线中匿名化影响的案例研究

Andreea-Elena Bodea, Stephen Meisenbacher, Florian Matthes

机构 * Technical University of Munich School of Computation, Information(慕尼黑技术大学计算、信息与技术学院)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文通过实证研究分析RAG流水线中匿名化位置对隐私-效用权衡的影响,探讨匿名化在数据集和生成答案处的不同效果。

Comments 7 pages, 1 figure, 6 tables. Accepted to IWSPA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15802 2026-04-20 cs.CL 91%

CHOP: Chunkwise Context-Preserving Framework for RAG on Multi Documents

CHOP:多文档RAG中的分块上下文保留框架

Hyunseok Park, Jihyeon Kim, Jongeun Kim, Dongsik Yoon

机构 * HDC LABS(HDC实验室)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract,abstract_cn);retriever(abstract);分类 cs.CL

AI总结 CHOP通过分块相关性评估和上下文连续性决策模块,有效解决多文档检索中相似文档导致的检索混淆问题,提升检索准确性和知识库质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00052 2026-04-20 cs.IR cs.AI cs.CL cs.LG 86%

AI-assisted Protocol Information Extraction For Improved Accuracy and Efficiency in Clinical Trial Workflows

人工智能辅助的协议信息提取以提高临床试验工作流程的准确性和效率

Ramtin Babaeipour, François Charest, Madison Wright

机构 * Banting Health AI(巴丁健康AI)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文研究了利用AI系统进行临床试验协议信息提取,通过比较RAG方法与传统LLM的准确性,发现AI能显著提升提取效率和准确性,降低工作负担。

Comments Updated to accepted manuscript. Published in Journal of Biomedical Informatics, Volume 179, July 2026, 105036

Journal ref Journal of Biomedical Informatics, Volume 179, July 2026, 105036

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15621 2026-04-20 cs.IR cs.AI cs.CL 85%

Rethinking the Necessity of Adaptive Retrieval-Augmented Generation through the Lens of Adaptive Listwise Ranking

重新审视通过适应性列表排序视角的适应性检索增强生成的必要性

Jun Feng, Jiahui Tang, Zhicheng He, Hang Lv, Hongchao Gu, Hao Wang, Xuezhi Yang, Shuai Fang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文通过适应性列表排序视角重新审视适应性检索增强生成的必要性,提出AdaRankLLM框架,通过零样本提示和段落dropout机制验证适应性排序的必要性,并通过两阶段渐进蒸馏提升小模型的精确排序与适应过滤能力。

Comments 7pages, 2figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13660 2026-04-20 cs.CV 80%

VRAG-DFD: Verifiable Retrieval-Augmentation for MLLM-based Deepfake Detection

VRAG-DFD: 可验证检索增强的基于大语言模型的深度伪造检测

Hui Han, Shunli Wang, Yandan Zhao, Taiping Yao, Shouhong Ding

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);knowledge retrieval(abstract)

AI总结 本文提出VRAG-DFD框架,通过结合检索增强生成和强化学习,解决深度伪造检测中专业伪造知识不足的问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15484 2026-04-20 cs.IR 79%

vstash: Local-First Hybrid Retrieval with Adaptive Fusion for LLM Agents

vstash:基于自适应融合的本地优先混合检索LLM代理

Jayson Steffens

专题命中 检索器与排序 :hybrid retrieval(title,abstract);分类 cs.IR

AI总结 vstash通过自适应融合和自监督嵌入优化,提升LLM代理在多数据集上的检索性能,实现NDCG@10的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12858 2026-04-20 cs.LG cs.AI 77%

Information-Consistent Language Model Recommendations through Group Relative Policy Optimization

通过群体相对策略优化实现信息一致的语言模型推荐

Sonal Prabhune, Balaji Padmanabhan, Kaushik Dutta

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出基于群体相对策略优化的强化学习框架,旨在提升语言模型在等效提示下的信息一致性,通过熵基帮助性和稳定性奖励优化模型稳定性。

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15485 2026-04-20 cs.SE 75%

LLM4C2Rust: Large Language Models for Automated Memory-Safe Code Transpilation

LLM4C2Rust: 利用大型语言模型实现自动内存安全代码转译

Sarah Bedell, Nazanin Siavash, Armin Moin

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 本文提出基于检索增强生成的框架,利用大型语言模型与小型语言模型结合,实现C/C++到Rust的转译,提升内存安全性。实验表明该方法能有效提高代码正确性和安全性,减少原始指针解引用和不安全类型转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19339 2026-04-20 cs.IR cs.AI cs.CL 67%

Spectral Tempering for Embedding Compression in Dense Passage Retrieval

光谱温控用于密集路径检索中的嵌入压缩

Yongkang Li, Panagiotis Eustratiadis, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 检索器与排序 :dense retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出Spectral Tempering方法,通过分析语料库的光谱特性,自适应调整光谱缩放参数γ,实现高效的嵌入压缩,无需标注数据或验证搜索。

Comments This paper has been accepted as a short paper at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07930 2026-04-20 cs.IR 57%

Unified Supervision for Walmart's Sponsored Search Retrieval via Joint Semantic Relevance and Behavioral Engagement Modeling

通过联合语义相关性和行为参与建模实现沃尔玛赞助搜索检索的统一监督

Shasvat Desai, Md Omar Faruk Rokon, Jhalak Nilesh Acharya, Isha Shah, Hong Yao, Utkarsh Porwal, Kuang-chih Lee

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR

AI总结 本文提出一种基于语义相关性和行为参与的统一监督框架,通过结合语义标签、检索先验分数和用户参与信号,提升沃尔玛电子商务赞助搜索检索性能。

Comments Accepted to SIGIR 2026, Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03746 2026-04-20 cs.CL 57%

Whose Facts Win? LLM Source Preferences under Knowledge Conflicts

谁的事实获胜?在知识冲突下LLM的来源偏好

Jakob Schuster, Vagrant Gautam, Katja Markert

机构 * Heidelberg University(海德堡大学) Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 研究探讨了LLM在知识冲突中的来源偏好,发现其更倾向于机构证实的信息,但可通过重复低可信度来源信息逆转。提出方法减少重复偏差,同时保持大部分偏好。

Comments Data and code: https://github.com/JaSchuste/llm-source-preference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15385 2026-04-20 cs.SE cs.LG 50%

Prompt-Driven Code Summarization: A Systematic Literature Review

基于提示的代码摘要:系统文献综述

Afia Farjana, Zaiyu Cheng, Antonio Mastropaolo

机构 * William & Mary(威廉玛丽学院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 本文综述了基于提示的代码摘要方法,分析了不同提示策略的有效性及评估挑战,旨在为未来研究和实际应用提供指导。

Comments 42 pages, 9 figures, 10 tables. Systematic Literature Review. This work is currently under review at ACM TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 长文档RAG 1 篇

2601.03378 2026-04-20 cs.SE 75%

RepoShapley: Shapley-Enhanced Context Filtering for Repository-Level Code Completion

RepoShapley:基于Shapley的上下文过滤用于仓库级代码补全

Yu Huo, Kun Zeng, Siyu Zhang, Yuquan Lu, Cheng Yang, Yifu Guo, Xiaoying Tang

专题命中 长文档RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 RepoShapley通过Shapley式边际贡献监督,实现仓库级代码补全的上下文过滤,提升补全质量并减少有害上下文和冗余检索。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图谱与结构化RAG 2 篇

2604.15676 2026-04-20 cs.DB 89%

EvoRAG: Making Knowledge Graph-based RAG Automatically Evolve through Feedback-driven Backpropagation

EvoRAG: 通过反馈驱动的反向传播使基于知识图谱的RAG自动进化

Zhenbo Fu, Yuanzhe Zhang, Qiange Wang, Hao Yuan, Yuehao Xu, Enze Yi, Yanfeng Zhang, Ge Yu

专题命中 图谱与结构化RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.DB

AI总结 本文提出EvoRAG,通过反馈驱动反向传播机制自动优化知识图谱,提升推理准确性,实验显示比现有方法提升7.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15347 2026-04-20 cs.HC cs.AI cs.IR cs.MA 85%

SocialWise: LLM-Agentic Conversation Therapy for Individuals with Autism Spectrum Disorder to Enhance Communication Skills

SocialWise: 用于自闭症谱系障碍个体的LLM代理对话疗法以增强沟通能力

Albert Tang

机构 * Albert Tang(阿尔伯特·坦)

专题命中 图谱与结构化RAG :RAG(summary_cn,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 SocialWise通过浏览器应用结合LLM对话代理和治疗性检索增强生成(RAG)知识库,为自闭症谱系障碍个体提供低成本、高效的沟通技能培训。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态RAG 2 篇

2604.14967 2026-04-20 cs.CV cs.AI 91%

UniDoc-RL: Coarse-to-Fine Visual RAG with Hierarchical Actions and Dense Rewards

UniDoc-RL: 基于分层动作和密集奖励的粗到细视觉RAG

Jun Wang, Shuo Tan, Zelong Sun, Tiancheng Gu, Yongle Zhao, Ziyong Feng, Kaicheng Yang, Zhiwu Lu

机构 * DeepGlint-AI

专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 UniDoc-RL通过分层动作空间和密集奖励方案,提升视觉RAG系统的细粒度视觉语义处理能力,实现端到端训练,实验显示优于现有方法。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15663 2026-04-20 cs.SE cs.AI 84%

CodeMMR: Bridging Natural Language, Code, and Image for Unified Retrieval

CodeMMR:连接自然语言、代码和图像以实现统一检索

Jiahui Geng, Qing Li, Fengyu Cai, Fakhri Karray

机构 * MBZUAI Linköping University(林雪平大学) University of Groningen(格罗宁根大学) TU Darmstadt(图宾根大学)

专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出CodeMMR,通过指令式多模态对齐,将自然语言、代码和图像嵌入共享语义空间,实现跨模态和语言的强泛化,优于基线模型,并提升RAG中的代码生成精度与视觉 grounding。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. RAG评测 5 篇

2512.07515 2026-04-20 cs.CL cs.AI 89%

TPA: Next Token Probability Attribution for Detecting Hallucinations in RAG

TPA:用于检测RAG中幻觉的下一个令牌概率归因

Pengqian Lu, Jie Lu, Anjin Liu, Guangquan Zhang

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 TPA通过归因七个来源量化各组件对生成下一个令牌的影响,有效识别幻觉响应,实验显示其性能领先。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02497 2026-04-20 cs.SE cs.AI quant-ph 89%

A PennyLane-Centric Dataset to Enhance LLM-based Quantum Code Generation using RAG

面向增强基于LLM的量子代码生成的PennyLane数据集

Abdul Basit, Nouhaila Innan, Muhammad Haider Asif, Minghao Shao, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

机构 * Center for Quantum and Topological Systems (CQTS)(量子与拓扑系统中心(CQTS)) NYUAD Research Institute(纽约大学阿布扎克研究院) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 RAG评测 :RAG(title,summary_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出PennyLang数据集,通过系统化方法提升LLM生成量子代码的性能,验证了RAG框架在增强量子代码生成中的有效性。

Comments 8 pages, 6 figures, 8 tables. Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15945 2026-04-20 cs.CL cs.LG 81%

RAGognizer: Hallucination-Aware Fine-Tuning via Detection Head Integration

RAGognizer: 通过检测头整合实现hallucination-aware微调

Fabian Ridder, Laurin Lessel, Malte Schilling

机构 * Computer Science Department(计算机科学系)

专题命中 RAG评测 :retrieval-augmented generation(abstract,abstract_cn);RAG(abstract,abstract_cn);分类 cs.CL

AI总结 RAGognizer通过整合轻量级检测头,实现hallucination-aware微调,提升内部状态分离性并减少生成hallucination。

Comments accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11182 2026-04-20 cs.CL 81%

Evaluating Memory Capability in Continuous Lifelog Scenario

在连续生活日志场景中评估记忆能力

Jianjie Zheng, Zhichen Liu, Zhanyu Shen, Jingxiang Qu, Guanhua Chen, Yile Wang, Yang Xu, Yang Liu, Sijie Cheng

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本文提出LifeDialBench基准,包含EgoMem和LifeMem两个子集,通过在线评估协议解决传统离线设置的时序泄漏问题,发现复杂记忆系统不如简单RAG基线表现,强调高保真上下文保存的重要性。

Comments 27 pages, 7 figures. ACL 2026 Findings camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14554 2026-04-20 cs.CL cs.AI 62%

VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models

VLegal-Bench: 用于大型语言模型越南法律推理的认知导向基准

Nguyen Tien Dong, Minh-Anh Nguyen, Thanh Dat Hoang, Nguyen Tuan Ngoc, Dao Xuan Quang Minh, Phan Phi Hai, Nguyen Thi Ngoc Anh, Dang Van Tu, Binh Vu

机构 * CMC OpenAI VinUniversity HUST SRH University Heidelberg

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 VLegal-Bench是首个系统评估大型语言模型在越南法律任务上的基准,包含10450个样本,通过严格标注流程确保样本基于权威法律文件,涵盖法律问题解答、检索增强生成、多步推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏