arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-04-03 至 2026-04-03 共收录 14 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 8 篇

2604.01733 2026-04-03 cs.IR cs.CL 88%

From BM25 to Corrective RAG: Benchmarking Retrieval Strategies for Text-and-Table Documents

从BM25到纠正性RAG:文本与表格文档检索策略的基准测试

Meftun Akarsu, Recep Kaan Karaman, Christopher Mierbach

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract);dense retrieval(abstract);hybrid retrieval(abstract)

AI总结 本文对比了十种检索策略,发现混合检索与神经重排序结合的方法在金融问答基准上表现优异,BM25在金融文档中优于最新密集检索,查询扩展方法对精确数值查询帮助有限。

Comments 11 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01058 2026-04-03 cs.CL cs.AI 84%

Speaking at the Right Level: Literacy-Controlled Counterspeech Generation with RAG-RL

在合适水平上发言:基于RAG-RL的识字率控制反驳生成

Xiaoying Song, Anirban Saha Anik, Dibakar Barua, Pengcheng Luo, Junhua Ding, Lingzi Hong

机构 * University of North Texas(北德克萨斯大学) Peking University(北京大学)

专题命中 检索器与排序 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于RAG-RL的识字率控制框架,生成适应不同健康识字水平的定制化反驳内容,提升信息可及性和有效性。

Comments Accepted at Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01395 2026-04-03 cs.SE 82%

AI Engineering Blueprint for On-Premises Retrieval-Augmented Generation Systems

面向企业本地检索增强生成系统的AI工程蓝图

Nicolas Weeger, Jakob Winkler, Annika Stiehl, Jóakim von Kistowski, Christian Uhl, Stefan Geißelsöder

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract)

AI总结 本文提出面向企业本地RAG系统的全面AI工程蓝图,提供端到端架构、参考应用及最佳实践,旨在解决部署挑战并提升集成效率。

Comments Accepted at ICSA 2026 Posters Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02039 2026-04-03 cs.SE 67%

APITestGenie: Generating Web API Tests from Requirements and API Specifications with LLMs

APITestGenie: 从需求和API规范生成Web API测试

André Pereira, Bruno Lima, João Pascoal Faria

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文提出APITestGenie工具,利用LLM、RAG和提示工程从业务需求和OpenAPI规范自动生成API测试,测试覆盖率达89%,发现API缺陷,提升测试与需求的一致性。

Journal ref 7th ACM/IEEE International Conference on Automation of Software Test (AST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20673 2026-04-03 cs.CL cs.AI 62%

PAVE: Premise-Aware Validation and Editing for Retrieval-Augmented LLMs

PAVE:基于前提的验证与编辑用于检索增强的大语言模型

Tianyi Huang, Caden Yang, Emily Yin, Eric Wang, Michael Zhang

机构 * Ryquo App-In Club

专题命中 检索器与排序 :retriever(abstract);分类 cs.CL、cs.AI

AI总结 PAVE通过在推理阶段验证和编辑检索到的证据,提高检索增强大语言模型的回答一致性。在两个证据基础问答任务中,PAVE在跨度基础基准上提升了32.7个准确率点。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07995 2026-04-03 cs.IR cs.AI 62%

DIVER: A Multi-Stage Approach for Reasoning-intensive Information Retrieval

DIVER:一种用于推理密集型信息检索的多阶段方法

Duolin Sun, Meixiu Long, Dan Yang, Junjie Wang, Yecheng Luo, Yue Shen, Jian Wang, Hualei Zhou, Chunxiao Guo, Peng Wei, Jiahai Wang, Jinjie Gu

机构 * Ant Group(蚂蚁集团) Sun Yat-sen University(中山大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 DIVER通过多阶段流程提升推理密集型信息检索性能,包含文档预处理、查询扩展、检索和重排序四个环节,有效应对需要抽象推理和多步推理的复杂查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02238 2026-04-03 cs.CY cs.AI stat.AP 57%

Generative AI Spotlights the Human Core of Data Science: Implications for Education

生成AI揭示数据科学的人类核心:对教育的影响

Nathan Taback

机构 * University of Toronto(多伦多大学)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 生成AI揭示数据科学中不可还原的人类核心,教育应强化人类推理能力,通过迭代提示-输出-提示循环提升学生贡献能力,评估应侧重推理与判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01226 2026-04-03 cs.CV cs.SE 50%

DOne: Decoupling Structure and Rendering for High-Fidelity Design-to-Code Generation

DOne:解耦结构与渲染以实现高保真设计到代码生成

Xinhao Huang, Jinke Yu, Wenhao Xu, Zeyi Wen, Ying Zhou, Junzhuo Liu, Junhao Ji, Zulong Chen

机构 * HKUST (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) University of Electronic Science(电子科技大学) Zhejiang Lab(之江实验室)

专题命中 检索器与排序 :retriever(abstract)

AI总结 DOne通过解耦结构理解与元素渲染,提升设计到代码生成的高保真度,通过布局分割模块、混合元素检索器和模式引导生成范式,克服了现有方法在结构与细节协调上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 向量检索 1 篇

2604.01617 2026-04-03 cs.IR 57%

STABLE: Efficient Hybrid Nearest Neighbor Search via Magnitude-Uniformity and Cardinality-Robustness

STABLE:通过幅度均匀性和基数鲁棒性实现高效的混合最近邻搜索

Qianyun Yang, Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Liqiang Nie

专题命中 向量检索 :hybrid retrieval(abstract);分类 cs.IR

AI总结 STABLE通过引入AUTO度量和HELP索引,解决相似性幅度异质性和属性基数鲁棒性问题,实现高效混合最近邻搜索。

Comments Accepted by IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识库问答 1 篇

2604.02259 2026-04-03 hep-ex cs.AI physics.ins-det 70%

Retrieval-Augmented Question Answering over Scientific Literature for the Electron-Ion Collider

基于科学文献的电子-离子对撞机检索增强问答

Tina. J. Jat, T. Ghosh, Karthik Suresh

机构 * Ramaiah University of Applied Sciences, India(印度拉马伊亚应用科学大学)

专题命中 知识库问答 :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出一种基于检索增强生成的问答系统,利用arXiv文献和LLaMA模型回答核物理领域专业问题,提供隐私保护且成本低廉的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图谱与结构化RAG 2 篇

2604.02276 2026-04-03 cs.AI cs.CL cs.LG 62%

De Jure: Iterative LLM Self-Refinement for Structured Extraction of Regulatory Rules

De Jure:基于迭代LLM自优化的结构化监管规则提取

Keerat Guliani, Deepkamal Gill, David Landsman, Nima Eshraghi, Krishna Kumar, Lovedeep Gondara

机构 * The Vanguard Group, Inc.(先锋集团)

专题命中 图谱与结构化RAG :RAG(abstract);分类 cs.CL、cs.AI

AI总结 De Jure通过四个阶段自动提取结构化监管规则,无需人工标注或领域知识,提升监管文本处理的效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00379 2026-04-03 cs.DB 57%

Towards Robustness: A Critique of Current Vector Database Assessments

迈向鲁棒性:对当前向量数据库评估的批评

Zikai Wang, Qianxi Zhang, Baotong Lu, Qi Chen, Cheng Tan

专题命中 图谱与结构化RAG :RAG(abstract);分类 cs.DB

AI总结 本文批评了平均召回率作为向量数据库评估指标的不足,提出Robustness-δ@K新指标以更全面评估召回分布,揭示不同数据库的鲁棒性差异,并指导优化尾部性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态RAG 2 篇

2504.02132 2026-04-03 cs.CL cs.CR cs.CV cs.IR 84%

One Pic is All it Takes: Poisoning Visual Document Retrieval Augmented Generation with a Single Image

一张图片足矣:通过单张图片对视觉文档检索增强生成进行污染攻击

Ezzeldin Shereen, Dan Ristea, Shae McFadden, Burak Hasircioglu, Vasilios Mavroudis, Chris Hicks

机构 * The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院)

专题命中 多模态RAG :retrieval augmented generation(title);retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

AI总结 本文研究了视觉文档检索增强生成(VD-RAG)对污染攻击的脆弱性,通过单张恶意图片实现针对性和通用性攻击,展示了VD-RAG在目标和通用设置下的漏洞,但在黑盒攻击下表现出一定的鲁棒性。

Comments Published in Transactions on Machine Learning Research (03/2026)

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02034 2026-04-03 cs.AI 70%

AI in Insurance: Adaptive Questionnaires for Improved Risk Profiling

保险中的AI:适应性问卷以提升风险评估

Diogo Silva, João Teixeira, Bruno Lima

机构 * Deloitte(德勤) Faculty of Engineering, University of Porto(波尔图大学工程学院) LIACC, Faculty of Engineering, University of Porto(波尔图大学工程学院人工智能与计算机科学实验室)

专题命中 多模态RAG :retrieval augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出ARQuest框架,利用大语言模型和替代数据源创建个性化适应性问卷,通过社交媒体图像分析等技术提升风险评估的准确性与用户满意度。

Journal ref International Workshop on Agentic Engineering (AGENT 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏