arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-03-10 至 2026-03-10 共收录 7 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 7 篇

2603.07379 2026-03-10 cs.AI cs.CL cs.CR cs.IR 89%

SoK: Agentic Retrieval-Augmented Generation (RAG): Taxonomy, Architectures, Evaluation, and Research Directions

SoK:基于代理的检索增强生成(RAG):分类、架构、评估及研究方向

Saroj Mishra, Suman Niroula, Umesh Yadav, Dilip Thakur, Srijan Gyawali, Shiva Gaire

机构 * University of North Dakota(北达科他大学) Youngstown State University(青年州大学) University of Toledo(托莱多大学) University of Missouri(密苏里大学) Tribhuvan University(特里布文大学)

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(title,abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文系统化地分析了基于代理的RAG系统,提出统一框架,识别关键风险并提出研究方向,以构建可靠可扩展的自主检索生成系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07612 2026-03-10 cs.CL 85%

KohakuRAG: A simple RAG framework with hierarchical document indexing

KohakuRAG:一种具有层次文档索引的简单RAG框架

Shih-Ying Yeh, Yueh-Feng Ku, Ko-Wei Huang, Buu-Khang Tu

机构 * National Tsing Hua University Comfy Org Research Kohaku-Lab

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);dense retrieval(abstract);分类 cs.CL

AI总结 KohakuRAG通过层次文档索引和集合推理技术,提升了检索增强生成系统在高精度引用任务中的性能,取得挑战赛第一名。

Comments 38pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06426 2026-03-10 cs.CL cs.AI 73%

NC-Bench: An LLM Benchmark for Evaluating Conversational Competence

NC-Bench: 一个评估大型语言模型对话能力的LLM基准

Robert J. Moore, Sungeun An, Farhan Ahmed, Jay Pankaj Gala

机构 * Independent Researcher(独立研究者) IBM Research(IBM研究院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 NC-Bench提出了一种评估大型语言模型对话能力的基准,通过三种不同集合测试模型在不同对话任务中的表现,发现模型在基础回答任务表现较好,但在复杂多轮请求上面临挑战。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07931 2026-03-10 cs.CL 70%

BRIDGE: Benchmark for multi-hop Reasoning In long multimodal Documents with Grounded Evidence

BRIDGE: 多跳推理长多模态文档基准测试与证据 grounded

Biao Xiang, Soyeon Caren Han, Yihao Ding

机构 * The University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 BRIDGE是一个针对长多模态文档的多跳推理基准测试,通过显式的多跳推理注释揭示证据聚合和 grounding 的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04663 2026-03-10 cs.LG cs.AI cs.CE 70%

Neuro-Symbolic Financial Reasoning via Deterministic Fact Ledgers and Adversarial Low-Latency Hallucination Detector

通过确定性事实账本和对抗性低延迟幻觉检测器实现神经符号金融推理

Pedram Agand

机构 * FactAI Lab(FactAI实验室)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出VeNRA,通过确定性事实账本和对抗性检测器实现零幻觉金融推理,结合确定性执行和高效检测机制,显著降低幻觉率并提升推理可靠性。

Comments 21 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06604 2026-03-10 cs.LG cs.CL 70%

Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection

知何时错误:将置信度与正确性对齐以用于LLM错误检测

Xie Xiaohu, Liu Xiaohu, Yao Benjamin

机构 * Alexa AI, Amazon, Seattle, WA, USA(Alexa AI,亚马逊,西雅图,华盛顿州)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL

AI总结 本文提出归一化置信度分数和自我评估框架,通过SFT提升LLM置信度可靠性,减少校准误差,提升错误检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14878 2026-03-10 cs.HC 67%

InterMind: Doctor-Patient-Family Interactive Depression Assessment Empowered by Large Language Models

InterMind:由大型语言模型赋能的医生-患者-家庭交互式抑郁症评估系统

Zhiyuan Zhou, Jilong Liu, Sanwang Wang, Shijie Hao, Yanrong Guo, Richang Hong

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 InterMind利用大型语言模型,通过医生、患者和家庭的互动提升抑郁症评估的精确性和效率。

Comments Accepted at ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏