arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-04-30 至 2026-04-30 共收录 4 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 4 篇

2604.25313 2026-04-30 cs.CL cs.AI 91%

Faithfulness-QA: A Counterfactual Entity Substitution Dataset for Training Context-Faithful RAG Models

忠实性问答:一个用于训练上下文忠实RAG模型的反事实实体替换数据集

Li Ju, Junzhe Wang, Qi Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Faithfulness-QA数据集,通过反事实实体替换生成可控的知识冲突,旨在训练上下文忠实的RAG模型并评估其上下文接地行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21072 2026-04-30 cs.CL 89%

Faithfulness-Aware Uncertainty Quantification for Fact-Checking the Output of Retrieval Augmented Generation

基于事实性的不确定性量化用于验证检索增强生成的输出

Ekaterina Fadeeva, Aleksandr Rubashevskii, Dzianis Piatrashyn, Roman Vashurin, Shehzaad Dhuliawala, Artem Shelmanov, Timothy Baldwin, Preslav Nakov, Mrinmaya Sachan, Maxim Panov

机构 * ETH Zürich(苏黎世联邦理工学院) MBZUAI(穆斯林人工智能研究所)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval augmented generation(title);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出FRANQ方法,通过不同不确定性量化技术区分事实性和检索忠实性,提升RAG输出的事实性检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26184 2026-04-30 cs.IR cs.AI cs.CL 86%

Auto-ARGUE: LLM-Based Report Generation Evaluation

Auto-ARGUE:基于大语言模型的报告生成评估

William Walden, Marc Mason, Orion Weller, Laura Dietz, John Conroy, Neil Molino, Hannah Recknor, Bryan Li, Gabrielle Kaili-May Liu, Yu Hou, Dawn Lawrie, James Mayfield, Eugene Yang

机构 * Johns Hopkins University(约翰霍普金斯大学) University of New Hampshire(新罕布什尔大学) IDA Center for Computing Services(IDA计算服务中心) Google(谷歌) Yale University(耶鲁大学) University of Maryland(马里兰大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出Auto-ARGUE,一种基于大语言模型的报告生成评估工具,通过TREC 2024 NeuCLIR和RAG任务验证,展示了与人类判断的良好相关性,并发布ARGUE-Viz可视化工具。

Comments SIGIR 2026: Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25931 2026-04-30 cs.CL 81%

Anchored Confabulation: Partial Evidence Non-Monotonically Amplifies Confident Hallucination in LLMs

锚定编造:部分证据非单调放大LLM中的自信幻觉

Ashish Balkishan Lathkar

机构 * Florida State University(佛罗里达州立大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中一种新校准特性:提供一个确认的中间事实可非单调放大自信错误答案率。通过六个证据线证明了参数幻觉信心(PHC)概念,并在RAG路由中应用,显著提升性能。

Comments 62 pages, 5 figures. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏