arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-07-31 至 2026-07-31 共收录 6 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 1 篇

2605.00086 2026-07-31 cs.CL cs.AI 版本更新 62%

NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus

NorBERTo:一个基于ModernBERT架构的葡萄牙语现代编码器模型,训练于331十亿个token语料库

Enzo S. N. Silva, Pablo B. Costa, Raphael C. Vlasman, Rosimeire P. Costa, Henrique L. P. Silva, Lucas F. A. O. Pellicer, Guilherme Rinaldo, Renato A. Almeida, Darian S. R. Rabbani, Cinthya O. Oestreich, Vinicius F. Caridá

机构 * Itaú Unibanco ICTi

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 NorBERTo基于ModernBERT架构,利用Aurora-PT语料库训练,具备长上下文支持和高效注意力机制,在葡萄牙语语义相似性、文本蕴含和分类任务中表现优异,达到最高F1和准确率。

Comments This article has already undergone formal submission, review, acceptance, and publication in the proceedings of PROPOR 2026: Proceedings of the 17th International Conference on Computational Processing of Portuguese, Vol. 1. The published version is available in the ACL Anthology at https://aclanthology.org/2026.propor-1.18/ 11 pages, 9 tables, 2 figures

Journal ref Proceedings of the 17th International Conference on Computational Processing of Portuguese (PROPOR 2026) - Vol. 1

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图谱与结构化RAG 1 篇

2605.24973 2026-07-31 cs.CV cs.AI cs.CL 版本更新 82%

MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing

MinerU-Popo:结构化文档解析的通用后处理模型

Bangrui Xu, Ziyang Miao, Xuanhe Zhou, Yiming Lin, Zirui Tang, Xiaomeng Zhao, Fan Wu, Cheng Tan, Fan Wu, Bin Wang, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) University of California, Berkeley(加州大学伯克利分校)

专题命中 图谱与结构化RAG :RAG(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出MinerU-Popo轻量级通用后处理框架,通过分解为文本/表格截断恢复、标题层级重建和图文关联四个子任务,并利用动态分块和重叠同步将OCR页面级结果重构为文档级逻辑结构,显著提升标题层级TEDS和RAG准确性。

Comments The code is available at https://github.com/opendatalab/MinerU-Popo

详情

展开后加载摘要…

URL PDF HTML 收藏

3. RAG评测 4 篇

2502.10497 2026-07-31 cs.CL cs.AI 版本更新 92%

Hallucinations and Truth: A Comprehensive Accuracy Evaluation of RAG, LoRA and DoRA

幻觉与真相:RAG、LoRA和DoRA的综合准确率评估

Mohammad Baqar, Rajat Khanda

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文评估RAG、LoRA、DoRA在2万条FAQ查询、40万条知识库上的性能,发现DoRA准确率90.1%、相关性0.88、延迟110毫秒最优,为高准确率领域部署生成式AI提供指导。

Comments 10 Pages

Journal ref 2026 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS), 10.1109/FLICS70075.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15297 2026-07-31 cs.CL 版本更新 86%

AfriEconQA: A Benchmark for Quantitative and Temporal Reasoning over World Bank Economic Reports

AfriEconQA:基于世界银行报告的非洲经济分析基准数据集

Edward Ajayi, Mustapha Alaba, David Stephen

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);hybrid retrieval(abstract);分类 cs.CL

AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。

Comments Dataset Explorer: https://afrieconqa.pages.dev/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02383 2026-07-31 cs.CL 版本更新 77%

MEDIAREF: A Public Knowledge Store for Media Background Checks

了解你的来源:用于媒体背景核查的公共知识库

Benjamin Nichols, Michael Schlichtkrull, Nedjma Ousidhoum

机构 * Cardiff University(卡迪夫大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 针对检索增强生成中证据来源可靠性问题,提出公开知识库MEDIAREF,支持可复现的低成本媒体背景核查生成,评估多种大语言模型并证明其有效性。

Comments Code and Data: https://github.com/nedjmaou/mediaref

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24802 2026-07-31 cs.IR cs.CL 版本更新 62%

SourceMinds at CheckThat! 2026: NLI-Grounded Citation Auditing in a Multi-Agent Pipeline for Full Fact-Checking Article Generation

SourceMinds参与2026年CheckThat!:多智能体管道中基于自然语言推理的引用审核用于完整事实核查文章生成

Farhan Sharukh Hasan, Anirban Saha Anik, Eric Liu, Xiaoying Song, Mohotarema Rashid, Lingzi Hong

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR、cs.CL

AI总结 针对CLEF 2026 CheckThat!实验室任务3,提出多智能体管道系统,结合证据检索、结构化规划、文章生成、自我批判及引用审核等方法,强调证据选择、结构化生成与生成后引用验证对事实核查文章生成的重要性。

Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏