arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-03-31 至 2026-03-31 共收录 9 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 9 篇

2601.05866 2026-03-31 cs.CL 83%

FACTUM: Mechanistic Detection of Citation Hallucination in Long-Form RAG

FACTUM:长形式RAG中引用幻觉的机制检测

Maxime Dassen, Rebecca Kotula, Kenton Murray, Andrew Yates, Dawn Lawrie, Efsun Kayi, James Mayfield, Kevin Duh

机构 * University of Amsterdam(阿姆斯特丹大学) Department of Defense(美国国防部) HLTCOE, Johns Hopkins University(约翰霍普金斯大学HLTCOE) Applied Physics Laboratory, Johns Hopkins University(约翰霍普金斯大学应用物理实验室)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 FACTUM通过四个机制性评分(CAS、BAS、PFS、PAS)检测RAG中的引用幻觉,发现高参数力(PFS)和注意力sink使用(BAS)与正确引用相关,且随着模型规模变化,正确性特征也随之演变,FACTUM在AUC上优于现有方法37.5%。

Comments Accepted at ECIR 2026. 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23562 2026-03-31 cs.LG cs.AI 79%

Synthetic Mixed Training: Scaling Parametric Knowledge Acquisition Beyond RAG

合成混合训练:在RAG之上扩展参数化知识获取

Seungju Han, Konwoo Kim, Chanwoo Park, Benjamin Newman, Suhas Kotha, Jaehun Jung, James Zou, Yejin Choi

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院) University of Washington(华盛顿大学)

专题命中 RAG评测 :RAG(title,abstract);分类 cs.AI

AI总结 本文提出合成混合训练方法,结合合成问答和文档,通过互补训练信号提升模型性能,在QuaLITY基准上实现4.4%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09096 2026-03-31 cs.CL cs.IR 73%

Link Prediction for Event Logs in the Process Industry

过程工业事件日志中的链接预测

Anastasia Zhukova, Thomas Walton, Christian E. Lobmüller, Bela Gipp

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL

AI总结 本文提出一种跨文档核心ference解决方法,用于解决过程工业中事件日志碎片化问题,提升数据质量和连接性。

Comments accepted to RESOURCEFUL 2026, co-located with LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27404 2026-03-31 cs.AI cs.CL cs.CY cs.HC cs.MA 73%

Heterogeneous Debate Engine: Identity-Grounded Cognitive Architecture for Resilient LLM-Based Ethical Tutoring

异质辩论引擎:基于身份的认知架构用于鲁棒的基于大语言模型的伦理导师

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙理工大学计算机科学研究所)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 本文提出异质辩论引擎,结合身份导向检索增强生成与启发式理论思维,解决多代理系统在伦理教学中保持精确回答的挑战。

Comments 15 pages, 3 figures, 4 tables. Accepted at ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28651 2026-03-31 cs.AI 70%

Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning

不是搜索,而是扫描:在面向学术论文推理的扫描任务上基准测试大语言模型

Rongjin Li, Zichen Tang, Xianghe Wang, Xinyi Hu, Zhengyu Wang, Zhengyu Lu, Yiling Huang, Jiayuan Chen, Weisheng Tan, Jiacheng Liu, Zhongjun Yang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.AI

AI总结 本文提出ScholScan基准,通过扫描式任务评估大语言模型在学术论文推理中的能力,发现检索增强生成方法在扫描任务上无显著提升,揭示了当前模型在该任务上的系统性缺陷。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27127 2026-03-31 cs.CR 67%

Red-MIRROR: Agentic LLM-based Autonomous Penetration Testing with Reflective Verification and Knowledge-augmented Interaction

Red-MIRROR:基于大语言模型的自主渗透测试系统,结合反射验证与知识增强交互

Tran Vy Khang, Nguyen Dang Nguyen Khang, Nghi Hoang Khoa, Do Thi Thu Hien, Van-Hau Pham, Phan The Duy

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 Red-MIRROR通过引入紧密耦合的记忆-反射架构,解决传统渗透测试中依赖参数知识、记忆碎片化和验证不足的问题,实现复杂Web漏洞的高效检测与验证,其在XBOW基准测试中成功率达到86%。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15355 2026-03-31 cs.CL 57%

HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning

HEAD-QA v2:扩展医疗基准以进行推理

Alexis Correa-Guillén, Carlos Gómez-Rodríguez, David Vilares

专题命中 RAG评测 :RAG(abstract);分类 cs.CL

AI总结 HEAD-QA v2扩展了医疗推理数据集,包含12000个西班牙专业考试问题,评估多种LLM性能,发现模型规模和推理能力是主要影响因素。

Comments LREC 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27768 2026-03-31 cs.CL 57%

TailNLG: A Multilingual Benchmark Addressing Verbalization of Long-Tail Entities

TailNLG:一种针对长尾实体 verbalization 的多语言基准

Lia Draetta, Michael Oliverio, Virginia Ramón-Ferrer, Pier Felice Balestrucci, Flaviana Corallo, Carlos Badenes-Olmedo, Alessandro Mazzei, Marco Antonio Stranisci, Rossana Damiano

机构 * University of Turin(都灵大学) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出TailNLG基准,评估大型语言模型在长尾实体上的表现,揭示其存在偏见,强调需更可靠的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08492 2026-03-31 cs.AI 57%

Autonomous Issue Resolver: Towards Zero-Touch Code Maintenance

自主问题解决者:迈向零接触代码维护

Aliaksei Kaliutau

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 RAG评测 :RAG(abstract);分类 cs.AI

AI总结 本文提出基于数据转换图的新型方法,通过数据状态节点和函数边的拓扑结构,解决传统代码属性图的控制流逻辑缺陷,实现数据完整性导航与控制流逻辑的统一,提升代码修复效率。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏