arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-08-18 至 2026-08-18 共收录 8 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 8 篇

2605.18490 2026-08-18 cs.CL cs.IR 版本更新 90%

Single-Round Vector RAG vs an LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research Corpus

向量RAG与LLM编写的维基:在小型多领域研究上的预注册比较

Theodore O. Cochran

机构 * AI for Altruism (A4A)(AI为利他主义(A4A))

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.IR、cs.CL

AI总结 本文通过预注册比较,研究了向量RAG系统与LLM编写的维基在小型多领域研究中的表现,发现两者在跨论文连接、答案组织和成本等方面各有优劣,没有单一系统在所有指标上最优。

Comments v2: two-judge reanalysis of the decomposition-RAG ablation (groundedness advantage +1.15 to +0.15); H3a adjudicated; one registered-plan deviation disclosed; artifact deposit at this http URL (http://osf.io/j37b8;) title corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16776 2026-08-18 cs.AI 新提交 84%

GRIP: Grounded Reasoning via Information-Restricted Premises

GRIP:基于信息受限前提的接地推理

Lirui Teng

机构 * University of Waterloo(滑铁卢大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 针对RAG中查询主导导致证据失效的问题,提出GRIP方法,通过容量不对称设计优化信息编码,在五个推理基准上实现性能提升,大幅降低互信息与幻觉。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16775 2026-08-18 cs.CR cs.AI 新提交 83%

Topological Attribution Distance (TAD): Revealing Segment-Level RAG Influence on LLM Output Geometry for Incident Log Analysis

拓扑归因距离(TAD):揭示用于事件日志分析的RAG片段级影响对LLM输出几何的作用

Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.AI

AI总结 该研究针对LLM在网络安全应用中证据归因追踪的缺口,提出拓扑归因距离(TAD)方法,可自适应识别对LLM输出关键的事件日志,为证据验证提供可解释追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02763 2026-08-18 cs.CL cs.AI cs.CY 版本更新 79%

Bye-bye, Bluebook? Automating Legal Drudgery With AI-Augmented Rule Following

再见,蓝皮书?用AI辅助规则遵循实现法律苦差事自动化

Matthew Dahl, Eric Martínez

机构 * Yale Law School(耶鲁法学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对法律AI在《蓝皮书》引文格式任务的表现,构建了新基准,提出神经符号系统方法使准确率提升32.4个百分点至最高85.5%,指出AI与符号规则引擎结合是可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14588 2026-08-18 cs.AI cs.CL cs.MA 新提交 73%

The Hallucination Snowball: Modeling Error Propagation as State Transitions in Multi-Agent LLM Pipelines

幻觉滚雪球:将多智能体大语言模型流水线中的错误传播建模为状态转移

Prabhjot Singh, Bhushan Pawar

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究发现多智能体LLM流水线中存在幻觉滚雪球效应,即幻觉会随状态转移而逃逸,且边界门控验证比末端检查更能有效降低幻觉存活率,还提出了最优验证资源分配策略。

Comments 10 pages, 3 figures; accepted at the FAGEN Workshop (Failure Modes in Agentic AI), ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16286 2026-08-18 cs.CL 新提交 70%

Clause Encounters of the Third Kind: Can LLMs Replace Language Teachers?

条款式的第三类接触:大型语言模型能否替代语言教师?

Kristina Šekrst, Ana Kovačić

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract_cn);分类 cs.CL

AI总结 该研究评估了LLM替代语言教师提供教学反馈与解释的能力,发现其纠错能力出色但教学解释不足,AI辅助语言学习热情或超出对其教学能力的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02473 2026-08-18 cs.DB 版本更新 70%

FDABench: A Benchmark for Data Agents on Analytical Queries over Heterogeneous Data

FDABench:异构数据上分析查询的数据代理基准

Ziting Wang, Shize Zhang, Haitao Yuan, Jinwei Zhu, Wei Dong, Gao Cong

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.DB

AI总结 提出FDABench基准,通过2007个任务覆盖六种数据模态,并设计PUDDING框架自动构建数据集,以评估数据代理在异构数据上的推理能力。

Comments Accepted to KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16586 2026-08-18 cs.IR 新提交 57%

When Is Complex Chunking Worth It? A Multi-Objective Evaluation of Chunking Methods at Scale

复杂分块何时值得?大规模分块方法的多目标评估

Laura Caspari, Kanishka Ghosh Dastidar, Michael Dinzinger, Jelena Mitrović, Michael Granitzer

专题命中 RAG评测 :dense retrieval(abstract);分类 cs.IR

AI总结 该研究针对长文档分块的多目标评估问题,在多语料库、多模型下对比八种分块策略,发现分块需兼顾检索性能与系统成本,应作为多目标设计决策。

详情

展开后加载摘要…

URL PDF HTML 收藏