arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-07-03 至 2026-07-03 共收录 5 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 5 篇

2602.19127 2026-07-03 cs.CL 版本更新 90%

AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准

Qijie You, Wenkai Yu, Wentao Zhang

机构 * University of Science and Technology Beijing(北京科技大学) Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL

AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01431 2026-07-03 cs.CL cs.AI 新提交 81%

IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs

IsoSci: 用于评估LLM中推理与知识检索的同构跨域科学问题基准

Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 RAG评测 :knowledge retrieval(title,abstract);分类 cs.CL、cs.AI

AI总结 提出IsoSci基准,通过逻辑结构相同但领域知识不同的科学问题对,分离推理能力与领域知识检索,发现91.3%的推理增益依赖于知识而非结构,挑战了思维链推理提升科学问题解决的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01846 2026-07-03 cs.AI 新提交 70%

CLAP: Closed-Loop Training, Evaluation, and Release Control for Domain Agent Post-training

CLAP:领域智能体后训练的闭环训练、评估与发布控制

Fangfei Li, Chenyang Zhao, Long Wang, Feng Tian, Zhiyue Zheng, Lv Guo

机构 * MatrixOrigin(矩阵起源)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 提出CLAP闭环方法,通过数据验证、奖励/KL诊断、离线门控和应用链回放,在制造场景中评估后训练效果,发现仅部分批次提升且存在KL风险,支持集成循环管理。

Comments 6 pages, 1 figure. Accepted to CRAE 2026; to appear in SPIE Proceedings. Best Poster Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28208 2026-07-03 cs.AR cs.ET 版本更新 67%

FCDC: Nonvolatile Charge-Domain Attention with HZO Ferroelectric Capacitors

基于HZO铁电电容的非易失性电荷域注意力机制:从器件到系统的仿真评估

Fares Abouagor

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract_cn)

AI总结 提出铁电电荷域计算单元(FCDC),利用HZO忆电容器实现非易失性模拟存储和电荷域向量矩阵乘法,用于Transformer注意力机制,通过器件到系统仿真评估两种部署模式,在多种大语言模型上验证了低功耗和精度保持。

Comments 28 pages, 7 figures. Code: https://github.com/faris-agour/FCDC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09517 2026-07-03 cs.CL 版本更新 57%

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

StatEval:大型语言模型在统计学中的综合基准

Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu, Ziwei Wang, Jiayi Xiang, Wenxin E, Changyu Zhu, Fan Zhou

机构 * Shanghai University of Finance and Economics(上海财经大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏