arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-05-22 至 2026-05-22 共收录 3 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 3 篇

2603.27355 2026-05-22 cs.AI cs.CL cs.SE 90%

LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications

LLM Readiness Harness: 评估、可观测性和持续集成门禁用于LLM/RAG应用

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出了一种LLM和RAG应用的准备性框架,通过自动化基准测试、OpenTelemetry可观测性和持续集成质量门禁,将评估转化为部署决策流程,并通过帕累托前沿计算场景加权的准备度分数,展示了在票务路由工作流和BEIR接地任务上的评估结果。

Comments 19 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21821 2026-05-22 cs.AI 77%

PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving

PHYSICS:在大学物理问题求解中基准测试基础模型

Kaiyue Feng, Yilun Zhao, Yixin Liu, Tianyu Yang, Chen Zhao, John Sous, Arman Cohan

机构 * Yale University(耶鲁大学) New York University(纽约大学) Notre Dame University(诺特丹大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出PHYSICS基准测试,用于评估大学水平物理问题求解能力,包含1297个专家标注的问题,涵盖六个核心领域,并通过自动化评估系统揭示了领先基础模型的显著局限性。

Journal ref Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22734 2026-05-22 cs.CL 70%

ChronoMedKG: A Temporally-Grounded Biomedical Knowledge Graph and Benchmark for Clinical Reasoning

ChronoMedKG:一个具有时间基础的生物医学知识图谱和用于临床推理的基准

Md Shamim Ahmed, Farzaneh Firoozbakht, Lukas Galke Poech, Jan Baumbach, Richard Röttger

机构 * University of Southern Denmark(丹麦南部大学) University of Hamburg(汉堡大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出ChronoMedKG,一个包含460,497个证据链接三元组的生物医学知识图谱,覆盖13,431种疾病,通过时间组件如发病窗口或进展阶段,为临床推理提供时间基础,并引入ChronoTQA基准测试,验证了其在时间推理任务中的有效性。

Comments 9 pages main text plus appendices, 8 figures. Dataset and benchmark paper. ChronoMedKG released under CC BY 4.0 and ChronoTQA/code under MIT (Zenodo: 10.5281/zenodo.19697542). Under review

详情

展开后加载摘要…

URL PDF HTML 收藏