arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-05-12 至 2026-05-12 共收录 8 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 8 篇

2605.08838 2026-05-12 cs.CL cs.AI 91%

Generating Leakage-Free Benchmarks for Robust RAG Evaluation

生成无泄漏的基准以评估鲁棒的RAG

Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) New Jersey Institute of Technology(新泽西理工学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SeedRG方法,通过半合成方式生成无知识泄漏的RAG评估基准,解决基准老化问题,确保评估的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10853 2026-05-12 cs.CL 91%

Grounded Satirical Generation with RAG

基于RAG的 grounded 愚笑生成

Oona Itkonen, Yuxin Su, Linyao Du, Ona De Gibert

机构 * University of Helsinki(赫尔辛基大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出基于RAG的 grounded 愚笑生成方法,通过当前新闻检索生成芬兰语讽刺词典定义,并引入任务特定评估框架,分析文化背景、源词类型及RAG存在与否对输出的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08385 2026-05-12 cs.CR 88%

Quantifiable Uncertainty: A Stochastic Consensus Multi-Agent RAG Framework for Robust Malware Detection

可量化不确定性:一种随机一致性多智能体RAG框架用于鲁棒恶意软件检测

ElMouatez Billah Karbab

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 本文提出MAGMA框架,通过语义代码检索与概率验证分离恶意软件分析,引入随机一致性集合和两个互补指标,提升恶意软件检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 85%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01532 2026-05-12 cs.AI 77%

PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools

PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现

Tianjun Feng, Yunfeng Chen, Chun-Yi Tsai, Yihan Sun, Ayan Das, Kaoutar El Maghraoui, Shuxin Lin, Dhaval Patel

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) IBM, New York(IBM,纽约)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08581 2026-05-12 cs.LG 75%

PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design

PRISM: 通过调度-内存协同设计实现快速在线LLM服务

Xingyu Qu, Tianhao Lin, Yiqi Li, Zhiyu Chen, Sheng Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 PRISM通过协同设计调度与内存管理,优化LLM服务响应时间,减少TTFT并提升缓存命中率。

Comments 25 pages, 9 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08462 2026-05-12 cs.CL cs.AI 73%

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan

机构 * Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系) Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过比较原始基准标注与Gemini 2.5 Flash和GPT-5 Mini的推理和跨度预测,评估了摘要任务中上下文幻觉检测的准确性,并发现人类仲裁提高了三重一致性和模型准确性。

Comments Presented at the ROMCIR Workshop at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02372 2026-05-12 cs.CR cs.AI cs.SE 70%

Scam2Prompt: A Scalable Framework for Auditing Malicious Scam Endpoints in Production LLMs

Scam2Prompt: 一种可扩展的框架,用于审计生产LLM中的恶意诈骗端点

Zhiyang Chen, Tara Saba, Xun Deng, Xujie Si, Fan Long

机构 * OpenAI

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 Scam2Prompt通过生成开发者风格提示来测试LLM生成恶意代码的能力,发现4.24%的LLM会生成恶意URL,且在2025年发布的七种LLM中,恶意代码生成率高达12.9%-47.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏