arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-05-12 至 2026-05-12 共收录 42 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 图谱与结构化RAG 3 篇

2605.10529 2026-05-12 cs.AI cs.LG 70%

PrimeKG-CL: A Continual Graph Learning Benchmark on Evolving Biomedical Knowledge Graphs

PrimeKG-CL:一个在演进生物医学知识图谱上的持续图学习基准

Yousef A. Radwan, Yao Li, Qing Qing, Ziqi Xu, Xingtong Yu, Jiaxing Huang, Renqiang Luo, Xikun Zhang

机构 * Technology, Innovation, Entrepreneurship Department(技术、创新与创业系) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学) School of Computing and Information Systems(计算与信息系) The University of Melbourne(墨尔本大学) College of Computer Science and Technology(计算机科学与技术学院) School of Computing Technologies(计算技术学院) Jilin University(吉林大学) RMIT University(皇家墨尔本理工大学) Department of Systems Engineering and Engineering Management(系统工程与工程管理系) The Chinese University of Hong Kong(香港中文大学) Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Hong Kong Polytechnic University(香港理工大学)

专题命中 图谱与结构化RAG :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出PrimeKG-CL基准,基于九个权威生物医学数据库构建,包含时间快照、任务和多模态特征,评估六种持续学习策略在不同解码器上的性能,发现解码器选择和策略交互显著,仅DistMult能区分持久与过时知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09304 2026-05-12 cs.SE cs.HC 67%

Generating Complex Code Analyzers from Natural Language Questions

从自然语言问题生成复杂代码分析器

Amirmohammad Nazari, Sadra Sabouri, Wang Bill Zhu, Robin Jia, Souti Chattopadhyay, Mukund Raghothaman

专题命中 图谱与结构化RAG :RAG(abstract,abstract_cn)

AI总结 本文提出Merlin系统,通过整合LLM与CodeQL,解决复杂代码分析问题,提升代码问题解答的准确性和效率。

Comments 12 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10791 2026-05-12 cs.AI 57%

PathISE: Learning Informative Path Supervision for Knowledge Graph Question Answering

PathISE: 通过信息路径监督学习知识图谱问答

Shengxiang Gao, Chao Lei, Jey Han Lau, Jianzhong Qi

机构 * The University of Melbourne(墨尔本大学)

专题命中 图谱与结构化RAG :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 PathISE通过学习高质量的中间监督信号提升知识图谱问答性能,利用轻量级Transformer估计关系路径信息,生成可复用的监督信号以增强现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态RAG 1 篇

2605.10253 2026-05-12 cs.CR cs.AI 89%

Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation

针对医疗多模态检索增强生成的知识污染攻击

Peiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang, Tao Qi

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract);分类 cs.AI

AI总结 本文提出M³Att框架,针对医疗多模态RAG系统,通过在文本数据中注入隐蔽虚假信息并利用配对视觉数据作为查询无关触发器,提升检索概率,从而在不依赖用户查询先验知识的情况下实现知识污染攻击。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. RAG评测 8 篇

2605.08838 2026-05-12 cs.CL cs.AI 91%

Generating Leakage-Free Benchmarks for Robust RAG Evaluation

生成无泄漏的基准以评估鲁棒的RAG

Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) New Jersey Institute of Technology(新泽西理工学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SeedRG方法,通过半合成方式生成无知识泄漏的RAG评估基准,解决基准老化问题,确保评估的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10853 2026-05-12 cs.CL 91%

Grounded Satirical Generation with RAG

基于RAG的 grounded 愚笑生成

Oona Itkonen, Yuxin Su, Linyao Du, Ona De Gibert

机构 * University of Helsinki(赫尔辛基大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出基于RAG的 grounded 愚笑生成方法,通过当前新闻检索生成芬兰语讽刺词典定义,并引入任务特定评估框架,分析文化背景、源词类型及RAG存在与否对输出的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08385 2026-05-12 cs.CR 88%

Quantifiable Uncertainty: A Stochastic Consensus Multi-Agent RAG Framework for Robust Malware Detection

可量化不确定性:一种随机一致性多智能体RAG框架用于鲁棒恶意软件检测

ElMouatez Billah Karbab

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 本文提出MAGMA框架,通过语义代码检索与概率验证分离恶意软件分析,引入随机一致性集合和两个互补指标,提升恶意软件检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 85%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01532 2026-05-12 cs.AI 77%

PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools

PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现

Tianjun Feng, Yunfeng Chen, Chun-Yi Tsai, Yihan Sun, Ayan Das, Kaoutar El Maghraoui, Shuxin Lin, Dhaval Patel

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) IBM, New York(IBM,纽约)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08581 2026-05-12 cs.LG 75%

PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design

PRISM: 通过调度-内存协同设计实现快速在线LLM服务

Xingyu Qu, Tianhao Lin, Yiqi Li, Zhiyu Chen, Sheng Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 PRISM通过协同设计调度与内存管理,优化LLM服务响应时间,减少TTFT并提升缓存命中率。

Comments 25 pages, 9 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08462 2026-05-12 cs.CL cs.AI 73%

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan

机构 * Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系) Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文通过比较原始基准标注与Gemini 2.5 Flash和GPT-5 Mini的推理和跨度预测,评估了摘要任务中上下文幻觉检测的准确性,并发现人类仲裁提高了三重一致性和模型准确性。

Comments Presented at the ROMCIR Workshop at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02372 2026-05-12 cs.CR cs.AI cs.SE 70%

Scam2Prompt: A Scalable Framework for Auditing Malicious Scam Endpoints in Production LLMs

Scam2Prompt: 一种可扩展的框架,用于审计生产LLM中的恶意诈骗端点

Zhiyang Chen, Tara Saba, Xun Deng, Xujie Si, Fan Long

机构 * OpenAI

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 Scam2Prompt通过生成开发者风格提示来测试LLM生成恶意代码的能力,发现4.24%的LLM会生成恶意URL,且在2025年发布的七种LLM中,恶意代码生成率高达12.9%-47.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏