arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-04-28 至 2026-04-28 共收录 9 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 9 篇

2604.23563 2026-04-28 cs.CR cs.AI cs.IR 91%

CyberCane: Neuro-Symbolic RAG for Privacy-Preserving Phishing Detection with Formal Ontology Reasoning

CyberCane:基于形式本体推理的隐私保护钓鱼检测神经符号RAG

Safayat Bin Hakim, Aniqa Afzal, Qi Zhao, Vigna Majmundar, Pawel Sloboda, Houbing Herbert Song

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Bowie State University(鲍威州立大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 CyberCane结合确定性符号分析与隐私保护RAG,通过形式本体推理实现高召回率的钓鱼检测,在隐私保护和抗AI攻击方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20324 2026-04-28 cs.CL 87%

Can Compact Language Models Search Like Agents? Distillation-Guided Policy Optimization for Preserving Agentic RAG Capabilities

紧凑语言模型能否像智能体一样搜索?基于知识增强的策略优化以保持智能体RAG能力

Rikuto Kotoge, Mai Nishimura, Jiaxin Ma

机构 * The University of Osaka(大阪大学) OMRON SINIC X Corporation(OMRON SINIC X公司)

专题命中 RAG评测 :RAG(title,title_cn);分类 cs.CL

AI总结 本文提出Distillation-Guided Policy Optimization方法,通过教师示范初始化和持续教师指导,使紧凑模型实现复杂的智能体搜索行为,甚至在某些情况下超越大模型。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24473 2026-04-28 cs.AI cs.CL 79%

Agentic clinical reasoning over longitudinal myeloma records: a retrospective evaluation against expert consensus

基于纵向骨髓瘤记录的代理临床推理:一项回顾性评估与专家共识的对比

Johannes Moll, Jannik Lübberstedt, Christoph Nuernbergk, Jacob Stroh, Luisa Mertens, Anna Purcarea, Christopher Zirn, Zeineb Benchaaben, Fabian Drexel, Hartmut Häntze, Anirudh Narayanan, Friedrich Puttkammer, Andrei Zhukov, Jacqueline Lammert, Sebastian Ziegelmayer, Markus Graf, Marion Högner, Marcus Makowski, Florian Bassermann, Lisa C. Adams, Jiazhen Pan, Daniel Rueckert, Krischan Braitsch, Keno K. Bressem

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与健康中的研究所,慕尼黑技术大学(TUM)及慕尼黑技术大学医院) Department of Diagnostic and Interventional Radiology, Klinikum rechts der Isar, TUM University Hospital, School of Medicine and Health, Technical University of Munich(诊断与介入放射科,莱茵河右岸医院,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学) Department of Cardiovascular Radiology and Nuclear Medicine, German Heart Center, TUM University Hospital, School of Medicine and Health, Technical University of Munich(心血管放射学与核医学科,德国心脏中心,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学) Department of Medicine III, Klinikum rechts der Isar, TUM University Hospital, School of Medicine and Health, Technical University of Munich(第三医学部,莱茵河右岸医院,慕尼黑技术大学医院,医学与健康学院,慕尼黑技术大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了代理推理系统在骨髓瘤长期记录中的表现,发现其在复杂问题和长记录中优于传统方法,但需进一步验证以确保临床应用的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16518 2026-04-28 cs.CL cs.AI 79%

CUB: Benchmarking Context Utilisation Techniques for Language Models

CUB:语言模型上下文利用技术的基准测试

Lovisa Hagström, Youna Kim, Haeun Yu, Sang-goo Lee, Richard Johansson, Hyunsoo Cho, Isabelle Augenstein

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Seoul National University(首尔国立大学) University of Copenhagen(哥本哈根大学) Ewha Womans University(成均馆大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CUB基准,用于评估语言模型在不同噪声上下文下的上下文利用技术,发现现有方法在真实场景中存在不足,需更全面的测试。

Comments Accepted at ACL 2026, 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13071 2026-04-28 cs.CL cs.AI 73%

EVE: A Domain-Specific LLM Framework for Earth Intelligence

EVE:面向地球智能的领域专用LLM框架

Àlex R. Atrio, Antonio Lopez, Jino Rohit, Yassine El Ouahidi, Marcello Politi, Vijayasri Iyer, Umar Jamil, Sébastien Bratières, Nicolas Longépé

机构 * Pi School(Pi学校) Mistral AI Translated ESA Φ \Phi -lab(ESA Φ实验室)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 EVE首次提出开源端到端框架,构建24B领域适应模型,在地球观测和科学基准上超越同类模型,提供系统化评估基准和生产系统,支持350名试点用户。

Comments To be published in the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13240 2026-04-28 cs.SE cs.AI cs.CL cs.LG 73%

KOCO-BENCH: Can Large Language Models Leverage Domain Knowledge in Software Development?

KOCO-BENCH: 大型语言模型能否在软件开发中利用领域知识?

Xue Jiang, Ge Li, Jiaru Qian, Xianjie Shi, Chenjie Li, Hao Zhu, Ziyu Wang, Jielun Zhang, Zheyu Zhao, Lingwei Wu, Kechi Zhang, Jia Li, Wenpin Jiao, Zhi Jin, Yihong Dong

机构 * School of Computer Science, Peking University(北京大学计算机科学系) School of Computer Science, Wuhan University(武汉大学计算机科学系)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 KOCO-BENCH旨在评估大型语言模型在软件开发中利用领域知识的能力,包含6个新兴领域、11个软件框架和25个项目,通过多粒度任务测试模型的知识获取与应用能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14952 2026-04-28 cs.CL cs.AI 62%

CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning

CorpusQA:一个1000万词的语料库分析与推理基准

Zhiyuan Lu, Chenliang Li, Yingcheng Shi, Weizhou Shen, Ming Yan, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 CorpusQA提出一个1000万词的基准,解决大规模语料库推理问题,通过合成数据框架生成复杂查询,验证长文本推理能力,发现先进架构对全局信息整合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23539 2026-04-28 cs.AI 57%

MetaGAI: A Large-Scale and High-Quality Benchmark for Generative AI Model and Data Card Generation

MetaGAI:一个大规模且高质量的生成AI模型和数据卡生成基准

Haoxuan Zhang, Ruochi Li, Yang Zhang, Zhenni Liang, Junhua Ding, Ting Xiao, Haihua Chen

机构 * University of North Texas(北德克萨斯大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 RAG评测 :retriever(abstract);分类 cs.AI

AI总结 本文提出MetaGAI基准,通过语义三角化构建2541个验证文档三元组,采用多智能体框架进行评估,揭示稀疏MoE架构在成本与质量效率上的优势,为大规模评估生成模型和数据卡方法提供基础测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23285 2026-04-28 cs.NI cs.SE 50%

Towards Agentic Test-Driven Quality Assurance for 6G Networks

面向6G网络的代理驱动测试驱动质量保证

Christos Tranoris, Besiana Agko, Kostis Trantzas, Irene Denazi

专题命中 RAG评测 :knowledge retrieval(abstract)

AI总结 本文提出一个代理驱动的端到端 orchestration 框架,通过意图共创与测试驱动质量保证相结合,确保SLA合规性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏