arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1199 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1199 篇

2502.13465 2025-09-25 cs.IR cs.AI cs.CL 82%

HawkBench: Investigating Resilience of RAG Methods on Stratified Information-Seeking Tasks

Hongjin Qian, Zheng Liu, Chao Gao, Yankai Wang, Defu Lian, Zhicheng Dou

机构 * Peking University(北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) University of Science and Technology of China(中国科学技术大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 RAG评测 :RAG(title,abstract);分类 cs.IR、cs.CL、cs.AI

Comments Neurips 25 DB Track, Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18869 2025-09-24 cs.DC 82%

On The Reproducibility Limitations of RAG Systems

Baiqiang Wang, Dongfang Zhao, Nathan R Tallent, Luanzheng Guo

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04125 2025-08-20 cs.SE cs.CR cs.LG 82%

VulScribeR: Exploring RAG-based Vulnerability Augmentation with LLMs

Seyed Shayan Daneshvar, Yu Nong, Xu Yang, Shaowei Wang, Haipeng Cai

机构 * University of Manitoba(曼尼托巴大学) Washington State University(华盛顿州立大学) University at Buffalo(布法罗大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract)

Comments Accepted by TOSEM; 26 pages, 6 figures, 8 tables, 3 prompt templates, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17347 2025-05-05 cs.SE cs.HC 82%

InspectorRAGet: An Introspection Platform for RAG Evaluation

Kshitij Fadnis, Siva Sankalp Patel, Odellia Boni, Yannis Katsis, Sara Rosenthal, Benjamin Sznajder, Marina Danilevsky

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract)

Comments Published at NAACL2025 Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00105 2025-05-02 cs.IR cs.CL cs.DB 82%

Optimization of embeddings storage for RAG systems using quantization and dimensionality reduction techniques

Naamán Huerga-Pérez, Rubén Álvarez, Rubén Ferrero-Guillén, Alberto Martínez-Gutiérrez, Javier Díez-González

机构 * Department of Mechanical, Computer and Aerospace Engineering(机械、计算机和航空航天工程系)

专题命中 RAG评测 :RAG(title);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.DB

Comments 13 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16883 2025-04-24 cs.HC 82%

Enhancing Critical Thinking with AI: A Tailored Warning System for RAG Models

Xuyang Zhu, Sejoon Chang, Andrew Kuik

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments Presented at the 2025 ACM Workshop on Human-AI Interaction for Augmented Reasoning

Journal ref Proceedings of the 2025 ACM CHI Workshop on Human-AI Interaction for Augmented Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13769 2025-04-21 cs.SE 82%

Detecting Malicious Source Code in PyPI Packages with LLMs: Does RAG Come in Handy?

Motunrayo Ibiyo, Thinakone Louangdy, Phuong T. Nguyen, Claudio Di Sipio, Davide Di Ruscio

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments The paper has been peer-reviewed and accepted for publication to the 29th International Conference on Evaluation and Assessment in Software Engineering (EASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09593 2025-04-18 cs.CR cs.LG 82%

ControlNET: A Firewall for RAG-based LLM System

Hongwei Yao, Haoran Shi, Yidou Chen, Yixin Jiang, Cong Wang, Zhan Qin

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments Project Page: https://ai.zjuicsr.cn/firewall

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21157 2025-04-08 cs.LG 82%

Real-Time Evaluation Models for RAG: Who Detects Hallucinations Best?

Ashish Sardana

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16444 2025-04-07 cs.LG 82%

CacheBlend: Fast Large Language Model Serving for RAG with Cached Knowledge Fusion

Jiayi Yao, Hanchen Li, Yuhan Liu, Siddhant Ray, Yihua Cheng, Qizheng Zhang, Kuntai Du, Shan Lu, Junchen Jiang

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05782 2025-02-11 cs.SE 82%

Quality Assurance for LLM-RAG Systems: Empirical Insights from Tourism Application Testing

Bestoun S. Ahmed, Ludwig Otto Baader, Firas Bayram, Siri Jagstedt, Peter Magnusson

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04476 2024-11-08 cs.LG 82%

LLM-R: A Framework for Domain-Adaptive Maintenance Scheme Generation Combining Hierarchical Agents and RAG

Laifa Tao, Qixuan Huang, Xianjun Wu, Weiwei Zhang, Yunlong Wu, Bin Li, Chen Lu, Xingshuo Hai

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract)

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06272 2024-08-13 cs.CR 82%

A RAG-Based Question-Answering Solution for Cyber-Attack Investigation and Attribution

Sampath Rajapaksha, Ruby Rani, Erisa Karafili

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract)

Comments Accepted at SECAI 2024 (ESORICS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09037 2026-08-03 cs.AI cs.MA 版本更新 81%

A Multi-Agent System for Motor Design Optimization via an FEA-AI Hybrid Approach

基于FEA-AI混合方法的IPMSM设计优化多智能体系统

Jinseong Han, Sunwoong Yang, Namwoo Kang

机构 * Cho Chun Shik Graduate School of Mobility, KAIST(KAIST Cho Chun Shik 移动研究生院) Department of Mechanical Engineering, Hanyang University(汉阳大学机械工程系) Narnia Labs

专题命中 RAG评测 :RAG(summary_cn,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出一种端到端自动化IPMSM设计优化框架,通过RAG结构化问题定义与不确定性感知的FEA-AI混合优化流水线,平衡计算成本与预测可靠性,在同等FEA预算下优于纯FEA或纯AI方法。

Comments 37 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14040 2026-07-16 cs.CL 新提交 81%

Can an Old Dog Be Taught New Tricks? Taking LLMs Beyond Sentence Level Translation

老狗能学新把戏吗?让大语言模型超越句子级翻译

Alaina Brandt

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 探讨能否让大语言模型超越逐句翻译范式,提出基于RAG的PAT系统,通过与语料库结合让大语言模型进行全文翻译生成草稿,经评估发现其能朝重新表述发展,但提升重新表述有效性仍需更多工作,还讨论了相关设计与评估等要点。

Comments Accepted for publication in HCI International 2026, Late Breaking Papers Proceedings, Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09322 2026-07-14 cs.AI 版本更新 81%

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

LongMedBench:用于长期临床决策的医疗智能体基准测试

Zihan Xu, Yanzhen Chen, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Transvascular Implantation Devices Research Institute(血管内植入装置研究所)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 介绍基于EHR的LongMedBench基准,用于长期临床决策。构建含多患者多事件数据集,提出评估分类法。实验表明大语言模型在隐式时间推理有挑战,RAG和智能体记忆系统对信息检索有帮助,决策任务性能依赖模型即时上下文。

Comments Submitted manuscript prior to peer review in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29914 2026-06-30 cs.CL cs.LG 81%

MemDelta: Controlled Baselines and Hidden Confounds in Agent Memory Evaluation

MemDelta:智能体记忆评估中的受控基线和隐藏混杂因素

Kuan Wang

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 提出MemDelta控制评估协议,通过逐一改变组件发现RAG与全上下文基线排名因模型而异,嵌入模型切换可翻转结论,智能体自记忆不如基本检索,建议固定嵌入模型并分层报告。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04109 2026-06-09 cs.CL 版本更新 81%

Discourse-Role Labels as Presentation-Time Variables for Context Use in Language Models

话语角色标签作为语言模型上下文使用的呈现时间变量

Jianguo Zhu, Xiangmei Li, Wenjie Liu

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 通过固定内容探针实验,研究不同话语角色标签(如Instruction、Reference、Example)如何影响语言模型对误导信息的采纳率,发现标签可导致采纳率变化56-84个百分点,并建议上下文利用和RAG基准应报告和控制包装标签。

Comments Revised version with updated author information, added clean baselines, clarified evaluation metrics, and tightened discussion of context-augmented settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28508 2026-06-02 cs.AI 81%

Benchmarking AI for low-resource contexts: Thinking beyond leaderboards

低资源场景下的AI基准测试:超越排行榜的思考

Aakash Pant, Kavya Shah, Apoorv Agnihotri, Sneha Nikam, Prasaanth Balraj, Nakul Jain

机构 * Wadhwani AI Global(Wadhwani AI全球)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 本文通过分析语音、聊天/RAG和视觉系统的基准测试,指出实验室评估与低资源环境部署之间的差距,提出以部署系统为评估单位,并整合任务性能与噪声输入、代码切换等部署条件,同时为不同应用类制定差异化评估框架,最后建议标准化报告工具以支持决策。

Comments Aakash Pant, Kavya Shah, and Apoorv Agnihotri contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09986 2026-05-28 stat.ML cs.CL cs.LG 81%

Federated Language Models Under Bandwidth Budgets: Distillation Rates and Conformal Coverage

带宽预算下的联邦语言模型:蒸馏率与共形覆盖

Prasanjit Dubey, Xiaoming Huo

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H. Milton Stewart工业与系统工程学院,佐治亚理工学院)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本文研究带宽受限节点间分布式语言模型的统计保证,提出联邦探针-对数蒸馏(FPLD)和联邦共形RAG(FC-RAG)两种协议,分别给出训练时的KL一致性率和推理时的无分布边际覆盖界,首次将带宽作为一阶统计参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17943 2026-05-28 cs.CL 81%

A Benchmark Construction and Evaluation Framework for Specialist Domains: Case Study on Defense-related Documents

专业领域基准构建与评估框架:以国防相关文档为例

Bao Gia Doan, Aditya Joshi, Pantelis Elinas, Aarya Bodhankar, Oscar Leslie, Tom Marchant, Flora Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Cyndr AI

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 提出DoRA框架,通过合成数据生成和双LLM流水线解决专业领域RAG问答的冷启动问题,在国防文档上显著减少幻觉并提升覆盖率和忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21063 2026-05-21 cs.CL 81%

APM: Evaluating Style Personalization in LLMs with Arbitrary Preference Mappings

APM:通过任意偏好映射评估大语言模型中的风格个性化

Philipp Spohn, Leander Girrbach, Zeynep Akata

机构 * Technical University of Munich, Helmholtz Munich(慕尼黑技术大学,亥姆霍兹慕尼黑) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本研究提出APM基准,通过隐式偏好映射评估大语言模型的风格个性化能力,发现路由方法是最可靠的方法,而RAG和软提示优化在强基础模型上才有提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06850 2026-05-12 cs.CR cs.AI 81%

The Dark Side of LLMs: Agent-based Attack Vectors for System-level Compromise

大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵

Matteo Lupinacci, Francesco Aurelio Pironti, Francesco Blefari, Francesco Romeo, Luigi Arena, Angelo Furfaro

机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25931 2026-04-30 cs.CL 81%

Anchored Confabulation: Partial Evidence Non-Monotonically Amplifies Confident Hallucination in LLMs

锚定编造:部分证据非单调放大LLM中的自信幻觉

Ashish Balkishan Lathkar

机构 * Florida State University(佛罗里达州立大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中一种新校准特性:提供一个确认的中间事实可非单调放大自信错误答案率。通过六个证据线证明了参数幻觉信心(PHC)概念,并在RAG路由中应用,显著提升性能。

Comments 62 pages, 5 figures. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20303 2026-04-29 cs.CL 81%

Citation Failure: Definition, Analysis and Efficient Mitigation

引用失败:定义、分析与高效缓解

Jan Buchmann, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(普遍知识处理实验室) Department of Computer Science(计算机科学系) Hessian Center for AI (hessian.AI)(黑森人工智能中心) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本文研究了LLM基于RAG系统的引用失败问题,提出CITECONTROL基准以分析失败模式,并通过CITENTION框架提升引用效率。

Comments Accepted to TACL in April 2024. Paper repository: https://github.com/UKPLab/tacl2026-citation-failure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15945 2026-04-20 cs.CL cs.LG 81%

RAGognizer: Hallucination-Aware Fine-Tuning via Detection Head Integration

RAGognizer: 通过检测头整合实现hallucination-aware微调

Fabian Ridder, Laurin Lessel, Malte Schilling

机构 * Computer Science Department(计算机科学系)

专题命中 RAG评测 :retrieval-augmented generation(abstract,abstract_cn);RAG(abstract,abstract_cn);分类 cs.CL

AI总结 RAGognizer通过整合轻量级检测头,实现hallucination-aware微调,提升内部状态分离性并减少生成hallucination。

Comments accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11182 2026-04-20 cs.CL 81%

Evaluating Memory Capability in Continuous Lifelog Scenario

在连续生活日志场景中评估记忆能力

Jianjie Zheng, Zhichen Liu, Zhanyu Shen, Jingxiang Qu, Guanhua Chen, Yile Wang, Yang Xu, Yang Liu, Sijie Cheng

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本文提出LifeDialBench基准,包含EgoMem和LifeMem两个子集,通过在线评估协议解决传统离线设置的时序泄漏问题,发现复杂记忆系统不如简单RAG基线表现,强调高保真上下文保存的重要性。

Comments 27 pages, 7 figures. ACL 2026 Findings camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01431 2026-07-03 cs.CL cs.AI 新提交 81%

IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs

IsoSci: 用于评估LLM中推理与知识检索的同构跨域科学问题基准

Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 RAG评测 :knowledge retrieval(title,abstract);分类 cs.CL、cs.AI

AI总结 提出IsoSci基准,通过逻辑结构相同但领域知识不同的科学问题对,分离推理能力与领域知识检索,发现91.3%的推理增益依赖于知识而非结构,挑战了思维链推理提升科学问题解决的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23915 2026-06-24 cs.CL cs.IR cs.LG 新提交 81%

Do LLM Attribution Metrics Transfer? Auditing Retrieval-Augmented Generation Evaluation Across Datasets and Constructs

LLM归因指标是否可迁移?跨数据集和构念的检索增强生成评估审计

Tianyu Ding, Aditya Nannapaneni, Juan Pablo De la Cruz Weinstein

机构 * Amazon Web Services(亚马逊云服务)

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);分类 cs.IR、cs.CL

AI总结 本研究审计了八种自动归因评分器在三个评估构念上的表现,发现没有评分器能在所有数据集上保持最佳性能,指标排名会反转,且简单选择最佳平均评分器会导致显著遗憾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05467 2026-04-08 cs.IR cs.CL cs.LG 81%

CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation

CUE-R:超越检索增强生成的最终答案

Siddharth Jain, Venkat Narayan Vedam

机构 * Intuit

专题命中 RAG评测 :retrieval-augmented generation(title);RAG(abstract);分类 cs.IR、cs.CL

AI总结 CUE-R通过干预基于证据项的检索使用痕迹,评估单次检索增强生成中每个证据项的操作效用,揭示证据项对正确性、基础忠实度和置信度误差的影响。

Comments 6 figures, 14 tables; appendix includes bootstrap CIs, metric definitions, duplicate position sensitivity, prompt template, and reproducibility details

详情

展开后加载摘要…

URL PDF HTML 收藏