arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-04-21 至 2026-04-21 共收录 7 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 7 篇

2604.16310 2026-04-21 cs.IR cs.AI cs.CL 93%

RAG-DIVE: A Dynamic Approach for Multi-Turn Dialogue Evaluation in Retrieval-Augmented Generation

RAG-DIVE: 多轮对话中检索增强生成系统动态评估方法

Lorenz Brehme, Benedikt Dornauer, Jan-Henrik Böttcher, Klaus Schmid, Mircea-Cristian Racasan, Ruth Breu

机构 * University of Innsbruck(因斯布鲁克大学) University of Hildesheim(希尔德斯海姆大学) c.c.com Moser GmbH(c.c.com Moser公司)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(title,abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 RAG-DIVE通过动态模拟用户交互,评估多轮对话中检索增强生成系统的动态性能,提出对话生成、验证和评估三个核心组件,验证了其在动态交互中的有效性。

Comments Accepted for publication at CAIN 2026 (5th International Conference on AI Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07711 2026-04-21 cs.CL 91%

Is Agentic RAG worth it? An experimental comparison of RAG approaches

代理RAG值得吗?RAG方法的实验比较

Pietro Ferrazzi, Milica Cvjeticanin, Alessio Piraccini, Davide Giannuzzi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Padova(帕多瓦大学) Cargill Geneve(卡吉尔日内夫) Alkemy(阿尔凯米) Komebi Studio(科梅比工作室)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文通过多场景多维度实验比较了增强型和代理型RAG方法,揭示了两者在性能与成本上的权衡,为实际应用提供选择指导。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17778 2026-04-21 cs.LG 88%

TeleEmbedBench: A Multi-Corpus Embedding Benchmark for RAG in Telecommunications

TeleEmbedBench: 一种面向电信领域的多语料嵌入基准

Pranshav Gajjar, Vijay K Shah

机构 * NextG Wireless Lab, North Carolina State University, Raleigh, USA(NextG无线实验室,北卡罗来纳州立大学,拉斐特,美国)

专题命中 RAG评测 :RAG(title,summary_cn);retrieval-augmented generation(abstract)

AI总结 本文提出TeleEmbedBench,首个针对电信领域RAG任务的多语料嵌入基准,评估八种嵌入模型在检索准确性和抗跨域干扰能力上的表现,发现LLM嵌入器性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17340 2026-04-21 cs.CL 77%

Neuro-Symbolic Resolution of Recommendation Conflicts in Multimorbidity Clinical Guidelines

神经符号推荐冲突在多病共存临床指南中的解决

Shiyao Xie, Jian Du

机构 * Peking University(北京大学) National Institute of Health Data Science(国家健康数据科学研究院) Peking University Health Science Center(北京大学医学部) Institute of Medical Technology(医学技术研究院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出神经符号框架解决多病共存临床指南中的推荐冲突问题,通过多智能体系统和SAT求解器验证逻辑规则,发现90.6%的冲突为局部冲突,F1分数达0.861。

Comments Accepted by Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (Bridge Program on Logic & AI: Logical and Symbolic Reasoning in Language Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03793 2026-04-21 cs.CL cs.CR 77%

AttnTrace: Contextual Attribution of Prompt Injection and Knowledge Corruption

AttnTrace: 基于提示注入和知识腐败的上下文归因

Yanting Wang, Runpeng Geng, Ying Chen, Jinyuan Jia

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出AttnTrace,一种基于LLM对提示生成的注意力权重的上下文追溯方法,通过增强效果和技术改进,提高了准确性和效率,并展示了其在检测长上下文中的提示注入应用。

Comments To appear in IEEE S&P 2026. The code is available at https://github.com/Wang-Yanting/AttnTrace. The demo is available at https://huggingface.co/spaces/SecureLLMSys/AttnTrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06710 2026-04-21 cs.AI cs.IR 73%

ATANT: An Evaluation Framework for AI Continuity

ATANT:人工智能连续性的评估框架

Samuel Sameer Tanguturi

机构 * Kenotic Labs(肯otic实验室)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.AI

AI总结 本文提出ATANT框架,用于评估AI系统在时间维度上的连续性能力,通过10个检查点方法和250个故事的叙事测试集,验证系统在不同架构下的连续性表现。

Comments 7 pages, 8 tables. Framework and evaluation protocol available at https://github.com/Kenotic-Labs/ATANT and https://kenoticlabs.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17966 2026-04-21 cs.AI 70%

TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering

TPS-CalcBench: 一种用于高超音速热防护系统工程中LLM分析计算能力的基准和诊断评估框架

Jinglai Zheng, Chuhan Qiao, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学土木工程学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TPS-CalcBench,首个针对高超音速气动学和高温气体动力学中闭式解析计算的诊断基准,通过领域导向任务分类、双轨评估和人类-AI数据管道,建立安全关键工程LLM部署评估的完整诊断-评估-干预框架。

详情

展开后加载摘要…

URL PDF HTML 收藏