arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1195 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1195 篇

2607.13189 2026-07-16 cs.CL cs.AI 新提交 85%

RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar

RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标

Marek Šuppa, Viktória Ondrejová, Lucia Ganajová, Gregor Karetka, Daniel Skala

机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) Cisco Systems(思科系统公司) Zaitra s.r.o.(扎伊特拉有限公司) NaiveNeuron(天真神经元)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。

Comments SemEval-2026 Task 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24902 2026-07-16 cs.CL cs.AI cs.LG 版本更新 85%

When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation

当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估

Faizan Faisal

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30062 2026-06-30 cs.CL cs.AI 85%

Little Brains, Big Feats: Exploring Compact Language Models

小脑袋,大成就:探索紧凑型语言模型

Dari Baturova, Elena Bruches, Ivan Chernov, Roman Derunets, Arsenii Fomin, Andrey Kostin

机构 * Siberian Neuronets LLC(西伯利亚神经网络有限公司)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本研究探索小型语言模型在检索增强生成(RAG)系统中的生成性能,实验表明无需GPU即可在设备上运行,并提供了基准测试结果。

Comments Accepted to ECML PKDD 2026, Applied Data Science track. Author preprint; the definitive version will appear in the proceedings of ECML PKDD 2026, Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 85%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01020 2026-05-04 cs.AI cs.CL 85%

Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics

用法律问题树准则评估法律推理轨迹

Jinu Lee, Kyoung-Woon On, Simeng Han, Arman Cohan, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) LBOX Stanford(斯坦福) Yale(耶鲁)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 LEGIT 数据集,用于评估 LLM 在法律领域推理轨迹的质量,发现法律问题覆盖度和正确性影响 LLM 推理能力,RAG 和带准则的 RL 分别提升整体能力与正确性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02208 2026-07-15 cs.CL cs.AI cs.IR cs.SE 85%

Towards AI Evaluation in Domain-Specific RAG Systems: The AgriHubi Case Study

面向领域特定RAG系统的AI评估:AgriHubi案例研究

Md. Toufique Hasan, Ayman Asad Khan, Mika Saari, Vaishnavi Bankhele, Pekka Abrahamsson

机构 * Faculty of Information Technology and Communication Sciences(信息科技与通讯科学学院)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 AgriHubi通过整合芬兰农业文档与开放模型,结合来源 grounding 和用户反馈,提升了农业决策支持系统的回答完整性、语言准确性和可靠性。

Comments 6 pages, 2 figures, submitted to MIPRO 2026

Journal ref 2026 49th MIPRO ICT and Electronics Convention (MIPRO), Opatija, Croatia, pp. 989-994

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01222 2026-06-02 eess.SP 85%

RAG-driven Multi-Agent LLM Framework with Task Decomposition for Beyond 5G Auto-Configuration

基于RAG驱动的多智能体LLM框架与任务分解的超越5G自动配置

İrşat Emin Sarıdaş, Onur Salan, Ali Görçin, Ibrahim Hokelek, Hakan Ali Çırpan

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 提出一种检索增强和任务分解的多智能体LLM框架,通过语义检索和模块化架构减少幻觉,实现超越5G网络自动配置,成功率达94.4%。

Comments 6 pages, 2 figures, accepted to International Conference on Telecommunications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25333 2026-03-27 cs.CL cs.AI cs.IR 85%

Adaptive Chunking: Optimizing Chunking-Method Selection for RAG

自适应分块:为RAG优化分块方法选择

Paulo Roberto de Moura Júnior, Jean Lelong, Annabelle Blangero

机构 * Ekimetrics

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出自适应分块框架,通过五个新指标优化分块策略,提升RAG性能,使答案正确率提升至72%,问题解答数增加30%。

Comments Accepted at LREC 2026. 10 pages, 4 figures. Code: https://github.com/ekimetrics/adaptive-chunking

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09028 2026-01-27 cs.CL cs.AI cs.IR 85%

OpenDecoder: Open Large Language Model Decoding to Incorporate Document Quality in RAG

OpenDecoder: 开源大型语言模型解码以纳入文档质量在RAG中

Fengran Mo, Zhan Su, Yuchen Hui, Jinghan Zhang, Jia Ao Sun, Zheyuan Liu, Chao Zhang, Tetsuya Sakai, Jian-Yun Nie

机构 * Clemson University(克莱姆森大学) University of Notre Dame(诺特丹大学) Georgia Institute of Technology(佐治亚理工学院) Waseda University(早稻田大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 OpenDecoder通过整合文档质量评估提升RAG模型的鲁棒性,利用相关性、排序和QPP评分优化生成过程。

Comments Accepted by ACM WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05260 2026-01-12 cs.IR cs.AI cs.CL cs.LG 85%

Quantifying Document Impact in RAG-LLMs

量化RAG-LLM中的文档影响

Armin Gerami, Kazem Faghih, Ramani Duraiswami

机构 * Department of Computer Science(计算机科学系) Umiacs University of Maryland(马里兰大学) College Park MD

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出影响评分(IS)用于量化RAG-LLM中单个文档对输出的影响,通过实验验证其有效性,提升系统透明度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07015 2025-12-29 cs.CL cs.AI cs.IR 85%

FVA-RAG: Falsification-Verification Alignment for Mitigating Sycophantic Hallucinations

FVA-RAG:通过对抗性上下文对齐缓解趋炎附势幻觉

Mayank Ravishankara

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 FVA-RAG通过引入对抗性上下文检索,有效缓解了因前提错误导致的幻觉问题,其在多个基准测试中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11654 2025-11-19 cs.IR cs.AI cs.CL 85%

FinVet: A Collaborative Framework of RAG and External Fact-Checking Agents for Financial Misinformation Detection

Daniel Berhane Araya, Duoduo Liao

机构 * College of Engineering and Computing(工程与计算学院) George Mason University(乔治·马歇尔大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04696 2025-11-10 cs.CL cs.AI cs.IR 85%

EncouRAGe: Evaluating RAG Local, Fast, and Reliable

Jan Strich, Adeline Scharfenberg, Chris Biemann, Martin Semmann

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13694 2025-10-10 cs.CL cs.AI cs.IR 85%

Multi-Source Knowledge Pruning for Retrieval-Augmented Generation: A Benchmark and Empirical Study

Shuo Yu, Mingyue Cheng, Qi Liu, Daoyu Wang, Jiqian Yang, Jie Ouyang, Yucong Luo, Chenyi Lei, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04675 2025-09-22 cs.CL cs.AI cs.IR 85%

ConfReady: A RAG based Assistant and Dataset for Conference Checklist Responses

Michael Galarnyk, Rutwik Routu, Vidhyakshaya Kannan, Kosha Bheda, Prasun Banerjee, Agam Shah, Sudheer Chava

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Sai University(赛大学)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted at EMNLP 2025 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06339 2025-06-10 cs.IR cs.AI cs.CL 85%

Optimizing RAG Pipelines for Arabic: A Systematic Analysis of Core Components

Jumana Alsubhi, Mohammad D. Alahmadi, Ahmed Alhusayni, Ibrahim Aldailami, Israa Hamdine, Ahmad Shabana, Yazeed Iskandar, Suhayb Khayyat

机构 * Naseej Innovation Lab, Naseej for Technology(Naseej创新实验室,Naseej技术)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15205 2025-04-22 cs.CL cs.AI cs.IR 85%

Support Evaluation for the TREC 2024 RAG Track: Comparing Human versus LLM Judges

Nandan Thakur, Ronak Pradeep, Shivani Upadhyay, Daniel Campos, Nick Craswell, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学) Snowflake(Snowflake公司) Microsoft(微软公司)

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted at SIGIR 2025 (short)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24307 2025-04-01 cs.CL cs.AI cs.IR cs.LG 85%

A Systematic Evaluation of LLM Strategies for Mental Health Text Analysis: Fine-tuning vs. Prompt Engineering vs. RAG

Arshia Kermani, Veronica Perez-Rosas, Vangelis Metsis

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09213 2024-11-15 cs.CL cs.AI cs.IR 85%

Comprehensive and Practical Evaluation of Retrieval-Augmented Generation Systems for Medical Question Answering

Nghia Trung Ngo, Chien Van Nguyen, Franck Dernoncourt, Thien Huu Nguyen

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12873 2024-07-23 cs.CL cs.AI cs.IR cs.LG 85%

Evaluation of RAG Metrics for Question Answering in the Telecom Domain

Sujoy Roychowdhury, Sumit Soman, H G Ranjani, Neeraj Gunda, Vansh Chhabra, Sai Krishna Bala

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted for publication in ICML 2024 Workshop on Foundation Models in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09476 2024-04-02 cs.CL cs.AI cs.IR 85%

ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems

Jon Saad-Falcon, Omar Khattab, Christopher Potts, Matei Zaharia

专题命中 RAG评测 :retrieval-augmented generation(title,abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09699 2024-10-15 cs.CL cs.AI 84%

Honest AI: Fine-Tuning "Small" Language Models to Say "I Don't Know", and Reducing Hallucination in RAG

Xinxi Chen, Li Wang, Wei Wu, Qi Tang, Yiyao Liu

专题命中 RAG评测 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI;retrieval augmented generation(journal_ref)

Journal ref 2024 KDD Cup Workshop for Retrieval Augmented Generation at the 30th ACM SIGKDD Conference on Knowledge Discovery and Data Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03708 2024-09-09 cs.CL cs.IR 84%

RAG based Question-Answering for Contextual Response Prediction System

Sriram Veturi, Saurabh Vaichal, Reshma Lal Jagadheesh, Nafis Irtiza Tripto, Nian Yan

专题命中 RAG评测 :RAG(title,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL

Comments Accepted at the 1st Workshop on GenAI and RAG Systems for Enterprise, CIKM'24. 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01791 2026-08-07 cs.ET cs.AI 版本更新 84%

PICopilot: An LLM-based Agentic Framework for Assisting Photonic Integrated Circuit Design via Script Generation

PICopilot:一种基于大语言模型的智能体框架,通过脚本生成辅助光子集成芯片设计

Xiaohan Jiang, Zeyu Li, Wei Zhang, Jiang Xu

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 PICopilot是首个基于LLM的智能体框架,通过带反馈机制的多智能体架构与专用RAG流程,成功完成全部48项PIC脚本任务,性能优于其他LLM方法及通用RAG的GPT-5。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18772 2026-07-22 cs.CL 新提交 84%

RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

RF-Agent:用于构建射频集成电路设计语言代理的实用框架

Yueqi Xing, Houbo He, Jolie Wang, Erin Ni, Shikai Wang, Qiufeng Li, Weidong Cao, Taiyun Chi

机构 * Rice University(莱斯大学) The George Washington University(乔治·华盛顿大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。

Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14385 2026-07-21 cs.CL cs.LG 版本更新 84%

MamaBench: Benchmarking LLM Robustness in Maternal and Child Health Diagnosis through Counterfactual Clinical Perturbation

MamaBench:通过反事实临床扰动对母婴健康诊断中的大语言模型稳健性进行基准测试

Thanni Adewuyi, Anuoluwa Sotome, Samuel Okoko, Angel Ezendu, Oluwafunke Akinbuwa, Oluwaseun Odunsi, Oluwasegun Oguntuase, Ifeoma Nwabueze, Abiodun Adereni

机构 * Helpmum Africa(非洲帮助妈妈组织) University of Ibadan(伊巴丹大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 研究针对大语言模型在母婴健康诊断中缺乏对临床相似表现区分能力的问题,提出MamaBench基准及EA - RAG方法,通过实验揭示基础准确率高估稳健准确率现象,EA - RAG有效降低BTR,提升稳健准确率,为临床人工智能反事实稳健性研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07978 2026-07-14 cs.IR 版本更新 84%

Cost and Accuracy of Long-Term Memory in Distributed Multi-Agent Systems Based on Large Language Models

基于大语言模型的分布式多智能体系统中长期记忆的成本与准确性

Benedict Wolff, Jacopo Bennati

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 针对分布式多智能体系统中长期记忆的成本与准确性评估空白,构建独立可复现测试平台,比较多种架构并发现检索不完整是准确率差距主因,RAG基线以更低总拥有成本达到高准确率。

Comments Copyright IEEE 2026. Manuscript accepted at IEEE COMPSAC 2026. Not for redistribution. Published version: https://doi.org/10.1109/XXXXXX

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00895 2026-07-02 cs.CL 新提交 84%

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

机构 * KR Labs(KR实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) TU Wien(维也纳工业大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15646 2026-06-16 cs.AI 新提交 84%

NeuroSymbolic AI for Legal AI-TRISM: Trustworthy, Reliable, Interpretable, Safe Models

面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型

Deepa Tilwani, Yash Saxena, Ankur Padia, Srinivasan Parthasarathy, Manas Gaur

机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22827 2026-06-16 cs.SE cs.AI 版本更新 84%

FasterPy: An LLM-based Code Execution Efficiency Optimization Framework

FasterPy:基于大语言模型的代码执行效率优化框架

Yue Wu, Minghao Han, Ruiyin Li, Peng Liang, Amjed Tahir, Zengyang Li, Qiong Feng, Mojtaba Shahin

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) School of Computer Science, Central China Normal University(中央中国师范大学计算机学院) School of Computer Science, Nanjing University of Science and Technology(南京理工大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出FasterPy框架,结合检索增强生成(RAG)和低秩适应(LoRA)技术,利用大语言模型自动优化Python代码执行效率,在PIE基准上超越现有方法。

Comments 38 pages, 5 images, 14 tables, Manuscript revision submitted to a Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏