arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

共收录 1199 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 1199 篇

2605.01567 2026-05-05 cs.SE cs.CL cs.LG 77%

Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture

反馈归一化的开发者内存用于强化学习编码代理:一种安全门控MCP架构

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University, Istanbul, Türkiye(PythaLab,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出RL Developer Memory架构,通过归一化反馈和安全门控机制提升强化学习编码代理的内存管理,实验证明其在确定性任务中的有效性。

Comments 25 pages, 5 figures, 7 tables. Preprint. Implementation and supplementary artifacts are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17340 2026-04-21 cs.CL 77%

Neuro-Symbolic Resolution of Recommendation Conflicts in Multimorbidity Clinical Guidelines

神经符号推荐冲突在多病共存临床指南中的解决

Shiyao Xie, Jian Du

机构 * Peking University(北京大学) National Institute of Health Data Science(国家健康数据科学研究院) Peking University Health Science Center(北京大学医学部) Institute of Medical Technology(医学技术研究院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出神经符号框架解决多病共存临床指南中的推荐冲突问题,通过多智能体系统和SAT求解器验证逻辑规则,发现90.6%的冲突为局部冲突,F1分数达0.861。

Comments Accepted by Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (Bridge Program on Logic & AI: Logical and Symbolic Reasoning in Language Models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03793 2026-04-21 cs.CL cs.CR 77%

AttnTrace: Contextual Attribution of Prompt Injection and Knowledge Corruption

AttnTrace: 基于提示注入和知识腐败的上下文归因

Yanting Wang, Runpeng Geng, Ying Chen, Jinyuan Jia

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出AttnTrace,一种基于LLM对提示生成的注意力权重的上下文追溯方法,通过增强效果和技术改进,提高了准确性和效率,并展示了其在检测长上下文中的提示注入应用。

Comments To appear in IEEE S&P 2026. The code is available at https://github.com/Wang-Yanting/AttnTrace. The demo is available at https://huggingface.co/spaces/SecureLLMSys/AttnTrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13201 2026-03-17 q-bio.GN cs.AI cs.MA 77%

Benchmarking LLM-based agents for single-cell omics analysis

对基于大语言模型的代理在单细胞组学分析中的性能评估

Yang Liu, Lu Zhou, Xiawei Du, Ruikun He, Xuguang Zhang, Rongbo Shen, Yixue Li

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);knowledge retrieval(abstract);分类 cs.AI

AI总结 本文提出一个评估系统,用于严格评估代理在单细胞组学分析中的能力,发现Grok3-beta在测试框架中表现最佳,多代理框架通过角色分工提升协作与执行效率。

Comments please see clear figures in this version. 6 main figures; 13 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14744 2025-12-18 q-fin.CP cs.AI 77%

VERAFI: Verified Agentic Financial Intelligence through Neurosymbolic Policy Generation

VERAFI:通过神经符号策略生成实现验证的代理金融智能

Adewale Akinfaderin, Shreyas Subramanian

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);dense retrieval(abstract);分类 cs.AI

AI总结 VERAFI通过神经符号策略生成实现验证的代理金融智能,显著提升金融领域事实正确性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07421 2025-10-15 cs.CL 77%

AgentAda: Skill-Adaptive Data Analytics for Tailored Insight Discovery

Amirhossein Abaskohi, Amrutha Varshini Ramesh, Shailesh Nanisetty, Chirag Goel, David Vazquez, Christopher Pal, Spandana Gella, Giuseppe Carenini, Issam H. Laradji

机构 * ServiceNow Research(ServiceNow 研究所) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) University of Montreal(蒙特利尔大学) Mila(Mila 研究所) CIFAR AI Chair(CIFAR 人工智能主席职位) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);hybrid retrieval(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21208 2025-09-26 cs.CL 77%

CLaw: Benchmarking Chinese Legal Knowledge in Large Language Models - A Fine-grained Corpus and Reasoning Analysis

Xinzhe Xu, Liang Zhao, Hongshen Xu, Chen Chen

机构 * Peking University(北京大学) LLM-Core

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);knowledge retrieval(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16768 2025-06-23 cs.IR 77%

eSapiens: A Real-World NLP Framework for Multimodal Document Understanding and Enterprise Knowledge Processing

Isaac Shi, Zeyuan Li, Wenli Wang, Lewei He, Yang Yang, Tianyu Shi

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);hybrid retrieval(abstract);分类 cs.IR

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01313 2024-01-09 cs.CL 77%

A Comprehensive Survey of Hallucination Mitigation Techniques in Large Language Models

S. M Towhidul Islam Tonmoy, S M Mehedi Zaman, Vinija Jain, Anku Rani, Vipula Rawte, Aman Chadha, Amitava Das

专题命中 RAG评测 :retrieval augmented generation(abstract);retriever(abstract);knowledge retrieval(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13052 2026-05-14 cs.IR cs.CL 76%

RAG-Enhanced Large Language Models for Dynamic Content Expiration Prediction in Web Search

增强型大型语言模型用于网络搜索中动态内容过期预测

Tingyu Chen, Wenkai Zhang, Li Gao, Lixin Su, Ge Chen, Dawei Yin, Daiting Shi

机构 * Baidu Inc.(百度公司)

专题命中 RAG评测 :RAG(title);分类 cs.IR、cs.CL

AI总结 本文提出基于大型语言模型的查询感知动态内容过期预测框架,通过提取细粒度时间上下文和利用LLM推断查询特定的有效性范围,提升搜索结果的新鲜度和用户体验。

Comments Accepted at SIGIR 2026. Final version: https://doi.org/10.1145/3805712.3808457

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10168 2025-04-15 cs.CL cs.AI 76%

HalluSearch at SemEval-2025 Task 3: A Search-Enhanced RAG Pipeline for Hallucination Detection

Mohamed A. Abdallah, Samhaa R. El-Beltagy

专题命中 RAG评测 :RAG(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20990 2024-07-31 cs.AI cs.CL cs.CV cs.HC cs.LG 76%

From Feature Importance to Natural Language Explanations Using LLMs with RAG

Sule Tekkesinoglu, Lars Kunze

专题命中 RAG评测 :RAG(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29243 2026-08-12 cs.LG 版本更新 75%

KrishokChat: A Provenance-Traceable Multi-Task Bengali Agricultural Benchmark with Safety-Critical Chemical Advisory

KrishokChat: 一个基于引用的孟加拉语农业咨询数据集与基准

Khan Raiyan Ibne Reza, Sumaiya Tabassum Nimi, Omar Ibne Shahid

专题命中 RAG评测 :RAG(summary_cn,abstract_cn)

AI总结 提出KrishokChat,首个基于引用的孟加拉语农业指令微调数据集,通过分层知识节点扩展生成14.55万QA对,并引入农夫基准评估,发现微调改善格式但化学剂量泛化仍困难,强调其作为RAG知识库的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05822 2026-08-07 cs.SE 新提交 75%

Agent-Based Test Assertion Generation via Diverse Perspective Aggregation

基于智能体的多视角聚合测试断言生成

Dong Wang, Qiaoyu Han, Lin Yang, Jianyi Zhou, Guangtai Liang, Junjie Chen

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01783 2026-08-04 cs.SD cs.HC stat.AP 新提交 75%

Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

GPT-4o-mini与教师平均评分在音乐分析回答自动评分中的比较验证:单次部署、可重复性及策略特异性偏差

Baicheng Lin, Lingxi Jin, Kyung-Seok Min

机构 * Sejong University(世宗大学) Ewha Womans University(梨花女子大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 本研究以教师平均评分为基准,评估GPT-4o-mini对音乐分析回答的自动评分能力,发现Fs+CoT策略与教师评分一致性最强,不同策略评分特征不同,实际应用需针对性校准与人工监督。

Comments Proceedings of the International Meeting of the Psychometric Society: The 91st Annual Meeting, Seoul, Republic of Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05440 2026-07-08 econ.EM cs.SY eess.SY 新提交 75%

Retrieval over Reasoning: A Cost-Controlled Benchmark of Language Models for Energy-Retrofit Recommendation

基于推理的检索:用于能源改造推荐的语言模型成本控制基准

Eliseo Curcio

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 研究为建筑推荐节能措施问题,通过树集成解决EUI预测,发现推荐任务框架影响模型选择,对八个大语言模型基准测试,表明其过度推荐,检索可缩小差距,还给出成本控制下模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22025 2026-06-11 cs.CL cs.AI cs.IR cs.SE 版本更新 75%

When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications

当通用提示改进有害:LLM应用的评估驱动迭代

Daniel Commey

机构 * Daniel Commey

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR、cs.CL、cs.AI

AI总结 提出最小可行评估套件(MVES),通过结构化评估框架和本地复现实验,发现通用提示添加并非单调改进,强调评估驱动的提示迭代。

Comments Technical report. 42 pages, 3 figures. Code, test suites, and result logs: https://github.com/dcommey/llm-eval-benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08921 2026-06-09 cs.LG 新提交 75%

Generalized Rank-based Evaluation for Knowledge Graph Completion: Perspectives, Framework, and Analyses

基于排序的知识图谱补全广义评估:视角、框架与分析

Sooho Moon, Jian Kang, Yunyong Ko

机构 * Chung-Ang University(中央大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 针对现有评估指标忽视预测锐度与流行偏差鲁棒性的问题,提出广义评估框架PROBE,通过排序变换器和排序聚合器实现更全面、灵活且一致的模型评估。

Comments 25 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08581 2026-05-12 cs.LG 75%

PRISM: Fast Online LLM Serving via Scheduling-Memory Co-design

PRISM: 通过调度-内存协同设计实现快速在线LLM服务

Xingyu Qu, Tianhao Lin, Yiqi Li, Zhiyu Chen, Sheng Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 PRISM通过协同设计调度与内存管理,优化LLM服务响应时间,减少TTFT并提升缓存命中率。

Comments 25 pages, 9 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14793 2026-04-17 q-fin.CP 75%

LR-Robot: An Human-in-the-Loop LLM Framework for Systematic Literature Reviews with Applications in Financial Research

LR-Robot:一种人机协同的LLM框架用于系统性文献综述及其在金融研究中的应用

Wei Wei, Jin Zheng, Zining Wang, Weibin Feng

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 针对传统系统性文献综述在金融研究中难以应对大规模复杂文献的问题,提出LR-Robot框架,结合领域专家定义的分类体系与大语言模型进行高效分类,并通过人机协同评估确保可靠性,支持时间演化跟踪和增强引用网络分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04472 2026-04-01 cs.IR cs.AI cs.CL cs.LG 75%

EventChat: Implementation and user-centric evaluation of a large language model-driven conversational recommender system for exploring leisure events in an SME context

EventChat: 一种基于大语言模型的对话推荐系统在中小企业休闲活动探索中的实现与用户导向评估

Hannes Kunstmann, Joseph Ollier, Joel Persson, Florian von Wangenheim

机构 * Swiss Federal Institute of Technology, Zurich(苏黎世联邦理工学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文提出一种基于大语言模型的对话推荐系统,通过客观指标和用户评价评估其在中小企业场景下的性能,揭示了系统在用户体验和商业可行性方面的挑战。

Comments Just accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19281 2026-03-23 cs.CL cs.AI cs.IR 75%

URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models

URAG:一种用于检索增强大型语言模型不确定性量化的基准

Vinh Nguyen, Cuong Dang, Jiahao Zhang, Hoa Tran, Minh Tran, Trinh Chau, Thai Le, Lu Cheng, Suhang Wang

机构 * Uppsala University(乌普萨拉大学) University of Science, VNU-HCM(VNU-HCM大学) Indiana University(印第安纳大学) FPT Software, AI Center(FPT软件人工智能中心) The Pennsylvania State University(宾夕法尼亚州立大学) VNU University of Engineering(VNU工程大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 URAG通过构建多选问答任务评估RAG系统在医疗、编程、科学、数学等领域的不确定性,揭示准确性与不确定性的关系及不同RAG方法的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05430 2026-02-17 cs.CL cs.AI cs.IR cs.LG 75%

ArtistMus: A Globally Diverse, Artist-Centric Benchmark for Retrieval-Augmented Music Question Answering

ArtistMus: 一个全球多样、以艺术家为中心的基准,用于检索增强的音乐问答

Daeyong Kwon, SeungHeon Doh, Juhan Nam

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 ArtistMus提出一个全球多样、以艺术家为中心的基准,通过检索增强生成技术提升音乐问答的准确性和上下文推理能力。

Comments Accepted to LREC 2026. This work is an evolution of our earlier preprint arXiv:2507.23334

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00010 2026-02-03 cs.IR cs.AI cs.CL 75%

ChunkNorris: A High-Performance and Low-Energy Approach to PDF Parsing and Chunking

ChunkNorris: 一种高性能且低能耗的PDF解析与分块方法

Mathieu Ciancone, Clovis Varangot-Reille, Marion Schaeffer

机构 * Wikit Laboratoire Hubert Curien(Hubert Curien实验室) Université Jean Monnet(Jean Monnet大学) INSA Rouen Normandie(Rouen Normandie国立理工学院)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 ChunkNorris通过高效启发式方法实现PDF解析与分块的高性能低能耗,优于现有技术,适用于资源受限的检索增强生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05256 2026-01-12 cs.AI cs.CL cs.CV cs.IR 75%

Naiad: Novel Agentic Intelligent Autonomous System for Inland Water Monitoring

Naiad:一种新型智能自主系统用于内陆水体监测

Eirini Baltzi, Tilemachos Moumouris, Athena Psalta, Vasileios Tsironis, Konstantinos Karantzalos

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 Naiad是一种基于大语言模型和外部工具的智能系统,用于通过地球观测数据实现内陆水体的全面监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16106 2025-12-19 cs.DB cs.AI cs.IR 75%

ModelTables: A Corpus of Tables about Models

ModelTables: 一个关于模型的表格语料库

Zhengyuan Dong, Victor Zhong, Renée J. Miller

机构 * University of Waterloo(滑铁卢大学) University Waterloo(滑铁卢大学)

专题命中 RAG评测 :dense retrieval(abstract);hybrid retrieval(abstract);分类 cs.IR、cs.AI、cs.DB

AI总结 ModelTables是一个大规模结构化数据基准,用于评估模型和表格的相关性,通过表格搜索展示了改进语义检索和结构化知识组织的潜力。

Comments 14 pages, 8 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06125 2025-11-11 cs.CL cs.AI cs.IR 75%

Evaluation of retrieval-based QA on QUEST-LOFT

Nathan Scales, Nathanael Schärli, Olivier Bousquet

机构 * Google DeepMind(谷歌DeepMind)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11310 2025-08-18 cs.CL cs.AI cs.IR 75%

SGSimEval: A Comprehensive Multifaceted and Similarity-Enhanced Benchmark for Automatic Survey Generation Systems

Beichen Guo, Zhiyuan Wen, Yu Yang, Peng Gao, Ruosong Yang, Jiaxing Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学) China Mobile (Hong Kong) Innovation and Research Institute(中国移动(香港)创新与研究院) Lingnan University(岭南大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted to The 21st International Conference on Advanced Data Mining and Applications (ADMA2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07179 2025-08-12 cs.CL cs.AI cs.DB 75%

Schema Lineage Extraction at Scale: Multilingual Pipelines, Composite Evaluation, and Language-Model Benchmarks

Jiaqi Yin, Yi-Wei Chen, Meng-Lung Lee, Xiya Liu

机构 * Microsoft Redmond, WA(微软红木城) Antra. Inc.(Antra公司)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI、cs.DB

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15737 2025-06-05 cs.CL cs.AI cs.IR 75%

Who's Who: Large Language Models Meet Knowledge Conflicts in Practice

Quang Hieu Pham, Hoang Ngo, Anh Tuan Luu, Dat Quoc Nguyen

机构 * VinAI Research(VinAI研究院) Nanyang Technological University(南洋理工大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.IR、cs.CL、cs.AI

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏