arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-06-09 至 2026-06-09 共收录 17 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 8 篇

2606.07783 2026-06-09 cs.CL 新提交 91%

Evaluating RAG Reliability under Clean, Misleading, and Mixed Retrieval

评估RAG在干净、误导和混合检索下的可靠性

Sevgi Yigit-Sert

机构 * Ankara University(安卡拉大学)

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 提出评估协议,通过参数覆盖和置信度指标,系统测试RAG系统在干净、有毒和混合证据下处理参数知识与检索证据冲突的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09724 2026-06-09 cs.AI 新提交 89%

Beyond Probabilistic Similarity: Structural, Temporal, and Causal Limitations of Retrieval-Augmented Generation in the Legal Domain

超越概率相似性:检索增强生成在法律领域的结构性、时间性和因果性局限

Hudson de Martim

机构 * Federal Senate of Brazil(巴西联邦参议院)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract);分类 cs.AI

AI总结 本文指出法律AI中RAG的失败源于概率检索与法律知识层次、时间及制度结构的架构不匹配,提出三种病理(部分盲、历时盲、因果不透明)并推导出确定性设计的四项架构承诺。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09160 2026-06-09 cs.LG cs.AI 新提交 89%

Crop Recommendation and Agricultural Query Answering System Using Spatio-Temporal Graph Neural Networks and Hybrid Retrieval Augmentation

基于时空图神经网络与混合检索增强的作物推荐及农业问答系统

Prajwal Thapa, Yagya Raj Pandeya

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 检索器与排序 :RAG(summary_cn,abstract);hybrid retrieval(title);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 提出融合时空图神经网络(STGCN)与检索增强生成(RAG)的精准农业系统,实现30天天气预报、作物推荐及农业问答,在尼泊尔1359个地点数据上STGCN预测MSE达0.011。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07523 2026-06-09 cs.CL cs.AI 新提交 86%

Retrieval Augmented Generation Framework for the Nepali Legal Domain Question Answering

面向尼泊尔法律领域问答的检索增强生成框架

Samir Wagle, Abiral Adhikari, Reewaj Khanal, Batsal Bhandari, Prashant Manandhar, Praveen Acharya, Bal Krishna Bal

机构 * Dublin City University(都柏林城市大学)

专题命中 检索器与排序 :retrieval augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个基于检索增强生成的尼泊尔法律问答模型,利用BM25和E5模型检索案例法,实现91%的top-1精度和74%的生成答案可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08135 2026-06-09 cs.SE 新提交 75%

TICoder: A Repository-Level Code Generation Framework with Test-Driven Planning and Implementation-Aware Reuse

TICoder: 一种具有测试驱动规划和实现感知复用的仓库级代码生成框架

Siyu Nan, Yaling Luo, Jian Wang, Neng Zhang, Bing Li

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 提出TICoder框架,通过测试驱动迭代规划机制和实现感知代码复用策略,解决仓库级代码生成中的依赖和上下文限制问题,在多个基准上平均提升11.52%。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08397 2026-06-09 cs.CL cs.IR 新提交 73%

TrustMargin: Training-Free Arbitration between Parametric Memory and Retrieved Evidence in Large Language Models

TrustMargin: 大语言模型中参数化记忆与检索证据之间的无训练仲裁

Jingyan Xu, Hong Shi, Yi Shan, Penghui Liu, Yunhao Bai, Ningyuan Li, Xueyang Liu

机构 * Peking University(北京大学)

专题命中 检索器与排序 :RAG(abstract,abstract_cn);分类 cs.IR、cs.CL

AI总结 针对大语言模型在知识问答中参数记忆与检索证据冲突的问题,提出无训练仲裁层TrustMargin,利用模型自身似然度评分选择更可信的答案,无需微调或外部评判。

Comments 13 pages, 6 figures, 9 tables. Code and data are available at https://github.com/mojixu/TrustMargin.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09459 2026-06-09 cs.CL 新提交 57%

AbstRAG: Learning to Abstract for Retrieval Problems

AbstRAG:面向检索问题的抽象学习

Lei Xu, Xin Quan, Daniel Pedronette, André Freitas

机构 * Idiap Research Institute(Idiap 研究所) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院 (EPFL)) São Paulo State University(圣保罗州立大学) University of Manchester(曼彻斯特大学) CRUK National Biomarker Centre(英国癌症研究中心国家生物标志物中心)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.CL

AI总结 针对查询与文档证据间的抽象鸿沟问题,提出AbstRAG方法,通过将抽象作为显式检索对象,并采用反思性精炼机制,在三个基准上提升了检索和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07654 2026-06-09 cs.CV cs.AI 新提交 57%

MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework

MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索

Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学)

专题命中 检索器与排序 :retriever(abstract);分类 cs.AI

AI总结 提出MM-Matryoshka,一种二维套娃训练框架,使视觉文档检索器在向量维度和编码器深度上实现弹性预算选择,无需为不同预算训练独立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 向量检索 1 篇

2606.09441 2026-06-09 cs.AI cs.AR 新提交 91%

SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance

SIFT: 利用注意力不变性实现RAG预填充快速计算的索引选择

Rya Sanovar, Srikant Bharadwaj, Hritvik Taneja, Moinuddin Qureshi

机构 * Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软)

专题命中 向量检索 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 针对RAG查询中文档重复导致预填充计算冗余和TTFT增加的问题,提出SIFT方法,通过离线提取文档高注意力分数位置并利用注意力不变性,在预填充时仅计算标记位置,将TTFT提升1.71倍且精度损失在1%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长文档RAG 2 篇

2606.08944 2026-06-09 cs.AR cs.PL 新提交 75%

LongRTL: Graph-Similarity-Guided LLM-driven Long Context RTL Optimization

LongRTL:基于图相似性的LLM驱动的长上下文RTL优化

Yuyang Ye, Che-Kuan Shen, Xiangfei Hu, Yuchen Liu, Shuo Yin, Xufeng Yao, Bei Yu, Tsung-Yi Ho

专题命中 长文档RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 提出一种基于图相似性的LLM驱动RTL优化框架,通过分区、优化和重构三个智能体解决长上下文RTL代码的优化问题。

Comments 7 pages, 6 figures, 5 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08539 2026-06-09 cs.AI 新提交 70%

AgentTrust: A Self-Improving Trust Layer for AI-Agent Actions

AgentTrust: AI代理行为的自改进信任层

Chenglin Yang

机构 * Independent Researcher(独立研究员)

专题命中 长文档RAG :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 提出AgentTrust v2,通过威胁类型分类(词汇/语义)和自学习机制,在代理行为中实现自改进信任决策,显著提升语义威胁检测准确率并降低误拦。

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图谱与结构化RAG 2 篇

2606.08317 2026-06-09 cs.DB 新提交 57%

Architectural Evolution and Selection Framework for Database Systems in AI-Ready Data Platforms

面向AI就绪数据平台的数据库系统架构演进与选择框架

Mohit Srivastava

专题命中 图谱与结构化RAG :retrieval-augmented generation(abstract);分类 cs.DB

AI总结 提出一个统一的多范式评估与选择框架,基于九个架构维度,通过工作负载特征化、约束过滤和兼容性评分,系统比较十三种数据库范式,揭示存储计算分离、工作负载驱动专业化、向AI就绪平台收敛三大演化模式,并通过金融欺诈检测案例验证。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09738 2026-06-09 cs.CV 新提交 50%

HDSL: A Hierarchical Domain-Specific Language for Structured 3D Indoor Scene Generation and Localized Editing with LLM Agents

HDSL:一种用于结构化3D室内场景生成和基于LLM智能体局部编辑的层次化领域特定语言

Letian Li, Chao Shen, Shuzhao Xie, Chenghao Gu, ZhengXiao He, Yu Meng, Xin Yang, Wenyuan Jiang, Zhi Wang

机构 * SIGS, Tsinghua University(清华大学深圳国际研究生院) Nankai University(南开大学) University of Arizona(亚利桑那大学) Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 图谱与结构化RAG :retrieval-augmented generation(abstract)

AI总结 提出HDSL语言,以树结构表示室内场景,结合LLM智能体生成、多模态检索和力导向布局优化,实现结构化场景生成与局部编辑,显著提升对象覆盖率和编辑效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态RAG 2 篇

2606.07924 2026-06-09 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 89%

Decoupling Semantics and Logic: A Training-Free Coarse-to-Fine Pipeline for Video Retrieval-Augmented Generation

解耦语义与逻辑:一种无需训练的从粗到精的视频检索增强生成流水线

Jiaxin Dai, Zehang Wei, Jiamin Yan, Xiang Xiang

机构 * School of Computer Science & Tech, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) School of AI and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院)

专题命中 多模态RAG :RAG(summary_cn,abstract);retrieval-augmented generation(title);dense retrieval(abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练的两阶段级联视频RAG流水线,通过解耦语义检索与逻辑推理,实现跨语言长视频理解、严格角色遵循和零幻觉时间定位。

Comments To be presented at ACL 2026 MAGMAR Workshop (Oral; Retrieval leaderboard No.1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07252 2026-06-09 cs.IR 新提交 81%

Constrained Dominant Sets for Multimodal Document Question Answering

约束主导集用于多模态文档问答

Ambuj Mehrish, Sebastiano Vascon

专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.IR

AI总结 提出基于查询增强亲和图的约束主导集检索方法,通过谱边界自动平衡相关性与冗余性,利用复制动态实现全局均衡,无需训练,在多模态文档问答中取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. RAG评测 2 篇

2606.09005 2026-06-09 cs.CR cs.CL 新提交 89%

Document-Authored Control-Signal Impersonation: A Low-Cost Indirect Prompt Attack on RAG Safety Boundaries

文档作者控制信号冒充:对RAG安全边界的低成本间接提示攻击

Jianguo Zhu

机构 * Chengdu University of Information Technology(成都信息工程大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 研究检索增强生成系统中文档文本冒充控制信号的安全漏洞,提出非命令式间接注入攻击方法DACSI,并在多个模型上验证其有效性。

Comments Preprint. Independent-author version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08921 2026-06-09 cs.LG 新提交 75%

Generalized Rank-based Evaluation for Knowledge Graph Completion: Perspectives, Framework, and Analyses

基于排序的知识图谱补全广义评估:视角、框架与分析

Sooho Moon, Jian Kang, Yunyong Ko

机构 * Chung-Ang University(中央大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 针对现有评估指标忽视预测锐度与流行偏差鲁棒性的问题,提出广义评估框架PROBE,通过排序变换器和排序聚合器实现更全面、灵活且一致的模型评估。

Comments 25 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏