arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-08-13 至 2026-08-13 共收录 12 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 7 篇

2608.11584 2026-08-13 cs.AI 新提交 81%

EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval

EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试

Huiqi Miao, Xinbao Sun, Bo Wang, Fanyu Meng, Lijun Mei, Na Wu, Di Jin, Chao Deng, Junlan Feng

机构 * Jiutian Research, China Mobile(中国移动九天研究院)

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 研究针对企业RAG部署的可靠性问题,推出含983个样本的EnterpriseRAG基准,评估13个LLM发现其指令遵循崩溃,为生产级RAG提供可复现的评估基础

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11277 2026-08-13 cs.CR cs.SE 新提交 80%

Knowledge-Graph-Guided Retrieval-Augmented LLMs for Explainable Root Cause Analysis in Automotive HiL Validation

知识图谱引导的检索增强大语言模型用于汽车在环(HiL)验证中的可解释根本原因分析

Hamza Ouarrad, Mohammad Abboush, Andreas Rausch

专题命中 检索器与排序 :RAG(summary_cn,abstract)

AI总结 该研究提出KG引导的RAG-LLM框架,用于汽车HiL数据的RCA与故障定位,在ASM汽油发动机和电动车系统案例中分别获90%、94% Top-1准确率,可实现可解释且泛化的故障分析。

Comments 10 pages, 3 figures, 5 tables. Accepted for publication and oral presentation at the 10th International Conference on System Reliability and Safety (ICSRS 2026), Rome, Italy, November 23--25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11922 2026-08-13 cs.CL cs.IR cs.LG 新提交 62%

LODESTAR: Trustworthy Entropy Is Navigated, Not Merely Measured -- Reinforced Polarizer Keeps a Frozen LLM from Being Confidently Misled by the Wrong Evidence

LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错

Po-Jen Ko, Che-Cheng Wu, Hung-Chun Hsu, Li-Yang Chang, Chuan-Ju Wang

专题命中 检索器与排序 :retriever(abstract);分类 cs.IR、cs.CL

AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12304 2026-08-13 cs.AI 新提交 57%

Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models

构建动态主逻辑模型作为知识图谱,用于使用检索增强大语言模型的复杂系统诊断

Saman Marandi, Yu-Shu Hu, Mohammad Modarres

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本研究提出基于检索增强大语言模型的KG-DML框架,实现了复杂系统动态主逻辑模型的自动化构建,经低压冷却剂注入系统验证,可转化技术文档为可执行功能模型用于诊断分析。

Comments 36 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12282 2026-08-13 cs.AI 新提交 57%

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

VAKRA:评估工具使用策略下跨API与检索的多跳推理能力

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor

机构 * IBM(国际商业机器公司(IBM))

专题命中 检索器与排序 :knowledge retrieval(abstract_cn);分类 cs.AI

AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11967 2026-08-13 cs.LG cs.AI 新提交 57%

LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

LoongReflect:通过全局视角蒸馏提升搜索智能体的长程反思能力

Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 检索器与排序 :retrieval-augmented generation(abstract);分类 cs.AI

AI总结 LoongReflect是将反思表述为记忆控制策略的训练框架,通过双信号通道结合全局视角蒸馏与结果导向GRPO优化,在多跳检索增强生成和数学推理任务上提升了搜索智能体的长程反思能力。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11592 2026-08-13 cs.RO 新提交 50%

Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems

Video2Track:从真实世界交互视频到自动驾驶系统的可操控对抗性封闭赛道测试

Mengjie Tian, Xinrui Zhang, Tianyu Li, Peizhi Zhang, Guirong Zhou, Haojie Feng, Junpeng Huang, Qixiang Zhang, Lu Xiong

专题命中 检索器与排序 :retrieval-augmented generation(abstract)

AI总结 本文提出Video2Track框架,通过两个耦合模块将真实驾驶视频交互场景转化为可操控对抗性封闭赛道测试,可复现实景交互场景并生成可控变体,为ADS验证提供可扩展方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图谱与结构化RAG 2 篇

2608.12129 2026-08-13 cs.CL 新提交 87%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG:基于查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI(智量科技)

专题命中 图谱与结构化RAG :retrieval augmented generation(title,abstract);RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本研究提出SAG(SQL检索增强生成)架构,通过查询时动态超边实现结构化检索,在HotpotQA等多跳问答基准上性能优于基线,为LLM智能体处理组织知识提供了新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11876 2026-08-13 cs.RO cs.HC 新提交 83%

D3D-GEN: Robot-Aware Domain-Grounded Interactive 3D World Generation for Social Robotics

D3D-GEN:面向社交机器人的机器人感知、领域锚定的交互式3D世界生成

Anh Duc Do, Volodymyr Scherbyna, Tai Duc Nguyen, Spaarsh Thakkar, Zhengcheng Shen, Teham Buiyan, Archan Misra, Linh Kästner

机构 * Singapore Management University(新加坡管理大学) Technical University Berlin(柏林工业大学) Max Planck Institute(马克斯·普朗克研究所) Technical University Braunschweig(布伦瑞克工业大学)

专题命中 图谱与结构化RAG :RAG(summary_cn,abstract);retrieval-augmented generation(abstract)

AI总结 D3D-GEN是一种新型3D世界生成系统,结合领域智能体与RAG流水线,可快速生成领域锚定的交互式3D世界,已构建多领域数据库并生成数十种仿真环境,适配Isaac Sim等仿真器。

Comments 8 pages, 5 figures, and 5 tables. Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态RAG 1 篇

2608.12121 2026-08-13 cs.CL cs.AI 新提交 91%

QV-PIC: Query-Aware Visual Position-Independent Caching for Efficient RAG Serving

QV-PIC:面向高效RAG服务的查询感知视觉位置无关缓存

Yilin Liu, Rui Meng, Wangze Ni, Jianxin Yan, Heng Cao, Libin Zheng, Peng Cheng, Jinfei Liu

专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 QV-PIC是一种查询感知双分辨率PIC复用框架,通过离线编译视觉缓存、在线分分辨率处理,解决渲染图像PIC质量下降问题,在6项RAG任务中显著提升F1并降低TTFT。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. RAG评测 2 篇

2608.12138 2026-08-13 cs.CL cs.AI cs.HC cs.IR cs.LG 新提交 92%

A corpus-specific clinical RAG system matches or outperforms newer frontier LLMs on HealthBench

针对特定语料库的临床检索增强生成(RAG)系统在HealthBench上的表现与较新的前沿大语言模型相当或更优

Praveen Reddy, Charuta Mandke, Suvrankar Datta, Sarah Khan, Siddharth Reddy Anthireddy, Shitij Arora, Vishal Singh

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);knowledge retrieval(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 本文评估专为中低收入环境构建的临床RAG系统VITA,其在HealthBench基准测试中与前沿LLM表现相当或更优,语料库特异性可提升模型落地性但会降低沟通流畅度。

Comments 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11238 2026-08-13 cs.AI 新提交 92%

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

面向查询不可知的RAG评估:基于查询覆盖率与声明可验证性

Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);retriever(abstract);分类 cs.AI

AI总结 本文提出Q-CARE框架,通过分解查询与答案实现RAG的细粒度评估,在8个数据集的基准测试中,其评估结果与人工判断的相关性优于现有4种RAG评估指标。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏