arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-04-20 至 2026-04-20 共收录 5 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 5 篇

2512.07515 2026-04-20 cs.CL cs.AI 89%

TPA: Next Token Probability Attribution for Detecting Hallucinations in RAG

TPA:用于检测RAG中幻觉的下一个令牌概率归因

Pengqian Lu, Jie Lu, Anjin Liu, Guangquan Zhang

机构 * Australian Artificial Intelligence Institute (AAII)(澳大利亚人工智能研究所)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 TPA通过归因七个来源量化各组件对生成下一个令牌的影响,有效识别幻觉响应,实验显示其性能领先。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02497 2026-04-20 cs.SE cs.AI quant-ph 89%

A PennyLane-Centric Dataset to Enhance LLM-based Quantum Code Generation using RAG

面向增强基于LLM的量子代码生成的PennyLane数据集

Abdul Basit, Nouhaila Innan, Muhammad Haider Asif, Minghao Shao, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique

机构 * Center for Quantum and Topological Systems (CQTS)(量子与拓扑系统中心(CQTS)) NYUAD Research Institute(纽约大学阿布扎克研究院) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 RAG评测 :RAG(title,summary_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出PennyLang数据集,通过系统化方法提升LLM生成量子代码的性能,验证了RAG框架在增强量子代码生成中的有效性。

Comments 8 pages, 6 figures, 8 tables. Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15945 2026-04-20 cs.CL cs.LG 81%

RAGognizer: Hallucination-Aware Fine-Tuning via Detection Head Integration

RAGognizer: 通过检测头整合实现hallucination-aware微调

Fabian Ridder, Laurin Lessel, Malte Schilling

机构 * Computer Science Department(计算机科学系)

专题命中 RAG评测 :retrieval-augmented generation(abstract,abstract_cn);RAG(abstract,abstract_cn);分类 cs.CL

AI总结 RAGognizer通过整合轻量级检测头,实现hallucination-aware微调,提升内部状态分离性并减少生成hallucination。

Comments accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11182 2026-04-20 cs.CL 81%

Evaluating Memory Capability in Continuous Lifelog Scenario

在连续生活日志场景中评估记忆能力

Jianjie Zheng, Zhichen Liu, Zhanyu Shen, Jingxiang Qu, Guanhua Chen, Yile Wang, Yang Xu, Yang Liu, Sijie Cheng

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Shenzhen University(深圳大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 本文提出LifeDialBench基准,包含EgoMem和LifeMem两个子集,通过在线评估协议解决传统离线设置的时序泄漏问题,发现复杂记忆系统不如简单RAG基线表现,强调高保真上下文保存的重要性。

Comments 27 pages, 7 figures. ACL 2026 Findings camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14554 2026-04-20 cs.CL cs.AI 62%

VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models

VLegal-Bench: 用于大型语言模型越南法律推理的认知导向基准

Nguyen Tien Dong, Minh-Anh Nguyen, Thanh Dat Hoang, Nguyen Tuan Ngoc, Dao Xuan Quang Minh, Phan Phi Hai, Nguyen Thi Ngoc Anh, Dang Van Tu, Binh Vu

机构 * CMC OpenAI VinUniversity HUST SRH University Heidelberg

专题命中 RAG评测 :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 VLegal-Bench是首个系统评估大型语言模型在越南法律任务上的基准,包含10450个样本,通过严格标注流程确保样本基于权威法律文件,涵盖法律问题解答、检索增强生成、多步推理等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏