arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-07-16 至 2026-07-16 共收录 7 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 7 篇

2607.13189 2026-07-16 cs.CL cs.AI 新提交 85%

RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar

RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标

Marek Šuppa, Viktória Ondrejová, Lucia Ganajová, Gregor Karetka, Daniel Skala

机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) Cisco Systems(思科系统公司) Zaitra s.r.o.(扎伊特拉有限公司) NaiveNeuron(天真神经元)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。

Comments SemEval-2026 Task 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24902 2026-07-16 cs.CL cs.AI cs.LG 版本更新 85%

When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation

当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估

Faizan Faisal

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14040 2026-07-16 cs.CL 新提交 81%

Can an Old Dog Be Taught New Tricks? Taking LLMs Beyond Sentence Level Translation

老狗能学新把戏吗?让大语言模型超越句子级翻译

Alaina Brandt

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.CL

AI总结 探讨能否让大语言模型超越逐句翻译范式,提出基于RAG的PAT系统,通过与语料库结合让大语言模型进行全文翻译生成草稿,经评估发现其能朝重新表述发展,但提升重新表述有效性仍需更多工作,还讨论了相关设计与评估等要点。

Comments Accepted for publication in HCI International 2026, Late Breaking Papers Proceedings, Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13370 2026-07-16 cs.CY cs.AI cs.HC 新提交 77%

Learning Engagement Assistant (LEA): Cross-Course Scalability and Classroom Evaluation of an Agentic AI Tutoring System

学习参与助手(LEA):智能AI辅导系统的跨课程可扩展性与课堂评估

Teri Rumble, Javad Zarrin, P. George Lovell, Ruth Falconer

机构 * Faculty of Design, Informatics and Business(设计、信息学与商业学院)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究LEA智能AI辅导系统,首次在真实学生中进行课堂部署并测试跨课程可扩展性,发现模拟与实际有差异,基于RAGAS评估答案相关性等指标,表明编排层无需改,下游组件课程无关性待进一步研究。

Comments Extended version of a paper presented at ICAART 2026. Manuscript under review at SN Computer Science (Springer). 32 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02023 2026-07-16 cs.CL cs.AI 版本更新 73%

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

并非所有线索都能被发现:事实分布和“不要编造”提示如何影响长上下文语言模型中的检索、推理和幻觉

Amirali Ebrahimzadeh, Seyyed M. Salili

机构 * Department of Electrical Engineering & Computer Science University of Michigan(电气工程与计算机科学系 密歇根大学)

专题命中 RAG评测 :retrieval-augmented generation(abstract);RAG(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中事实分布和反幻觉提示对检索、推理及幻觉的影响,通过扩展基准评估多个模型,识别出分布崩溃和安全代价两种失败模式,发现许多失败源于无效上下文利用,强调特定模型稳健性和上下文管理的重要性。

Comments 16 pages, 8 figures, 2 tables. Accepted at the FAGEN Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14035 2026-07-16 cs.IR cs.DL 新提交 70%

Optimizing Visibility in Generative Engines: A Critical Survey of Generative Engine Optimization (2023-2026)

优化生成引擎中的可见性:生成引擎优化的批判性综述(2023 - 2026)

Olivier Martinez

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.IR

AI总结 该研究对2023年11月至2026年有关生成引擎优化的45项研究进行批判性综述,指出其术语等存在异质性。贡献多阶段形式模型等,表明虽有成果但证据有限,未显示技术对有机可发现性等有稳定因果效应。

Comments 18 pages, 8 tables, 1 figure; critical survey of 45 studies; ancillary literature matrix and search protocol included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13754 2026-07-16 cs.CR 新提交 67%

PriEval-Protect: A Unified Framework for Privacy Evaluation and Protection in Healthcare Systems

PriEval-Protect:医疗系统中隐私评估与保护的统一框架

Ilef Chebil, Asma El Hadj, Souheib Yousfi, Aroua Hedhili, Layth Sliman

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 针对医疗系统隐私问题,PriEval-Protect框架分两阶段统一评估与缓解隐私风险。评估阶段结合法规评分与技术分析得出综合风险评分,保护阶段依风险推荐对策,实现法规与数据级风险分析的衔接,结果具合规性与可解释性。

Comments 10 pages, 3 figures. Accepted at IDT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏