arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-05-05 至 2026-05-05 共收录 5 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 5 篇

2605.00964 2026-05-05 cs.IR cs.AI cs.HC 91%

Seeking Information with RAG-Assistants: Does Model Size Matter in Human-AI Collaborations?

通过RAG助手获取信息:在人机协作中模型大小是否重要?

Lennard C. Froma, Tom Kouwenhoven, Maaike H. T. de Boer, Catholijn M. Jonker, Max J. van Duijn

机构 * Leiden University(莱顿大学) TNO(荷兰代尔夫特理工大学) TU Delft(代尔夫特理工大学)

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 研究评估基于RAG的助手在真实多轮信息检索场景中的表现,探讨模型大小对人机协作动态及用户感知的影响,发现混合系统在信息检索中具有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00957 2026-05-05 cs.IR cs.AI 86%

"I Don't Know" -- Towards Appropriate Trust with Certainty-Aware Retrieval Augmented Generation

我不知道--迈向具有确定性意识的适当信任

Daan Di Scala, Maaike de Boer, Pınar Yolum

机构 * TNO Netherlands Organisation for Applied Scientific Research, Department Data Science(荷兰应用科学研究院,数据科学部门) Utrecht University, Department of Information and Computing Sciences(乌得勒支大学,信息与计算科学系)

专题命中 RAG评测 :retrieval augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.IR、cs.AI

AI总结 本文提出CERTA系统,通过结合问题、上下文和答案的相关性来反映不确定性,以建立适当的信任。研究创建了Certainty Benchmark,并通过实验验证了CERTA在减少过度同意和提供谨慎行为方面的有效性。

Comments To be published in VALE 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01567 2026-05-05 cs.SE cs.CL cs.LG 77%

Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture

反馈归一化的开发者内存用于强化学习编码代理:一种安全门控MCP架构

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University, Istanbul, Türkiye(PythaLab,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 本文提出RL Developer Memory架构,通过归一化反馈和安全门控机制提升强化学习编码代理的内存管理,实验证明其在确定性任务中的有效性。

Comments 25 pages, 5 figures, 7 tables. Preprint. Implementation and supplementary artifacts are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01425 2026-05-05 cs.LG 67%

Barriers to Counterfactual Credit Attribution for Autoregressive Models

自回归模型中反事实信用归因的障碍

Aloni Cohen, Chenhao Zhang

专题命中 RAG评测 :RAG(abstract,abstract_cn)

AI总结 研究自回归模型中反事实信用归因的挑战,发现信用归因不具有自回归性,且基于弱最优性要求的反事实归因需指数级查询复杂度。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17677 2026-05-05 cs.AI 57%

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving

EngiBench:用于评估大型语言模型在工程问题解决上的基准

Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu, Ruixi Zou, Yuheng Cheng, Yulu Xie, Wenxuan Liu, Huan Zhao, Yan Xu, Jinjin Gu, Junhua Zhao

机构 * Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The University of Hong Kong(香港大学) Hong Kong Polytechnic University(香港理工大学) AIRS

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.AI

AI总结 EngiBench是一个分层基准,用于评估大型语言模型在解决工程问题上的能力,涵盖基础知识检索、情境推理和开放性建模三个层次,揭示当前LLM在现实工程中仍缺乏高级推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏