arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-07-30 至 2026-07-30 共收录 5 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. RAG评测 5 篇

2607.26843 2026-07-30 cs.SE 新提交 90%

When Knowledge Changes: Metamorphic Testing of RAG Systems with Mutations

当知识发生变化时:面向RAG系统的变异体态测试

Jinhan Kim, Samuele Pasini, Paolo Tonella

专题命中 RAG评测 :RAG(title,title_cn);retrieval-augmented generation(abstract)

AI总结 针对现有RAG系统评估方法无法检测语料库演变带来的故障问题,提出含11个变异算子的体态测试框架,实验显示其F1分数远优于RAGAS,可有效评估RAG系统在语料库变化下的一致性。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26075 2026-07-30 cs.IR cs.AI 新提交 82%

IDP AutoOpt: Agent-Driven Optimization of Document Processing Pipeline Configurations

IDP AutoOpt:智能文档处理流水线配置的智能体驱动优化

David Kaleko, Sergey Ivanov, Md Mofijul Islam

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.IR、cs.AI

AI总结 IDP AutoOpt是自主LLM智能体,通过闭环流程优化IDP流水线配置,在多领域任务上性能优于人类专家且成本更低,还可扩展至RAG等其他企业AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24162 2026-07-30 cs.AI cs.LG 版本更新 77%

Agent-UCT: Upper Confidence Bounds Applied to Trees for Agentic Workflow Optimization with Cost-Awareness

Agent-UCT:应用于树的上置信界,用于具有成本意识的智能工作流优化

Yang Li, Hai Liu, Dian Shao, Yu Wang, Xiyu Chen, Sergey Volkov, Bozhi Wang, Ziyu Sun, Sihang Liu, Ye Luo, Xiaowei Zhang

机构 * The University of Hong Kong(香港大学) School of Artificial Intelligence, Jiangxi Science and Technology Normal University(江西科技师范大学人工智能学院) The Hong Kong University of Science and Technology(香港科技大学) University of Science and Technology of China(中国科学技术大学) New York University(纽约大学)

专题命中 RAG评测 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 研究针对智能工作流优化中计算冗余和预算分配低效问题,提出Agent-UCT算法,结合RAGSpace框架和WTB,通过重用感知正则化项减少冗余执行,实验证明其能有效识别最佳配置,实现成本感知、可重现且组合高效的智能工作流优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26160 2026-07-30 cs.AI 新提交 70%

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo

专题命中 RAG评测 :RAG(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07314 2026-07-30 cs.CL cs.AI 版本更新 62%

MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications

MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估

Praveenkumar Kanithi, Clément Christophe, Marco AF Pimentel, Tathagata Raha, Prateek Munjal, Nada Saadi, Hamza A Javed, Svetlana Maslenkova, Nasir Hayat, Ronnie Rajan, Shadab Khan

机构 * M42

专题命中 RAG评测 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 MEDIC通过综合评估框架揭示LLM在临床应用中的安全性和实用性差异,强调需采用组合方法以应对多维度性能权衡。

Comments Published in Transactions on Machine Learning Research (06/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏