arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

RAG / 检索增强生成

检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。

2026-07-14 至 2026-07-14 共收录 28 信号源:cs.IR, cs.CL, cs.AI, cs.DB

1. 检索器与排序 12 篇

2607.11159 2026-07-14 cs.IR 新提交 92%

NGM-RAG: Neural Graph Matching based Retrieval-Augmented Generation

NGM-RAG:基于神经图匹配的检索增强生成

Guo Chen, Ziwen Li, Maolin Zheng, Hao Gao, Junjie Huang, Tao Jia

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(title,abstract);分类 cs.IR

AI总结 研究针对传统RAG方法在处理复杂问题时的局限,提出基于神经图匹配的检索增强生成框架NGM-RAG,将图构建、匹配与答案生成统一,结合文本匹配和GNN,采用自适应加权策略,实验证明该模型在多跳问答等任务中性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10316 2026-07-14 cs.IR 新提交 92%

SVD-RAG: Efficient Tree-Organized Retrieval-Augmented Generation via Singular Value Decomposition

SVD-RAG:通过奇异值分解实现高效的树状组织检索增强生成

Zhihui Sun

专题命中 检索器与排序 :RAG(title,title_cn);retrieval-augmented generation(title,abstract);分类 cs.IR

AI总结 研究提出SVD-RAG,通过对密集句子嵌入矩阵应用奇异值分解进行层次RAG抽取式摘要。该方法具确定性、成本效益高、内容自适应特点,实验表明其检索质量与RAPTOR相近,构建树速度更快且在多主题基准上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11783 2026-07-14 cs.CL 新提交 89%

How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation?

温度如何塑造检索增强生成中的意识形态话语?

Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) São Paulo Catholic University(圣保罗天主教大学)

专题命中 检索器与排序 :RAG(summary_cn,abstract);retrieval-augmented generation(title,abstract);分类 cs.CL

AI总结 研究探讨温度对检索增强生成中意识形态话语的影响,通过对新冠治疗文章语料库应用词汇多维分析,让模型在不同温度下回答意识形态问题并评估,发现RAG框架易转移意识形态话语,中等温度下话语对齐最高,低温时下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10491 2026-07-14 cs.LG 新提交 88%

EvidentialRAG: Quantifying and Mitigating Information Conflict in Multi-Source Retrieval-Augmented Generation via Evidential Deep Learning

证据RAG:通过证据深度学习量化和缓解多源检索增强生成中的信息冲突

S M Asif Hossain, Ruksat Khan Shayoni, M. F. Mridha

机构 * School of Computing, Wichita State University(威奇托州立大学计算学院) Department of Computer Science, American International University-Bangladesh(美国国际孟加拉大学计算机科学系)

专题命中 检索器与排序 :RAG(title_cn,abstract);retrieval-augmented generation(title,abstract)

AI总结 研究多源检索增强生成中信息冲突问题,提出ERAG框架,通过将检索块转换为概率证据、用轻量级评估器和融合规则处理不确定性,实验表明该框架在标准问答有竞争力,在冲突情况下行为改善,是可信信息处理实用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05235 2026-07-14 cs.CL 版本更新 85%

FedMosaic: Federated Retrieval-Augmented Generation via Parametric Adapters

FedMosaic:通过参数适配器进行联邦检索增强生成

Zhilin Liang, Yuxiang Wang, Zimu Zhou, Hainan Zhang, Boyi Liu, Yongxin Tong

机构 * SKLCCSE Lab Beihang University Beijing China(SKLCCSE实验室 北航) Department of Data Science City University of Hong Kong Hong Kong China(数据科学系 香港城市大学) Beijing Advanced Innovation Center Beihang University Beijing China(北京先进创新中心 北航) Beihang University(北航) City University of Hong Kong(香港城市大学)

专题命中 检索器与排序 :retrieval-augmented generation(title,abstract);RAG(abstract,abstract_cn);分类 cs.CL

AI总结 研究针对隐私敏感领域,解决联邦检索增强生成中高存储通信及适配器聚合问题。核心方法是提出FedMosaic框架,聚类文档成多文档适配器并选择性聚合。主要贡献是准确率提高,存储和通信成本降低,且不共享原始文档。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11362 2026-07-14 cs.IR 新提交 81%

Boolean queries are all you need?

布尔查询就足够了吗?

Charles L. A. Clarke, Mark D. Smucker

专题命中 检索器与排序 :RAG(summary_cn,abstract);分类 cs.IR

AI总结 研究在TREC 2024 RAG赛道任务中,为基于大语言模型的搜索代理配备布尔检索引擎,仅依据语料库子串与查询匹配密度排名,无需监督学习等,结果表明简单模式匹配或足以用于智能搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11465 2026-07-14 cs.IR 新提交 79%

Score-Only Distillation for Compact Dense Retrieval

用于紧凑密集检索的仅分数蒸馏

Kirill Dubovikov, Martin Takac, Salem Lahlou

专题命中 检索器与排序 :dense retrieval(title);retriever(abstract);分类 cs.IR

AI总结 研究紧凑检索器能否从分数向量学教师排序行为,用行中心分数向量目标训练,在固定评估面板上蒸馏协议可弥补部分基础与教师模型差距,蒸馏后学生模型编码加速,外部迁移性能有好有坏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09682 2026-07-14 cs.LG cs.SE 新提交 75%

AuditWeave: A Tamper-Evident, Auditor-Navigable Evidence Layer for AI-Assisted and Data-Transformation Workflows

AuditWeave:用于人工智能辅助和数据转换工作流程的防篡改、审计可导航证据层

Vimal Nakrani

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 研究针对人工智能辅助和数据转换工作流程中证据追溯及防篡改问题,提出轻量级Python库AuditWeave,它能将工作流程步骤记录到哈希链接账本,通过链验证检测篡改,评估了其记录开销等性能,保证了事件完整性。

Comments 8 pages, 3 figures, open-source implementation at pypi.org/project/auditweave

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11309 2026-07-14 physics.comp-ph 新提交 75%

Toward AI-Agent-Driven Particle Transport Simulations: Implementation of AI-Assisted Workflows for PHITS

迈向人工智能代理驱动的粒子输运模拟:PHITS的人工智能辅助工作流程实现

Tatsuhiko Sato, Shintaro Hashimoto, Tatsuhiko Ogawa, Takuya Furuta, Yuho Hirata, Seiki Ohnishi, Yasuhito Sakaki, Nobuhiro Shigyo

专题命中 检索器与排序 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)

AI总结 研究针对蒙特卡罗粒子输运代码使用复杂的问题,提出将人工智能助手和代理应用于PHITS的策略,准备了两组人工智能就绪资源,经五个示范任务验证,表明提供适当资源和规则时人工智能代理可处理复杂工作流程,支持捆绑资源使用通用人工智能工具。

Comments 30 pages, 3 figures, and 2 tables, including 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10994 2026-07-14 cs.LG 新提交 67%

A Multi-Agent Framework for Zero-Dimensional Reduced-Order Model Planning

用于零维降阶模型规划的多智能体框架

Bingteng Sun, Hao Yin, Yiling Chen, Renjie Xiao, Lei Xie, Shanyou Wang, Ruonan Wang, Shubao Chen, Qingzong Xu, Lin Lu, Qiang Du, Junqiang Zhu

机构 * Institute of Engineering Thermophysics, Chinese Academy of Sciences(中国科学院工程热物理研究所) National Key Laboratory of Science and Technology on Advanced Light-duty Gas-turbine(先进轻型燃气轮机技术重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Qingdao Institute of Aeronautical Technology(青岛航空技术研究院) Nanjing Future Energy System Research Institute(南京未来能源系统研究院)

专题命中 检索器与排序 :retrieval-augmented generation(abstract);RAG(abstract)

AI总结 本文针对复杂零维降阶模型规划中依赖人工、传统方法局限等问题,提出多智能体架构Z-COPA,其核心是专用图表示法,将规划转化为图结构优化问题,经多基准测试验证,该框架性能卓越且打破传统范式,提供新规划技术方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07372 2026-07-14 cs.CL cs.AI 版本更新 62%

Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models

通过可扩展查找实现条件记忆:大语言模型稀疏性的新轴

Xin Cheng, Rui Tian, Wangding Zeng, Damai Dai, Qinyu Chen, Bingxuan Wang, Zhenda Xie, Kezhao Huang, Xingkai Yu, Chengqi Deng, Shangyan Zhou, Chenggang Zhao, Zhewen Hao, Yukun Li, Han Zhang, Zhengyan Zhang, Yixu Wei, M. Y Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang

机构 * Peking University(北京大学) DeepSeek-AI

专题命中 检索器与排序 :knowledge retrieval(abstract);分类 cs.CL、cs.AI

AI总结 研究针对Transformer缺乏知识查找原语的问题,引入条件记忆及Engram模块,通过制定稀疏分配问题发现U形缩放定律,扩展Engram至27B参数,在多领域提升性能,揭示其优势,为下一代稀疏模型提供重要建模原语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11364 2026-07-14 cs.LG cs.AI cs.MM 新提交 57%

BackgroundMellow: A Multi-Modal Cohesive Framework for Narrative-Driven Rich Cinematic Soundscape Generation

BackgroundMellow:一种用于叙事驱动的丰富电影音效生成的多模态凝聚框架

Ajitesh Jamulkar, Aritra Hazra

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡拉格布尔分校)

专题命中 检索器与排序 :retriever(abstract);分类 cs.AI

AI总结 多模态AI中为文本叙事生成电影音效困难,BackgroundMellow框架将其视为编排与信号处理问题,通过主 - 专家架构、Tango2模型、背景音乐检索器及NLP模块实现,经实验验证在时间同步等方面有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 向量检索 1 篇

2606.21535 2026-07-14 cs.IR 版本更新 81%

From Embedding Geometry to Spectral Search: Energy Dispersion Networks For Vector Retrieval

从嵌入几何到谱搜索:面向向量检索的能量色散网络

Lorenzo Moriondo, Ilias Azizi

专题命中 向量检索 :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);vector search(abstract);分类 cs.IR

AI总结 提出图布线框架,利用特征空间谱结构改进向量检索,通过谱索引和τ调制实现几何与谱信息的融合,提升头尾一致性和语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 知识库问答 1 篇

2402.01767 2026-07-14 cs.CL cs.AI cs.LG 版本更新 86%

HiQA: A Hierarchical Contextual Augmentation RAG for Multi-Documents QA

HiQA:一种用于多文档问答的分层上下文增强检索与生成模型

Xinyue Chen, Pengyu Gao, Jiangjiang Song, Xiaoyang Tan

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Southeast University(东南大学) Hello World(Shanghai) Technology Co., Ltd.(Hello World(上海)科技有限公司)

专题命中 知识库问答 :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 针对检索增强生成在多文档问答中面对大量相似文档时检索准确性有限的问题,提出HiQA框架,它集成级联元数据与多路径检索机制,还发布MasQA基准,在多文档环境中展现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长文档RAG 3 篇

2606.09204 2026-07-14 cs.LG cs.CL cs.CR 版本更新 90%

The Injection Paradox: Brand-Level Suppression in Safety-Trained LLM Recommendations via RAG Context Injection

注入悖论:通过RAG上下文注入在安全训练的LLM推荐中实现品牌级压制

Hyunseok Paeng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 长文档RAG :RAG(title,title_cn);分类 cs.CL

AI总结 研究发现在基于RAG的LLM推荐中,安全训练会导致注入提示反而压制目标品牌推荐率,揭示了安全机制可能被逆向利用的风险。

Comments 18 pages, 1 figure, 15 tables. Accepted at the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN), a non-archival venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10463 2026-07-14 cs.AI cs.IR 新提交 86%

GRASP: GRanularity-Aware Search Policy for Agentic RAG

GRASP:用于智能检索增强生成的粒度感知搜索策略

Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe 研究院)

专题命中 长文档RAG :RAG(title,abstract);retrieval-augmented generation(abstract);分类 cs.IR、cs.AI

AI总结 研究智能体检索增强生成中模型决策难题,提出GRASP强化学习框架,训练智能体协调互补检索工具,实验表明其提升检索召回率和问答性能,还展现出可解释行为,凸显协调检索信号和上下文粒度对智能体推理的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01299 2026-07-14 cs.DC 版本更新 67%

HYPIC: Accelerating Hybrid-Attention LLM Serving with Position-Independent Caching

HYPIC: 利用位置无关缓存加速混合注意力LLM服务

Yifei Liu, Juntong Wu, Yang Liu, Junhao Hu, Minghao Li, Xiaoxu Chen, Weihang Chen

专题命中 长文档RAG :retrieval-augmented generation(abstract);RAG(abstract_cn)

AI总结 提出Hypic系统,通过段累积转移算子和边界重计算,实现混合注意力LLM的位置无关缓存,显著降低首令牌延迟并提升吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图谱与结构化RAG 3 篇

2607.10151 2026-07-14 cs.IR 新提交 91%

MC-RAG System: A Structure-Driven RAG System for Multi-Constraint Queries

MC-RAG系统:用于多约束查询的结构驱动RAG系统

Xiao Zhang, Yang Wan, Yi Li, Miao Xie, Chunli Lv

专题命中 图谱与结构化RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 针对RAG系统难以满足复杂多约束查询的问题,提出MC-RAG系统,将检索转化为知识图上的子图匹配问题,通过整合语义、结构嵌入与路径级索引,实现可解释、结构感知和约束一致的检索与生成,并提供交互式演示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11683 2026-07-14 cs.CL cs.AI 新提交 62%

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM

RAGU:一个具有紧凑域适应语言模型的多步图检索增强生成引擎

Mikhail Komarov, Ivan Bondarenko, Stanislav Shtuka, Oleg Sedukhin, Roman Shuvalov, Yana Dementyeva, Matvey Solovyov, Nikolay O. Nikitin

机构 * ITMO University(圣彼得堡国立信息技术机械与光学大学) Novosibirsk State University(新西伯利亚国立大学) Far Eastern Federal University(远东联邦大学)

专题命中 图谱与结构化RAG :retrieval-augmented generation(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有GraphRAG系统问题,提出RAGU引擎,通过分离提取与合并多步处理知识图。核心方法包括两阶段提取等。贡献在于训练的Meno-Lite-0.1模型表现出色,在多方面超越其他模型,且RAGU安装简单、运行要求低并开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新 50%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 图谱与结构化RAG :retrieval-augmented generation(abstract)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态RAG 3 篇

2604.04969 2026-07-14 cs.IR cs.AI 版本更新 93%

MG$^2$-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation

MG$^2$-RAG:多粒度图用于多模态检索增强生成

Sijun Dai, Qiang Huang, Xiaoxing You, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(title,abstract);分类 cs.IR、cs.AI

AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22378 2026-07-14 cs.SD cs.AI cs.MM eess.AS 91%

Zero-Effort Image-to-Music Generation: An Interpretable RAG-based VLM Approach

零努力图像到音乐生成:一种可解释的基于RAG的视觉语言模型方法

Zijian Zhao, Dian Jin, Zijing Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong Polytechnic University(香港理工大学) The University of Hong Kong(香港大学) The Hong Kong University of Science(香港科学大学) The Hong Kong Polytechnic University Hong Kong China(香港理工大学香港中国) The University of Hong Kong Hong Kong China(香港大学香港中国)

专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.AI

AI总结 本文提出一种基于RAG的视觉语言模型方法,实现图像到音乐生成,通过ABC记谱法连接文本与音乐模态,并利用多模态检索增强生成和自反思技术,提供高可解释性且低计算成本的音乐生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10798 2026-07-14 cs.CL 新提交 89%

Trust Before Fusion: QIMG-7 and Source-Aware Resolution for Polluted Multimodal RAG

融合前的信任:用于受污染多模态RAG的QIMG-7和源感知分辨率

Saadeldine Eletter, Owais Aijaz, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态RAG :RAG(title,title_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 研究多模态检索增强生成中受污染内容问题,提出QIMG-7基准。针对朴素多模态融合脆弱问题,提出源感知信任分辨率(SATR),Field-Selector变体效果最佳,结果支持选择性信任,显式文本可靠性建模是收益主要驱动因素。

Comments 23 pages, 6 figures, 23 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏

7. RAG评测 5 篇

2607.10626 2026-07-14 cs.CL 新提交 89%

Eval-Pair Matrix: Answer-Paired Meta-Evaluation of LLM Judges for Grounded RAG

评估对矩阵:基于事实的检索增强生成中大型语言模型评判器的答案配对元评估

Sriram Selvam, Anneswa Ghosh

专题命中 RAG评测 :RAG(title,summary_cn);retrieval-augmented generation(abstract);分类 cs.CL

AI总结 研究针对基于事实的检索增强生成中大型语言模型评判器自我宽容难识别问题,引入Eval-Pair Matrix协议,通过特定流程生成答案并评估,经实验得出同模型效应等结果,强调RAG评判器研究应报告多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11267 2026-07-14 cs.IR cs.AI cs.CL 新提交 86%

Enhancing LLMs through human feedback: a journey towards self-improvement

通过人类反馈增强语言模型:自我提升之旅

Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon

机构 * Intel Corporation(英特尔公司)

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval augmented generation(abstract);分类 cs.IR、cs.CL、cs.AI

AI总结 研究在信息检索系统中,通过整合辅助反馈RAG系统及人工参与,利用人类反馈优化主RAG系统性能,经多数据集测试验证方法有效,强调了其变革潜力,为自适应信息检索技术研究树立了先例。

Comments AIC 2025: The 10th International Workshop on Artificial Intelligence and Cognition (held as part of ECAI 2025). October 25-26, 2025. Bologna, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07978 2026-07-14 cs.IR 版本更新 84%

Cost and Accuracy of Long-Term Memory in Distributed Multi-Agent Systems Based on Large Language Models

基于大语言模型的分布式多智能体系统中长期记忆的成本与准确性

Benedict Wolff, Jacopo Bennati

专题命中 RAG评测 :RAG(summary_cn,abstract);retrieval-augmented generation(abstract);分类 cs.IR

AI总结 针对分布式多智能体系统中长期记忆的成本与准确性评估空白,构建独立可复现测试平台,比较多种架构并发现检索不完整是准确率差距主因,RAG基线以更低总拥有成本达到高准确率。

Comments Copyright IEEE 2026. Manuscript accepted at IEEE COMPSAC 2026. Not for redistribution. Published version: https://doi.org/10.1109/XXXXXX

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09322 2026-07-14 cs.AI 版本更新 81%

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

LongMedBench:用于长期临床决策的医疗智能体基准测试

Zihan Xu, Yanzhen Chen, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Transvascular Implantation Devices Research Institute(血管内植入装置研究所)

专题命中 RAG评测 :RAG(summary_cn,abstract);分类 cs.AI

AI总结 介绍基于EHR的LongMedBench基准,用于长期临床决策。构建含多患者多事件数据集,提出评估分类法。实验表明大语言模型在隐式时间推理有挑战,RAG和智能体记忆系统对信息检索有帮助,决策任务性能依赖模型即时上下文。

Comments Submitted manuscript prior to peer review in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10380 2026-07-14 cs.CL 新提交 57%

CAFE: A Compound-AI Factorial Evaluation Framework

CAFE:一种复合人工智能因子评估框架

Fabian Lukassen, Christoph Weisser, Thomas Kneib, Alexander Silbersdorff

机构 * University of Göttingen(哥廷根大学) Bielefeld University of Applied Sciences and Arts (HSBI)(比勒费尔德应用科学与艺术大学)

专题命中 RAG评测 :retriever(abstract);分类 cs.CL

AI总结 CAFE是开源平台,用于复合人工智能系统评估。它将管道组件设为因子构建析因设计,运行配置并用模型评判器和人工评分。能归因质量差异,报告多种结果,还能解释组件影响,在问答管道验证有效,已发布为Python包和Web应用。

详情

展开后加载摘要…

URL PDF HTML 收藏