TextlessRAG: End-to-End Visual Document RAG by Speech Without Text
机构 * IEEE
专题命中 多模态RAG :RAG(title,abstract)
Comments 5 pages, 4 figures,
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
机构 * IEEE
专题命中 多模态RAG :RAG(title,abstract)
Comments 5 pages, 4 figures,
机构 * University of Science, VNU-HCM(越南国家大学科学学院)
专题命中 多模态RAG :retriever(title,abstract)
Comments ACM Multimedia 2025
机构 * Shiv Nadar University Chennai(施瓦斯纳大学钦奈)
专题命中 多模态RAG :RAG(title,abstract)
专题命中 多模态RAG :RAG(title,abstract)
Comments 37 pages, 36 figures
专题命中 多模态RAG :RAG(title,abstract)
Comments 19 pages, 24 figures (65 images)
ScoreShield:相似度分数的差分隐私发布
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 研究生物识别等应用中相似度分数隐私保护问题,提出ScoreShield先扰动后投影机制,添加校准高斯噪声并投影到可行性集,满足(ε,δ)-DP,给出效用保证,在多任务中评估,改进了风险的n依赖性。
MMIR-TCM:面向中医临床决策支持的记忆集成多模态推理与检索
机构 * Institute of Biopharmaceutics and Health Engineering, Tsinghua Shenzhen International Graduate School(清华深圳国际研究生院生物医药与健康工程研究院) ; Chinese Medicine Guangdong Laboratory(广东省中医药实验室) ; Beijing Normal University(北京师范大学) ; First Hospital of Hebei Medical University(河北医科大学第一医院) ; Lishui Hospital of Zhejiang University(浙江大学丽水医院) ; XiaoMing TCM Hospital(小明中医医院)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出MMIR-TCM框架,结合多模态大模型、记忆增强分割与检索增强生成,解决中医舌诊中的主观性和语义鸿沟问题,在MedTCM数据集上优于GPT-4o等模型。
生成搜索引擎中的标题注入用于优化
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 本文提出Caption Injection,一种多模态G-SEO方法,通过提取图像标题并注入文本内容,提升生成搜索中的主观可见性,实验表明其在G-EVAL指标下优于文本-only基线。
Comments 24 pages, 4 figures, ECML PKDD 2026 Accepted
ProMSA: 渐进式多模态搜索智能体用于基于知识的视觉问答
机构 * OPPO AI Center, OPPO Inc. China(OPPO AI中心,OPPO公司) ; The Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retriever(abstract);分类 cs.AI
AI总结 提出渐进式多模态搜索智能体ProMSA,通过迭代选择图像搜索、文本搜索或停止,在显式工具调用预算和去重机制下,结合序列级强化学习优化,提升基于知识的视觉问答的检索和端到端准确性。
CaVe-VLM-CoT:一种可解释的视觉-语言模型框架
机构 * Vector Institute(向量研究所)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retriever(abstract);分类 cs.AI
AI总结 提出CaVe-VLM-CoT框架,通过五阶段闭环流水线(提取器、检索器、求解器、引用注入器、验证器)实现证据推理,并引入CaVeScore复合指标评估检索质量、引用忠实度和跨模态基础,在ScienceQA和MMMU上取得性能提升。
MIRAGE:基于层次分解的多向量图像检索运行时调度
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) ; School of Information, Renmin University of China(中国人民大学信息学院) ; School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval augmented generation(abstract);分类 cs.IR
AI总结 提出MIRAGE框架,通过层次化分解和跨层次相似性一致性减少冗余计算,实现多向量图像检索的精度提升和3.5倍计算加速。
Comments Will appear in DAC'2026, camera ready
ProtoMedAgent: 通过隐私感知的智能体工作流实现多模态临床可解释性
机构 * School of Computing and Communications(计算与通信学校) ; Lancaster University(兰卡斯特大学) ; Lancaster Medical School(兰卡斯特医学院) ; PUC-Rio(里约热内卢联邦大学) ; Puc-Behring Institute for AI(人工智能皮克林研究所)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 提出ProtoMedAgent框架,通过神经符号瓶颈和反射性Scribe-Critic循环约束生成过程,解决原型网络在临床报告中的语义结构缺失和检索谄媚问题,并引入k-匿名和ℓ-多样性隐私门控。
Comments CVR 2026
从独立大语言模型到整合智能:复合AI系统综述
机构 * New Jersey Institute of Technology(新泽西理工学院)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文综述了复合AI系统,探讨了其整合大语言模型与外部组件的方法,分析了四种基础范式,并指出规模化、互操作性等挑战及未来研究方向。
在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆
机构 * University of Macau(澳门大学) ; UESTC(电子科技大学) ; Purdue University(普渡大学) ; McGill University(麦吉尔大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of Washington(华盛顿大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。
弥合实验最后一公里:数字化实验室知识以实现安全的人工智能辅助支持
机构 * Division of Applied Chemistry, Faculty of Engineering, Hokkaido University(北海道大学工学部应用化学科) ; Graduate School of Chemical Sciences and Engineering, Hokkaido University(北海道大学研究生院化学科学和工程学系) ; Graduate School of Information Science and Technology, Hokkaido University(北海道大学研究生院信息科学和技术学系) ; Quantum Nexus, Inc.
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出一种结合视频、多模态AI和检索增强生成的AI助手,通过提取实验室特定知识来提升实验安全性,经评估显示其在指导和安全方面具有实用性。
Comments 32 pages in total (main 13 pages, appendix 19 pages), 2 main figures, 1 main table
基于案例相似性搜索的医学影像印象 grounded 多模态检索增强草稿生成
机构 * Independent AI Researcher(独立AI研究员)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文提出一种多模态检索增强生成系统,结合对比图像-文本嵌入、基于案例的相似性检索和引用约束草稿生成,以生成具有临床依据的医学影像印象。
Comments 15 pages, 4 figures, 3 tables
GeoSearch:通过网络级反向图像搜索和图像匹配增强全球地理定位
机构 * University of Science, VNU-HCM(越南国家科学大学)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.IR
AI总结 本文提出GeoSearch框架,通过整合网络级反向图像搜索与图像匹配技术,提升全球图像地理定位的准确性,实验表明其在考虑泄漏因素下的优越性。
Comments Accepted to SIGIR 2026 Main Conference
AITP:通过多模态大语言模型进行交通事故责任分配
机构 * Global Institute of Future Technology(未来技术全球研究院)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.CL
AI总结 本文提出AITP模型,结合多模态链式推理和法律知识检索,解决交通事故责任分配问题,并构建DecaTARA基准测试集,验证模型在责任分配、事故检测和理解任务中的领先性能。
Journal ref CVPR 2026 Findings
表征几何形状任务性能在CT结肠镜视觉-语言建模中的作用
机构 * Gilbert S. Omenn Department of Computational Medicine and Bioinformatics(Gilbert S. Omenn 计算医学与生物信息学部门) ; Department of Gastroenterology(消化内科部门) ; Department of Emergency Medicine(急诊医学部门) ; Department of Electrical Engineering and Computer Science(电气工程与计算机科学部门)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract);分类 cs.AI
AI总结 本文研究了CT结肠镜视觉-语言迁移学习,发现均值池化在疾病分类中表现更优,而注意力池化在跨模态检索中更有效,同时指出单片组织对比度比空间覆盖范围更重要,为构建体积医学影像视觉-语言系统提供了基础。
ADSeeker: 一种基于知识的推理框架用于工业异常检测与推理
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);knowledge retrieval(abstract);分类 cs.IR
AI总结 ADSeeker通过整合视觉文档知识库和查询图像-知识检索增强生成框架,提升工业异常检测性能,提出层次稀疏提示机制和类型级特征以提取异常模式,构建大规模AD数据集MulA,实现零样本状态下的最佳性能。
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) ; Alibaba Cloud Computing(阿里巴巴云计算)
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);knowledge retrieval(abstract);分类 cs.AI
Comments Accepted by NeurIPS 2025
HVM-GraphRAG:复杂文档上的整体视图多模态图检索增强生成
专题命中 多模态RAG :retrieval-augmented generation(title);分类 cs.IR、cs.AI
AI总结 针对复杂文档问答中跨模态证据索引不可靠和图遍历昂贵的问题,提出HVM-GraphRAG框架,用整体视图指导图构建,检索时在概念级图上搜索并通过索引访问证据,实验证明其能提升答案性能和检索效率。
专题命中 多模态RAG :retrieval-augmented generation(title);分类 cs.CL、cs.AI
Comments CVPR 2024 Workshop on What is Next in Multimodal Foundation Models
AI原型制作器:一个用于基于分解的GUI原型制作的Figma插件
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)
AI总结 研究针对GUI原型制作耗时问题,提出AI Prototyper插件,通过分解和检索增强生成管道,结合特定技术栈与大语言模型,经人工参与编辑步骤,能多语言输入,在时间和质量维度上表现良好。
Comments Accepted at the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026), Tool Demonstration and Data Showcase Track
EvoGraph-R1:用于智能检索的自进化多模态知识超图
机构 * Northwestern Polytechnical University(西北工业大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Monash University(莫纳什大学) ; The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)
AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。
Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper
M2Note: 通过错误笔记本学习实现视觉语言模型的持续演化
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)
AI总结 提出M2Note,一种无需训练的持续演化框架,通过将失败轨迹转化为可编辑的笔记,利用多模态检索增强生成在推理时引导模型,避免重复错误,并在多个基准上提升性能。
合成专家:一个经过验证的多模态数据集用于可信的人工智能辅助游泳教练
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)
AI总结 本文提出一个多模态数据集,用于构建可信的人工智能游泳教练系统,通过多代理LLM架构生成1864个验证的'问题-上下文-答案'三元组,提升自动化指导的可靠性。
智能体应取代窄预测AI作为6G AI-RAN的协调者
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)
AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。
个性化工具包:无需训练的大型视觉语言模型个性化
机构 * Toyota Motor Europe(丰田欧洲公司)
专题命中 多模态RAG :RAG(abstract,abstract_cn);retrieval-augmented generation(abstract)
AI总结 本文提出无需训练的LVLM个性化方法,通过预训练视觉基础模型提取特征,结合检索增强生成技术实现多概念个性化,适用于图像和视频。
Comments Accepted at Transactions on Machine Learning Research (TMLR) 2026
TRACE: 在上下文中对时间序列进行建模以实现多模态嵌入与检索
专题命中 多模态RAG :retrieval-augmented generation(abstract);RAG(abstract);retriever(abstract)
AI总结 TRACE通过在上下文中对时间序列进行建模,实现多模态嵌入与检索,提升下游任务的预测精度和可解释性,同时作为强大的独立编码器优化上下文感知表示。