PromptCap: Prompt-Guided Task-Aware Image Captioning
专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.CL
Comments Accepted to ICCV 2023
AI 大模型
检索增强生成、向量检索、知识库问答和面向大模型的搜索系统。
专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.CL
Comments Accepted to ICCV 2023
专题命中 多模态RAG :retriever(abstract);分类 cs.CL
Comments Bachelor's thesis
专题命中 多模态RAG :retriever(abstract);分类 cs.CL
Comments Preprint (16 pages, 5 figures)
专题命中 多模态RAG :knowledge retrieval(abstract);分类 cs.CL
Comments Accepted in AACL-IJCNLP 2022
专题命中 多模态RAG :dense retrieval(abstract);分类 cs.IR
Comments 7 pages, IMuR Preprint
专题命中 多模态RAG :retriever(abstract);分类 cs.CL
Comments Accepted at ACM Multimedia (ACMMM) 2021
专题命中 多模态RAG :vector search(abstract);分类 cs.CL
Comments Accepted to ACL2021 (10 pages)
专题命中 多模态RAG :retriever(abstract);分类 cs.CL
Comments Accepted by CVPR 2021
专题命中 多模态RAG :retriever(abstract);分类 cs.CL
Comments ACM MM 2019
专题命中 多模态RAG :RAG(abstract,comments)
Comments Code is available at https://github.com/NJU-PCALab/RAG-Diffusion
AffectAgent:协同多智能体推理用于检索增强的多模态情感识别
机构 * Great Bay University(大湾大学) ; Guangming Laboratory(光明实验室)
专题命中 多模态RAG :retrieval-augmented generation(abstract)
AI总结 本文提出AffectAgent,通过协同多智能体推理框架,解决多模态情感识别中的模态模糊和复杂情感依赖问题,引入MB-MoE和RAAF提升表现。
Comments Accepted by ACM MM 2026
从解释到诊断:具有失误感知能力的下一代交互式视频教练
专题命中 多模态RAG :knowledge retrieval(abstract)
AI总结 提出一种基于双模型架构的失误感知教练能力,通过将任务-方法-知识模型与教学模型结合,实现学习者错误的检测、分类和诊断性支架生成,从而提供更精确、可操作的反馈。
FOLIO:用于流视频理解的聚焦语义记忆
机构 * University of Southern California (USC)(南加州大学) ; Intel Labs(英特尔实验室) ; DEVCOM Army Research Office(陆军研究办公室)
专题命中 多模态RAG :hybrid retrieval(abstract)
AI总结 研究在线流视频理解中如何保留信息及组织历史记录的挑战,提出FOLIO聚焦语义记忆系统,通过动态聚焦状态更新记忆,结合短期视觉缓冲区与长期语义记忆,实现轻量级混合检索,提升性能并降低流记忆维护成本。
Comments 28 pages, 5 figures
LEMUR 2:释放人工智能的神经网络多样性
机构 * University of Würzburg(维尔茨堡大学)
专题命中 多模态RAG :RAG(abstract)
AI总结 LEMUR 2旨在释放神经网络多样性,通过统一生成、评估和部署管道,利用多种方式生成超14000个不同架构及大量训练记录,采用特定管道进行自动部署和延迟基准测试,涵盖多模态任务,为LLM微调提供数据基础,推动相关新兴范式发展。
Comments 10 pages, 9 figures, 1 table
花瓶博物馆:古希腊陶器数字智能博物馆
机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Huazhong University of Science and Technology(华中科技大学) ; Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系) ; UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学UCAS-Terminus人工智能实验室)
专题命中 多模态RAG :knowledge retrieval(abstract)
AI总结 针对古希腊陶器文化遗产领域中视觉语言模型面临的挑战,提出轻量级模块化多模态智能体框架花瓶博物馆,结合虚拟博物馆与花瓶智能体,经多模态感知等操作,提高引用有效性,减少幻觉并产生更中立答案。
Comments Code: https://github.com/AIGeeksGroup/VaseMuseum. Website: https://aigeeksgroup.github.io/VaseMuseum
Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA
机构 * ShanghaiTech University(上海科技大学) ; Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) ; Lingang Laboratory(临港实验室)
专题命中 多模态RAG :retriever(abstract)
AI总结 提出Wiki-R1框架,通过可控课程数据生成和课程采样策略,结合强化学习激励MLLMs在KB-VQA中的推理能力,在Encyclopedic VQA和InfoSeek上取得新SOTA。
Comments Accepted by ICLR 26, code and weights are publicly available
DataEvolver: 面向文本丰富图像生成的自我进化多智能体数据构建
机构 * Central South University(中南大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 多模态RAG :retriever(abstract)
AI总结 提出DataEvolver,一种自我进化的多智能体框架,通过反馈驱动策略迭代优化数据构建,显著提升文本丰富图像生成质量。
Vortex: 面向智能视频检索的多模态融合系统
机构 * University of Science, VNU-HCM(越南国立大学胡志明市理科大学) ; Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市)
专题命中 多模态RAG :hybrid retrieval(abstract)
AI总结 提出Vortex系统,融合自适应关键帧提取、多模态元数据生成及混合检索策略(CLIP与SigLIP2的倒数秩融合),结合Rocchio反馈和多阶段时序搜索,在比赛中取得优异成绩。
Comments SOICT 2025
基于多模态LLM的ICT图像描述:弥合通用与行业领域之间的差距
机构 * GTS, Huawei Technologies Co., Ltd.(华为技术有限公司GTS部门)
专题命中 多模态RAG :retrieval-augmented generation(abstract)
AI总结 本文提出多阶段训练策略,构建ICT领域图像描述模型DICModel,通过合成图像文本对提升模型性能,实验表明其在BLEU指标和准确率上均优于现有模型。
Journal ref 2025 CCF BigData
细节决定成败——从OCR处理旧教会斯拉夫语到纯粹视觉谱系重建
专题命中 多模态RAG :RAG(abstract)
AI总结 本文通过对比多种OCR系统,探讨OCR在处理18世纪手写教会斯拉夫语文本中的准确性,并引入基于图像处理的纯视觉谱系重建方法。
Comments International conference at Valamo monastery, Finnland, 2026
Fundus-R1: 基于公共数据训练具备知识感知推理能力的视网膜图像阅读MLLM
机构 * Renmin University of China(中国人民大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang Gongshang University(浙江工商大学)
专题命中 多模态RAG :RAG(abstract)
AI总结 本文提出Fundus-R1,通过公共数据集训练具备知识感知推理能力的视网膜图像阅读MLLM,采用RAG方法生成知识感知推理轨迹,并通过过程奖励增强RLVR,实验证明其在三个基准测试中优于多个基线模型。
ReCALL: 为基于MLLM的组合图像检索 recalibrate 能力退化
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Southeast University(东南大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; National University of Singapore(新加坡国立大学) ; Wuhan AI Research(武汉人工智能研究院) ; Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)
专题命中 多模态RAG :retriever(abstract)
AI总结 ReCALL通过诊断生成器盲点、生成修正指令和三元组、并持续训练来缓解基于生成式MLLM的检索能力退化问题,实验证明其在CIRR和FashionIQ上达到SOTA性能。
Comments Accepted to CVPR 2026
从单目视频生成时空世界场景图
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Indian Institute of Technology Delhi(印度理工学院德里)
专题命中 多模态RAG :RAG(abstract)
AI总结 本文提出World Scene Graph Generation任务,通过ActionGenome4D数据集,引入三种方法解决未观测物体推理问题,推动视频场景理解向世界中心、时间持久和可解释的方向发展。
ExpReS-VLA: 通过经验回放和检索专门化视觉-语言-动作模型
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 多模态RAG :retrieval-augmented generation(abstract)
AI总结 ExpReS-VLA通过经验回放和检索增强,提升VLA模型在特定任务中的适应能力与性能。
Comments 8 pages, 4 figures, 3 tables, accepted to International Conference on Robotics and Automation (ICRA) 2026
打破多模态知识驱动视觉问答中的视觉捷径
机构 * Korea University(韩国大学) ; KAIST(韩国科学技术院) ; Amazon(亚马逊)
专题命中 多模态RAG :retriever(abstract)
AI总结 本研究通过RETINA基准和MIMIR方法,打破多模态知识驱动视觉问答中的视觉捷径问题,验证现有模型对捷径的依赖并展示改进效果。
大规模视觉-语言重排序的高效判别联合编码器
机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本·古里安内盖夫大学INSIGHT实验室)
专题命中 多模态RAG :vector search(abstract)
AI总结 EDJE通过离线预计算和轻量级注意力适配器,实现了高效视觉-语言重排序,显著降低存储和计算成本,提升大规模检索性能。
Comments Accepted at ICLR 2026
MMA:多模态记忆代理
机构 * School of Computer Science, Peking University(北京大学计算机学院)
专题命中 多模态RAG :RAG(abstract)
AI总结 MMA通过动态可靠性评分和冲突感知网络共识,提升多模态代理在长horizon任务中的记忆检索与决策能力,同时在多个基准测试中展现优越性能。
基于块邻接矩阵的时空驱动注意力图神经网络(STAG-NN-BA)用于遥感土地利用变化检测
专题命中 多模态RAG :RAG(abstract)
AI总结 本文提出STAG-NN-BA模型,利用超像素和块邻接矩阵实现遥感土地利用变化检测,优于传统图和非图基线。
Journal ref AAAI Symposium 2023
AudioRAG:一个用于音频推理和信息检索的挑战性基准
专题命中 多模态RAG :retrieval-augmented generation(abstract)
AI总结 AudioRAG是一个用于评估音频推理和信息检索能力的挑战性基准,通过整合检索增强生成技术,为未来研究提供更强大的基准。
Comments Accepted by Audio-AAAI
WorldVQA:评估多模态大语言模型的原子视觉世界知识
机构 * Moonshot AI
专题命中 多模态RAG :knowledge retrieval(abstract)
AI总结 WorldVQA通过评估多模态大语言模型的原子视觉知识,建立衡量其事实性和百科全书广度的基准测试。