Deep Unified Multimodal Embeddings for Understanding both Content and Users in Social Media Networks
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Preprint submitted to IJCV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
Comments Preprint submitted to IJCV
专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM
Comments 7 pages,3 figures,4 tables;The paper is under consideration at Image and Vision Computing
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
Comments 8 pages, 5 figures, accepted by ACM Multimedia 2017
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.MM
Comments 20 pages, 11 figures, 9 tables
专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV;multi-modal(comments)
Comments Submitted to Multi-Modal Scene Understanding. arXiv admin note: substantial text overlap with arXiv:1808.06368
专题命中 跨模态检索 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV
Comments ACM International Conference on Multimodal Interaction (ICMI 2018)
基于双角色标识符的生成式通用多模态检索
专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.AI
AI总结 本文针对生成式信息检索的三大挑战,提出具备双角色标识符的DrIG框架,经实验验证其在多模态检索任务中性能优于现有基线,且能平衡效率与效果。
Comments This paper is under review
CertBind:从多模态连接到可验证的检索决策
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 该研究提出CertBind多尺度理论,解决多模态编码器组合后的检索决策可验证问题,通过多尺度设计实现误差控制与恢复,在实验中验证了其对原生检索能力的可控性与无损害性。
DARAD:用于持续遥感图像-文本检索的双适配器与排序感知蒸馏框架
专题命中 跨模态检索 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对持续遥感图像-文本检索中跨模态对齐空间失真的问题,提出双适配器与排序感知蒸馏框架DARAD,通过双分支设计与双向排序蒸馏实现新数据适应性与历史数据有效性的平衡,性能优于现有持续学习方法。
当模态无法“共舞”:多模态对比学习中的共形后门检测
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV
AI总结 针对多模态对比学习后门检测方法的缺陷,提出CASCADE两阶段共形框架,在CC3M数据集上实现高TPR下低FPR与高AUROC,可应对自适应攻击。
AffectAgent:协同多智能体推理用于检索增强的多模态情感识别
机构 * Great Bay University(大湾大学) ; Guangming Laboratory(光明实验室)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出AffectAgent,通过协同多智能体推理框架,解决多模态情感识别中的模态模糊和复杂情感依赖问题,引入MB-MoE和RAAF提升表现。
Comments Accepted by ACM MM 2026
MRAFnd:面向零样本假新闻检测的多模态检索增强框架
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 针对零样本假新闻检测的现有方法无法识别重复虚假手段与跨模态差异的问题,本文提出多模态检索增强框架MRAFnd,经多智能体协作推理,在Weibo-21等数据集上准确率最高提升2.35%,优于现有方法。
Comments 14 pages, 6 figures, 2 tables, Presented at the MMM 2026
HVM-GraphRAG:复杂文档上的整体视图多模态图检索增强生成
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 针对复杂文档问答中跨模态证据索引不可靠和图遍历昂贵的问题,提出HVM-GraphRAG框架,用整体视图指导图构建,检索时在概念级图上搜索并通过索引访问证据,实验证明其能提升答案性能和检索效率。
基于全局监督的局部多模态音乐对齐
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM
AI总结 研究如何利用全局监督实现局部多模态音乐对齐,提出FuSiLi方法,通过基于Sinkhorn的软对齐操作局部特征,结合传统全局相似性微调预训练编码器,在跨模态检索和帧级对齐任务中表现出色,优于多种基线。
Comments ISMIR 2026
超越目标表现力:多模态对比学习中的几何保留
机构 * Berlin Institute of Health, Charité - Universitätsmedizin Berlin(柏林健康研究院,柏林夏里特大学医学中心) ; Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系) ; Intelligent Medicine Institute, Fudan University(复旦大学智能医学研究院)
专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.AI
AI总结 研究多模态对比学习从成对扩展到高阶对齐的挑战,确定编码器雅可比条件是关键因素,引入几何保留编码器,通过正则化调节雅可比,实验证明改善其条件可提升检索和线性探针性能,表明多模态对比学习还取决于编码器几何和优化属性。
RADD:基于检索的离散扩散用于多模态知识图谱补全
机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院)
专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 本文提出RADD框架,通过分离检索与重排序过程,提升多模态知识图谱补全的性能,实验表明其在多个基准上表现最佳。
Comments 13 pages, 3 figures, 8 tables
开普勒编码器v0.1:迈向机器人的多模态嵌入模型
机构 * Menlo Research(门洛研究公司)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究针对机器人理解自身状态问题,提出开普勒编码器v0.1,通过学习查询交叉注意力层融合多模态信息,经自监督训练。实验表明其仅视觉潜空间能恢复末端执行器状态,优于其他方法,单个编码器涵盖多个机器人,冻结潜空间有多种用途。
Comments 33 pages
EvoGraph-R1:用于智能检索的自进化多模态知识超图
机构 * Northwestern Polytechnical University(西北工业大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Monash University(莫纳什大学) ; The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。
Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper
SOLAR:用于对称多模态检索的自监督联合学习
机构 * Ant Group(蚂蚁集团)
专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出SOLAR框架,通过自监督学习解决对称多模态检索问题,利用未标记数据提升模型性能,实验显示其在基准测试中优于现有方法。
Comments Accepted by ICML 2026. Code, model and benchmark are available at https://github.com/codefuse-ai/SOLAR
MG$^2$-RAG:多粒度图用于多模态检索增强生成
机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 MG$^2$-RAG通过构建层次化多模态知识图谱,融合文本与视觉信息,提升多模态检索与生成性能,实验显示其在四个任务中均取得最佳效果,同时显著提升效率。
FDRMFL:基于信息最大化和对比学习的多模态联邦特征提取模型
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 针对非IID数据分布下联邦回归的多模态特征提取难题,提出FDRMFL框架,通过统一的四项局部目标应对挑战,实验表明该框架能有效降低平均MSE,在六种联邦算法中表现最佳。
Comments Accepted author manuscript; published version DOI: 10.1016/j.asoc.2026.115874
Journal ref Applied Soft Computing 202 (2026) 115874
属性提示核哈希用于无监督数据高效跨模态检索
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; VinUniversity
专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 提出属性提示核哈希(APKH),利用视觉-语言基础模型的广义属性先验,通过上下文优化属性核映射和核平滑对比对齐,在数据受限场景下实现从可见到不可见类别的跨模态检索。
基于全局邻域对齐哈希的无监督数据高效跨模态检索
机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ; Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) ; College of Computer and Information Engineering, Henan Normal University(河南师范大学计算机与信息工程学院) ; VinUniversity(Vin大学)
专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 提出全局邻域对齐哈希(GNAH),通过原型锚定全局对齐和对比随机邻域对齐,在少量图像-文本对下学习紧凑二进制码,实现数据高效的无监督跨模态检索。
TriPAH:面向跨模态医学检索的不平衡感知三提示亲和哈希
专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.MM
AI总结 提出TriPAH框架,通过本体引导的患者级提示、轻量级提示-令牌混合器及不平衡感知多任务目标,解决跨模态医学哈希检索中的语义碎片、长尾标签和量化脆弱性问题,在三个数据集上超越现有方法。
Comments 10 pages, 3 figures, 4 tables
基于迭代能量多模态Transformer的Sentinel-1与Sentinel-2时序联合反演小麦土壤水分、叶面积指数和株高
机构 * Department of Urban and Environmental Policy and Program, Tufts University(Tufts大学城市与环境政策与项目系) ; Electrical and Computer Engineering Department, Mississippi State University(密苏里州立大学电气与计算机工程系) ; Department of Physics, Indian Institute of Technology (BHU)(印度理工学院(BHU)物理系) ; Institute of Environment and Sustainable Development, Banaras Hindu University(巴纳尔斯赫尔大学环境与可持续发展研究所)
专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
AI总结 提出迭代能量Transformer(iEBT),通过嵌入多模态预测器并迭代更新目标向量,从Sentinel-1和Sentinel-2时序数据中联合反演土壤水分、叶面积指数和株高,在印度瓦拉纳西实测数据上取得高精度,并利用终端能量作为质量诊断指标。
DREAM: 通过双目标编码扩展视觉-语言模型用于跨模态检索
机构 * Sejong University(世宗大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Ulsan National Institute of Science and Technology(乌山国立科学研究院)
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出DREAM模型,通过双路径表示增强与对齐,结合层级视觉编码器和混合语言建模,在视频检索任务中实现新SOTA。
ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。
基于层次化基序的多模态蛋白质嵌入增强蛋白质-蛋白质相互作用预测
机构 * National University of Singapore(新加坡国立大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 跨模态检索 :multimodal(title,abstract);multi-modal(abstract);分类 cs.AI
AI总结 提出MMM-PPI模型,通过层次化基序的多模态编码(微观、中观、宏观三尺度)整合序列、结构和功能信息,提升蛋白质-蛋白质相互作用预测性能。
IDO: 面向多模态假新闻检测的不一致性感知分布优化
机构 * Nanjing University(南京大学) ; University of Birmingham(伯明翰大学) ; East China Normal University(华东师范大学) ; Zhejiang University(浙江大学)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出不一致性感知分布优化(IDO)方法,通过事实不一致性和模态不一致性建模,提升多模态假新闻检测性能。
Comments Accept by GlobalSouthML@ICML 2026
GaMi: 通过跨模态减法解缠实现几何无关的材料识别
机构 * National University of Singapore(新加坡国立大学) ; Shanghai Jiao Tong University(上海交通大学) ; Northwestern Polytechnical University(西北工业大学)
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 提出GaMi系统,利用毫米波和声学传感的跨模态减法解缠框架,在不受约束的几何条件下实现高精度材料识别。
Comments 17 pages, 18 figures