Douyin Multimodal Embedding Model Technical Report
抖音多模态嵌入模型技术报告
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。
Comments Technical Report
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
抖音多模态嵌入模型技术报告
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。
Comments Technical Report
UEmbed:统一稀疏与稠密多模态嵌入
机构 * CASIA(中国科学院自动化研究所) ; Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Yale University(耶鲁大学)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 UEmbed是一种仅解码器的多模态嵌入模型,可单次前向传播生成稀疏与稠密表示,在MMEB-v2和BEIR上表现优异,统一了两类嵌入并支持多模态智能体应用。
MRAFnd:面向零样本假新闻检测的多模态检索增强框架
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 针对零样本假新闻检测的现有方法无法识别重复虚假手段与跨模态差异的问题,本文提出多模态检索增强框架MRAFnd,经多智能体协作推理,在Weibo-21等数据集上准确率最高提升2.35%,优于现有方法。
Comments 14 pages, 6 figures, 2 tables, Presented at the MMM 2026
V-Mem:面向多模态智能体长期记忆的模态路由检索
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 该研究针对多模态智能体记忆的模态与相似性-相关性差距,提出V-Mem系统,通过模态路由检索优化,在Mem-Gallery、LoCoMo数据集上显著提升多模态问答性能。
Comments 19 pages, 2 figures, 16 tables. Code: https://github.com/Dingyi-Kang/V-Mem
GeoArbiter:面向遥感多模态大语言模型的可验证性导向 grounding 方法
机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 该研究针对遥感多模态大语言模型的事实断言问题,提出无需训练的 GeoArbiter 流程,通过仅注入图像无法验证的地理事实,有效降低了模型的断言级幻觉并提升了对冲突记录的鲁棒性。
面向有效联邦多模态图学习的多层面异质性导航方法
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)
AI总结 针对联邦多模态图学习的多层面异质性问题,本文提出FedTCR算法,通过两阶段范式与拓扑感知跨模态路由机制,在7个领域的图中心与模态中心任务上优于现有最优基线。
Comments Under Review
通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉
机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。
Comments 29 pages, 9 figures
OptimusKG:统一生物医学知识的现代多模态图
机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Edison Scientific Inc.(Edison科学公司) ; Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) ; Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) ; Harvard Data Science Initiative(哈佛大学数据科学计划)
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI
AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。
UniCVR:从对齐到重排序的统一零样本复合视觉检索
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; City University of Hong Kong(香港城市大学) ; Southern University of Science and Technology(南方科技大学) ; Pengcheng Laboratory(鹏城实验室)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.MM
AI总结 UniCVR提出首个统一零样本复合视觉检索框架,结合多模态大语言模型与视觉语言预训练模型,通过两阶段方法实现多任务联合优化,实验表明其在五个基准测试中表现优异。
面向语义物联网数字孪生平台中三维相似度搜索的多模态嵌入
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 本文针对语义物联网数字孪生平台缺乏三维相似度搜索能力的问题,提出多模态嵌入框架,在Thing'in平台实现后经S3DIS验证,可支持混合本体-向量查询,满足相关领域的三维相似度搜索需求。
Journal ref 4th International Workshop on the Semantic WEb of EveryThing (SWEET 2026), co-located with ICWE 2026, Jun 2026, Lyon, France
零成本虚拟RNA:通过跨模态WSI检索近似免疫治疗特征
机构 * Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) ; IRB Lleida(莱里达生物医学研究所)
专题命中 跨模态检索 :cross-modal(title);分类 cs.CV
AI总结 针对胃腺癌免疫治疗RNA特征检测成本高的问题,提出VITA模型,通过H&E与RNA跨模态对齐实现仅用H&E切片近似RNA特征,取得0.72准确率等结果,提供低成本预筛选工具。
Comments Accepted to MIDL 2026 Short Paper track
PHA-Net:用于文本-视频检索的基于原型的分层对齐网络
专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract)
AI总结 针对文本-视频检索中跨模态语义不匹配及计算成本高的问题,提出PHA-Net,以模态共享原型为桥梁,结合原型支持的令牌合并模块与原型对比损失,在四个基准数据集上取得显著性能提升。
用于光学显微镜下颗粒与纤维表征的人工智能方法
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种带语义锚点的AI蒸馏框架,训练仅视觉输入的学生ViT模型,在颗粒与纤维显微镜表征任务中获80%伪类验证准确率等结果,实现更丰富可解释的表征,适用于相关分析场景。
基于语义对比学习的表意文字视觉预训练
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Jilin University(吉林大学) ; King’s College London(伦敦国王学院) ; University College London(伦敦大学学院)
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 针对表意文字数据集不平衡问题,提出结合视觉与上下文语义的多模态学习方法,通过语义对比预训练提升字符识别性能,在多数据集及下游任务上优于现有最优方法。
Comments ACM MM 2026 paper
语法与语义融合:理解科学公式
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 本研究针对科学公式语法与语义表征不匹配问题,采用图编码器、文本编码器结合对比学习实现跨模态对齐,显著提升了学术信息检索中的跨模态检索性能。
StyleForge:基于超图场中反事实推理的室内家具风格生成
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。
排序前分配:面向通用大模型(OmniLLMs)的解耦令牌压缩
机构 * University of Houston(休斯顿大学) ; The University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 针对通用大模型令牌压缩的偏向音频分配问题,提出无需训练的Macer压缩器,先分配音视频预算再按模态排序,降本同时在多基准上保持性能,在OmniVinci-9B上提升达12.9个点。
判别轴,而非数据量:对比语料库能为音频嵌入模型带来什么启示
机构 * Eximius Labs(埃克西米厄斯实验室) ; Wabash College(沃巴什学院)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL
AI总结 该研究发现对比音频嵌入模型编码的属性由语料库结构而非规模决定,通过调整语料标注多样性可提升情感识别性能,同时平衡关键词检测能力。
Comments 10 pages, 4 figures
面向KV缓存的互联网:在大语言模型推理时代重新思考经典基础设施边界
专题命中 跨模态检索 :multi-modal(abstract)
AI总结 该研究提出面向KV缓存的互联网愿景,主张跨云与数据中心解耦计算与KV缓存存储,将KV缓存管理作为内容分发系统,以最小化大语言模型推理的延迟与成本。
AgenTag:基于行为指纹的AI编码智能体归因
专题命中 跨模态检索 :multimodal(abstract)
AI总结 本文提出多模态框架AgenTag,基于PR的文本、行为等模态,结合监督对比学习实现开放世界AI编码智能体归因,在AIDev数据集上取得良好效果,且发现归因主要依赖PR描述和提交消息等行为指纹。
GARDRec:面向大语言模型推荐的决策级图接地方法
专题命中 跨模态检索 :multimodal(abstract)
AI总结 本文针对现有图增强型LLM推荐器排序决策受用户-物品关系约束弱的问题,提出GARDRec框架,通过图接地技术提升下一项推荐的候选排序性能,经实验验证其优于代表性基线。
Comments 18 pages, 2 figures