Douyin Multimodal Embedding Model Technical Report
抖音多模态嵌入模型技术报告
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。
Comments Technical Report
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
抖音多模态嵌入模型技术报告
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。
Comments Technical Report
Mr.Dec:用于30天再入院预测的日尺度纵向多模态建模
机构 * Yeji X
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 本研究提出Mr.Dec模型,通过Transformer解码器整合每日EHR与CXR数据,结合疾病特异性监督对比学习,在MIMIC-IV等数据集上实现30天再入院预测的SOTA性能,还可识别住院关键天数提供临床解释。
Comments MICCAI 2026 MultiTab Workshop Oral
WiFo-MiSAC:一种无线基础模型,通过机器的通感(SoM)实现多模态感知与通信的整合
专题命中 跨模态检索 :multimodal(title);cross-modal(abstract)
AI总结 WiFo-MiSAC通过统一空间的自监督预训练,解决通信与传感数据碎片化处理导致的泛化问题,采用共享-特定解耦的混合专家架构,实现多模态交互,实验表明其在多任务中表现优异,具备强大的少样本适应与新模态集成能力。
多模态对比学习中的表达能力
专题命中 跨模态检索 :multimodal(title)
AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。
双流跨锚校正:接地长文本描述与对象级锚点的域限制
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对多模态大语言模型的长文本描述对象幻觉问题,本文提出双流跨锚校正方法,通过耦合感知流与认知流提升精度,在长文本场景下实现最优性能,且存在域条件性限制。
AutoResearch:输入洞见,输出无幻觉
机构 * EvoMap(伊沃地图)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 AutoResearch是两阶段自主研究系统,通过创意生成与执行结合,在多场景提升研究进展,修正实验结果,在RSICD基准上召回率提升且问题事件更少。
AI辅助健康咨询:共情表达与对话语境如何影响用户的沟通行为
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究通过2×2×3被试内实验,发现对话语境对用户沟通行为的影响远大于共情表达模态,为构建语境感知的AI健康咨询系统提供设计依据。
Comments 5 pages, 2 figures. To appear in UbiComp Companion 2026 (October 11-15, 2026, Shanghai, China)
基于大语言模型的生成式检索用于Snapchat内容推荐
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。