Douyin Multimodal Embedding Model Technical Report
抖音多模态嵌入模型技术报告
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。
Comments Technical Report
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
抖音多模态嵌入模型技术报告
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL
AI总结 针对现有多模态嵌入模型难以兼顾效率与细粒度区分的问题,提出分两阶段训练的DME模型,在MMEB-v2数据集及抖音生产场景中均取得优异效果。
Comments Technical Report
mR²AG:用于基于知识的视觉问答的多模态检索-反思增强生成
专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究针对多模态大语言模型在基于知识的视觉问答中的缺陷,提出mR²AG框架,通过两种反思操作实现自适应检索与信息定位,在相关基准任务上性能优于现有方法。
Comments Accepted for publication in IEEE Transactions on Multimedia (TMM)
基于超图的多模态检索增强生成与增量优化
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; Beijing University of Technology(北京工业大学) ; Tsinghua University(清华大学)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 该研究针对现有多模态检索增强生成系统的二元连接局限与优化冗余问题,提出Hyper-M2RAG框架,通过多模态超图建模与锚点驱动的增量优化机制,在多模态基准数据集上实现优于现有方法的性能。
Comments Accepted to the 34th ACM International Conference on Multimedia (ACM MM 2026)
MODAL:基于模型驱动稀疏解耦与文本-图像差分滤波的多模态对象重识别
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院)
专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出MODAL多模态对象重识别框架,通过多模态特征稀疏解耦模块与文本-图像差分滤波模块解决现有方法的特征纠缠与模态缺失性能下降问题,在四个数据集上取得SOTA性能。
ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL
AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。
Comments Accepted by VIS 2026
用于胎儿脑室体积测量与异常筛查的跨模态超声-MRI学习
专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究提出跨模态学习框架VIFBA,基于超声视频实现胎儿脑室体积预测、VM严重程度分类及非VM异常筛查,性能优于基线与现有模型,为产前脑筛查提供实用方案。
Comments 17 pages, 11 figures, 6 tables
基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试
机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea ; organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA
专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。
电商中产品媒体排序的序列多模态证据优化
机构 * Amazon.com Inc.(亚马逊公司)
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 针对电商产品媒体排序问题,本文提出SMEO框架,通过轨迹效用模型和生存加权自回归策略优化,提升转化率并减少消费者划动次数。
Comments Proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026), Rome, Italy
重排序器所见:面向长文档多模态问答的多方面页面标注
机构 * Emory University(埃默里大学) ; Hippocratic AI(希波克拉底人工智能公司)
专题命中 跨模态检索 :multimodal(title);分类 cs.AI
AI总结 本文针对长文档多模态问答的重排序瓶颈,提出含Trident-R与Trident-S组件的Trident模型,通过多方面页面标注提升检索与生成性能,在多数据集上取得显著效果。
DSPrompt:针对M-RAG污染的动态软提示防御
专题命中 跨模态检索 :multimodal(abstract,abstract_cn);分类 cs.CL
AI总结 本文针对M-RAG面临的对抗攻击问题,提出DSPrompt动态软提示防御框架,通过在冻结检索器编码器插入可学习软提示,以低开销实现了优于现有方法的防御效果,同时维持检索与生成性能。
FusionBERT: 多视角图像-3D检索 via 跨注意力视觉融合与正常感知3D编码器
机构 * IROOTECH TECHNOLOGY ; Wolf 1069 b Lab, Sany Group(三一集团Wolf 1069 b实验室) ; Zhejiang University(浙江大学) ; School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) ; BPIT, Sany Group(三一集团BPIT)
专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 FusionBERT通过跨注意力视觉融合和正常感知3D编码器,实现多视角图像-3D多模态检索,提升跨模态检索性能。
Comments 9 pages, 5 figures, 3 tables
EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索
机构 * University of Michigan(密歇根大学)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。
D2-ScaleAgent:面向长文档理解的双维度缩放方法
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; University of Science and Technology of China(中国科学技术大学)
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL
AI总结 针对现有多模态RAG长文档理解方法缺乏动态计算缩放能力的问题,提出D2-ScaleAgent双维度缩放智能体框架,在相关基准上取得良好效果。
面向AI友好的制图学:理解颜色设计如何影响基础模型在顺序 choropleth 地图上的空间推理
机构 * School of Geographic Sciences, Hunan Normal University(湖南师范大学地理科学学院) ; Hunan Key Laboratory of Geospatial Big Data Mining and Application(湖南省地理空间大数据挖掘与应用重点实验室) ; School of Information and Communication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与通信工程学院) ; School of Geography and Information Engineering, China University of Geosciences(中国地质大学(武汉)地理与信息工程学院) ; Advanced Interdisciplinary Institute of Satellite Applications, State Key Laboratory of Earth Surface Processes and Resource Ecology, Faculty of Geographical Science, Beijing Normal University(北京师范大学地理科学学部卫星应用先进交叉研究院、地表过程与资源生态国家重点实验室)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI
AI总结 本研究探究颜色设计对基础模型空间推理的影响,构建基准评估多模态模型,发现顺序颜色排序和足够对比度对机器地图理解关键,为AI友好制图提供实证指导。
Comments 42 pages, 12 figures, 13 tables
基于因果机制监测的跨域工业故障检测
机构 * Deakin University(迪肯大学)
专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI
AI总结 该研究针对工业系统的耦合故障检测问题,提出CMR-Mamba方法,通过因果正则化的Mamba编码器与kNN流形评分实现跨域故障检测,在多类耦合故障域上优于基准模型。
面向分布式智能的AI原生6G:流量特性、感知与AI网格
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究针对AI原生6G的流量特性等问题,提出AI Grid分布式AI基础设施平台,结合AI感知连接使6G成为分布式智能平台。
Comments 8 pages, 5 figures, 1 table
结合大语言模型增强多图学习与对比对齐的兴趣点推荐
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究针对POI推荐的物品冷启动问题,提出LLM-MGCL模型,结合语义、地理与交互多图及对比学习,在Yelp数据集上显著优于基线模型,缓解了冷启动问题。
对我们的端到端无人机规划器的若干改进
机构 * TJU-Aerial-Robotics(TJU空中机器人实验室)
专题命中 跨模态检索 :multi-modal(abstract)
AI总结 该研究针对端到端无人机规划器YOPO的缺陷,通过采用MINCO参数化、扩展多模态预测、添加动态约束及替换损失函数等改进,提升了轨迹质量与避障安全性。
检索器能否从不同方面找到同一篇论文?一个多方面全论文科学检索基准
专题命中 跨模态检索 :multimodal(abstract)
AI总结 该研究推出多方面全论文科学检索基准MAPLE及查询生成流程MAPLE-Synth,发现现有检索器在从单一方面与多方面检索论文间存在显著差距,为相关检索器研发提供测试平台。