Robust Multimodal Recommendation via Graph Retrieval-Enhanced Modality Completion
通过图检索增强的模态完成实现鲁棒的多模态推荐
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 本文提出GRE-MC框架,通过图检索增强模态完成,解决多模态数据不完整问题,提升推荐系统鲁棒性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
通过图检索增强的模态完成实现鲁棒的多模态推荐
专题命中 跨模态检索 :multimodal(title,abstract)
AI总结 本文提出GRE-MC框架,通过图检索增强模态完成,解决多模态数据不完整问题,提升推荐系统鲁棒性。
为精细化视频检索适应大语言模型
机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出一种统一嵌入模型,通过对比损失微调文本训练的多模态大语言模型,以处理视频检索中的时间、否定和多模态细微差别,实现最先进的检索性能。
Comments 38 Pages. Project page at http://bpiyush.github.io/tara-website
BlenderRAG: 通过检索增强的代码合成实现高保真的3D物体生成
机构 * University of Bologna(博洛尼亚大学) ; Ferrari S.p.A.(法拉利公司)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 BlenderRAG通过检索增强的代码合成方法,利用500个专家验证的多模态数据集提升Blender代码生成的准确性和一致性,无需微调或专用硬件。