arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-04 至 2026-05-04 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 3 篇

2605.00670 2026-05-04 cs.IR cs.SI 78%

Robust Multimodal Recommendation via Graph Retrieval-Enhanced Modality Completion

通过图检索增强的模态完成实现鲁棒的多模态推荐

Yuan Li, Jun Hu, Jiaxin Jiang, Bryan Hooi, Bingsheng He

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出GRE-MC框架,通过图检索增强模态完成,解决多模态数据不完整问题,提升推荐系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13511 2026-05-04 cs.CV cs.IR 77%

Adapting MLLMs for Nuanced Video Retrieval

为精细化视频检索适应大语言模型

Piyush Bagad, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种统一嵌入模型,通过对比损失微调文本训练的多模态大语言模型,以处理视频检索中的时间、否定和多模态细微差别,实现最先进的检索性能。

Comments 38 Pages. Project page at http://bpiyush.github.io/tara-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00632 2026-05-04 cs.CV cs.AI cs.GR cs.HC cs.LG 62%

BlenderRAG: High-Fidelity 3D Object Generation via Retrieval-Augmented Code Synthesis

BlenderRAG: 通过检索增强的代码合成实现高保真的3D物体生成

Massimo Rondelli, Francesco Pivi, Maurizio Gabbrielli

机构 * University of Bologna(博洛尼亚大学) Ferrari S.p.A.(法拉利公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 BlenderRAG通过检索增强的代码合成方法,利用500个专家验证的多模态数据集提升Blender代码生成的准确性和一致性,无需微调或专用硬件。

详情

展开后加载摘要…

URL PDF HTML 收藏