arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-13 至 2026-03-13 共收录 2 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 2 篇

2603.11520 2026-03-13 cs.CV cs.AI 84%

FBCIR: Balancing Cross-Modal Focuses in Composed Image Retrieval

FBCIR: 在组合图像检索中平衡跨模态聚焦

Chenchen Zhao, Jianhuan Zhuo, Muxi Chen, Zhaohua Zhang, Wenyu Jiang, Tianwen Jiang, Qiuyong Xiao, Jihong Zhang, Qiang Xu

专题命中 跨模态检索 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FBCIR方法,通过分析CIR模型中的聚焦不平衡问题,提出数据增强工作流程以提升模型在挑战性场景下的性能。

Comments 20 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13823 2026-03-13 cs.CV 83%

Embed-RL: Reinforcement Learning for Reasoning-Driven Multimodal Embeddings

Embed-RL: 用于推理驱动的多模态嵌入的强化学习

Haonan Jiang, Yuji Wang, Yongjie Zhu, Xin Lu, Wenyu Qin, Meng Wang, Pengfei Wan, Yansong Tang

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出基于嵌入引导强化学习的推理驱动多模态嵌入框架,通过生成证据可追溯的推理链提升多模态嵌入质量,实现跨模态语义一致性增强和细粒度匹配能力提升。

Comments Correcting errors and improving organizational logic

详情

展开后加载摘要…

URL PDF HTML 收藏