arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-30 至 2026-04-30 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 4 篇

2604.18112 2026-04-30 cs.CL cs.MM 88%

Retrieval-Augmented Multimodal Model for Fake News Detection

增强检索的多模态模型用于虚假新闻检测

Yiheng Li, Weihai Lu, Hanyi Yu, Yue Wang

机构 * University of International Business and Economics(国际商务经济大学) Peking University(北京大学) University of Southern California(南加州大学) Upstart Holdings, Inc.(Upstart Holdings公司)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.CL、cs.MM

AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。

Comments Accepted to SIGIR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13942 2026-04-30 cs.CV cs.AI 85%

Glance-or-Gaze: Incentivizing LMMs to Adaptively Focus Search via Reinforcement Learning

glance-or-gaze: 通过强化学习激励大 multimodal 模型适应性聚焦搜索

Hongbo Bai, Yujin Zhou, Yile Wu, Chi-Min Chan, Pengcheng Wen, Kunhao Pan, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 跨模态检索 :multimodal(title_cn,summary_cn);分类 cs.CV、cs.AI

AI总结 本文提出 glanco-or-gaze 框架,通过强化学习使大 multimodal 模型主动规划视觉搜索,通过选择性注视和复杂度自适应强化学习提升复杂视觉查询性能。

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22958 2026-04-30 cs.CV 70%

Contrastive Heliophysical Image Pretraining for Solar Dynamics Observatory Records

对比学习太阳物理图像预训练用于太阳动力学观测记录

Shiyu Shen, Zhe Gao, Taifeng Chai, Yang Huang, Bin Pan

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出SolarCHIP,通过对比学习预训练视觉骨干网络,解决太阳成像中的多模态传感、弱类间分离性和强类内变化性问题,提升跨模态翻译和日冕闪分类性能。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26467 2026-04-30 cs.CR 67%

Differentially Private Contrastive Learning via Bounding Group-level Contribution

差分隐私对比学习通过限制群体级贡献

Kecen Li, Chen Gong, Zinan Lin, Tianhao Wang, Xiaokui Xiao

专题命中 跨模态检索 :multi-modal(abstract);image-text(abstract)

AI总结 本文提出DP-GCL框架,通过限制梯度依赖提升差分隐私对比学习效果,实验显示在多个数据集上均取得最佳性能,图像分类准确率提升5.6%,图像-文本检索准确率提升20.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏