arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-02 至 2026-03-02 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2602.23863 2026-03-02 cs.CV cs.CL 84%

NAU-QMUL: Utilizing BERT and CLIP for Multi-modal AI-Generated Image Detection

NAU-QMUL: 利用BERT和CLIP进行多模态AI生成图像检测

Xiaoyu Guo, Arkaitz Zubiaga

机构 * School of Accounting, Nanjing Audit University (NAU), Nanjing, Jiangsu, China(会计学院,南京审计大学(NAU)) School of Electronic Engineering and Computer Science, Queen Mary University of London (QMUL), London, UK(电子工程与计算机科学学院,女王玛丽大学(QMUL))

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 NAU-QMUL利用BERT和CLIP进行多模态AI生成图像检测,通过跨模态特征融合和多任务损失函数提升检测性能,在竞赛中取得佳绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23588 2026-03-02 cs.CV cs.AI cs.LG 84%

Hyperdimensional Cross-Modal Alignment of Frozen Language and Image Models for Efficient Image Captioning

高维跨模态对齐冻结语言和图像模型以实现高效的图像描述生成

Abhishek Dalvi, Vasant Honavar

机构 * Artificial Intelligence Research Laboratory(人工智能研究实验室) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 HDFLIM通过冻结语言和图像模型的高维计算实现高效的图像描述生成,无需参数调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24038 2026-03-02 cs.CV cs.MA 70%

Enhancing CLIP Robustness via Cross-Modality Alignment

通过跨模态对齐增强CLIP鲁棒性

Xingyu Zhu, Beier Zhu, Shuo Wang, Kesen Zhao, Hanwang Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20812 2026-03-02 cs.CV cs.AI cs.CL 67%

Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation

小草稿,大结论:通过推测进行信息密集的视觉推理

Yuhan Liu, Lianhui Qin, Shengjie Wang

机构 * New York University(纽约大学) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SV通过结合多个轻量级草稿专家和大型结论模型,提升信息密集视觉推理的效率和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24014 2026-03-02 cs.CV cs.AI 62%

Interpretable Debiasing of Vision-Language Models for Social Fairness

可解释的视觉-语言模型社会公平性偏见消除

Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Copenhagen(哥本哈根大学) NVIDIA(英伟达公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。

Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏