arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-16 至 2026-04-16 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2604.13054 2026-04-16 cs.CL cs.AI cs.CV 85%

Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling

先caption,后VQA:知识密度而非任务格式驱动多模态扩展

Hongjian Zou, Yue Ge, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * vivo AI Lab(vivo人工智能实验室) Wuhan University(武汉大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。

Comments 23 pages, 4 figures, 10 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08261 2026-04-16 cs.CV cs.AI 84%

DBMF: A Dual-Branch Multimodal Framework for Out-of-Distribution Detection

DBMF:一种用于分布外检测的双分支多模态框架

Jiangbei Yue, Darren Treanor, Venkataraman Subramanian, Sharib Ali

机构 * University of Leeds(利兹大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DBMF框架,通过双分支利用多模态信息提升分布外检测性能,实验表明其在不同模型架构下鲁棒性强,性能提升达24.84%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13321 2026-04-16 cs.CV 81%

Why MLLMs Struggle to Determine Object Orientations

为何大规模多模态语言模型难以确定物体方向

Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

机构 * Department of Computer Science(计算机科学系)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文研究大规模多模态语言模型在处理图像中2D物体方向推理任务时的困难,通过实验发现方向信息可从编码器表示中恢复,挑战了视觉编码器限制的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13561 2026-04-16 cs.CV cs.AI 76%

CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling

CLIP架构用于腹部CT图像-文本对齐和零样本学习:研究批量组成和数据缩放

Shivika, Kartik Bose, Pankaj Gupta

机构 * Department of Radiodiagnosis(放射诊断部门)

专题命中 图文多模态 :image-text(title);分类 cs.CV、cs.AI

AI总结 本文研究了CLIP架构在腹部CT图像-文本对齐和零样本学习中的效果,探讨了训练批量组成和数据缩放的影响,发现随机采样和交替批次比人工类平衡更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09687 2026-04-16 cs.CV cs.AI 62%

Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

Grid2Matrix: 揭示视觉语言模型中的数字失读

Yunkai Zhang, Linda Li, Yingxin Cui, Xiyuan Ruan, Zeyu Zheng, Kezhen Chen, Yi Zhang, Diji Yang

机构 * BAIR, UC Berkeley(伯克利大学BAIR实验室) UC Santa Cruz(圣克拉拉大学) Analogy AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Grid2Matrix通过控制视觉复杂度测试视觉语言模型在捕捉细节方面的不足,发现模型在小网格上表现不佳,揭示了视觉编码与语言表达间的差距,即'数字失读'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13788 2026-04-16 cs.RO cs.CV 57%

Failure Identification in Imitation Learning Via Statistical and Semantic Filtering

通过统计和语义过滤进行模仿学习中的故障识别

Quentin Rolland, Fabrice Mayran de Chamisso, Jean-Baptiste Mouret

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Inria, CNRS, Université de Lorraine, LORIA(Inria,CNRS,洛林大学,LORIA) Bleu Robotics(Bleu机器人)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FIDeL模块,结合统计和语义过滤技术,提升机器人模仿学习中的故障检测性能,通过多模态数据集BotFails验证其有效性。

Comments 8 pages, Appendix coming soon, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11671 2026-04-16 eess.SP cs.RO 50%

VLMaterial: Vision-Language Model-Based Camera-Radar Fusion for Physics-Grounded Material Identification

VLMaterial: 基于视觉-语言模型的相机-雷达融合用于物理基础的材料识别

Jiangyou Zhu, He Chen

机构 * Department of Inforation Engineering(信息工程系)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 本文提出VLMaterial框架,通过融合视觉语言模型与雷达知识实现物理基础的材料识别,采用双管道架构和上下文增强生成策略,提升跨模态融合性能,实验表明其在120余次真实实验中达到96.08%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏