arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-06 至 2026-04-06 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2507.22264 2026-04-06 cs.CV cs.AI 79%

SmartCLIP: Modular Vision-language Alignment with Identification Guarantees

SmartCLIP: 基于识别保证的模块化视觉-语言对齐

Shaoan Xie, Lingjing Kong, Yujia Zheng, Yu Yao, Zeyu Tang, Eric P. Xing, Guangyi Chen, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The University of Sydney(悉尼大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SmartCLIP,通过理论条件实现文本与视觉表征的灵活对齐,确保语义信息完整保留并解耦视觉表征,提升多任务性能。

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20554 2026-04-06 cs.CV 72%

When Negation Is a Geometry Problem in Vision-Language Models

当否定是在视觉-语言模型中一个几何问题

Fawaz Sammani, Tzoulio Chamiti, Paul Gavrikov, Nikos Deligiannis

机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO系) imec Independent Researcher(独立研究员)

专题命中 图文多模态 :multimodal(abstract,comments);image-text(abstract);分类 cs.CV

AI总结 本文探讨了视觉-语言模型中否定理解的几何问题,提出基于多模态大语言模型的评估框架,并通过表示工程操控CLIP模型实现否定意识。

Comments Accepted to CVPR (Multimodal Algorithmic Reasoning Workshop) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03231 2026-04-06 cs.CV 70%

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

CoME-VL:扩展互补多编码视觉语言学习

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出CoME-VL框架,通过融合对比学习和自监督编码器提升视觉语言模型性能,实验显示在多个基准上优于单编码基线。

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02748 2026-04-06 cs.CV 57%

Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks

面向多样化脑部MRI任务的视觉指令微调语言模型

Jonghun Kim, Sinyoung Ra, Hyunjin Park

机构 * Sungkyunkwan University(成均馆大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Artificial Intelligence(人工智能系)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出LLaBIT模型,通过视觉指令微调提升语言模型在脑部MRI任务中的表现,通过特征图重用和文本数据生成提升性能,验证了其在报告生成、视觉问答、图像分割和图像翻译中的有效性。

Comments ICPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03139 2026-04-06 cs.RO 50%

FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation

FSUNav: 一种用于快速、安全和通用零样本目标导向导航的脑皮层-小脑架构

Mingao Tan, Yiyang Li, Shanze Wang, Xinming Zhang, Wei Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) College of Information Science and Technology, Eastern Institute of Technology(东方理工学院信息科学与技术学院)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出FSUNav架构,通过整合视觉语言模型与小脑-脑皮层模块,实现跨异构平台的零样本目标导航,提升效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏