arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-07 至 2026-04-07 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 13 篇

2604.03953 2026-04-07 cs.CV cs.LG 88%

Multimodal Structure Learning: Disentangling Shared and Specific Topology via Cross-Modal Graphical Lasso

多模态结构学习:通过跨模态图拉索解耦共享和特定拓扑

Fei Wang, Yutong Zhang, Xiong Wang

机构 * Stony Brook University(石溪大学) Sichuan University(四川大学) USTC(中国科学技术大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态图拉索方法,通过统一视觉语言编码器和跨注意力蒸馏机制,解耦共享与类别特定拓扑,提升多模态表征的可解释性。

Comments Submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04905 2026-04-07 cs.CV cs.GR cs.HC 79%

ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality

ClickAIXR: 基于设备的多模态视觉-语言交互与现实世界对象在扩展现实中的交互

Dawar Khan, Alexandre Kouyoumdjian, Xinyu Liu, Omar Mena, Dominik Engel, Ivan Viola

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 ClickAIXR通过设备端视觉-语言模型与基于控制器的对象选择方法,实现对现实世界对象的精确点击交互,提升隐私和延迟方面的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04780 2026-04-07 cs.CV 79%

CLEAR: Unlocking Generative Potential for Degraded Image Understanding in Unified Multimodal Models

CLEAR: 解锁统一多模态模型中退化图像理解的生成潜力

Xiangzhao Hao, Zefeng Zhang, Zhenyu Zhang, Linhao Yu, Yao Chen, Yiqian Zhang, Haiyun Guo, Shuohuan Wang, Yu Sun

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Baidu Inc.(百度公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 CLEAR通过三个步骤提升统一多模态模型在退化图像中的理解能力,包括监督微调、潜在表示桥梁和交错GRPO,增强模型在退化输入下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04608 2026-04-07 cs.CV 79%

Beyond Semantics: Uncovering the Physics of Fakes via Universal Physical Descriptors for Cross-Modal Synthetic Detection

超越语义:通过通用物理描述符揭示合成检测的物理本质

Mei Qiu, Jianqiang Zhao, Yanyun Qu

机构 * SDIC Intelligence Information Technology Co., Ltd.(国投智能信息技术有限公司) Xia'men University(厦门大学)

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出通过通用物理描述符区分真实与AI生成图像,探索跨模态合成检测中的核心物理特征及多模态模型整合方法,实现高准确率检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04145 2026-04-07 cs.AI 79%

Solar-VLM: Multimodal Vision-Language Models for Augmented Solar Power Forecasting

Solar-VLM:用于增强太阳能发电预测的多模态视觉语言模型

Hang Fan, Haoran Pei, Runze Liang, Weican Liu, Long Cheng, Wei Wei

机构 * North China Electric Power University(华北电力大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Solar-VLM框架,通过融合时序观测、卫星图像和文本天气信息,提升太阳能发电预测的准确性,采用多模态编码器和图注意力网络捕捉空间依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23095 2026-04-07 cs.CV 79%

Revisiting Multimodal Positional Encoding in Vision-Language Models

重新审视视觉-语言模型中的多模态位置编码

Jie Huang, Xuejing Liu, Sibo Song, Ruibing Hou, Hong Chang, Junyang Lin, Shuai Bai

机构 * Qwen Team, Alibaba Group(Qwen团队,阿里巴巴集团) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文分析了多模态Rotary Positional Embedding的核心组件,提出MHRoPE和MRoPE-Interleave两种改进方法,在多种基准测试中表现优异,提升了多模态理解能力。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04564 2026-04-07 cs.RO cs.CV 74%

Visual Prompt Based Reasoning for Offroad Mapping using Multimodal LLMs

基于视觉提示的越野制图推理使用多模态大语言模型

Abdelmoamen Nasser, Yousef Baba'a, Murad Mebrahtu, Nadya Abdel Madjid, Jorge Dias, Majid Khonji

机构 * Khalifa University(哈利法大学)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出一种零样本方法,利用SAM2进行环境分割和多模态大语言模型(VLM)进行可行驶区域推理,通过整合分割图像和原始图像实现越野制图推理,无需专门地形模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04473 2026-04-07 cs.CV 70%

Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks

超越标准基准:对视觉-语言模型在不同任务中对自然语义变化鲁棒性的系统审计

Jia Chengyu, AprilPyone MaungMaung, Huy H. Nguyen, Jinyin Chen, Isao Echizen

机构 * Zhejiang University of Technology(浙江工业大学) National Institute of Informatics(国立信息学研究所)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文系统评估了视觉-语言模型在自然对抗场景下的鲁棒性,分析了不同模型在零样本图像分类、语义分割和视觉问答中的表现,揭示了鲁棒CLIP模型放大对抗漏洞的问题。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03556 2026-04-07 cs.CV cs.AI cs.CL 67%

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

重点至关重要:面向视觉语言模型中幻觉的相位感知抑制

Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

机构 * Pusan National University(釜山大学) Pukyong National University(釜庆大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出一种轻量级干预方法,在视觉编码器的聚焦阶段选择性抑制低关注的token,通过单次前向传递统计信息和DPP保留多样视觉线索,减少幻觉的同时保持caption质量,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04172 2026-04-07 cs.CV cs.AI 62%

GENFIG1: Visual Summaries of Scholarly Work as a Challenge for Vision-Language Models

GENFIG1:学术工作的视觉摘要对视觉-语言模型的挑战

Yaohan Guan, Pristina Wang, Najim Dehak, Alan Yuille, Jieneng Chen, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 GENFIG1基准测试要求视觉-语言模型生成能清晰表达论文核心思想的图表,强调科学理解与视觉合成的结合,揭示生成高质量学术图表的难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04133 2026-04-07 cs.CV cs.AI 62%

Learning Robust Visual Features in Computed Tomography Enables Efficient Transfer Learning for Clinical Tasks

在计算机断层扫描中学习鲁棒的视觉特征以实现临床任务的高效迁移学习

Rubén Moreno-Aguado, Alba Magallón, Victor Moreno, Yingying Fang, Guang Yang

机构 * Bioengineering Department and Imperial-X, Imperial College London(帝国理工学院生物工程系与Imperial-X) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Oncology Data Analytics Program, Catalan Institute of Oncology(加泰罗尼亚肿瘤研究所肿瘤数据分析项目) Colorectal Cancer Group, ONCOBELL Program, Institut d’Investigació Biomèdica de Bellvitge(贝尔维特奇生物医学研究所ONCOBELL项目结直肠癌研究组) Consortium for Biomedical Research in Epidemiology and Public Health(流行病学与公共卫生生物医学研究联盟) Department of Clinical Sciences, Faculty of Medicine and Health Sciences, Universitat de Barcelona(巴塞罗那大学医学与健康科学学院临床科学系) Institute of Complex Systems, University of Barcelona(巴塞罗那大学复杂系统研究所) National Heart and Lung Institute, Imperial College London(帝国理工学院国家心肺研究所) Cardiovascular Research Centre, Royal Brompton Hospital(皇家布朗普顿医院心血管研究中心) School of Biomedical Engineering & Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VoxelFM,一种基于自蒸馏的3D CT基础模型,通过学习语义丰富的特征,实现了在多种临床任务中无需微调即可高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04357 2026-04-07 cs.CV 57%

Spatially-Weighted CLIP for Street-View Geo-localization

基于空间加权的CLIP用于街景地理定位

Ting Han, Fengjiao Li, Chunsong Chen, Haoling Huang, Yiping Chen, Meiliu Wu

机构 * School of Geospatial Engineering and Science, Sun Yat-Sen University(中山大学地理科学与规划学院) School of Geographical and Earth Sciences, University of Glasgow(格拉斯哥大学地理与地球科学学院) School of System Science and Engineering, Sun Yat-Sen University(中山大学系统科学与工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出空间加权CLIP(SW-CLIP),通过引入空间自相关增强视觉-语言对比学习,改进街景地理定位的准确性与空间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17362 2026-04-07 cs.CV 57%

ATAC: Augmentation-Based Test-Time Adversarial Correction for CLIP

ATAC:基于增强的测试时间对抗修正用于CLIP

Linxiang Su, András Balogh

机构 * University of Szeged(塞格德大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出ATAC方法,通过在CLIP嵌入空间中计算增强诱导的漂移向量,修正嵌入以提高对抗鲁棒性,实验显示其鲁棒性显著优于现有方法。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏