arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-20 至 2026-04-20 共收录 10 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2505.11237 2026-04-20 cs.MM cs.LG 83%

Concept Drift Guided LayerNorm Tuning for Efficient Multimodal Metaphor Identification

概念漂移引导的层归一化调优用于高效的多模态隐喻识别

Wenhao Qian, Zhenzhen Hu, Zijie Song, Jia Li

机构 * Hefei University of Technology(合肥工业大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出CDGLT框架,通过概念漂移和提示构造策略提升多模态隐喻识别效率,实现MET-Meme基准的最先进性能并降低训练成本。

Comments ICMR'25, June 30-July 3, 2025, Chicago, IL, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11490 2026-04-20 cs.AI cs.CL cs.CV 82%

Anthropogenic Regional Adaptation in Multimodal Vision-Language Model

人为区域适应于多模态视觉-语言模型

Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan

机构 * Cohere SEACrowd AI Singapore Universiti Teknologi PETRONAS Oracle Carnegie Mellon University(卡内基梅隆大学) Monash University, Indonesia(莫纳什大学(印尼)) King Mongkut’s University of Technology Thonburi(泰国孔敬大学) Nara Institute of Science and Technology(奈良科学技術大學) Stanford University(斯坦福大学) MBZUAI National University of Singapore(新加坡国立大学) Monash University, Australia(莫纳什大学(澳大利亚)) Brown University(布朗大学) University of Bath(巴斯大学) Mila - Quebec AI Institute(蒙特利尔AI研究所) Institut Teknologi Bandung(Bandung 工程技术大学) Ateneo de Manila University(马尼拉亚特内奥大学) Universitas Pelita Harapan(Pelita Harapan 大学) Seoul National University of Science and Technology(首尔科学技术大学) Thammasat University(泰国 Thammasat 大学) Independent(独立) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) MiroMind AI University of Indonesia(印度尼西亚大学) University of New Haven(纽黑文大学) INTI International University and Colleges(INTI 国际大学和学院) Binus University(Binus 大学) National University Philippines(菲律宾国家大学) ThoughtFull

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出人为区域适应框架,通过地理通用化简化方法提升多模态模型在特定区域的文化相关性,实验显示在东南亚地区提升5-15%的同时保持全球性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.07420 2026-04-20 cs.CV cs.CL cs.DL cs.SI 81%

Automatic Modeling of Social Concepts Evoked by Art Images as Multimodal Frames

艺术图像中引发的社会概念的自动建模作为多模态框架

Delfina Sol Martinez Pandiani, Valentina Presutti

机构 * Department of Computer Science and Engineering (DISI), University of Bologna, Italy(博洛尼亚大学计算机科学与工程系(DISI)) Department of Modern Languages, Literatures and Cultures (LILEC), University of Bologna, Italy(博洛尼亚大学现代语言、文学与文化系(LILEC))

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出将社会概念表示为多模态框架的方法,通过整合多感官数据提取和分析视觉艺术材料的多模态特征,以解决社会概念自动检测中的语义鸿沟问题。

Comments First International Workshop on Multisensory Data and Knowledge at the 3rd Conference on Language, Data and Knowledge (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15495 2026-04-20 cs.AI cs.CV cs.HC cs.RO 81%

GIST: Multimodal Knowledge Extraction and Spatial Grounding via Intelligent Semantic Topology

GIST:通过智能语义拓扑进行多模态知识提取与空间定位

Shivendra Agrawal, Bradley Hayes

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 GIST通过智能语义拓扑提取多模态知识,构建语义标注的导航拓扑,实现复杂环境中的空间定位与人类-AI交互任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16256 2026-04-20 cs.CV cs.CL 73%

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究

Yige Xu, Yongjie Wang, Zizhuo Wu, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14373 2026-04-20 cs.CV cs.AI 62%

SatBLIP: Context Understanding and Feature Identification from Satellite Imagery with Vision-Language Learning

SatBLIP:基于卫星影像的视觉-语言学习用于农村环境理解和特征识别

Xue Wu, Shengting Cao, Shenglin Li, Jiaqi Gong

机构 * The University of Alabama(阿拉巴马大学) Knox College(克诺克斯学院)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 SatBLIP通过结合对比图像-文本对齐与定制化卫星语义描述,提升农村风险环境的可解释性分析,预测县级社会脆弱性指数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05547 2026-04-20 cs.CV cs.AI 62%

VIB-Probe: Detecting and Mitigating Hallucinations in Vision-Language Models via Variational Information Bottleneck

VIB-Probe:通过变分信息瓶颈检测和缓解视觉-语言模型中的幻觉

Feiran Zhang, Yixin Wu, Zhenghua Wang, Xiaohua Wang, Changze Lv, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院,上海,中国) Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIB-Probe框架,通过变分信息瓶颈理论检测和缓解视觉-语言模型中的幻觉,利用注意力头提取判别模式并过滤语义噪声,实验表明其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16248 2026-04-20 cs.CV 57%

Where Do Vision-Language Models Fail? World Scale Analysis for Image Geolocalization

视觉-语言模型在何处失效?面向图像地理定位的世界尺度分析

Siddhant Bharadwaj, Ashish Vashist, Fahimul Aleem, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文评估了多种先进视觉-语言模型在国家层面图像地理定位中的表现,揭示了模型在粗粒度地理定位中的潜力及当前模型在细粒度地理线索捕捉上的局限。

Comments Accepted to the CVPR EarthVision 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16067 2026-04-20 cs.LG cs.CV 57%

AEGIS: Anchor-Enforced Gradient Isolation for Knowledge-Preserving Vision-Language-Action Fine-Tuning

AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调

Guransh Singh

机构 * Independent Researcher(独立研究者)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27759 2026-04-20 cs.CV 57%

When Surfaces Lie: Exploiting Wrinkle-Induced Attention Shift to Attack Vision-Language Models

当表面欺骗:利用褶皱诱导的注意力转移攻击视觉-语言模型

Chengyin Hu, Xuemeng Sun, Jiaju Han, Qike Zhang, Xiang Chen, Xin Wang, Yiwei Wei, Jiahua Long

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种参数化结构扰动方法,通过构建多尺度褶皱场和整合位移场扭曲与表面一致的外观变化,以攻击视觉-语言模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏