arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 26 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 26 篇

2604.17243 2026-04-21 cs.CV 87%

RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation

RemoteShield:为地球观测启用鲁棒的多模态大语言模型

Rui Min, Liang Yao, Shiyu Miao, Shengxiang Xu, Yuxuan Liu, Chuanyi Zhang, Shimin Di, Fan Liu

机构 * Hohai University(河海大学) Nanjing University(南京大学) Southeast University(东南大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);image-text(abstract);分类 cs.CV

AI总结 本文提出RemoteShield,一种针对地球观测的鲁棒多模态大语言模型,通过偏好学习提升在现实输入变化下的稳定性与一致性,实验显示其在多模态扰动下表现优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16785 2026-04-21 cs.CV cs.AI 87%

Bridging Coarse and Fine Recognition: A Hybrid Approach for Open-Ended Multi-Granularity Object Recognition in Interactive Educational Games

弥合粗粒与细粒识别:一种混合方法用于交互教育游戏中的开放多粒度物体识别

Hanling Yi, Feng Lin, Mao Luo, Yifan Yang, Xiaotian Yu, Rong Xiao

机构 * Intellifusion Inc.(Intellifusion公司)

专题命中 图文多模态 :MLLM(summary_cn,abstract);multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HyMOR混合框架,结合MLLM和CLIP模型,解决开放多粒度物体识别中的粗粒与细粒任务差距问题,通过TBO数据集实验验证其在多模态内容生成和互动学习中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16979 2026-04-21 cs.CV cs.CL 84%

DOSE: Data Selection for Multi-Modal LLMs via Off-the-Shelf Models

DOSE: 通过现成模型进行多模态大语言模型的数据选择

Biao Wu, Yiwu Zhong, Meng Fang, Ling Chen

机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所) Peking University(北京大学) University of Liverpool(利物浦大学)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 本文提出DOSE方法,利用现成预训练模型筛选多模态数据,提升数据质量和对齐性,减少计算成本,增强数据多样性,使模型在标准VQA和数学基准测试中表现优异。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16892 2026-04-21 cs.CV 83%

CrossFlowDG: Bridging the Modality Gap with Cross-modal Flow Matching for Domain Generalization

CrossFlowDG:通过跨模态流匹配弥合模态差距以实现领域泛化

Antonios Kritikos, Nikolaos Spanos, Athanasios Voulodimos

机构 * National Technical University of Athens(希腊国家技术大学)

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出CrossFlowDG,通过无噪声的跨模态流匹配解决领域泛化中的模态差距问题,利用联合欧几里得潜在空间中的连续变换,将领域偏向的图像嵌入向领域不变的文本嵌入迁移。

Comments Accepted in CVPRW 2026 (DG-EBF Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16213 2026-04-21 cs.CV cs.AI cs.CL 82%

M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation

M4CXR:探索多任务潜力的多模态大语言模型在胸部X光解读中的应用

Jonggwon Park, Soobum Kim, Byungmu Yoon, Jihun Hyun, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出M4CXR,一种多模态大语言模型,通过链式推理策略提升胸部X光报告生成的临床准确性,并在视觉问答和视觉 grounding 任务中表现出色。

Journal ref IEEE Transactions on Neural Networks and Learning Systems, vol. 36, no. 10, pp. 17841-17855, Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18429 2026-04-21 cs.CV cs.AI 81%

Revisiting Change VQA in Remote Sensing with Structured and Native Multimodal Qwen Models

重新审视遥感中的变化视觉问答问题:结构化与原生多模态Qwen模型

Yakoub Bazi, Mohamad M. Al Rahhal, Mansour Zuair, Faroun Mohamed

机构 * Computer Engineering Department, College of Computer and Information Sciences, King Saud University(计算机工程系,计算机与信息科学学院,沙特国王大学) Applied Computer Science Department, College of Applied Computer Science, King Saud University(应用计算机科学系,应用计算机科学学院,沙特国王大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文重新审视遥感中的变化视觉问答问题,比较了结构化视觉语言模型与原生多模态模型在CDVQA基准上的表现,发现原生模型在语义变化推理中更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17217 2026-04-21 cs.CV cs.AI 81%

Cross-Modal Attention Analysis and Optimization in Vision-Language Models: A Study on Visual Reliability

视觉-语言模型中的跨模态注意力分析与优化:对视觉可靠性的研究

Lijie Zhou

机构 * School of Computer Science(计算机科学学院) University of Nottingham Ningbo China(诺丁汉大学宁波分校)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究了视觉-语言模型中跨模态依赖性问题,通过对抗性评估框架发现优化模型能显著降低跨模态依赖,提升视觉特征关注度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16311 2026-04-21 cs.CL cs.AI cs.SI 81%

Multimodal Claim Extraction for Fact-Checking

多模态声明提取用于事实核查

Joycelyn Teo, Rui Cao, Zhenyun Deng, Zifeng Ding, Michael Sejr Schlichtkrull, Andreas Vlachos

机构 * Defence Science and Technology Agency, Singapore(新加坡国防科学与技术局) University of Cambridge, UK(英国剑桥大学) Queen Mary University of London, UK(英国伦敦大学学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个多模态社交媒体声明提取基准,评估了最先进的多模态大语言模型,在语义对齐、忠实度和去上下文化框架下发现基线模型难以建模修辞意图和上下文线索,引入意图感知框架MICE提升关键意图场景性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17949 2026-04-21 cs.CV 79%

ZSG-IAD: A Multimodal Framework for Zero-Shot Grounded Industrial Anomaly Detection

ZSG-IAD:一种用于零样本 grounded 工业异常检测的多模态框架

Qiuhui Chen, Jiaxiang Song, Shuai Tan, Weimin Zhong

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ZSG-IAD框架,通过多模态数据生成结构化异常报告和像素级掩码,采用语言引导的两跳接地模块和可执行规则GRPO提升可靠性,实现在多个工业异常基准上的强零样本性能和透明解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17278 2026-04-21 cs.CV 79%

PestVL-Net: Enabling Multimodal Pest Learning via Fine-grained Vision-Language Interaction

PestVL-Net: 通过细粒度视觉-语言交互实现多模态害虫学习

Xueheng Li, Tao Hu, Ke Cao, Runsheng Qi, Huixin Zhang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学) Zhongke Hefei Institute of Technology Innovation Engineering(中科合肥技术创新工程研究院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出PestVL-Net框架,结合视觉与语言模型,解决细粒度害虫识别难题,通过RWKV架构和多模态大语言模型实现高效害虫学习。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16884 2026-04-21 cs.CV 79%

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

具有偏见约束的多模态智能用于公平且可靠的临床AI

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院放射科) Department of Urology, South China Hospital, Medical School, Shenzhen University(深圳大学南方医院泌尿科) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出BiasCareVL框架,通过在模型设计中直接引入偏见控制,解决医疗影像与文本整合中公平性和可靠性问题,展示了其在多任务和基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17982 2026-04-21 cs.CV cs.CL 76%

Mitigating Multimodal Hallucination via Phase-wise Self-reward

通过分阶段自奖励缓解多模态幻觉

Yu Zhang, Chuyang Sun, Kehai Chen, Xuefeng Bai, Yang Xiang, Min Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen(深圳) China(中国)

专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL

AI总结 本文提出PSRD框架,通过分阶段自奖励信号在推理时动态抑制幻觉,有效降低LLaVA-1.5-7B的幻觉率50%,在多个基准上优于现有方法。

Comments Self-reward for vision hallucination mitigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13868 2026-04-21 cs.CV cs.AI 73%

When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models

当感知超越认知:在视觉-语言模型中解构知识冲突

Francesco Ortu, Zhijing Jin, Diego Doimo, Alberto Cazzaniga

机构 * University of Trieste(特里este大学) AREA Science Park(AREAS科学公园) MPI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究视觉-语言模型如何解决跨模态冲突,通过引入WHOOPS-AHA!数据集,发现特定注意力头可调节模型对内部知识或视觉信息的偏好,提升冲突解决的精确度。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18134 2026-04-21 cs.CV 70%

Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?

LLM生成文本能否增强外科视觉-语言预训练?

Chengan Che, Chao Wang, Jiayuan Huang, Xinyue Chen, Luis C. Garcia-Peraza-Herrera

机构 * Visual Understanding Research Group, Department of Informatics, King’s College London, UK(视觉理解研究组,信息学院,伦敦国王学院,英国)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出SurgLIME框架,利用LLM生成的文本进行多模态预训练,以解决标注成本高的问题,通过LoRA适配和自适应置信度估计机制提升模型鲁棒性。

Comments Accepted at CVPRW 2026 (AI4RWC Oral presentationn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18452 2026-04-21 cs.CV cs.CL 62%

ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting

ESsEN: 在低资源环境下训练紧凑的判别视觉-语言变换器

Clayton Fields, Casey Kennington

机构 * Department of Computer Science(计算机科学系)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出ESsEN模型,通过双塔编码器结构和传统卷积网络,实现低资源环境下高效视觉-语言模型训练,实验表明其参数量仅为其他模型的分数,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17941 2026-04-21 cs.CV cs.CL 62%

From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models

从头到神经元:多任务视觉-语言模型中的因果归因与操控

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出HONES框架,通过任务相关的注意力头来评估神经元的因果贡献,改进多任务视觉-语言模型中神经元的归因与操控,提升模型性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16517 2026-04-21 cs.CV cs.CL 62%

SmoGVLM: A Small, Graph-enhanced Vision-Language Model

SmoGVLM:一种小型、图增强的视觉-语言模型

Debjyoti Mondal, Rituraj Singh, Subhadarshi Panda

机构 * Samsung R\&D Institute India-Bangalore

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出SmoGVLM,一种结合图神经网络的视觉-语言模型,通过结构化知识提升小规模多模态推理性能,实验表明小型模型性能提升达16.24%。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16499 2026-04-21 cs.CV cs.AI 62%

HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models

HQA-VLAttack:面向视觉-语言预训练模型的高质量对抗攻击

Han Liu, Jiaqi Li, Zhi Xu, Xiaotong Zhang, Xiaoming Xu, Fenglong Ma, Yuanman Li, Hong Yu

机构 * Dalian University of Technology(大连理工大学) The Pennsylvania State University(宾夕法尼亚州立大学) Shenzhen University(深圳大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HQA-VLAttack框架,通过文本和图像攻击阶段生成高质量对抗示例,同时优化正负样本相似度,提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.11474 2026-04-21 cs.CV cs.CL 62%

#PraCegoVer: A Large Dataset for Image Captioning in Portuguese

#PraCegoVer:一种用于葡萄牙语图像描述的大型数据集

Gabriel Oliveira dos Santos, Esther Luna Colombini, Sandra Avila

机构 * Institute of Computing, University of Campinas(计算机学院,坎皮纳斯大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出#PraCegoVer数据集,基于Instagram帖子生成葡萄牙语图像描述,是首个大规模葡萄牙语图像描述数据集,具有单张图像仅一个描述及较长句子长度的挑战性特征。

Comments 23 pages, 21 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18107 2026-04-21 cs.CV 57%

Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models

基于延迟反馈的测试时扰动学习用于视觉-语言-动作模型

Zehua Zang, Xi Wang, Fuchun Sun, Xiao Xu, Lixiang Lium, Jiahuan Zhou, Jiangmeng Li

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) National Defense University(国防大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PDF框架,通过不确定性数据增强和动作投票缓解轨迹过拟合,提升决策性能,实验显示在LIBERO和Atari任务中取得显著成效。

Comments 12 pages, 7 figures, 5 tables

Journal ref CVPR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18032 2026-04-21 cs.CV 57%

CFSR: Geometry-Conditioned Shadow Removal via Physical Disentanglement

CFSR:通过物理解耦实现几何条件下的阴影去除

Pan Wang, Yihao Hu, Xiujin Liu, Hang Wang

机构 * University of Science and Technology of China(科学技术大学) University of Michigan - Ann Arbor(密歇根大学安娜堡分校) Sun Yat-sen University(中山大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CFSR框架,通过物理约束恢复过程解决传统阴影去除网络缺乏物理可解释性的问题,结合3D几何信息与大规模基础模型语义,有效弥合2D-3D领域差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17915 2026-04-21 cs.CV 57%

OneDrive: Unified Multi-Paradigm Driving with Vision-Language-Action Models

OneDrive: 统一的多范式驾驶与视觉-语言-动作模型

Yiwei Zhang, Xuesong Chen, Jin Gao, Hanshi Wang, Fudong Ge, Weiming Hu, Shaoshuai Shi, Zhipeng Zhang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA School of Artificial Intelligence, University of Chinese Academy of Sciences AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University Voyager Research, Didi Chuxing School of Information Science(多模态人工智能系统国家重点实验室,中国科学院自动化所人工智能学院,中国科学院大学,AutoLab,上海交通大学人工智能学院,Voyager Research,滴滴出行,信息科学与技术学院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于预训练视觉语言模型的统一自动驾驶框架,通过单一Transformer解码器整合异构解码行为,实现多任务联合优化,实验表明在nuScenes和NAVSIM上取得最优性能,且推理效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17896 2026-04-21 cs.LG cs.AI cs.RO 57%

Can Explicit Physical Feasibility Benefit VLA Learning? An Empirical Study

显式物理可行性能否促进VLA学习?一项实证研究

Yubai Wei, Chen Wu, Hashem Haghbayan

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文研究显式物理可行性监督对VLA学习的影响,提出几何基础可行性目标并集成到扩散基VLA策略训练中,实验证明其能提升物理可靠性和任务性能,增强低数据下的学习效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17748 2026-04-21 cs.CV 57%

Source-Free Domain Adaptation with Vision-Language Prior

无源领域适应与视觉-语言先验

Song Tang, Yunxiang Bai, Wenxin Su, Mao Ye, Jianwei Zhang, Xiatian Zhu

机构 * Institute of Machine Intelligence(机器智能研究所) University of Shanghai for Science and Technology(上海科技大学) Department of Informatics(信息学院) Universität Hamburg(汉堡大学) European Molecular Biology Laboratory(欧洲分子生物学实验室) School of Computer Science and Engineering(计算机科学与工程学院) University of Electronic Science and Technology of China(电子科技大学) TAMS Group(多模态系统技术组) Surrey Institute for People-Centred Artificial Intelligence(萨里大学以人为本的人工智能研究所) Centre for Vision, Speech and Signal Processing (CVSSP)(视觉、语音与信号处理中心) University of Surrey(萨里大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DIFO++方法,利用视觉-语言模型进行无源领域适应,通过定制和知识蒸馏减少领域差距,提升目标域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17147 2026-04-21 cs.CV cs.RO 57%

ScenarioControl: Vision-Language Controllable Vectorized Latent Scenario Generation

ScenarioControl: 基于视觉-语言的向量化潜在场景生成

Lili Gao, Yanbo Xu, William Koch, Samuele Ruffino, Luke Rowe, Behdad Chalaki, Dmitriy Rivkin, Julian Ost, Roger Girgis, Mario Bijelic, Felix Heide

机构 * Torc Robotics(Torc机器人公司) Princeton University(普林斯顿大学) Mila

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ScenarioControl通过视觉-语言控制机制生成多样且真实的3D场景,结合向量化潜在空间和跨全局控制机制,实现对道路布局和交通状况的精细控制,支持长时程驾驶场景延续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02618 2026-04-21 cs.CV 57%

Mind the Way You Select Negative Texts: Pursuing the Distance Consistency in OOD Detection with VLMs

注意你选择负样本的方式:在使用VLMs进行OOD检测时追求距离一致性

Zhikang Xu, Qianqian Xu, Zitai Wang, Cong Hua, Sicong Li, Zhiyong Yang, Qingming Huang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出InterNeg框架,通过统一的跨模态距离增强提升OOD检测性能,实验显示在ImageNet和Near-OOD基准上取得显著改进。

Comments Accepted by the main track of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏