arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-24 至 2026-03-24 共收录 15 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 15 篇

2506.04559 2026-03-24 cs.CV 83%

Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning

面向可扩展多模态推理的推理对齐感知解耦

Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huawei Cloud Project(华为云项目)

专题命中 图文多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出RAPID方法,通过解耦多模态模型的感知与推理模块,利用强化学习优化感知输出,使模型能与任意强大文本推理模型配合,实现无需重新训练的性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22179 2026-03-24 cs.AI 79%

MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management

MARCUS:一种用于心脏诊断和管理的代理式多模态视觉-语言模型

Jack W O'Sullivan, Mohammad Asadi, Lennart Elbe, Akshay Chaudhari, Tahoura Nedaee, Francois Haddad, Michael Salerno, Li Fe-Fei, Ehsan Adeli, Rima Arnaout, Euan A Ashley

机构 * Division of Cardiology, Department of Medicine, Stanford University(斯坦福大学心脏病学系) Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Medicine, Radiology, and Pediatrics, UCSF(旧金山大学医学系、放射学与儿科学系) Bakar Institute, UCSF(Bakar研究所,旧金山大学) UCSF–UC Berkeley Joint Program in Computational Precision Health(旧金山大学-伯克利计算精准健康联合计划) Department of Radiology, Stanford University(斯坦福大学放射学系) Department of Psychiatry and Behavioral Sciences, Stanford University(斯坦福大学精神病学与行为科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系) Department of Biology, Stanford University(斯坦福大学生物学系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 MARCUS通过多模态视觉-语言模型实现心电图、超声和心脏磁共振成像的端到端解读,其多代理架构在心脏诊断中表现出优于前沿模型的准确率和自由文本质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21426 2026-03-24 cs.CV 79%

Uncertainty-Aware Knowledge Distillation for Multimodal Large Language Models

面向不确定性的多模态大语言模型知识蒸馏

Jingchen Sun, Shaobo Han, Deep Patel, Wataru Kohno, Can Jin, Changyou Chen

机构 * NEC Laboratories America, Inc.(NEC美洲实验室) University at Buffalo, SUNY(布法罗大学) Rutgers University(罗格斯大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Beta-KD框架,通过统一贝叶斯视角平衡数据与教师指导,提升多模态VQA任务性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21010 2026-03-24 cs.CV 74%

SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis

SkinCLIP-VL: 一种面向多模态皮肤癌诊断的一致性感知视觉-语言学习框架

Zhixiang Lu, Shijie Xu, Kaicheng Yan, Xuyue Cai, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学)

专题命中 图文多模态 :multimodal(title);分类 cs.CV

AI总结 本文提出SkinCLIP-VL,通过冻结感知与自适应推理范式,结合CLIP编码器与轻量量化Qwen2.5-VL,引入一致性聚焦对齐损失,实现高效皮肤癌诊断,优于13B参数基线模型,参数更少且临床信任度更高。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04839 2026-03-24 cs.CV 70%

Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction

通过语义增强的动态对比交互实现高度可迁移的视觉-语言攻击

Yuanbo Li, Tianyang Xu, Cong Hu, Tao Zhou, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(Surrey 大学视觉、语音和信号处理中心)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出SADCA方法,通过语义引导的渐进扰动提升视觉-语言模型的对抗可迁移性,实验表明其在多个数据集上优于现有方法。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01571 2026-03-24 cs.CV cs.RO 70%

PixelVLA: Advancing Pixel-level Understanding in Vision-Language-Action Model

PixelVLA:推进视觉-语言-动作模型中的像素级理解

Wenqi Liang, Gan Sun, Yao He, Jiahua Dong, Suyan Dai, Ivan Laptev, Salman Khan, Yang Cong

机构 * University of Trento(特伦托大学) School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学) Australian National University(澳大利亚国立大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 PixelVLA通过引入多尺度像素感知编码器和视觉提示感知编码器,提升视觉-语言-动作模型的像素级理解和多模态提示能力,在三个基准和两个模型变体中提升了10.1%-28.7%的操控成功率。

Comments 17pages,7 figures, 5 tabels

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20662 2026-03-24 cs.AI cs.CV 62%

Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning

空间中的注意:VLM头部在空间推理中的功能角色

Xueqi Ma, Shuo Yang, Yanbei Jiang, Shu Liu, Zhenzhen Liu, Jiayang Ao, Xingjun Ma, Sarah Monazam Erfani, James Bailey

机构 * The University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学) Fudan University(复旦大学) Monash University(莫纳什大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20275 2026-03-24 cs.CV cs.AI 62%

Understanding Pruning Regimes in Vision-Language Models Through Domain-Aware Layer Selection

通过领域感知的层选择理解视觉-语言模型中的剪枝规则

Saeed Khaki, Nima Safaei, Kamal Ginotra

机构 * Microsoft AI(微软人工智能)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究通过领域感知激活相似性分析,揭示视觉-语言模型中不同剪枝预算下层移除对性能的影响,发现三种剪枝规则:低预算下性能敏感,中预算下结构损伤累积,高预算下结构连续性主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22165 2026-03-24 cs.CV 57%

ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints

ACPO: 通过不对称约束对抗视觉-语言对齐中的似然位移

Kaili Huang, Hongming Zhang, Rui Shen, Linjun Dai, Jiahao Wang, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 ACPO通过动态目标导向缩放解决视觉-语言对齐中的似然位移问题,通过不对称抑制拒绝项梯度流,防止视觉锚点坍塌,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21484 2026-03-24 cs.CV 57%

Which Concepts to Forget and How to Refuse? Decomposing Concepts for Continual Unlearning in Large Vision-Language Models

哪些概念需要遗忘以及如何拒绝?分解概念以在大视觉-语言模型中实现持续反学习

Hyundong Jin, Dongyoon Han, Eunwoo Kim

机构 * Chung-Ang University(Chung-Ang大学) NAVER AI Lab(NAVER AI实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种持续反学习框架,通过分解删除目标中的视觉和文本概念,生成基于细粒度描述的拒绝响应,以提升反学习效果和保持通用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17657 2026-03-24 cs.CV 57%

SPACE-CLIP: Spatial Perception via Adaptive CLIP Embeddings for Monocular Depth Estimation

SPACE-CLIP:通过自适应CLIP嵌入实现空间感知的单目深度估计

Taewan Cho, Taeryang Kim, Andrew Jaeyong Choi

机构 * School of Computing, Gachon University(加尔文大学计算机学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 SPACE-CLIP提出了一种仅解码器的深度框架,通过冻结的CLIP视觉编码器直接读取几何线索,无需文本编码器,实现了高效的单目深度估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21047 2026-03-24 cs.CV 57%

When Minor Edits Matter: LLM-Driven Prompt Attack for Medical VLM Robustness in Ultrasound

微小修改同样重要:基于LLM驱动的提示攻击用于医学视觉语言模型在超声中的鲁棒性

Yasamin Medghalchi, Milad Yazdani, Amirhossein Dabiriaghdam, Moein Heidari, Mojan Izadkhah, Zahra Kavian, Giuseppe Carenini, Lele Wang, Dena Shahriari, Ilker Hacihaliloglu

机构 * University of British Columbia, Vancouver, Canada(不列颠哥伦比亚大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一个可扩展的对抗评估框架,利用大语言模型生成临床合理的对抗提示变体,评估SOTA医学视觉语言模型在超声中的鲁棒性,揭示模型在临床应用中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12224 2026-03-24 cs.RO cs.AI 57%

RoboFAC: A Comprehensive Framework for Robotic Failure Analysis and Correction

RoboFAC:机器人故障分析与纠正的综合框架

Zewei Ye, Weifeng Lu, Minghao Ye, Tao Lin, Shuo Yang, Junchi Yan, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 RoboFAC通过构建大规模故障中心数据集,开发轻量级多模态模型,提升机器人故障诊断与纠正能力,实验显示其故障分析准确率比GPT-4o高34.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15977 2026-03-24 cs.HC 50%

Adaptive Captioning with Emotional Cues: Supporting DHH and Neurodivergent Learners in STEM

适应性字幕与情感提示:支持聋人及神经多样性学习者在STEM领域

Sunday David Ubur, Eugenia Ha Rim Rho, Denis Gracanin

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文探讨了四种嵌入情感和多模态提示的字幕原型,通过实验证明其能降低认知负荷并提升理解成绩,强调了为神经多样性用户定制字幕功能的重要性。

Comments Accepted and presented at Affective Computing and Intelligent Interaction (ACII) Conference 2025; final version to appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20607 2026-03-24 cs.RO cs.LG 50%

Towards Practical World Model-based Reinforcement Learning for Vision-Language-Action Models

面向视觉-语言-动作模型的实用世界模型强化学习

Zhilong Zhang, Haoxiang Ren, Yihao Sun, Yifei Sheng, Haonan Wang, Haoxin Lin, Zhichao Wu, Pierre-Luc Bacon, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家实验室,南京大学,南京,中国) School of Artificial Intelligence, Nanjing University, Nanjing, China(人工智能学院,南京大学,南京,中国) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出VLA-MBPO框架,解决视觉-语言-动作模型在强化学习中的世界建模、多视角一致性及稀疏奖励下的误差累积问题,提升策略性能和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏