arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-26 至 2026-05-26 共收录 12 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 12 篇

2605.25479 2026-05-26 cs.CV 83%

MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models

MAIL++: 视觉语言模型的多模态双向智能体层

Kaixiang Chen, Pengfei Fang, Hui Xue

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国)

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出MAIL/MAIL++方法,通过将跨模态耦合嵌入VLM内在计算模块并引入双向桥接,实现参数高效微调,在少样本分类和跨域检索中超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25708 2026-05-26 cs.CV cs.CL cs.ET 81%

CMAP: Cross-Modal Adaptive Prompting for Multi-Domain Task-Incremental Learning

CMAP: 面向多域任务增量学习的跨模态自适应提示

Sriram Mandalika

机构 * Hasso Plattner Institute(霍普斯·普拉特纳研究所)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对多域任务增量学习,提出跨模态自适应提示方法,利用CLIP文本嵌入空间进行任务路由、置信度估计和编码器适应,在MTIL基准上超越现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03191 2026-05-26 cs.CV cs.AI cs.LG 81%

AnatomiX, an Anatomy-Aware Grounded Multimodal Large Language Model for Chest X-Ray Interpretation

AnatomiX:一种解剖学感知的胸部X光解读多模态大语言模型

Anees Ur Rehman Hashmi, Numan Saeed, Christoph Lippert

机构 * Hasso Plattner Institute(霍普夫纳研究所) MBZUAI(穆萨大学人工智能研究所)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出AnatomiX,一种两阶段解剖学感知多模态大语言模型,通过先识别解剖结构再执行下游任务,在解剖定位、短语定位、定位诊断和定位描述任务上相比现有方法提升超过25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24794 2026-05-26 cs.CV cs.CL 76%

DUEL: Adversarial Self-Play for Multimodal Reasoning

DUEL: 用于多模态推理的对抗性自我对弈

Lin Qiu, Hanqing Zeng, Yao Liu, Bingjun Sun, Guangdeng Liao, Ji Liu

机构 * Meta AI

专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL

AI总结 提出DUEL框架,通过对抗性自我对弈从预训练VLM生成监督信号,结合长度归一化对数似然奖励,无需人工标注即可提升视觉推理与判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10921 2026-05-26 cs.CV cs.AI cs.LG 62%

FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model

FG-CLIP 2: 一种双语细粒度视觉-语言对齐模型

Chunyu Xie, Bin Wang, Fanjing Kong, Jincheng Li, Dawei Liang, Ji Ao, Dawei Leng, Yuhui Yin

机构 * AI Research(360人工智能研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FG-CLIP 2双语视觉语言模型,通过区域-文本匹配、长描述建模和文本内模态对比损失等细粒度监督,在英中双语上实现细粒度对齐,在29个数据集上取得最优结果。

Comments Accepted in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25036 2026-05-26 cs.CL cs.AI 62%

Language Bias in LVLMs: From In-Depth Analysis to Simple and Effective Mitigation

LVLMs中的语言偏差:从深入分析到简单有效的缓解方法

Yangneng Chen, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文系统研究了大视觉语言模型中的语言偏差问题,发现其根源在于训练中的模态未对齐,并提出了两种简单有效的缓解方法:语言偏差正则化(LBR)和语言偏差惩罚(LBP)。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24957 2026-05-26 cs.AI cs.CV cs.LG 62%

Mitigating Object Hallucinations in Vision-Language Models through Region-Aware Attention Recalibration

通过区域感知注意力重校准减轻视觉语言模型中的对象幻觉

Yuanzhi Xu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Sixue Lin, Yuteng Xiao

机构 * Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院)) China Telecom Digital Intelligence Technology Co, Ltd(中国电信数字智能技术有限公司) Shenyang Aerospace University(沈阳航空航天大学) Qilu Institute of Technology(齐鲁理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种无需训练的区域感知自适应加权机制,通过计算注意力头的稳健统计中点并利用跨头分歧动态调整干预预算,以连续惩罚调制抑制幻觉路径,有效纠正视觉语义错位,同时保持生成流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24807 2026-05-26 cs.CV 57%

CLIP-Guided SAM: Parameter-Efficient Semantic Conditioning for Promptable Segmentation

CLIP引导的SAM:用于可提示分割的参数高效语义条件

Shayan Jalilian, Abdul Bais

机构 * University of Regina, Regina, SK, Canada(里贾纳大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出CLIP-Guided SAM框架,通过轻量级多模态语义适配器将CLIP特征注入SAM图像编码器,实现内部语义条件化,在低标注数据下提升分割性能并支持手动和半自动两种模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09431 2026-05-26 cs.CR cs.CV 57%

Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models

基于文本驱动的攻击:提升编码器对抗迁移性以攻击大型视觉-语言模型

Xinwei Zhang, Li Bai, Tianwei Zhang, Youqian Zhang, Qingqing Ye, Yingnan Zhao, Ruochen Du, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Harbin Engineering University(哈尔滨工程大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出文本驱动攻击(GDA),通过将扰动优化与文本接地证据对齐,并采用接地感知扰动分配和接地中心证据破坏策略,显著提升编码器攻击在黑盒大型视觉-语言模型上的迁移性。

Comments Under review;

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24098 2026-05-26 cs.CV 57%

D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving

D2-V2X: 面向自动驾驶的深度驱动协同V2X推理

Kevin Richard, Alphin Varghese, Colin Pham, David Oh, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对单车辆视觉语言模型受传感器遮挡限制的问题,提出D2-V2X基准和基线模型,通过融合3D LiDAR特征与VLM潜空间,利用链式思维推理实现遮挡目标识别和空间估计,在识别遮挡危险和降低空间估计误差上取得显著提升。

Comments Accepted to the DriveX Workshop at CVPR 2026 (Non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24024 2026-05-26 cs.CV 57%

Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating

通过因果路由门控减轻大型视觉语言模型中的幻觉

Zhe Cheng, Wenyu Chen, Fode Zhang, Dehuan Shen

机构 * Center of Statistical Research, School of Statistics and Data Science, Southwestern University of Finance and Economics, Chengdu, China.(统计研究中心,统计与数据科学学院,西南财经大学,成都,中国) Department of Biomedical Engineering, College of Design and Engineering, National University of Singapore, Singapore(生物医学工程系,设计与工程学院,新加坡国立大学,新加坡)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型中因文本路径主导导致幻觉的问题,提出一种无训练、决策对齐的干预方法,通过分解注意力头为视觉和文本路由并抑制文本路由,有效减少幻觉错误。

Comments Accepted as a Spotlight Paper at ICML 2026. 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08011 2026-05-26 cs.CV 57%

It's Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models

是时候正确了:提升视觉语言模型中的模拟时钟读取和指针空间推理能力

Jaeha Choi, Jin Won Lee, Siwoo You, Jangho Lee

机构 * Incheon National University(延世国立大学) McGill University(麦吉尔大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉语言模型在真实环境中读取模拟时钟的挑战,提出TickTockVQA数据集和Swap-DPO微调框架,显著提升时钟读取准确性和鲁棒性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏