arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-19 至 2026-03-19 共收录 11 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 11 篇

2603.17326 2026-03-19 cs.CV 70%

FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions

FineViT: 通过密集描述逐步解锁细粒度感知

Peisen Zhao, Xiaopeng Zhang, Mingxing Xu, Ruoyu Sun, Zewei Du, Dunzheng Wang, Guanghao Zheng, Haohang Xu, Zhibo Zhang, Yuhang Zhang, Yi Ai, Lin Liu, Qi Tian

机构 * Huawei Inc.(华为公司)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 FineViT通过密集描述逐步训练,提升细粒度视觉感知能力,在长上下文检索中表现优异,超越现有多模态视觉编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17079 2026-03-19 cs.CV 70%

ACE-LoRA: Graph-Attentive Context Enhancement for Parameter-Efficient Adaptation of Medical Vision-Language Models

ACE-LoRA:图注意上下文增强用于医疗视觉-语言模型的参数高效适应

M. Arda Aydın, Melih B. Yilmaz, Aykut Koç, Tolga Çukur

机构 * Bilkent University(比尔肯特大学) National Magnetic Resonance Research Center (UMRAM)(国家磁共振研究所以及UMRAM)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出ACE-LoRA框架,通过整合LoRA模块和ACE-HGNN模块,提升医疗VLM的零样本泛化能力,解决领域特异性与泛化能力的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18002 2026-03-19 cs.CV cs.AI cs.CL 67%

Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models

Loc3R-VLM:基于语言的定位与3D推理的视觉语言模型

Kevin Qu, Haozhe Qi, Mihai Dusmanu, Mahdi Rad, Rui Wang, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间AI实验室) ETH Zurich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Loc3R-VLM通过结合全局布局重建和显式情境建模,提升视觉语言模型的3D空间理解能力,在语言定位和3D问答任务中取得最优性能。

Comments Project Page: https://kevinqu7.github.io/loc3r-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06313 2026-03-19 cs.CV 57%

WMoE-CLIP: Wavelet-Enhanced Mixture-of-Experts Prompt Learning for Zero-Shot Anomaly Detection

WMoE-CLIP:小波增强的专家混合提示学习用于零样本异常检测

Peng Chen, Chao Huang

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, Shenzhen(中山大学深圳校区计算机科学与技术学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出WMoE-CLIP方法,通过小波分解提取多频图像特征并结合变分自编码器提升提示适应性,引入语义感知的专家混合模块,有效提升零样本异常检测性能。

Journal ref ICASSP 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09262 2026-03-19 cs.CV 57%

MultiMedEval: A Benchmark and a Toolkit for Evaluating Medical Vision-Language Models

MultiMedEval:用于评估医学视觉-语言模型的基准和工具包

Corentin Royer, Bjoern Menze, Anjany Sekuboyina

机构 * University of Zürich(苏黎世大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 MultiMedEval通过23个数据集和11个医学领域,评估六种多模态任务,提供开源工具简化VLM评估,促进公平统一的基准测试。

Comments Accepted at MIDL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17520 2026-03-19 cs.CV 57%

PCA-Seg: Revisiting Cost Aggregation for Open-Vocabulary Semantic and Part Segmentation

PCA-Seg:重新审视开放词汇语义和部分分割中的成本聚合

Jianjian Yin, Tao Chen, Yi Chen, Gensheng Pei, Xiangbo Shu, Yazhou Yao, Fumin Shen

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Normal University(南京师范大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系) University of Electronic Science and Technology of China(电子科技大学) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进施工机械智能制造国家重点实验室)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出PCA-Seg方法,通过并行成本聚合缓解类级语义与空间上下文之间的知识干扰,提升开放词汇语义和部分分割性能。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17325 2026-03-19 cs.CV 57%

MedSAD-CLIP: Supervised CLIP with Token-Patch Cross-Attention for Medical Anomaly Detection and Segmentation

MedSAD-CLIP:基于Token-Patch交叉注意力的监督CLIP用于医学异常检测和分割

Thuy Truong Tran, Minh Kha Do, Phuc Nguyen Duy, Min Hun Lee

机构 * Singapore Management University(新加坡管理大学) La Trobe University(拉特罗布大学) Vietnam National University, Hanoi(越南国家大学河内分校)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出MedSAD-CLIP,通过Token-Patch交叉注意力提升医学图像中病变定位,结合轻量级图像适配器和可学习提示词,实现CLIP在医学领域的有效监督适应,实验表明其在分割和分类任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16600 2026-03-19 cs.CV 57%

Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models

原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型

Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。

Comments 25 pages, 10 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14549 2026-03-19 cs.CV cs.LG 57%

ASAP: Attention-Shift-Aware Pruning for Efficient LVLM Inference

ASAP: 一种面向高效视觉-语言模型推理的注意力转移感知剪枝方法

Surendra Pathak, Bo Han

机构 * George Mason University(乔治·马歇尔大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ASAP方法,通过动态双向软注意力掩码缓解注意力转移问题,并引入加权软合并组件减少语义冗余,实现视觉上下文近似无损压缩,保持99.02%的LLaVA-NeXT-7B性能,计算量降低约80%。

Comments Update in V2: Added citations, refrences, and other minor rewrites

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11005 2026-03-19 cs.CV 57%

Draft and Refine with Visual Experts

草稿与润色:借助视觉专家

Sungheon Jeong, Ryozo Masukawa, Jihong Park, Sanggeon Yun, Wenjun Huang, Hanning Chen, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学) MOLOCO

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DnR框架,通过可视化专家反馈提升模型视觉利用能力,减少幻觉并提高多模态系统可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06231 2026-03-19 cs.CV 57%

RSRefSeg 2: Decoupling Referring Remote Sensing Image Segmentation with Foundation Models

RSRefSeg 2: 解耦引用遥感图像分割与基础模型

Keyan Chen, Chenyang Liu, Bowen Chen, Jiafan Zhang, Zhengxia Zou, Zhenwei Shi

机构 * Beihang University(北京航空航天大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 RSRefSeg 2通过解耦传统三阶段流程,提出双阶段协作框架,结合CLIP的跨模态对齐与SAM的分割泛化能力,提升遥感图像分割精度与复杂语义解释能力。

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 1-20, 2026, Art no. 4700420

详情

展开后加载摘要…

URL PDF HTML 收藏