arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-09 至 2026-03-09 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2603.06340 2026-03-09 cs.CV cs.AI 62%

K-MaT: Knowledge-Anchored Manifold Transport for Cross-Modal Prompt Learning in Medical Imaging

K-MaT: 基于知识的流形传输用于医学影像中的跨模态提示学习

Jiajun Zeng, Shadi Albarqouni

机构 * University of Bonn(波恩大学) University Hospital Bonn(波恩大学医院) Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 K-MaT通过基于知识的流形传输实现跨模态提示学习,提升医学影像模型在不同模态间的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05629 2026-03-09 cs.CV 57%

Rethinking Concept Bottleneck Models: From Pitfalls to Solutions

重新思考概念瓶颈模型:从误区到解决方案

Merve Tapli, Quentin Bouniot, Wolfgang Stammer, Zeynep Akata, Emre Akbas

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 CBM-Suite通过引入熵度量、非线性层和蒸馏损失,系统解决概念瓶颈模型的准确性、可解释性和系统性研究问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏