arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-09 至 2026-03-09 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2603.06090 2026-03-09 cs.CV cs.CL 86%

DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model

DeepSight: 通过深度驱动的多模态模型连接深度图与语言

Hao Yang, Hongbo Zhang, Yanyan Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 DeepSight通过深度驱动的多模态模型提升三维场景理解,利用深度图像特性增强空间推理能力,并通过新数据集和模型改进实现了深度感知和任务性能的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06340 2026-03-09 cs.CV cs.AI 81%

K-MaT: Knowledge-Anchored Manifold Transport for Cross-Modal Prompt Learning in Medical Imaging

K-MaT: 基于知识的流形传输用于医学影像中的跨模态提示学习

Jiajun Zeng, Shadi Albarqouni

机构 * University of Bonn(波恩大学) University Hospital Bonn(波恩大学医院) Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 K-MaT通过基于知识的流形传输实现跨模态提示学习,提升医学影像模型在不同模态间的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06084 2026-03-09 cs.RO 78%

Multimodal Behavior Tree Generation: A Small Vision-Language Model for Robot Task Planning

多模态行为树生成:一种小型视觉-语言模型用于机器人任务规划

Cristiano Battistini, Riccardo Andrea Izzo, Gianluca Bardaro, Matteo Matteucci

机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子信息与生物工程系,米兰理工学院)

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 本文提出一种小型视觉-语言模型,通过生成行为树提升机器人任务规划效率,实验证明其在性能和资源消耗上均优于现有闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19535 2026-03-09 cs.CV cs.AI 62%

CASA: Cross-Attention over Self-Attention for Efficient Vision-Language Fusion

CASA: 交叉注意力优于自注意力用于高效的视觉-语言融合

Moritz Böhle, Amélie Royer, Juliette Marrie, Edouard Grave, Patrick Pérez

机构 * Kyutai

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 CASA通过交叉注意力机制提升视觉-语言模型的效率,实现实时视频字幕处理中的低延迟和恒定内存成本。

Comments updated with improved CA results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06270 2026-03-09 cs.CV cs.AI 62%

HiPP-Prune: Hierarchical Preference-Conditioned Structured Pruning for Vision-Language Models

HiPP-Prune: 基于层次化偏好条件的结构化剪枝用于视觉-语言模型

Lincen Bai, Hedi Tabia, Raul Santos-Rodriguez

机构 * Université Paris-Saclay(巴黎萨克雷大学) University of Bristol(布里斯托大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 HiPP-Prune通过层次化偏好条件的结构化剪枝框架,在视觉-语言模型中实现高效部署,通过多目标优化提供可控的鲁棒性与效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06256 2026-03-09 cs.CV cs.AI 62%

GazeMoE: Perception of Gaze Target with Mixture-of-Experts

GazeMoE:基于专家混合的注视目标感知

Zhuangzhuang Dai, Zhongxi Lu, Vincent G. Zakka, Luis J. Manso, Jose M Alcaraz Calero, Chen Li

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 GazeMoE通过MoE模块结合多模态线索,实现对注视目标的高精度识别,优于现有方法。

Comments 8 pages, 3 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01653 2026-03-09 cs.CV cs.AI 62%

MAP: Mitigating Hallucinations in Large Vision-Language Models with Map-Level Attention Processing

MAP: 通过地图级注意力处理缓解大视觉-语言模型中的幻觉

Chenxi Li, Yichen Guo, Benfang Qian, Jinhao You, Kai Tang, Yaosong Du, Zonghao Zhang, Xiande Huang

机构 * DAIL Tech(DAIL科技)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MAP通过地图级注意力处理提升大视觉-语言模型的事实一致性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05732 2026-03-09 cs.CV 57%

From Phase Grounding to Intelligent Surgical Narratives

从相位接地到智能手术叙述

Ethan Peterson, Huixin Zhan

机构 * New Mexico Institute of Mining and Technology(新墨西哥矿业技术研究所)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的多模态框架,通过自动创建手术时间线和叙述,减少手动标注的需要。

详情

展开后加载摘要…

URL PDF HTML 收藏