arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-14 至 2026-04-14 共收录 165 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 18 篇

2511.09282 2026-04-14 cs.SD cs.CL 57%

End-to-end Contrastive Language-Speech Pretraining Model For Long-form Spoken Question Answering

端到端对比语言-语音预训练模型用于长形式语音问答

Jiliang Hu, Zuchao Li, Baoyuan Qi, Liu Guoming, Ping Wang

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出CLSR模型,通过将音频特征转换为文本表示,提升长音频问答任务的性能,实验表明其优于现有方法。

Comments 12 pages, 7 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10413 2026-04-14 cs.SD 50%

Sign-to-Speech Prosody Transfer via Sign Reconstruction-based GAN

通过手语重建的生成对抗网络实现手语到语音语调转换

Toranosuke Manabe, Yuto Shibata, Shinnosuke Takamichi, Yoshimitsu Aoki

机构 * Keio University(庆应义塾大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 本文提出手语到语音语调转换任务,通过SignRecGAN和S2PFormer模型,在无需跨模态标注的情况下实现手语语调信息的直接整合,提升语音合成的情感表达。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 19 篇

2604.10060 2026-04-14 cs.PF 78%

Mosaic: Cross-Modal Clustering for Efficient Video Understanding

Mosaic:用于高效视频理解的跨模态聚类

Tuowei Wang, He Zhou, Chengru Song, Qiushi Li, Ju Ren

专题命中 视频多模态 :cross-modal(title,abstract)

AI总结 Mosaic是首个针对流式长视频理解的跨模态聚类驱动VLM推理系统,通过优化KVCache管理实现1.38倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11627 2026-04-14 cs.CV 77%

POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs

POINTS-Long: 基于人类视觉系统的自适应双模式视觉推理MLLM

Haicheng Wang, Yuan Liu, Yikun Liu, Zhemeng Yu, Zhongyin Zhao, Yangxiu You, Zilin Yu, Le Tian, Xiao Zhou, Jie Zhou, Weidi Xie, Yanfeng Wang

机构 * SAI, Shanghai Jiao Tong University(上海交通大学人工智能研究院) WeChat AI, Tencent(腾讯微信人工智能)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV

AI总结 POINTS-Long引入动态视觉token缩放机制,通过聚焦模式和待机模式实现效率与精度的动态平衡,在细粒度视觉任务中保持最优性能,在长形式视觉理解中使用1/40-1/10的视觉token保留97.7-99.7%的精度,支持流式视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22911 2026-04-14 cs.CV cs.AI 76%

ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling

ForestPrune: 通过时空森林建模实现视频多模态大语言模型的高比率视觉令牌压缩

Shaobo Ju, Baiyang Song, Tao Chen, Jiapeng Zhang, Qiong Wu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 视频多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 本文提出ForestPrune,一种无需训练的视频MLLM令牌压缩方法,通过时空森林建模实现高效高比率压缩,实验表明其在视频任务中效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17574 2026-04-14 cs.CV cs.AI 73%

HumanVBench: Probing Human-Centric Video Understanding in MLLMs with Automatically Synthesized Benchmarks

HumanVBench: 通过自动合成基准测试探测多模态大语言模型中的以人为本的视频理解

Ting Zhou, Daoyuan Chen, Qirui Jiao, Bolin Ding, Yaliang Li, Ying Shen

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团) Peng Cheng Laboratory(鹏城实验室) Guangdong Provincial Key Laboratory of Fire Science and Intelligent Emergency Technology(广东省消防科学与智能应急技术重点实验室)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HumanVBench,一个针对多模态大语言模型(MLLMs)中以人为本的视频理解能力的综合基准测试,通过自动化流程生成高质量视频注释和挑战性问题,揭示30个领先MLLMs在感知细微情绪和对齐语音与视觉线索方面的不足。

Comments Accepted as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11156 2026-04-14 cs.CV 70%

rPPG-VQA: A Video Quality Assessment Framework for Unsupervised rPPG Training

rPPG-VQA:一种用于无监督rPPG训练的视频质量评估框架

Tianyang Dai, Ming Chang, Yan Chen, Yang Hu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出rPPG-VQA框架,通过信号级和场景级分析评估视频对rPPG模型训练的适用性,结合双分支架构和两阶段自适应采样策略提升模型性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17012 2026-04-14 cs.CV 70%

4D-RGPT: Toward Region-level 4D Understanding via Perceptual Distillation

4D-RGPT:通过感知蒸馏实现区域级4D理解

Chiao-An Yang, Ryo Hachiuma, Sifei Liu, Subhashree Radhakrishnan, Raymond A. Yeh, Yu-Chiang Frank Wang, Min-Hung Chen

机构 * NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出4D-RGPT和P4D框架,解决3D/4D视频问答中4D感知和时间理解不足的问题,并构建了区域级提示的R4D-Bench基准。

Comments CVPR 2026 (Highlight). Project page: https://www.ca-joe-yang.com/resource/projects/4D_RGPT/. GitHub: https://github.com/NVlabs/4D-RGPT. Dataset: https://huggingface.co/datasets/nvidia/R4D-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24329 2026-04-14 cs.CL cs.AI cs.CV 67%

GameplayQA: A Benchmarking Framework for Decision-Dense POV-Synced Multi-Video Understanding of 3D Virtual Agents

GameplayQA: 一种用于3D虚拟代理多视频理解的决策密集型视角同步评估框架

Yunzhe Wang, Runhui Xu, Kexin Zheng, Tianyi Zhang, Jayavibhav Niranjan Kogundi, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 GameplayQA通过密集标注多玩家3D游戏视频,构建了2.4K诊断QA对,评估代理感知与推理能力,揭示了前沿MLLM在时间同步、跨视频定位及决策密度处理上的不足。

Comments Accepted to the Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10527 2026-04-14 cs.CV cs.AI 62%

STORM: End-to-End Referring Multi-Object Tracking in Videos

STORM:视频中的端到端提及多目标跟踪

Zijia Lu, Jingru Yi, Jue Wang, Yuxiao Chen, Junwen Chen, Xinyu Li, Davide Modolo

机构 * Amazon(亚马逊)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 STORM通过统一框架联合执行目标定位与跟踪,提升数据效率并构建新数据集,实现多目标跟踪的先进性能。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11572 2026-04-14 cs.RO cs.MM 57%

DA-PTQ: Drift-Aware Post-Training Quantization for Efficient Vision-Language-Action Models

DA-PTQ:面向视觉-语言-动作模型的漂移感知后训练量化

Siyuan Xu, Tianshi Wang, Fengling Li, Lei Zhu, Heng Tao Shen

机构 * Tongji University(同济大学) University of Technology Sydney(悉尼科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出DA-PTQ,通过跨空间表示补偿和运动驱动混合精度分配,解决视觉-语言-动作模型中因量化扰动导致的轨迹漂移问题,实现低比特下的高效部署。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11498 2026-04-14 cs.CV 57%

TAG-Head: Time-Aligned Graph Head for Plug-and-Play Fine-grained Action Recognition

TAG-Head:时间对齐图头用于即插即用的细粒度动作识别

Imtiaz Ul Hassan, Nik Bessis, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TAG-Head,一种轻量级时空图头,通过RGB单一模态提升细粒度动作识别性能,采用Transformer编码器和图结构增强时空依赖性,实验证明其在RGB-only模型中达到SOTA,优于多模态方法。

Comments 15 pages, 3 figures, to appear in ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10789 2026-04-14 cs.CV 57%

ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment

ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成

Mingyu Dong, Chong Xia, Mingyuan Jia, Weichen Lyu, Long Xu, Zheng Zhu, Yueqi Duan

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。

Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09547 2026-04-14 cs.CV 57%

Tango: Taming Visual Signals for Efficient Video Large Language Models

Tango:驯服视觉信号以提高视频大语言模型的效率

Shukang Yin, Sirui Zhao, Hanchao Wang, Baozhi Jia, Xianquan Wang, Chaoyou Fu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Reconova AI Lab(Reconova AI实验室) Nanjing University(南京大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 Tango通过改进注意力选择和相似性聚类方法,优化视频大语言模型的视觉信号利用,实现在保留10%视频token时性能损失仅0.1%,推理速度提升1.88倍。

Comments Code: https://github.com/xjtupanda/Tango

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02311 2026-04-14 cs.CV cs.LG 57%

Inferring Dynamic Physical Properties from Video Foundation Models

从视频基础模型推断动态物理性质

Guanqi Zhan, Xianzheng Ma, Weidi Xie, Andrew Zisserman

机构 * VGG, University of Oxford(牛津大学VGG实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文研究通过视频预测动态物理性质,提出新数据集和三种推断方法,展示视频基础模型与多模态大语言模型的性能对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06964 2026-04-14 cs.CV 57%

Adversarial Video Promotion Against Text-to-Video Retrieval

对抗性视频推广对抗文本到视频检索

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Qian Li, Shuai Liu, Chao Shen

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。

Comments This paper has been accepted by TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09799 2026-04-14 cs.LG cs.AI 57%

Explainable Human Activity Recognition: A Unified Review of Concepts and Mechanisms

可解释的人体活动识别:概念和机制的统一综述

Mainak Kundu, Catherine Chen, Rifatul Islam, Ismail Uysal, Ria Kanjilal

机构 * University of South Florida(南佛罗里达大学) California Polytechnic State University(加州州立理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了可解释人体活动识别方法,从概念和机制角度分析其复杂性,总结了主要挑战和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18373 2026-04-14 cs.CV 57%

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) University of Southern California(南加州大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.09513 2026-04-14 cs.CV 57%

Learning Parallax for Stereo Event-based Motion Deblurring

基于立体事件和强度相机的立体事件运动去模糊网络

Mingyuan Lin, Chi Zhang, Chu He, Lei Yu

机构 * School of Electronic Information, Wuhan University(武汉大学电子信息学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出St-EDNet网络,通过粗到细框架直接从错位输入恢复高质量图像,利用立体事件和强度相机数据,无需真实深度,构建双特征嵌入架构以重建潜在锐化图像序列。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11128 2026-04-14 cs.AR 50%

Technology solutions targeting the performance of gen-AI inference in resource constrained platforms

面向资源受限平台的生成式AI推理性能的技术解决方案

Joyjit Kundu, Joshua Klein, Aakash Patel, Dwaipayan Biswas

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文针对生成式AI推理在资源受限平台上的内存压力问题,提出两种技术方案,通过分层屋顶线分析模型评估其在容量和带宽上的性能影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20380 2026-04-14 cs.LG 50%

TESSERA: Temporal Embeddings of Surface Spectra for Earth Representation and Analysis

TESSERA:表面光谱的时间嵌入用于地球表示与分析

Zhengpeng Feng, Clement Atzberger, Sadiq Jaffer, Jovana Knezevic, Silja Sormunen, Robin Young, Madeline C. Lisaius, Markus Immitzer, Toby Jackson, James Ball, David A. Coomes, Anil Madhavapeddy, Andrew Blake, Srinivasan Keshav

机构 * University of Cambridge(剑桥大学) dClimate Labs(dClimate实验室) Aalto University(阿尔托大学) University of Bristol(布里斯托大学)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 TESSERA通过多模态遥感时间序列学习鲁棒嵌入,提升植被物候分析的准确性与效率,提供轻量级工具支持大规模地球观测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 跨模态检索 8 篇

2512.20136 2026-04-14 cs.CL cs.AI 84%

M$^3$KG-RAG: Multi-hop Multimodal Knowledge Graph-enhanced Retrieval-Augmented Generation

M$^3$KG-RAG:多跳多模态知识图谱增强的检索增强生成

Hyeongcheol Park, Jiyoung Seo, Jaewon Mun, Hogun Park, Wonmin Byeon, Sung June Kim, Hyeonsoo Im, JeungSub Lee, Sangpil Kim

机构 * Korea University(高丽大学) Sungkyunkwan University(成均馆大学) NVIDIA Research(英伟达研究院) Hanwha Systems(韩华系统)

专题命中 跨模态检索 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M$^3$KG-RAG,通过构建多跳多模态知识图谱并引入GRASP机制,提升多模态大语言模型的推理深度和回答准确性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11095 2026-04-14 cs.LG cs.AI 79%

Bottleneck Tokens for Unified Multimodal Retrieval

瓶颈令牌用于统一多模态检索

Siyu Sun, Jing Ren, Zhaohe Liao, Dongxiao Mao, Xiangyuan Ren, Yiyi Zhang, Haohua Zhao, Weixiong Lin, Jiang Shaohua, Liqing Zhang, Yuchao Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出瓶颈令牌和生成信息压缩方法,解决多模态大语言模型在统一检索中的隐式池化和对比微调问题,提升语义压缩效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10071 2026-04-14 cs.CV 79%

Spotlight and Shadow: Attention-Guided Dual-Anchor Introspective Decoding for MLLM Hallucination Mitigation

聚光与阴影:基于注意力的双锚点反思解码用于MLLM幻觉缓解

Yebo Wu, Han Jin, Zhijiang Guo, Li Li

机构 * State Key Laboratory of IOTSC, University of Macau(澳门大学物联网国家重点实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 跨模态检索 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出双锚点反思解码框架DaID,通过动态校准每个token生成来缓解MLLM幻觉,利用视觉注意力分布指导双锚点选择,提升推理能力。

Comments Accepted for Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13777 2026-04-14 cs.CV cs.AI cs.SD 73%

Sat2Sound: A Unified Framework for Zero-Shot Soundscape Mapping

Sat2Sound:一种用于零样本声音景观映射的统一框架

Subash Khanal, Srikumar Sastry, Aayush Dhakal, Adeel Ahmad, Abby Stylianou, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Taylor Geospatial(泰勒地理空间) Saint Louis University(圣路易斯大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Sat2Sound通过融合多模态数据,实现地球表面声音分布的零样本映射,通过对比学习和代码本对齐学习发现跨模态的'声音景观概念',在GeoSound和SoundingEarth基准上取得最佳性能。

Comments Accepted to EarthVision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18994 2026-04-14 cs.CV 70%

Dual-Margin Embedding for Fine-Grained Long-Tailed Plant Taxonomy

细粒度长尾植物分类的双边嵌入

Cheng Yaw Low, Heejoon Koo, Jaewoo Park, Meeyoung Cha

机构 * Changwon National University(昌原国立大学) Max Planck Institute for Security and Privacy (MPI-SP)(马克斯·普朗克安全与隐私研究所) AiV Co.(AiV公司)

专题命中 跨模态检索 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出TaxoNet框架,通过理论支撑的双边目标优化类别决策边界,在类别不平衡情况下提升细粒度区分能力和稀有类表示几何。在开放世界设置中,利用多种植物数据集验证了其优于多模态基础模型的性能。

Comments 4 figures, 5 tables, and 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10297 2026-04-14 cs.CV cs.AI 62%

FashionMV: Product-Level Composed Image Retrieval with Multi-View Fashion Data

FashionMV:基于多视角时尚数据的产品级复合图像检索

Peng Yuan, Bingyin Mei, Hui Zhang

机构 * Tsinghua University(清华大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FashionMV,首个大规模多视角时尚数据集,用于产品级复合图像检索。通过构建包含127K产品、472K多视角图像和220K三元组的数据集,结合ProCIR框架,采用多阶段对话、标题对齐和思维链引导等机制,提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10167 2026-04-14 cs.CV cs.CL cs.IR 62%

Visual Late Chunking: An Empirical Study of Contextual Chunking for Efficient Visual Document Retrieval

视觉后期分块:一种上下文分块用于高效视觉文档检索的实证研究

Yibo Yan, Mingdong Ou, Yi Cao, Jiahao Huo, Xin Zou, Shuliang Liu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云) Hong Kong University of Science and Technology(香港科技大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出ColChunk框架,通过多模态后期分块构建高效上下文化多向量,减少存储需求并提升检索性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11668 2026-04-14 cs.CV 57%

UNIGEOCLIP: Unified Geospatial Contrastive Learning

UNIGEOCLIP:统一地理对比学习

Guillaume Astruc, Eduard Trulls, Jan Hosang, Loic Landrieu, Paul-Edouard Sarlin

机构 * LASTIG, Univ Gustave Eiffel, IGN, ENSG, France(LASTIG,古斯塔夫·埃菲尔大学,法国国家地理林业信息研究所,法国国家地理科学学院,法国) Google, Switzerland(谷歌,瑞士) CNES, France(法国国家空间研究中心,法国) LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris, Marne-la-Vallée, France(LIGM,法国国家科学研究中心,古斯塔夫·埃菲尔大学,巴黎高科桥梁学院,巴黎理工学院,马恩拉瓦莱,法国)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 UNIGEOCLIP通过统一嵌入空间对五种地理模态进行联合对齐,提升多模态地理数据的对比学习性能,优于单一模态模型和坐标基线。

Journal ref CVPR 2026 EarthVision

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 24 篇

2604.10233 2026-04-14 cs.CV cs.AI 86%

Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis

将2D多模态大语言模型适应于3DCT图像分析

Yang Yu, Dunyuan Xu, Yaoqian Li, Xiaomeng Li, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子及计算机工程学系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所) Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人创新中心)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);MLLM(abstract);cross-modal(abstract)

AI总结 本文提出将2D多模态大语言模型适应于3DCT图像分析,设计Text-Guided Hierarchical MoE框架,采用两阶段训练策略提升医学报告生成和视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏