arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-25 至 2026-03-25 共收录 105 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 13 篇

2603.23037 2026-03-25 cs.CV cs.AI cs.CL cs.LG cs.RO 82%

YOLOv10 with Kolmogorov-Arnold networks and vision-language foundation models for interpretable object detection and trustworthy multimodal AI in computer vision perception

YOLOv10结合Kolmogorov-Arnold网络和视觉-语言基础模型用于可解释的目标检测和可信的多模态AI在计算机视觉感知

Marios Impraimakis, Daniel Vazquez, Feiyu Zhou

机构 * University of Bath(巴斯大学) Zhejiang University(浙江大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出一种基于Kolmogorov-Arnold网络和视觉-语言基础模型的YOLOv10框架,通过七种几何和语义特征提升目标检测的可解释性,并在模糊、遮挡或低纹理场景中实现可信的置信度估计。

Comments 14 pages, 23 Figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22287 2026-03-25 cs.CV cs.AI cs.CL 80%

Founder effects shape the evolutionary dynamics of multimodality in open LLM families

奠基效应塑造了开放大语言模型家族中多模态的进化动态

Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究通过分析模型谱系数据,发现多模态能力在开放大语言模型家族中通过罕见的奠基事件进入,并在后代谱系中快速扩展,导致多模态能力的采用动态呈现突变特征。

Comments 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23311 2026-03-25 cs.CV cs.LG 79%

ARGENT: Adaptive Hierarchical Image-Text Representations

ARGENT:自适应层次图像-文本表示

Chuong Huynh, Hossein Souri, Abhinav Kumar, Vitali Petsiuk, Deen Dayal Mohan, Suren Kumar

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Samsung Research America, AI Center(三星美国研究院人工智能中心)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI 73%

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23023 2026-03-25 cs.CV 70%

Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps

Cog3DMap:基于3D认知地图的多视角视觉语言推理

Chanyoung Gwak, Yoonwoo Jeong, Byungwoo Jeon, Hyunseok Lee, Jinwoo Shin, Minsu Cho

机构 * POSTECH KAIST(韩国科学技术院) RLWRLD

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出Cog3DMap框架,通过构建显式的3D记忆,使多视角图像中的每个token都具备语义和几何信息,从而提升多模态大语言模型的空间推理能力。

Comments Project Page: https://cog3dmap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22815 2026-03-25 cs.CV cs.AI 62%

Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding

聚焦,而非裁剪:识别与指令相关的区域以实现信息丰富的图像理解

Mincheol Kwon, Minseung Lee, Seonga Choi, Miso Choi, Kyeong-Jin Oh, Hyunyoung Lee, Cheonyoung Park, Yongho Song, Seunghyun Park, Jinkyu Kim

机构 * Korea University(韩国大学) KT Corporation(KT公司) Soongsil University(松山大学) Kakao Mobility(Kakao移动)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PinPoint框架,通过识别与指令相关的图像区域并提取细粒度视觉特征,提升多模态任务的推理效率与准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22690 2026-03-25 cs.CV cs.AI 62%

WiFi2Cap: Semantic Action Captioning from Wi-Fi CSI via Limb-Level Semantic Alignment

WiFi2Cap:从Wi-Fi CSI进行语义动作描述的肢体级语义对齐

Tzu-Ti Wei, Chu-Yu Huang, Yu-Chee Tseng, Jen-Jee Chen

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出WiFi2Cap框架,通过Wi-Fi CSI生成动作描述,引入镜像一致性损失解决方向敏感问题,并在基准数据集上验证了其在隐私保护语义感知中的有效性。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01969 2026-03-25 cs.CV cs.AI 62%

Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration

通过注意力校准缓解大视觉-语言模型中的物体幻觉

Younan Zhu, Linwei Tao, Minjing Dong, Chang Xu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出动态注意力校准方法,通过对比学习动态强制位置不变性,有效缓解大视觉-语言模型中的物体幻觉问题,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22882 2026-03-25 cs.LG cs.CV 57%

TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration

TreeTeaming:通过分层策略探索实现视觉语言模型的自主红队测试

Chunxiao Li, Lijun Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 TreeTeaming通过动态演化策略探索方法,实现对视觉语言模型的自主红队测试,显著提升攻击成功率和策略多样性,同时降低攻击毒性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17108 2026-03-25 cs.CV 57%

LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience

基于大语言模型的社交媒体影像洪水深度估计:一种具有机制可解释性的视觉-语言模型框架用于交通韧性

Nafis Fuad, Xiaodong Qian

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FloodLlama,一种基于视觉-语言模型的洪水深度估计框架,通过合成数据集和多模态传感管道实现厘米级实时洪水深度估计,提升交通网络韧性。

Comments There is a update in result, which is needed to be addressed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15253 2026-03-25 cs.CV 57%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化模型生成的描述和人工标注揭示了模型在不同难度任务中的表现差异,并发现检测器倾向于认为响应开头的句子正确。

Comments This work was intended as a replacement of arXiv:2511.20515 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20515 2026-03-25 cs.CV 57%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

机构 * OMRON SINICX The University of Tokyo(东京大学) The University of Osaka(大阪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化VLM生成的描述和人类标注揭示模型差异,发现检测器倾向于认可响应开头的句子,并通过强VLM过滤减少数据噪声。

Comments Previously this version appeared as arXiv:2603.15253 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22800 2026-03-25 cs.RO 50%

CATNAV: Cached Vision-Language Traversability for Efficient Zero-Shot Robot Navigation

CATNAV:基于缓存的视觉-语言可 traversability 用于高效零样本机器人导航

Aditya Potnis, Francisco Affonso, Shreya Gummadi, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * Field Robotics Engineering and Science Hub (FRESH)(田纳西机器人工程与科学中心(FRESH))

专题命中 图文多模态 :multimodal(abstract)

AI总结 CATNAV通过多模态LLM生成零样本、体态感知的成本图,利用视觉语义缓存机制减少85.7%的在线VLM查询,结合基于VLM的轨迹选择模块,在五项导航任务中实现更高的目标到达率和更少的行为约束违规。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 8 篇

2603.22732 2026-03-25 cs.CV 85%

SOUPLE: Enhancing Audio-Visual Localization and Segmentation with Learnable Prompt Contexts

SOUPLE: 通过可学习的提示上下文增强音频-视觉定位与分割

Khanh Binh Nguyen, Chae Jung Park

机构 * Deakin University(德克萨斯大学) National Cancer Center(国立癌症中心)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 SOUPLE通过可学习的上下文标记提升音频-视觉定位与分割性能,利用视觉特征生成条件上下文以连接音频与视觉输入。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17181 2026-03-25 cs.CV cs.LG cs.SD 85%

Investigating self-supervised representations for audio-visual deepfake detection

探究用于音频-视觉深度伪造检测的自监督表示

Dragos-Alexandru Boldisor, Stefan Smeu, Dan Oneata, Elisabeta Oneata

机构 * Bitdefender Politehnica Bucharest(巴蒂亚努大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文系统评估了自监督表示在多模态和多领域中的检测效果、信息可解释性和跨模态互补性,发现音频引导的表示在深度伪造检测中表现最佳。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22985 2026-03-25 cs.CL cs.CY 79%

Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation

超越仇恨:区分多模态内容审核中的不文明与不宽容言论

Nils A. Herrmann, Tobias Eder, Jingyi He, Georg Groh

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出细粒度标注方案区分不文明与不宽容言论,通过2030个仇恨漫画数据验证,细粒度标注提升模型性能,减少有害内容误判。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14203 2026-03-25 cs.CV 79%

Selective Noise Suppression and Discriminative Mutual Interaction for Robust Audio-Visual Segmentation

选择性噪声抑制与判别互作用用于鲁棒音频视觉分割

Kai Peng, Yunzhe Shen, Miao Zhang, Leiye Liu, Yidong Han, Wei Ji, Jingjing Li, Yongri Piao, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) Yale University(耶鲁大学) University of Alberta(阿尔伯塔大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出SDAVS方法,通过选择性噪声抑制处理器和判别音频视觉互融合策略,提升动态场景中音频视觉分割的鲁棒性与准确性。

Comments Accepted to IEEE Transactions on Multimedia (TMM) 2026. Code: https://github.com/happylife-pk/SDAVS

Journal ref IEEE Transactions on Multimedia (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22306 2026-03-25 cs.AI 79%

Memory Bear AI Memory Science Engine for Multimodal Affective Intelligence: A Technical Report

Memory Bear AI记忆科学引擎:多模态情感智能的技术报告

Deliang Wen, Ke Sun, Yu Wang

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Memory Bear AI框架,通过结构化记忆处理提升多模态情感智能,实现持续、鲁棒的情感识别与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20476 2026-03-25 cs.CV cs.MM eess.AS eess.IV 67%

Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio

迈向包容性沟通:一种统一框架,用于从手语、唇形和音频生成口语语言

Jeong Hun Yeo, Hyeongseop Rha, Sungjune Park, Junil Won, Yong Man Ro

机构 * Integrated Vision Language Laboratory, School of Electrical Engineering, Korea Advanced Institue of Science and Technology (KAIST)(整合视觉语言实验室,电气工程学院,韩国科学技术院(KAIST))

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文提出首个统一框架,整合手语、唇形和音频生成口语文本,探索多模态协同作用,提升手语翻译性能。

Comments Updated the professional title of the corresponding author. Added an Acknowledgement section

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22728 2026-03-25 cs.SD eess.AS 57%

The Interspeech 2026 Audio Encoder Capability Challenge for Large Audio Language Models

2026年国际语音处理大会大型音频语言模型音频编码能力挑战

Heinrich Dinkel, Jiahao Zhou, Guanbo Wang, Yadong Niu, Junbo Zhang, Yufeng Hao, Ying Liu, Ke Li, Wenwu Wang, Zhiyong Wu, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., Beijing, China(小米公司,北京) DataoceanAI Inc., USA(DataoceanAI公司,美国) Centre for Vision Speech and Signal Processing, University of Surrey, Guildford, UK(视觉语音与信号处理中心, Surrey大学, Guildford,英国) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(深圳国际研究生院,清华大学,深圳,中国)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出Interspeech 2026音频编码能力挑战,旨在评估和提升预训练音频编码器在大型音频语言模型中的性能,通过统一的生成评估框架XARES-LLM,评估编码器在多种下游任务中的表现。

Comments Interspeech 2026 Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23415 2026-03-25 cs.CY 50%

Integrating GenAI in Filmmaking: From Co-Creativity to Distributed Creativity

将生成式AI融入影视创作:从协同创作到分布式创作

Pierluigi Masai, Lorenzo Carta, Mateusz Miroslaw Lis

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 本文从社会技术史视角探讨生成式AI在影视创作中的作用,提出影视创作是分布式过程,技术革新重塑了传统创作流程与美学。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 14 篇

2501.08415 2026-03-25 cs.CV cs.AI 81%

Cross-Modal Transferable Image-to-Video Attack on Video Quality Metrics

跨模态可迁移的图像到视频攻击视频质量度量

Georgii Gotin, Ekaterina Shumitskaya, Anastasia Antsiferova, Dmitriy Vatolin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能研究中心) MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所) Laboratory of Innovative Technologies for Processing Video Content(视频内容处理创新技术实验室)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出IC2VQA方法,通过跨模态攻击探索现代视频质量度量模型的漏洞,利用CLIP模块提升对抗扰动的可迁移性,实验显示在三种黑盒视频质量度量模型上攻击成功率高。

Comments Accepted for VISAPP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22313 2026-03-25 cs.LG cs.AI 79%

A Multi-Modal CNN-LSTM Framework with Multi-Head Attention and Focal Loss for Real-Time Elderly Fall Detection

一种集成多头注意力和聚焦损失的多模态CNN-LSTM框架用于实时老年人跌倒检测

Lijie Zhou, Luran Wang

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态深度学习框架MultiModalFallDetector,结合多尺度CNN、多传感器数据融合、多头注意力机制和聚焦损失,实现高精度实时老年人跌倒检测,实验表明其在SisFall数据集上达到98.7的F1分数,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22371 2026-03-25 eess.IV 78%

Multimodal Fusion of Skeleton Dynamics and Clinical Gait Features for Video-Based Cerebral Palsy Severity Assessment

基于骨骼动力学和临床步态特征的多模态融合用于视频基于的脑瘫严重程度评估

Kaiyuan Yang, Xupeng Chen, Jiangpeng He

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种多模态融合框架,结合骨骼动力学和临床有意义的步态特征,提升视频脑瘫严重程度评估的预测性能和生物力学可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG 73%

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13719 2026-03-25 cs.CV cs.AI cs.IR 62%

Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search

基于音频视觉实体凝聚力与代理搜索的层次化长视频理解

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HAVEN框架,通过整合音频视觉实体凝聚力与层次化视频索引与代理搜索,解决长视频理解中的信息碎片化和全局一致性问题,实验显示在LVBench上达到84.1%的准确率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23489 2026-03-25 cs.CV 57%

AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation

AgentRVOS: 基于对象跟踪的零样本视频对象分割

Woojeong Jin, Jaeho Lee, Heeseong Shin, Seungho Jang, Junhwan Heo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 AgentRVOS通过结合SAM3和MLLM的优势,提出无需训练的管道,利用生成的掩码跟踪提供可靠的时空信息,通过查询引导的推理实现零样本视频对象分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23478 2026-03-25 cs.CV 57%

UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

UniFunc3D: 统一的主动空间-时间接地用于3D功能分割

Jiaying Lin, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniFunc3D通过统一框架实现3D场景功能分割,利用多模态大语言模型作为主动观察者,结合语义、时间和空间推理,提升任务分解的准确性与效率,实现优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23186 2026-03-25 cs.CV 57%

ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting

ViKey:通过视觉提示增强视频中的时间理解

Yeonkyung Lee, Dayun Ju, Youngmin Kim, Seil Kang, Seong Jae Hwang

机构 * Yonsei University(延世大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ViKey通过视觉提示和轻量级关键词-帧映射模块提升视频模型的时间推理能力,在减少帧数的情况下保持性能。

Comments accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22953 2026-03-25 cs.CV 57%

Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

基于簇的时空掩码用于高效的视频-语言预训练

Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏