arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-10 至 2026-04-10 共收录 85 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 12 篇

2604.08541 2026-04-10 cs.CV cs.AI cs.CL 85%

Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts

视觉而无思维:多模态混合专家中的路由干扰

Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究揭示多模态混合专家模型在视觉输入时路由机制无法有效激活任务相关专家,导致推理失败,提出路由干扰假说并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08322 2026-04-10 cs.CV 83%

Fundus-R1: Training a Fundus-Reading MLLM with Knowledge-Aware Reasoning on Public Data

Fundus-R1: 基于公共数据训练具备知识感知推理能力的视网膜图像阅读MLLM

Yuchuan Deng, Qijie Wei, Kaiheng Qian, Jiazhen Liu, Zijie Xin, Bangxiang Lan, Jingyu Liu, Jianfeng Dong, Xirong Li

机构 * Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科技大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 图文多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出Fundus-R1,通过公共数据集训练具备知识感知推理能力的视网膜图像阅读MLLM,采用RAG方法生成知识感知推理轨迹,并通过过程奖励增强RLVR,实验证明其在三个基准测试中优于多个基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08395 2026-04-10 cs.CV cs.AI 62%

Phantasia: Context-Adaptive Backdoors in Vision Language Models

幻象:面向视觉语言模型的上下文自适应后门

Nam Duong Tran, Phi Le Nguyen

机构 * Institute for AI Innovation and Societal Impact, Hanoi University of Science and Technology(河内科技大学人工智能创新与社会影响研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Phantasia,一种能根据输入语义动态调整恶意输出的后门攻击方法,提升了攻击隐蔽性和适应性,实验显示其在多种防御设置下均保持良好性能。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26036 2026-04-10 cs.CV cs.AI cs.LG 62%

SeMoBridge: Semantic Modality Bridge for Efficient Few-Shot Adaptation of CLIP

SeMoBridge:用于CLIP高效少样本适应的语义模态桥

Christoph Timmermann, Hyunse Lee, Woojin Lee

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 SeMoBridge通过语义模态桥技术解决CLIP在少样本分类中的模态对齐问题,通过轻量级方法提升低数据场景下的性能,训练时间显著减少。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07914 2026-04-10 cs.CV cs.AI 62%

Mitigating Entangled Steering in Large Vision-Language Models for Hallucination Reduction

缓解大型视觉-语言模型中的纠缠引导以减少幻觉

Yuanhong Zhang, Zhaoyang Wang, Xin Zhang, Weizhan Zhang, Joey Tianyi Zhou

机构 * Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室) Centre for Frontier AI Research, Institute of High Performance Computing, Agency for Science, Technology and Research(前沿人工智能研究中心,高性能计算研究所,科技研究局)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MESA框架,通过可控的潜在空间干预减少视觉-语言模型中的幻觉,同时保持生成行为,实验表明其在多个模型家族中表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07740 2026-04-10 cs.CV cs.AI 62%

Beyond Pedestrians: Caption-Guided CLIP Framework for High-Difficulty Video-based Person Re-Identification

超越行人:基于描述的CLIP框架用于高难度视频基的人重识别

Shogo Hamano, Shunya Wakasugi, Tatsuhito Sato, Sayaka Nakamura

机构 * Sony Group Corporation(索尼集团公司)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CG-CLIP框架,通过文本描述和可学习令牌提升视频中高难度行人重识别性能,实验表明其在多个数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26241 2026-04-10 cs.CV cs.CL 62%

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

时间如何流逝?基于心理物理学的评估用于视觉-语言模型

Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

机构 * Kyoto University(京都大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(国立信息通信技术研究所) The University of Osaka(大阪大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过心理物理学验证的基准测试评估了视觉-语言模型对时间方向的理解能力,发现大多数模型表现接近随机,且在物理不可逆过程和因果手动动作上远低于人类水平。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07997 2026-04-10 cs.CV 57%

Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments

少样本增量式动态室内环境3D物体检测

Yun Zhu, Jianjun Qian, Jian Yang, Jin Xie, Na Zhao

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing University(南京大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FI3Det框架,利用视觉语言模型学习未见类别知识,通过VLM引导模块和多模态原型模块实现高效3D感知,在ScanNet V2和SUN RGB-D数据集上取得显著提升。

Comments Accepted by CVPR 2026

Journal ref CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07814 2026-04-10 cs.CV 57%

AgriChain Visually Grounded Expert Verified Reasoning for Interpretable Agricultural Vision Language Models

AgriChain:基于视觉的专家验证推理用于可解释的农业视觉语言模型

Hazza Mahmood, Yongqiang Yu, Rao Anwer

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出AgriChain数据集,通过专家验证的推理链提升农业视觉语言模型的准确性和可解释性,实验表明其在植物病害诊断中优于多个基线模型。

Comments 9 pages

Journal ref LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-04-10 cs.CL 57%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20231 2026-04-10 cs.RO cs.CV 57%

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。

Comments https://manishgovind.github.io/unilact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG 57%

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 11 篇

2604.07741 2026-04-10 cs.CV cs.MM 86%

MSCT: Differential Cross-Modal Attention for Deepfake Detection

MSCT:深度伪造检测中的差分跨模态注意力

Fangda Wei, Miao Liu, Yingxue Wang, Jing Wang, Shenghui Zhao, Nan Li

机构 * Beijing Institute of Technology(北京理工大学) China Academy of Electronics and Information Technology(中国电子信息技术研究院)

专题命中 音频语音多模态 :cross-modal(title,abstract);multi-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 本文提出MSCT模型,通过多尺度自注意力和差分跨模态注意力提升深度伪造检测性能,实验验证其在FakeAVCeleb数据集上的有效性。

Comments Accpeted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08209 2026-04-10 cs.CV 85%

OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering

OmniJigsaw:通过模态协调重排序增强多模态推理

Yiduo Jia, Muzhi Zhu, Hao Zhong, Mingyu Liu, Yuling Xi, Hao Chen, Bin Qin, Yongjie Yang, Zhenbo Luo, Chunhua Shen

机构 * Zhejiang University(浙江大学) Xiaomi Inc.(小米公司)

专题命中 音频语音多模态 :omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 OmniJigsaw通过模态协调重排序任务提升多模态推理能力,采用三重策略实现跨模态整合,并通过两级数据过滤提升模型适应性,验证了其在多模态自监督学习中的有效性。

Comments Project page: https://aim-uofa.github.io/OmniJigsaw/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08147 2026-04-10 cs.SD cs.CV 85%

Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning

通过教师引导的双路径实现语义噪声削减

Linge Wang, Yingying Chen, Bingke Zhu, Lu Zhou, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Objecteye Inc.(北京眼神科技有限公司)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出TG-DP框架,通过分离重建与对齐路径,减少语义噪声,提升音频视频表示学习效果,实现零样本检索性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07859 2026-04-10 eess.SP 82%

Object-Attribute-Relation Model Driven Adaptive Hierarchical Transmission for Multimodal Semantic Communication

基于对象-属性-关系模型的自适应分层传输机制用于多模态语义通信

Chenxing Li, Yiping Duan, Han Jiao, Xiaoming Tao, Weiyao Lin, Mingquan Lu

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出基于自适应对象-属性-关系层次的多模态语义通信框架,通过融合视觉、文本和音频流构建决策导向拓扑图,在低带宽下实现90%的带宽节省和10倍的带宽减少,同时消除深度衰减信道中的悬崖效应。

Comments 13 pages,7 figures, 6 tables,56 reference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08359 2026-04-10 eess.AS 79%

Tracking Listener Attention: Gaze-Guided Audio-Visual Speech Enhancement Framework

跟踪听者注意力:基于注视的音频视觉语音增强框架

Hsiang-Cheng Yang, You-Jin Li, Rong Chao, Yu Tsao, Borching Su, Shao-Yi Chien

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 本文提出基于注视的音频视觉语音增强框架,通过结合注视方向与面部检测提取目标说话人特征,提升多说话人环境中的语音增强效果。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06950 2026-04-10 cs.CV 79%

Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation

让 MLLMs 失明:MLLM 内容审核中的对抗走私攻击

Zhiheng Li, Zongyang Ma, Yuntong Pan, Ziqi Zhang, Xiaolei Lv, Bo Li, Jun Gao, Jianing Zhang, Chunfeng Yuan, Bing Li, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京市多模态信息超智能安全重点实验室) Hellogroup University of Washington(华盛顿大学) Jilin University(吉林大学) ShanghaiTech University(上海科技大学)

专题命中 音频语音多模态 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 本文揭示了MLLM在内容审核中面临的新威胁——对抗走私攻击,通过SmuggleBench基准测试发现多种模型易受攻击,提出通过感知和推理角度分析其根本原因并探索缓解策略。

Comments Accepted to ACL 2026. 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12817 2026-04-10 eess.SP cs.SD 78%

An Attention-Assisted Multi-Modal Data Fusion Model for Real-Time Estimation of Underwater Sound Velocity

一种结合注意力机制的多模态数据融合模型用于实时估计水下声速

Pengfei Wu, Wei Huang, Yujie Shi, Hao Zhang

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学部) School of Environmental Science and Engineering, Ocean University of China(中国海洋大学环境科学与工程学院)

专题命中 音频语音多模态 :multi-modal(title);multimodal(abstract)

AI总结 本文提出一种结合注意力机制的多模态数据融合卷积神经网络,用于实时估计水下声速剖面,通过提取远程感应海面温度数据与历史声速剖面特征之间的关系,提升估计精度和鲁棒性。

Journal ref IEEE Transactions on Neural Networks and Learning Systems,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08384 2026-04-10 eess.AS cs.AI 62%

TASU2: Controllable CTC Simulation for Alignment and Low-Resource Adaptation of Speech LLMs

TASU2:用于语音大语言模型对齐和低资源适应的可控CTC模拟

Jing Peng, Chenghao Wang, Yi Yang, Lirong Qian, Junjie Li, Yu Xi, Shuai Wang, Kai Yu

机构 * X-LANCE Lab, Department of Computer Science and Engineering, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系X-LANCE实验室) MoE Key Lab of Artificial Intelligence(教育部人工智能重点实验室) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) AISpeech Ltd(思必驰科技股份有限公司) Nanjing University(南京大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 TASU2通过可控CTC模拟生成文本监督,提升语音大语言模型的对齐和低资源适应性能,优于TASU和文本细调等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07895 2026-04-10 cs.AI 57%

DialBGM: A Benchmark for Background Music Recommendation from Everyday Multi-Turn Dialogues

DialBGM:从日常多轮对话中推荐背景音乐的基准测试

Joonhyeok Shin, Jaehoon Kang, Yujun Lee, Hannah Lee, Yejin Lee, Yoonji Park, Kyuhong Shim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出DialBGM基准测试,通过1200个日常对话数据,评估模型在无音乐描述的多轮对话中推荐非侵入性背景音乐的能力,发现现有模型在Hit@1指标上远低于人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07467 2026-04-10 cs.CL cs.LG 57%

Lexical Tone is Hard to Quantize: Probing Discrete Speech Units in Mandarin and Yorùbá

词调难以量化:探究 Mandarin 和 Yorùbá 中的离散语音单元

Opeyemi Osakuade, Simon King

机构 * The Centre for Speech Technology Research, University of Edinburgh, UK(英国爱丁堡大学语音技术研究中心)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究发现离散语音单元在编码超段落信息时可靠性较低,尤其在词调方面,提出通过两次聚类方法改进词调编码。

Comments Accepted at Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08363 2026-04-10 cs.SD 50%

CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation

CapTalk:单语句和对话语音生成的统一语音设计

Xiaosu Su, Zihan Sun, Peilei Jia, Jun Gao

机构 * University of Chinese Academy of Sciences(中国科学院大学) Hello Group Inc.

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 CapTalk提出一种统一的文本-音频自回归框架,实现单语句和对话语音设计,通过分层变分条件模块平衡语音稳定性和上下文适应性,提升表达可控性和上下文恰当性。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 11 篇

2604.08050 2026-04-10 cs.CV 83%

ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning

ABMAMBA: 多模态大语言模型中的对齐层次双向扫描用于高效的视频描述

Daichi Yashima, Shuhei Kurita, Yusuke Oda, Shuntaro Suzuki, Seitaro Otsuki, Komei Sugiura

机构 * Keio University(庆应义塾大学) National Institute of Informatics(国立信息学研究所) National Institute of Informatics Research and Development Center for Large Language Models(国立信息学研究所大型语言模型研发中心)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ABMamba,一种具有线性计算复杂度的多模态大语言模型,通过替代二次注意力机制,实现视频序列的高效处理,在视频描述任务中表现出色。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08410 2026-04-10 cs.CV 83%

Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval

通过一次剪辑检索增强多模态大语言模型的长视频理解

Tao Chen, Shaobo Ju, Qiong Wu, Chenxin Fang, Kun Zhang, Jun Peng, Hui Li, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算教育部重点实验室) Xiamen University(厦门大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出OneClip-RAG方法,通过一次剪辑检索提升多模态大语言模型对长视频的理解能力,改进知识完整性和语义连贯性,并设计新数据集和训练方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08418 2026-04-10 cs.RO cs.AI 79%

Exploring Temporal Representation in Neural Processes for Multimodal Action Prediction

探索神经过程在多模态动作预测中的时间表示

Marco Gabriele Fedozzi, Yukie Nagai, Francesco Rea, Alessandra Sciutti

机构 * DIBRIS Department, University of Genoa(热那亚大学DIBRIS系) CONTACT Unit, Italian Institute of Technology(意大利理工学院CONTACT单元) International Research Center for Neurointelligence, The University of Tokyo(东京大学国际神经智能研究中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文研究了条件神经过程在机器人自监督多模态动作预测中的应用,提出改进的DMBN-PTE模型以提升时间信息表示的鲁棒性。

Comments Submitted to the AIC 2023 (9th International Workshop on Artificial Intelligence and Cognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08062 2026-04-10 cs.HC cs.AI 79%

From Gaze to Guidance: Interpreting and Adapting to Users' Cognitive Needs with Multimodal Gaze-Aware AI Assistants

从注视到引导:通过多模态注视感知AI助手解读和适应用户认知需求

Valdemar Danry, Javier Hernandez, Andrew Wilson, Pattie Maes, Judith Amores

机构 * Microsoft Research(微软研究院) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种基于注视的多模态LLM助手,通过眼动追踪提升用户阅读行为评估的准确性与个性化,实验表明其能有效提升信息回忆能力并提高交互效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08334 2026-04-10 stat.CO stat.AP 78%

mmid: Multi-Modal Integration and Downstream analyses for healthcare analytics in Python

mmid:用于医疗分析的多模态整合与下游分析的Python工具

Andrea Mario Vergani, Valeria Iapaolo, Emanuele Di Angelantonio, Marco Masseroli, Francesca Ieva

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 mmid是一个Python包,提供多模态融合、填补缺失数据、分类、时间到事件预测和聚类功能,用于结构化环境中整合顺序数据并进行下游分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08120 2026-04-10 cs.CV cs.AI cs.CL cs.LG 75%

Small Vision-Language Models are Smart Compressors for Long Video Understanding

小视觉-语言模型是长视频理解的智能压缩器

Junjie Fei, Jun Chen, Zechun Liu, Yunyang Xiong, Chong Zhou, Wei Wen, Junlin Han, Mingchen Zhuge, Saksham Suri, Qi Qian, Shuming Liu, Lemeng Wu, Raghuraman Krishnamoorthi, Vikas Chandra, Mohamed Elhoseiny, Chenchen Zhu

机构 * Meta AI King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出Tempo框架,利用小视觉-语言模型压缩长视频,通过自适应令牌分配实现高效压缩,实验显示其在极端长视频任务中表现优异。

Comments Project page and demo are available at https://FeiElysia.github.io/tempo-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06836 2026-04-10 cs.LG 71%

STQuant: Spatio-Temporal Adaptive Framework for Optimizer Quantization in Large Multimodal Model Training

STQuant:一种用于大规模多模态模型训练中优化器量化的空间-时间自适应框架

Minglu Liu, Cunchen Hu, Liangliang Xu, Fengming Tang, Ruijia Wang, Fu Yu

机构 * Xidian University(西安电子科技大学) China Telecom Cloud Computing Research Institute(中国电信云计算研究院)

专题命中 视频多模态 :multimodal(title)

AI总结 STQuant通过动态分配精度降低优化器状态内存,保持模型质量,实验显示内存减少84.4%,平均比特宽低至5.1。

详情

展开后加载摘要…

URL PDF HTML 收藏