arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 16 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 16 篇

2604.17422 2026-04-21 cs.CV cs.MM 86%

Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

聚焦何处:用于长视频理解的查询调节多模态关键帧选择

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Xuming Hu, Hui Xiong

机构 * Department of CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.MM

AI总结 本文提出Q-Gate框架,通过动态模态路由解决长视频理解中关键帧选择问题,有效抑制模态噪声,提升多模态大语言模型的推理能力。

Comments 9 pages, 7 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17690 2026-04-21 cs.MM cs.CV cs.SD eess.AS 82%

Mechanisms of Multimodal Synchronization: Insights from Decoder-Based Video-Text-to-Speech Synthesis

多模态同步机制:来自基于解码器的视频-文本到语音合成的洞察

Akshita Gupta, Tatiana Likhomanenko, Karren Dai Yang, Richard He Bai, Zakaria Aldeneh, Navdeep Jaitly

机构 * Apple(苹果公司)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文通过视频-文本到语音合成研究多模态同步机制,探讨了解码器如何整合不同模态信息,以及模态顺序对性能和迁移的影响,提出了TimeSync指标用于细粒度分析。

Comments 30 pages, Decoder-only model, Speech Synthesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16411 2026-04-21 cs.LG 82%

CGCMA: Conditionally-Gated Cross-Modal Attention for Event-Conditioned Asynchronous Fusion

CGCMA:基于事件条件的异步融合条件门控跨模态注意力

Yunxiang Guo

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本文提出CGCMA,用于异步融合场景中事件条件下的跨模态注意力,通过分离文本条件接地与滞后感知信任控制,提升异步多模态融合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16748 2026-04-21 cs.CV cs.AI 81%

TriTS: Time Series Forecasting from a Multimodal Perspective

TriTS:从多模态视角进行时间序列预测

Xiang Ao

机构 * School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院)

专题命中 视频多模态 :multimodal(title);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 TriTS从多模态视角提出新的跨模态解耦框架,通过时间、频率和2D视觉空间投影,结合周期感知重塑策略和视觉Mamba,实现高效的时间序列预测,实验表明其在多个基准数据集上达到SOTA性能。

Comments 9 pages, 3 figures. Accepted by the A2A-MML Workshop in conjunction with CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI 81%

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16367 2026-04-21 cs.CY cs.AI 79%

Talk, Walk, and Market Response: Multimodal Measurement of AI Washing and Its Capital Market Consequences in China

讲话、行走与市场反应:多模态测量AI洗绿及其资本市场后果在中国

Wen Zhanjie, Guo Jingqiao

机构 * School of Economics and Trade, Guangdong University of Finance(广东金融学院经济贸易学院) Department of Computer Science, Faculty of Science, Hong Kong Baptist University(香港 Baptist 大学科学学院计算机科学系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过多模态方法测量中国AI洗绿现象,发现其对资本市场的负面影响,揭示了AI投资与实际创新之间的关系及市场反应机制。

Comments 18 pages, 3 figures, 7 tables, academic research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17375 2026-04-21 cs.CV cs.AI 73%

When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models

当文本劫持视觉:基准测试与减轻文本叠加引起的视觉语言模型幻觉

Cui Yakun, Xingqun Qi, TianTian Geng, Yuyao Zhang, Sirui Han, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) University of Birmingham(伯明翰大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VisualTextTrap基准测试,通过大规模人工验证样本和定制评估指标,减轻文本叠加引起的幻觉问题,并提出VTHM-MoE框架以提升视觉-文本解耦能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17052 2026-04-21 cs.CV 70%

OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning

OASIS:按需分层事件记忆用于流媒体视频推理

Zhijia Liang, Jiaming Li, Weikai Chen, Yanhao Zhang, Haonan Lu, Guanbin Li

机构 * Sun Yat-sen University(中山大学) OPPO AI Center(OPPO人工智能中心) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 OASIS通过结构化按需检索解决流媒体视频推理中记忆检索的挑战,提升长周期准确性和组合推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05067 2026-04-21 cs.CV cs.AI 62%

LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding

LLaVA-Octopus:解锁指令驱动的自适应投影器融合用于视频理解

Boyuan Sun, Jiaxing Zhao, Xiang Chen, Xihan Wei, Qibin Hou

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Tongyi Group, Alibaba(阿里巴巴通义集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 LLaVA-Octopus通过根据用户指令动态调整不同视觉投影器的特征权重,提升视频理解任务的性能,实验表明其在多个基准测试中表现优异。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20715 2026-04-21 cs.CV cs.CL 62%

MUSEG: Reinforcing Video Temporal Understanding via Timestamp-Aware Multi-Segment Grounding

MUSEG:通过时间感知多段定位增强视频时间理解

Fuwen Luo, Shengfeng Lou, Chi Chen, Ziyue Wang, Chenliang Li, Weizhou Shen, Jiyue Guo, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Yang Liu

机构 * THUNLP-MT

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 MUSEG通过引入时间感知多段定位,提升多模态大语言模型对视频时间信息的理解能力,通过定制化强化学习训练方案实现更全面的时间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18313 2026-04-21 cs.CV 57%

Denoise and Align: Diffusion-Driven Foreground Knowledge Prompting for Open-Vocabulary Temporal Action Detection

去噪与对齐:基于扩散的前景知识提示用于开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Jinchao Zhang, Cong Wang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Beijing China Institute of Information Engineering, Chinese Academy of Sciences Beijing China Hangzhou Dianzi University Hangzhou China Institute of Information Engineering, Chinese Academy of Sciences\ Key Laboratory of Cyberspace Security Defense Beijing China Engineering, Zhejiang University Hangzhou China Institute of Information Engineering, Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Beijing China Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense Institute of Information Engineering, Chinese Academy of Sciences Hangzhou Dianzi University Institute of Information Engineering, Chinese Academy of Sciences\ Key Laboratory of Cyberspace Security Defense Engineering, Zhejiang University Institute of Information Engineering, Chinese Academy of Sciences State Key Laboratory of Cyberspace Security Defense

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DFAlign框架,通过扩散去噪生成前景知识,解决开放词汇时序动作检测中语义不平衡问题,提升动作相关片段的判别性。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18260 2026-04-21 cs.CV 57%

Geometry-Guided 3D Visual Token Pruning for Video-Language Models

基于几何的3D视觉标记修剪用于视频-语言模型

Han Li, Zehao Huang, Jiahui Fu, Naiyan Wang, Si Liu

机构 * Beihang University(北京航空航天大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Geo3DPruner框架,通过几何感知全局注意力建模跨帧相关性,并采用两阶段修剪过程,保留90%的视觉标记同时保持90%原始性能,优于现有文本引导和视觉引导修剪方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17880 2026-04-21 cs.RO cs.CV 57%

ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation

ST-$π$: 结构化时空VLA用于机器人操作

Chuanhao Ma, Hanyu Zhou, Shihan Peng, Yan Li, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出ST-$π$模型,通过结构化时空视觉语言模型和动作专家,解决机器人操作中精细时空推理问题,同时引入结构化时空标注数据集进行训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04583 2026-04-21 cs.CV 57%

PEPR: Privileged Event-based Predictive Regularization for Domain Generalization

PEPR:基于特权事件的预测正则化用于领域泛化

Gabriele Magrini, Federico Becattini, Niccolò Biondi, Pietro Pala

机构 * University of Florence(佛罗伦萨大学) University of Siena(锡耶纳大学) University of Trento(特伦托大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出PEPR方法,通过利用特权信息提升领域泛化能力,改进RGB模型在昼夜域转移中的鲁棒性,优于基于对齐的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16893 2026-04-21 cs.CV cs.LG 57%

EasyVideoR1: Easier RL for Video Understanding

EasyVideoR1: 更容易的视频理解强化学习

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EasyVideoR1框架,通过高效预处理、统一奖励系统和混合训练策略,提升视频理解任务的训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08491 2026-04-21 cs.HC 50%

Figures as Interfaces: Toward LLM-Native Artifacts for Scientific Discovery

图表作为接口:迈向面向大语言模型的科学发现原生图件

Yifang Wang, Rui Sheng, Erzhuo Shao, Yifan Qian, Haotian Li, Nan Cao, Dashun Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出LLM原生图件概念,通过融合语言-视觉接口,实现数据驱动的可解释图件,提升科学发现的可重复性和透明性。

详情

展开后加载摘要…

URL PDF HTML 收藏