arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-22 至 2026-04-22 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 9 篇

2604.18610 2026-04-22 cs.NE cs.AI 83%

SpikeMLLM: Spike-based Multimodal Large Language Models via Modality-Specific Temporal Scales and Temporal Compression

基于脉冲的多模态大语言模型:通过模态特定的时间尺度和时间压缩

Han Xu, Zhiyong Qin, Di Shang, Jiahong Zhang, Xuerui Qiu, Bo Lei, Tiejun Huang, Bo Xu, Guoqi Li

机构 * 1 Institute of Automation, Chinese Academy of Sciences 2 University of Chinese Academy of Sciences 3 Beijing Academy of Artificial Intelligence 4 Zhongguancun Academy 5 Peking University 6 Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology 7 Spiking Intelligence Lab, Tianqiao \& Chrissy Chen Institute [0.5em] Equal contribution Corresponding authors

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出SpikeMLLM,首个基于脉冲的多模态大语言模型框架,通过模态特定时间尺度和时间压缩技术,在减少时间步数的同时保持高性能,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01455 2026-04-22 cs.CV cs.AI cs.CL cs.IR cs.MM 83%

From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents

从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体

Niu Lian, Yuting Wang, Hanshu Yao, Jinpeng Wang, Bin Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。

Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07259 2026-04-22 cs.CV cs.AI cs.LG cs.MM 82%

COMODO: Cross-Modal Video-to-IMU Distillation for Efficient Egocentric Human Activity Recognition

COMODO:跨模态视频到IMU知识蒸馏用于高效的第一人称人类活动识别

Baiyu Chen, Wilson Wongso, Zechen Li, Yonchanok Khaokaew, Hao Xue, Flora Salim

机构 * The University of New South Wales(新南威尔士大学) King Mongkut's University of Technology North Bangkok(科技技术北巴吞蓬大学) The Hong Kong University of Science(香港科学大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出COMODO框架,通过跨模态自监督蒸馏将视频语义知识转移到IMU,提升第一人称人类活动识别的效率与泛化能力。

Comments IMWUT/UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19217 2026-04-22 cs.CV cs.AI 81%

Attention-based Multi-modal Deep Learning Model of Spatio-temporal Crop Yield Prediction with Satellite, Soil and Climate Data

基于注意力机制的多模态深度学习模型:融合卫星、土壤和气候数据的时空作物产量预测

Gopal Krishna Shyam, Ila Chandrakar

机构 * Presidency University, Bengaluru, India(班加罗尔大学) University of Europe for Applied Sciences, Berlin(欧洲应用科学大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ABMMDLF模型,结合多年的卫星影像、高分辨率气象时间序列和初始土壤属性,通过卷积神经网络提取空间特征和时间注意力机制适应性加权关键物候期,实现高精度时空作物产量预测,R²达0.89。

Comments 6 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08014 2026-04-22 cs.CV 77%

Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding

弥合时空:解耦的时空对齐用于视频定位

Xuezhen Tu, Jingyu Wu, Fangyu Kang, Qingpeng Nong, Kaijin Zhang, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) ZTE Corporation(中兴通讯)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出Bridge-STG框架,通过解耦时空定位并保持语义连贯性,解决视频定位中时空对齐和视觉token冗余问题,实验表明其在多个基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24803 2026-04-22 cs.LG cs.AI 57%

TimeOmni-1: Incentivizing Complex Reasoning with Time Series in Large Language Models

TimeOmni-1:通过时间序列激励大型语言模型的复杂推理

Tong Guan, Zijie Meng, Dianqi Li, Shiyu Wang, Chao-Han Huck Yang, Qingsong Wen, Zuozhu Liu, Sabato Marco Siniscalchi, Ming Jin, Shirui Pan

机构 * Griffith University(格里菲斯大学) Zhejiang University(浙江大学) NVIDIA(英伟达) Squirrel Ai Learning University of Palermo(帕尔米奥大学) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出TimeOmni-1,首个统一推理模型,通过时间序列推理解决多样化现实问题,提升因果发现和有效响应率。

Comments Accepted by the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17797 2026-04-22 cs.CV 57%

Weakly-Supervised Referring Video Object Segmentation through Text Supervision

通过文本监督实现弱监督的指称视频对象分割

Miaojing Shi, Jun Huang, Zijie Yue, Hanli Wang

机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出WSRVOS方法,通过文本表达训练模型,利用对比学习生成正负表达,实现细粒度多模态对齐,并引入实例感知分类和伪掩码融合策略,提升视频对象分割性能。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11253 2026-04-22 cs.AI 57%

VideoAgent: Personalized Synthesis of Scientific Videos

VideoAgent:科学视频的个性化合成

Xiao Liang, Bangxin Li, Zixuan Chen, Hanyue Zheng, Zhi Ma, Di Wang, Cong Tian, Quan Wang

机构 * RobotY, Xidian University(西电机器人院) ICTT, Xidian University(西电智能技术研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 VideoAgent通过意图驱动的规划问题重新定义科学视频合成,结合静态幻灯片与动态动画,提升叙述的语义密度和教学效果,实验表明其能有效传达复杂技术逻辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03540 2026-04-22 cs.RO 50%

Drift-Based Policy Optimization: Native One-Step Policy Learning for Online Robot Control

基于漂移的策略优化:面向在线机器人控制的原生一步生成策略

Yuxuan Gao, Yedong Shen, Shiqi Zhang, Wenhao Yu, Yifan Duan, Jia pan, Jiajia Wu, Jiajun Deng, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出一种原生一步生成策略框架,通过将迭代细化移至训练阶段,提升在线机器人控制的效率与稳定性,实验显示其在推理速度和性能上优于多步扩散策略。

详情

展开后加载摘要…

URL PDF HTML 收藏