arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-17 至 2026-03-17 共收录 33 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 33 篇

2603.14719 2026-03-17 cs.LG 82%

Multimodal Deep Learning for Early Prediction of Patient Deterioration in the ICU: Integrating Time-Series EHR Data with Clinical Notes

多模态深度学习用于ICU中患者恶化的早期预测:整合时间序列电子健康记录数据与临床笔记

Binesh Sadanandan

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出一种多模态深度学习方法,结合结构化时间序列数据和非结构化临床笔记,用于预测ICU患者恶化。模型在MIMIC-IV数据库上训练,测试集AUROC达0.7857,临床笔记提升AUROC2.5个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15392 2026-03-17 cs.MM cs.HC 79%

Multimodal Cyber-physical Interaction in XR: Hybrid Doctoral Thesis Defense

XR中的多模态物理交互:混合博士论文答辩

Ahmad Alhilal, Kit Yung Lam, Lik-Hang Lee, Xuetong Wang, Sijia Li, Matti Siekkinen, Tristan Braud, Pan Hui

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出一种多模态框架,突破传统答辩模式,支持现场、虚拟现实和浏览器等多种参与方式,通过全身体姿追踪实现自然交互,验证了其在混合活动中的有效性。

Comments 10 pages, 3 figures, magazine paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07463 2026-03-17 cs.CV cs.LG eess.IV 79%

MSEG-VCUQ: Multimodal SEGmentation with Enhanced Vision Foundation Models, Convolutional Neural Networks, and Uncertainty Quantification for High-Speed Video Phase Detection Data

MSEG-VCUQ: 多模态分割与增强视觉基础模型、卷积神经网络和不确定性量化用于高速视频相位检测数据

Chika Maduabuchi, Ericmoore Jossou, Matteo Bucci

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MSEG-VCUQ,结合U-Net和SAM提升高速视频相位检测分割精度,引入不确定性量化和首个开源多模态数据集,实现更可靠的相位分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13759 2026-03-17 cs.CV 79%

QTrack: Query-Driven Reasoning for Multi-modal MOT

QTrack: 基于查询的多模态 MOT 推理

Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

专题命中 视频多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于查询的多模态 MOT 推理方法,通过自然语言查询定位和跟踪特定目标,构建了 RMOT26 基准并提出 QTrack 模型,结合多模态推理与跟踪定位,提升语言引导的跟踪性能。

Comments Project Page: https://gaashlab.github.io/QTrack/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13367 2026-03-17 cs.CV cs.LG 79%

Multimodal Deep Learning for Dynamic and Static Neuroimaging: Integrating MRI and fMRI for Alzheimer Disease Analysis

多模态深度学习用于动态和静态神经影像:整合MRI和fMRI进行阿尔茨海默病分析

Anima Kujur, Zahra Monfared

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出一种多模态深度学习框架,整合MRI和fMRI对阿尔茨海默病、轻度认知障碍和正常认知状态进行多类分类,通过3D卷积神经网络提取结构特征,用递归架构学习fMRI的时间特征,并融合这些表示进行联合空间-时间学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14953 2026-03-17 cs.CV cs.AI 73%

Learning Question-Aware Keyframe Selection with Synthetic Supervision for Video Question Answering

基于合成监督的学习问题感知关键帧选择用于视频问答

Minchan Kwon, Hyounguk Shon, Junmo Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 视频多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种问题感知的关键帧选择框架,通过伪关键帧标签和覆盖正则化提升视频问答的准确率,尤其在时间与因果问题上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15008 2026-03-17 cs.CV 70%

Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning

线索至关重要:利用潜在视觉线索增强视频推理

Kaixin zhang, Xiaohe Li, Jiahao Li, Haohua Wu, Xinyu Zhao, Zide Fan, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 视频多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06662 2026-03-17 cs.CV cs.LG 70%

HyperTokens: Controlling Token Dynamics for Continual Video-Language Understanding

HyperTokens: 通过控制令牌动态实现连续视频-语言理解

Toan Nguyen, Yang Liu, Celso De Melo, Flora D. Salim

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出HyperTokens,通过按需生成微调令牌,控制提示更新并保持内存固定,通过元启发式正则化抑制遗忘,提升连续视频问答任务的准确率与保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12664 2026-03-17 cs.CL cs.AI 62%

From Text to Forecasts: Bridging Modality Gap with Temporal Evolution Semantic Space

从文本到预测:通过时间演化的语义空间弥合模态差距

Lehui Li, Yuyao Wang, Jisheng Yan, Wei Zhang, Jinliang Deng, Haoliang Sun, Zhongyi Han, Yongshun Gong

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TESS方法,通过引入时间演化语义空间弥合文本与预测模型间的模态差距,实验显示在四个真实世界数据集上预测误差降低29%。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10979 2026-03-17 cs.CV cs.AI 62%

PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs

PAS:一种无训练的时序编码稳定器

Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Hang Wu, Yiwei Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对视频大语言模型中时序不一致问题,提出PAS机制,通过相位聚合平滑技术减少帧间扰动,提升注意力稳定性,实验表明在不增加计算开销的情况下提升了视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13374 2026-03-17 cs.CV cs.AI 62%

Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection

基于几何的语义推理用于无训练视频异常检测

Ali Zia, Usman Ali, Muhammad Umer Ramzan, Hamza Abid, Abdul Rehman, Wei Xiang

机构 * School of Computing, Engineering \& Mathematical Sciences, La Trobe University, Melbourne, Australia School of Engineering Applied Sciences, GIFT University, Gujranwala 52250, Pakistan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MM-VAD框架,通过将异常检测转为适应性测试时推理,利用双曲空间保留层次结构,并结合可学习提示和Mahalanobis细化提升性能,实现在多个基准上优于现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05092 2026-03-17 cs.LG cs.AI cs.CL 62%

Aura: Universal Multi-dimensional Exogenous Integration for Aviation Time Series

Aura:通用多维外源整合用于航空时间序列

Jiafeng Lin, Mengren Zheng, Simeng Ye, Yuxuan Wang, Huan Zhang, Yuhui Liu, Zhongyi Pei, Jianmin Wang

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学) Hongshen College, Chongqing University(弘深学院、重庆大学) School of Software, Tsinghua University(软件学院、清华大学) China Southern Airlines(中国南方航空)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Aura框架,通过整合多维外源因素提升航空时间序列预测精度,实验表明其在航空安全与可靠性方面具有广泛应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15167 2026-03-17 cs.CV 57%

Question-guided Visual Compression with Memory Feedback for Long-Term Video Understanding

基于记忆反馈的问题引导视觉压缩用于长期视频理解

Sosuke Yamao, Natsuki Miyahara, Yuankai Qi, Shun Takeuchi

机构 * Fujitsu Research(富士通研究实验室) Macquarie University(麦考瑞大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出QViC-MF框架,通过问题引导的多模态选择性注意力和记忆反馈提升长期视频理解性能,在多个基准测试中取得显著提升。

Comments Accepted to CVPR 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15153 2026-03-17 cs.CV 57%

TextOVSR: Text-Guided Real-World Opera Video Super-Resolution

TextOVSR: 基于文本引导的现实世界歌剧视频超分辨率

Hua Chang, Xin Xu, Wei Liu, Jiayi Wu, Kui Jiang, Fei Ma, Qi Tian

机构 * School of Computer Science and Technology, Wuhan University of Science and Technology(武汉科技大学计算机科学与技术学院) Hubei Province Key Laboratory of Intelligent Information Processing and Real-time Industrial System(湖北省智能信息处理与实时工业系统重点实验室) Harbin Institute of Technology Zhengzhou Research Institute(哈尔滨工业大学郑州研究所) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Huawei Technologies Ltd(华为技术有限公司)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对歌剧视频因早期拍摄设备限制和长期存储退化导致的视觉质量差问题,本文提出TextOVSR网络,通过引入两种文本提示引导超分辨率过程,结合文本增强判别器和降质鲁棒特征融合模块,提升纹理重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15003 2026-03-17 cs.CV 57%

Edit2Interp: Adapting Image Foundation Models from Spatial Editing to Video Frame Interpolation with Few-Shot Learning

Edit2Interp:从空间编辑到视频帧插值的图像基础模型适应

Nasrin Rahimi, Mısra Yavuz, Burak Can Biner, Yunus Bilge Kurt, Ahmet Rasim Emirdağı, Süleyman Aslan, Görkay Aydemir, M. Akın Yılmaz, A. Murat Tekalp

机构 * Codeway AI Research Dept. of Electrical \& Electronics Engineering, Ko c University, \. I stanbul, T\" u rkiye

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

AI总结 本文通过少量样本学习,将图像编辑模型适应于视频帧插值,揭示了静态场景中物体变换的理解可激活潜在的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14935 2026-03-17 cs.CV 57%

Video-CoE: Reinforcing Video Event Prediction via Chain of Events

Video-CoE:通过事件链强化视频事件预测

Qile Su, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里妈妈,阿里巴巴集团)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 本文提出Video-CoE方法,通过构建时间事件链提升视频事件预测的准确性,实验表明其优于现有主流大语言模型。

Comments 21 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06097 2026-03-17 cs.CV 57%

VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning

VideoChat-A1: 通过镜头链推理实现长视频的思考

Zikang Wang, Boyu Chen, Zhengrong Yue, Yi Wang, Yu Qiao, Limin Wang, Yali Wang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14750 2026-03-17 cs.CV 57%

Face-Guided Sentiment Boundary Enhancement for Weakly-Supervised Temporal Sentiment Localization

基于面部引导的弱监督时间情感定位边界增强

Cailing Han, Zhangbin Li, Jinxing Zhou, Wei Qian, Jingjing Hu, Yanghao Zhou, Zhangling Duan, Dan Guo

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FSENet框架,通过面部特征引导情感定位,解决弱监督时间情感定位中的边界不精确问题,实现跨不同标注设置的高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14733 2026-03-17 cs.CV 57%

A Skill-augmented Agentic Framework and Benchmark for Multi-Video Understanding

一种具备技能的代理框架和多视频理解基准

Yue Zhang, Liqiang Jing, Jia Li, Yapeng Tian, Xinya Du, Yunhui Guo, Vibhav Gogate

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MVX-Bench多视频跨维基准和SAMA框架,通过整合视觉工具和技能实现结构化推理,实验显示其在多视频理解任务中优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14401 2026-03-17 cs.RO cs.CV 57%

OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer

OCRA:基于3D和触觉先验的人到机器人动作迁移的物体中心学习

Kuanning Wang, Ke Fan, Yuqian Fu, Siyu Lin, Hu Luo, Daniel Seita, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 OCRA通过结合3D和触觉先验,利用多视角视频和先进模型重建物体中心3D点云,生成稳健的机器人操作动作,实验表明其在视觉和视觉-触觉任务中优于现有方法。

Comments Project page: https://sressers.github.io/OCRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14361 2026-03-17 cs.CV 57%

BROTHER: Behavioral Recognition Optimized Through Heterogeneous Ensemble Regularization for Ambivalence and Hesitancy

BROTHER: 通过异质性集成正则化优化行为识别以应对矛盾与犹豫

Alexandre Pereira, Bruno Fernandes, Pablo Barros

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BROTHER框架,通过异质集成正则化方法,结合视觉、音频和语言数据,提升对矛盾与犹豫等复杂行为状态的识别能力,采用PSO硬投票集成策略,实现宏F1分数达0.7465。

Comments 5 pages, 2 figures, 3 tables, Ambivalence/Hesitancy (AH) Video Recognition Challenge, ABAW10th, CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14300 2026-03-17 cs.CV 57%

Show Me When and Where: Towards Referring Video Object Segmentation in the Wild

展示时间与地点:迈向野外的指称视频对象分割

Mingqi Gao, Jinyu Yang, Jingnan Luo, Xiantong Zhen, Jungong Han, Giovanni Montana, Feng Zheng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种新的野外指称视频对象分割任务,引入了包含更多时长和场景的YoURVOS数据集,并提出OMFormer方法以实现高效的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14245 2026-03-17 cs.LG cs.AI 57%

GoldenStart: Q-Guided Priors and Entropy Control for Distilling Flow Policies

GoldenStart: 基于Q引导先验和熵控制的流策略蒸馏

He Zhang, Ying Sun, Hui Xiong

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出GoldenStart方法,通过Q引导先验和显式熵控制,改进流匹配策略的生成起点和探索能力,实现在连续控制任务中高效且具有探索性的策略。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01804 2026-03-17 cs.CV 57%

V-CORE: Temporally Consistent Video Understanding for Video-LLM

V-CORE:面向视频大语言模型的时序一致视频理解

Zhengjian Kang, Qi Chen, Rui Liu, Kangtong Mo, Xingyu Zhang, Xiaoyu Deng, Ye Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 V-CORE通过引入显式时序约束提升视频理解性能,采用可学习空间聚合和因果感知时间投影器,有效解决视频时序一致性问题,在多个基准测试中取得显著成果。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19554 2026-03-17 cs.CV 57%

Harvest Video Foundation Models via Efficient Post-Pretraining

通过高效后预训练收获视频基础模型

Yizhuo Li, Kunchang Li, Yinan He, Yi Wang, Yali Wang, Limin Wang, Yu Qiao, Ping Luo

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种高效框架,通过随机丢弃视频片段和遮蔽文本来从图像基础模型中获取视频基础模型,提升了训练效率并强化了跨模态融合,实验表明其在多种视频-语言任务中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13412 2026-03-17 cs.CV 57%

WAT: Online Video Understanding Needs Watching Before Thinking

WAT:在线视频理解需要先观看再思考

Zifan Han, Hongbo Sun, Jinglin Xu, Canhui Tang, Yulong Lei, Xuchong Zhang, Hongbin Sun, Zhongjiang He, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(国家人类-机器混合增强智能重点实验室,人工智能与机器人研究院,西安交通大学) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) University of Science and Technology Beijing(北京科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 WAT提出双阶段框架,通过分阶段处理实现在线视频理解,结合查询与短期记忆进行跨时间推理,实验显示在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07976 2026-03-17 cs.RO cs.CV 57%

VLD: Visual Language Goal Distance for Reinforcement Learning Navigation

VLD:用于强化学习导航的视觉语言目标距离

Lazar Milikic, Manthan Patel, Jonas Frey

机构 * ETH Zurich(苏黎世联邦理工学院) EPFL(瑞士联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VLD学习框架,通过解耦感知学习与策略学习,利用大规模视频数据训练距离预测器,提升机器人导航性能与现实迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24310 2026-03-17 cs.RO 56%

World In Your Hands: A Large-Scale and Open-Source Ecosystem for Learning Human-Centric Manipulation in the Wild

世界在你手中:一个大规模且开源的生态系统,用于在真实世界中学习以人类为中心的操纵

Yupeng Zheng, Jichao Peng, Weize Li, Yuhang Zheng, Xiang Li, Yujie Jin, Julong Wei, Guanhua Zhang, Ruiling Zheng, Ming Cao, Songen Gu, Zhenhong Zou, Kaige Li, Ke Wu, Mingmin Yang, Jiahao Liu, Pengfei Li, Hengjie Si, Feiyu Zhu, Wang Fu, Likun Wang, Ruiwen Yao, Jieru Zhao, Yilun Chen, Wenchao Ding

专题命中 视频多模态 :multimodal(abstract,comments)

AI总结 本文提出World In Your Hands,一个包含1000小时真实人类操纵数据的开源生态系统,通过高精度运动捕捉和多模态数据提升机器人在杂乱环境中的操作成功率。

Comments This dataset represents the first large-scale collection of real-world, human-centric multimodal data integrating vision, language, tactile sensing, and action (VLTA) Github: https://github.com/tars-robotics/World-In-Your-Hands

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14397 2026-03-17 cs.RO 50%

eNavi: Event-based Imitation Policies for Low-Light Indoor Mobile Robot Navigation

eNavi:基于事件的模仿策略用于低光室内移动机器人导航

Prithvi Jai Ramesh, Kaustav Chanda, Krishna Vinod, Joseph Raj Vishal, Yezhou Yang, Bharatesh Chakravarthi

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出eNavi,通过结合RGB和事件数据的多模态策略提升低光环境下机器人导航的鲁棒性,实验显示融合模型在未见低光条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14388 2026-03-17 eess.SY cs.SY 50%

Context-Aware Adaptive Shared Control for Magnetically-Driven Bimanual Dexterous Micromanipulation

具有情境感知的自适应共享控制用于磁驱动双臂灵巧微 manipulation

Yongchen Wang, Kangyi Lu, Lan Wei, Dandan Zhang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出Bi-CAST框架,通过融合多模态信息实现双臂磁力微 manipulation的自适应共享控制,提升复杂结构中的导航精度与效率,减少碰撞和工作负荷。

详情

展开后加载摘要…

URL PDF HTML 收藏