arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-25 至 2026-03-25 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 14 篇

2501.08415 2026-03-25 cs.CV cs.AI 81%

Cross-Modal Transferable Image-to-Video Attack on Video Quality Metrics

跨模态可迁移的图像到视频攻击视频质量度量

Georgii Gotin, Ekaterina Shumitskaya, Anastasia Antsiferova, Dmitriy Vatolin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能研究中心) MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所) Laboratory of Innovative Technologies for Processing Video Content(视频内容处理创新技术实验室)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出IC2VQA方法,通过跨模态攻击探索现代视频质量度量模型的漏洞,利用CLIP模块提升对抗扰动的可迁移性,实验显示在三种黑盒视频质量度量模型上攻击成功率高。

Comments Accepted for VISAPP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22313 2026-03-25 cs.LG cs.AI 79%

A Multi-Modal CNN-LSTM Framework with Multi-Head Attention and Focal Loss for Real-Time Elderly Fall Detection

一种集成多头注意力和聚焦损失的多模态CNN-LSTM框架用于实时老年人跌倒检测

Lijie Zhou, Luran Wang

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出多模态深度学习框架MultiModalFallDetector,结合多尺度CNN、多传感器数据融合、多头注意力机制和聚焦损失,实现高精度实时老年人跌倒检测,实验表明其在SisFall数据集上达到98.7的F1分数,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22371 2026-03-25 eess.IV 78%

Multimodal Fusion of Skeleton Dynamics and Clinical Gait Features for Video-Based Cerebral Palsy Severity Assessment

基于骨骼动力学和临床步态特征的多模态融合用于视频基于的脑瘫严重程度评估

Kaiyuan Yang, Xupeng Chen, Jiangpeng He

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出一种多模态融合框架,结合骨骼动力学和临床有意义的步态特征,提升视频脑瘫严重程度评估的预测性能和生物力学可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG 73%

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13719 2026-03-25 cs.CV cs.AI cs.IR 62%

Hierarchical Long Video Understanding with Audiovisual Entity Cohesion and Agentic Search

基于音频视觉实体凝聚力与代理搜索的层次化长视频理解

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HAVEN框架,通过整合音频视觉实体凝聚力与层次化视频索引与代理搜索,解决长视频理解中的信息碎片化和全局一致性问题,实验显示在LVBench上达到84.1%的准确率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23489 2026-03-25 cs.CV 57%

AgentRVOS: Reasoning over Object Tracks for Zero-Shot Referring Video Object Segmentation

AgentRVOS: 基于对象跟踪的零样本视频对象分割

Woojeong Jin, Jaeho Lee, Heeseong Shin, Seungho Jang, Junhwan Heo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV

AI总结 AgentRVOS通过结合SAM3和MLLM的优势,提出无需训练的管道,利用生成的掩码跟踪提供可靠的时空信息,通过查询引导的推理实现零样本视频对象分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23478 2026-03-25 cs.CV 57%

UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

UniFunc3D: 统一的主动空间-时间接地用于3D功能分割

Jiaying Lin, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniFunc3D通过统一框架实现3D场景功能分割,利用多模态大语言模型作为主动观察者,结合语义、时间和空间推理,提升任务分解的准确性与效率,实现优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23186 2026-03-25 cs.CV 57%

ViKey: Enhancing Temporal Understanding in Videos via Visual Prompting

ViKey:通过视觉提示增强视频中的时间理解

Yeonkyung Lee, Dayun Ju, Youngmin Kim, Seil Kang, Seong Jae Hwang

机构 * Yonsei University(延世大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ViKey通过视觉提示和轻量级关键词-帧映射模块提升视频模型的时间推理能力,在减少帧数的情况下保持性能。

Comments accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22953 2026-03-25 cs.CV 57%

Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

基于簇的时空掩码用于高效的视频-语言预训练

Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11336 2026-03-25 cs.CV 57%

UFVideo: Towards Unified Fine-Grained Video Cooperative Understanding with Large Language Models

UFVideo:迈向统一的细粒度视频协作理解的大型语言模型

Hewen Pan, Cong Wei, Dashuang Liang, Zepeng Huang, Pengfei Gao, Ziqi Zhou, Lulu Xue, Pengfei Yan, Xiaoming Wei, Minghui Li, Shengshan Hu

机构 * Huazhong University of Science and Technology(华中科技大学) Meituan(美团)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 UFVideo通过统一多粒度协作理解能力,实现视频理解的全面覆盖,展示了其在多粒度视频任务中的灵活性和优势。

Comments CVPR 2026 Camera Ready, Github Code: https://github.com/Heven-Pan/UFVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03405 2026-03-25 cs.CV 57%

ViDiC: Video Difference Captioning

ViDiC:视频差异描述

Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ViDiC任务及ViDiC-1K数据集,旨在评估多模态大语言模型对视频对相似性与差异性的细粒度描述能力,揭示现有模型在比较描述和差异感知上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00571 2026-03-25 eess.SP 50%

Delay Bound Relaxation with Deep Learning-based Haptic Estimation for Tactile Internet

基于深度学习的触觉估计用于触觉互联网的延迟放宽

Georgios Kokkinis, Alexandros Iosifidis, Qi Zhang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出一种基于深度学习的触觉估计方法,通过多模态输入估计力反馈,从而放宽触觉互联网中对延迟的要求,提高资源利用效率和可靠性。

Comments 6 pages, 6 figures, 1 table, conference paper accepted in GLOBECOM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23232 2026-03-25 cs.LG 50%

GEM: Guided Expectation-Maximization for Behavior-Normalized Candidate Action Selection in Offline RL

GEM:用于离线强化学习中行为归一化的候选动作选择的引导期望最大化

Haoyu Wang, Jingcheng Wang, Shunyu Wu, Xinwei Xiao

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 GEM通过引导期望最大化框架,在离线强化学习中实现多模态且可控的动作选择,通过高斯混合模型和行为归一化支持提升决策稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22760 2026-03-25 cs.RO 50%

SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation

SG-VLA:学习空间接地的视觉-语言-动作模型用于移动操作

Ruisen Tu, Arth Shukla, Sohyun Yoo, Xuanlin Li, Junxi Li, Jianwen Xie, Hao Su, Zhuowen Tu

机构 * UC San Diego(南加洲大学) Lambda, Inc(Lambda公司)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SG-VLA模型,通过辅助任务协同训练和多模态输入增强,提升移动操作中视觉-语言-动作模型的空间感知与表征能力,实现在家庭环境中更高效的物体抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏