arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-19 至 2026-03-19 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 6 篇

2603.17693 2026-03-19 cs.CV 83%

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 视频理解 :video reasoning(title);video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17840 2026-03-19 cs.CV 80%

Video Understanding: From Geometry and Semantics to Unified Models

视频理解:从几何与语义到统一模型

Zhaochong An, Zirui Li, Mingqiao Ye, Feng Qiao, Jiaang Li, Zongwei Wu, Vishal Thengane, Chengzu Li, Lei Li, Luc Van Gool, Guolei Sun, Serge Belongie

机构 * Department of Computer Science(计算机科学系) University of Copenhagen(哥本哈根大学) College of Computer Science(计算机科学学院) Nankai University(南开大学) School of Computer and Communication Sciences(计算机与通信科学学校) EPFL(苏黎世联邦理工学院) Department of Computer Science & Engineering(计算机科学与工程系) Washington University in St. Louis(圣路易斯华盛顿大学) Computer Vision Lab(计算机视觉实验室) University of Würzburg(乌尔姆大学) Computer Science Research Centre(计算机科学研究中心) University of Surrey(萨里大学) School of Electrical, Computer and Telecommunications Engineering(电气、计算机和电信工程学院) University of Wollongong(沃林根大学) Language Technology Lab(语言技术实验室) University of Cambridge(剑桥大学) School of Artificial Intelligence(人工智能学院) Beijing Institute of Technology(北京理工大学) Institute for Computer Science(计算机科学研究所) INSAIT

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文综述了视频理解的发展,从低层几何理解到高层语义理解和统一模型,探讨了时间动态和视觉上下文建模的重要性,并总结了当前研究趋势和挑战。

Comments A comprehensive survey of video understanding, spanning low-level geometry, high-level semantics, and unified understanding models

Journal ref Machine Intelligence Research 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17374 2026-03-19 cs.CV 79%

Shot-Aware Frame Sampling for Video Understanding

面向快门的视频帧采样

Mengyu Zhao, Di Fu, Yongyu Xie, Jiaxing Zhang, Zhigang Yuan, Shirin Jalali, Yong Cao

机构 * ByteDance(字节跳动) Rutgers University(罗格斯大学) Georgia Tech(佐治亚理工学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出InfoShot,一种任务无关的快门感知帧采样方法,用于长视频理解。通过分割视频为语义一致的快门,并选择两种互补的关键帧,以保留视频结构和短时变化信息,提升视频理解和异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI 79%

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17948 2026-03-19 cs.CV cs.AI 57%

VideoAtlas: Navigating Long-Form Video in Logarithmic Compute

VideoAtlas: 在对数计算中导航长视频

Mohamed Eltahir, Ali Habibullah, Yazan Alshoibi, Lama Ayash, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡斯特大学) Department of Computer Science, King Khalid University (KKU)(国王 Khalid 大学计算机科学系) Department of Computer Science, Edge Hill University(Edge Hill 大学计算机科学系)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 VideoAtlas通过层次化网格结构实现长视频的无损表示,解决视频表示和长上下文问题,提出Video-RLM架构,展示对数计算增长、环境预算和自适应计算分配等贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17813 2026-03-19 cs.CV 57%

M2P: Improving Visual Foundation Models with Mask-to-Point Weakly-Supervised Learning for Dense Point Tracking

M2P:通过Mask-to-Point弱监督学习改进视觉基础模型以实现密集点跟踪

Qiangqiang Wu, Tianyu Yang, Bo Fang, Jia Wan, Matias Di Martino, Guillermo Sapiro, Antoni B. Chan

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Meituan, Shenzhen, China(美团(深圳,中国)) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出M2P学习方法,利用视频对象分割掩码注解改进视觉基础模型,通过局部结构一致性损失、掩码标签一致性损失和掩码边界约束,提升密集点跟踪性能,实验表明其在TAP-Vid-DAVIS基准上优于DINOv2和DINOv3。

详情

展开后加载摘要…

URL PDF HTML 收藏