arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-20 至 2026-03-20 共收录 14 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2510.20579 2026-03-20 cs.CV cs.AI cs.MM 84%

Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence

Open-o3-Video: 基于显式时空证据的视频推理

Jiahao Meng, Xiangtai Li, Haochen Wang, Yue Tan, Tao Zhang, Lingdong Kong, Yunhai Tong, Anran Wang, Zhiyang Teng, Yujing Wang, Zhuochen Wang

机构 * PKU(北京大学) ByteDance(字节跳动) CASIA(CASIA研究院) WHU(武汉大学) NUS(新加坡国立大学)

专题命中 视频理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Open-o3-Video,通过显式时空证据提升视频推理的可追溯性与可验证性,基于STGR数据集和冷启动强化学习策略,在V-STAR基准上取得SOTA性能,并支持置信度感知的测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21782 2026-03-20 cs.CV 79%

Mobile-VideoGPT: Fast and Accurate Model for Mobile Video Understanding

Mobile-VideoGPT:用于移动视频理解的高效模型

Abdelrahman Shaker, Muhammad Maaz, Chenhui Gou, Hamid Rezatofighi, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Monash University(莫纳什大学) Linköping University(利尔贝里大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出Mobile-VideoGPT,一种轻量级多模态框架,通过高效编码器、投影器和小语言模型实现快速推理,提升移动视频理解效率。

Comments Technical Report. Project: https://amshaker.github.io/Mobile-VideoGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17024 2026-03-20 cs.CV cs.AI cs.CL 57%

HopChain: Multi-Hop Data Synthesis for Generalizable Vision-Language Reasoning

HopChain: 多跳数据合成用于通用视觉语言推理

Shenzhi Wang, Shixuan Liu, Jing Zhou, Chang Gao, Xiong-Hui Chen, Binghai Wang, An Yang, Shiji Song, Bowen Yu, Gao Huang, Junyang Lin

机构 * Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司) LeapLab, Tsinghua University(清华大学跃迁实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出HopChain框架,通过多跳视觉语言推理数据合成提升VLMs的通用推理能力,实验表明其在多个基准测试中显著提升性能。

Comments 28 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 5 篇

2603.18600 2026-03-20 cs.CV 83%

Improving Joint Audio-Video Generation with Cross-Modal Context Learning

通过跨模态上下文学习提升联合音频视频生成

Bingqi Ma, Linlong Lang, Ming Zhang, Dailan He, Xingtong Ge, Yi Zhang, Guanglu Song, Yu Liu

机构 * Vivix Group Limited(维维克斯集团有限公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出跨模态上下文学习方法,解决双流Transformer生成中模态交互不一致、训练不稳定等问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20649 2026-03-20 cs.CV 83%

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。

Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18524 2026-03-20 cs.CV 79%

3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model

3DreamBooth:高保真3D主体驱动视频生成模型

Hyun-kyu Ko, Jihyeon Park, Younghyun Kim, Dongheok Park, Eunbyung Park

机构 * Yonsei University(延世大学) Sungkyunkwan University(成均馆大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出3DreamBooth和3Dapter框架,通过单帧优化解耦空间几何与时间运动,构建鲁棒3D先验,提升纹理细节并加速收敛,解决3D主体定制中的空间先验不足问题。

Comments Project page: https://ko-lani.github.io/3DreamBooth Code: https://github.com/Ko-Lani/3DreamBooth

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18811 2026-03-20 cs.RO 78%

V-Dreamer: Automating Robotic Simulation and Trajectory Synthesis via Video Generation Priors

V-Dreamer:通过视频生成先验自动机器人仿真与轨迹合成

Songjia He, Zixuan Chen, Hongyu Ding, Dian Shao, Jieqi Shi, Chenxu Li, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 V-Dreamer通过视频生成先验自动构建仿真环境和可执行轨迹,利用大语言模型和3D生成模型生成物理合理的3D场景,并通过Sim-to-Gen模块实现高效轨迹合成。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19231 2026-03-20 cs.CV 57%

MonoArt: Progressive Structural Reasoning for Monocular Articulated 3D Reconstruction

MonoArt:基于渐进结构推理的单目关节3D重建

Haitian Li, Haozhe Xie, Junxiang Xu, Beichen Wen, Fangzhou Hong, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, 637335 Singapore(南洋理工大学S实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MonoArt通过渐进结构推理实现单目关节3D重建,无需外部运动模板或多阶段流程,提升重建精度和推理速度,并扩展至机器人操作和关节场景重建。

Comments Project page: https://lihaitian.com/MonoArt

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2603.18501 2026-03-20 cs.CV cs.AI 79%

Efficient Video Diffusion with Sparse Information Transmission for Video Compression

高效视频扩散与稀疏信息传输用于视频压缩

Mingde Zhou, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Diff-SIT方法,通过稀疏时序编码模块和单步视频扩散模型提升视频压缩的感知质量和时间一致性,尤其在超低比特率下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18742 2026-03-20 cs.CV 74%

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

6Bit-Diffusion:视频扩散模型推理时的混合精度量化

Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

机构 * Fudan University(复旦大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出了一种推理时的混合精度量化框架,通过动态分配NVFP4和INT8精度,提升视频扩散模型的效率与质量,实验显示在推理速度和内存占用上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 2 篇

2603.18298 2026-03-20 cs.RO cs.AI cs.CV 57%

Sparse3DTrack: Monocular 3D Object Tracking Using Sparse Supervision

Sparse3DTrack: 基于稀疏监督的单目3D物体跟踪

Nikhil Gosala, B. Ravi Kiran, Senthil Yogamani, Abhinav Valada

机构 * University of Freiburg, Germany(弗赖堡大学) Qualcomm SARL France(法国高通公司) Automated Driving, Qualcomm Technologies, Inc., USA(美国高通技术公司自动驾驶部门)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出首个稀疏监督的单目3D物体跟踪框架,通过分解为2D查询匹配和3D几何估计两阶段任务,利用时空一致性增强稀疏标注样本,生成高质量3D伪标签,提升极端稀疏标注下的跟踪性能。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11746 2026-03-20 cs.CV 57%

SoulX-LiveAct: Towards Hour-Scale Real-Time Human Animation with Neighbor Forcing and ConvKV Memory

SoulX-LiveAct: 向小时级实时人体动画迈进:通过邻居强制和ConvKV内存

Dingcheng Zhen, Xu Zheng, Ruixin Zhang, Zhiqi Jiang, Yichao Yan, Ming Tao, Shunshun Yin

机构 * Soul AI Lab, China(中国灵魂AI实验室) HKUST(GZ)(香港科技大学(广州)) Soochow University(苏州大学)

专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV

AI总结 本文提出Neighbor Forcing和ConvKV内存机制,解决小时级实时人体动画中样本不一致和历史表示无结构的问题,提升训练收敛性、生成质量和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 2 篇

2603.19217 2026-03-20 cs.CV 74%

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

LVOmniBench:开创性长音频视频理解评估用于多模态大语言模型

Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of California Merced(加州大学默塞德分校)

专题命中 视频数据与评测 :video understanding(title);分类 cs.CV

AI总结 LVOmniBench旨在评估多模态大语言模型在长音频视频中的跨模态理解能力,通过275个10至90分钟的高质量视频和1014个问题-答案对,揭示当前模型在处理长形式输入时的挑战。

Comments Project page: https://kd-tao.github.io/LVOmniBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19098 2026-03-20 cs.CV 57%

TAU-R1: Visual Language Model for Traffic Anomaly Understanding

TAU-R1:用于交通异常理解的视觉语言模型

Yuqiang Lin, Kehua Chen, Sam Lockyer, Arjun Yadav, Mingxuan Sui, Shucheng Zhang, Yan Shi, Bingzhang Wang, Yuang Zhang, Markus Zarbock, Florain Stanek, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang

机构 * University of Bath(巴斯大学) University of Washington(华盛顿大学) City of Carmel, Indiana(印第安纳州卡迈尔市) Starwit GmbH

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出TAU-R1模型,通过两层框架提升交通异常识别与推理能力,结合定制化训练策略与数据集,实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏