arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-28 至 2026-07-28 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 7 篇

2607.06173 2026-07-28 cs.CV 版本更新 83%

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan:弥合移动视频扩散的质量差距

Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 研究旨在弥合移动视频扩散质量差距,提出将5B参数视频扩散Transformer通过循环重公式化等方法高效部署在移动硬件上,经多种优化,成为首个可商用移动设备部署的该规模模型,取得新的端到端延迟和分数,建立移动视频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24124 2026-07-28 cs.CV 新提交 79%

ViDS: Video Diffusion Shader using 3D Face Tracking

ViDS:使用3D面部跟踪的视频扩散着色器

Wenbo Ji, Davide Davoli, Zhe Chen, Liam Schoneveld, Matthias Nießner, Jiapeng Tang

机构 * Technical University of Munich(慕尼黑工业大学) Toyota Motor Europe NV/SA(丰田汽车欧洲股份公司) Woven by Toyota(丰田编织)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 研究利用3D面部跟踪实现肖像动画,先重建3DMM网格,再用驱动视频参数动画处理,借助视频扩散模型合成动画,引入自回归扩散采样过程,相比之前方法能更精细控制表情姿势,且保留身份外观,消融研究验证了有效性。

Comments 12 pages, 6 figures, and 8 tables. Project page: https://fusheng-ji.github.io/ViDS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22696 2026-07-28 cs.CV cs.AI 新提交 79%

MegaSlide-DiT: Memory-Centric Adaptation and Deformable Local Attention for Efficient Video Diffusion

MegaSlide-DiT:用于高效视频扩散的以内存为中心的自适应和可变形局部注意力

Jiacheng Liu, Jason Liu

机构 * Trendinsight Lab / UC San Diego(趋势洞察实验室/加州大学圣地亚哥分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 研究针对高分辨率视频扩散模型内存消耗大问题,提出MegaSlide-DiT,通过让GPU不持有模型状态及用3D-DSA取代全局注意力,降低内存和计算复杂度,实现105B DiT在单H200 GPU上的适配,为大规模视频扩散模型全参数适配提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00874 2026-07-28 cs.CV cs.AI cs.LG cs.MM 73%

Latent Space Probing for Adult Content Detection in Video Generative Models

潜在空间探测用于视频生成模型中的成人内容检测

Alizishaan Khatri, Chiquita Prabhu

机构 * Wrynx Inc.(Wrynx公司) Independent Researcher(独立研究者)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种潜在空间探测框架,通过拦截视频扩散模型生成过程中的去噪潜在表示,利用轻量级分类器实现实时成人内容检测,实验表明潜在空间信号在有害内容检测中具有强判别能力。

Comments To be published in 2026 56th Annual IEEE International Conference on Dependable Systems and Networks Workshops (DSN-W)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23844 2026-07-28 cs.CV 新提交 70%

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models

OmniCache:用于扩散模型的多维分层特征缓存

Zhaoyuan He, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对高分辨率图像和视频扩散模型推理成本高的问题,提出OmniCache框架,利用中间扩散特征冗余,通过多种缓存实现多维特征重用,减少推理延迟,在多模型上取得良好效果,且无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12940 2026-07-28 cs.CV 版本更新 70%

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

循环自回归扩散:全局记忆与局部注意力相结合

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

机构 * Peking University(北京大学) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。

Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22772 2026-07-28 eess.IV cs.CV 新提交 62%

Generative Video Compression with Adaptive Score Distillation

基于自适应分数蒸馏的生成式视频压缩

Naifu Xue, Zhaoyang Jia, Haosen Li, Zihan Zheng, Jiahao Li, Bin Li, Xiaoyi Zhang, Qi Meng, Yuan Zhang, Yan Lu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 研究针对视频压缩探索专门设计的扩散模型,提出GenVC,通过全局到局部层次结构恢复时空细节,用自适应分数蒸馏加速推理,在超低比特率下实现高质量重建,参数少且解码速度快。

详情

展开后加载摘要…

URL PDF HTML 收藏