arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-24 至 2026-02-24 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 6 篇

2512.05016 2026-02-24 cs.CV 83%

Generative Neural Video Compression via Video Diffusion Prior

基于视频扩散先验的生成神经视频压缩

Qi Mao, Hao Cheng, Tinghan Yang, Libiao Jin, Siwei Ma

机构 * School of Information and Communication Engineering, Communication University of China(信息与通信工程学院,通信大学) School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 GNVC-VD通过结合视频扩散先验和序列级去噪,实现了高效的生成神经视频压缩,显著减少了闪烁伪影并提升了感知质量。

Comments accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23377 2026-02-24 cs.CV cs.AI cs.SD eess.AS 83%

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

JavisDiT:具有层次化时空先验同步的联合音频视频扩散变换器

Kai Liu, Wei Li, Lai Chen, Shengqiong Wu, Yanhao Zheng, Jiayi Ji, Fan Zhou, Jiebo Luo, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 JavisDiT通过层次化时空先验同步机制,实现了高质量的音频视频同步生成,解决了现实场景中的同步评估问题。

Comments Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07399 2026-02-24 cs.CV cs.LG 79%

StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation

StreamDiffusionV2:动态交互视频生成的流式系统

Tianrui Feng, Zhi Li, Shuo Yang, Haocheng Xi, Muyang Li, Xiuyu Li, Lvmin Zhang, Keting Yang, Kelly Peng, Song Han, Maneesh Agrawala, Kurt Keutzer, Akio Kodaira, Chenfeng Xu

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 StreamDiffusionV2通过无训练管道和系统级优化,实现了低延迟、高效率的实时视频生成,支持灵活的去噪步骤和多GPU扩展,推动生成直播的实用化和普及。

Comments Accepted by MLSys 2026. Project Page: http://streamdiffusionv2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06391 2026-02-24 cs.CV 70%

Object-WIPER : Training-Free Object and Associated Effect Removal in Videos

Object-WIPER : 无需训练的对象及关联效果视频去除

Saksham Singh Kushwaha, Sayan Nag, Yapeng Tian, Kuldeep Kulkarni

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 Object-WIPER通过预训练的文本到视频扩散模型实现无需训练的对象及关联效果视频去除,通过创新的去噪方法和新指标在DAVIS和WIPER-Bench上取得优越性能。

Comments Accepted to CVPR 2026. Project Page: https://sakshamsingh1.github.io/object_wiper_webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06336 2026-02-24 cs.CV cs.LG eess.IV 62%

MEt3R: Measuring Multi-View Consistency in Generated Images

MEt3R:测量生成图像的多视图一致性

Mohammad Asim, Christopher Wewer, Thomas Wimmer, Bernt Schiele, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔州信息校园) ETH Zurich(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV

AI总结 MEt3R是一种用于评估生成图像多视图一致性的新指标,通过密集3D重建和特征比较,独立于场景和采样过程,评估生成模型的质量。

Comments Project website: https://geometric-rl.mpi-inf.mpg.de/met3r/ Updated to Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19089 2026-02-24 cs.CV cs.GR cs.LG 57%

Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling

Ani3DHuman:基于自引导随机采样的逼真3D人体动画

Qi Sun, Can Wang, Jiaxiang Shang, Yingchun Liu, Jing Liao

机构 * City University of Hong Kong(香港城市大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Ani3DHuman通过结合运动学动画与视频扩散先验,利用自引导随机采样实现逼真3D人体动画生成。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏