arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-01 至 2026-05-01 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2604.27322 2026-05-01 cs.CV 57%

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

YOSE: 你只选择本质的标记以实现高效的DiT基于视频对象移除

Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Huawei Noah’s Ark Lab(华为诺亚实验室) NKIARI, Shenzhen Futian(深圳南山研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 YOSE通过引入BVI和DiffSim模块,实现了高效的DiT视频对象移除,通过动态选择关键标记和模拟扩散过程,使推理时间与遮挡区域线性相关,从而在70%的情况下达到2.5倍的加速,同时保持视觉质量。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27871 2026-05-01 cs.GR 50%

D-Rex : Diffusion Rendering for Relightable Expressive Avatars

D-Rex:基于扩散的可重新照明表达性人体虚拟角色

Timo Teufel, Xilong Zhou, Umar Iqbal, Jan Kautz, Marc Habermann, Vladislav Golyanik, Christian Theobalt

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 D-Rex提出一种人特定框架,实现真实感、可重新照明、表达性和可动画化的全身体虚拟角色,通过图像空间后处理实现与虚拟角色建模的解耦,优于基于物理的可重新照明虚拟角色基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27443 2026-05-01 cs.LG cs.AI 50%

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

ABC:通过非马尔可夫扩散桥实现连续时间和空间中的任意子集自回归

Gabe Guo, Thanawat Sornwanee, Lutong Hao, Elon Litman, Stefano Ermon, Jose Blanchet

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ABC模型,通过非马尔可夫扩散桥在连续时间和空间中实现任意子集的自回归,解决了传统方法在结构相似性捕捉、噪声注入和条件化任意子集方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏