arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-28 至 2026-07-28 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 1 篇

2607.21848 2026-07-28 cs.CV 版本更新 57%

Closing the Loop: Training-Free Revisit Consistency for Autoregressive Generative Rendering

闭环:自回归生成渲染的无训练重访一致性

Wenchao Ma, Changran Liu, Sharon X. Huang, Haomiao Jiang

机构 * Roblox(罗布乐思) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 研究自回归生成渲染中相机重访位置时的不一致问题,利用3D引擎提供的时间和空间对应关系,将姿态匹配的历史潜在块检索到KV缓存,并使注意力偏向对应区域,在相关数据集上实验,提升了重访一致性且不损失视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 2 篇

2607.06173 2026-07-28 cs.CV 版本更新 83%

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan:弥合移动视频扩散的质量差距

Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 研究旨在弥合移动视频扩散质量差距,提出将5B参数视频扩散Transformer通过循环重公式化等方法高效部署在移动硬件上,经多种优化,成为首个可商用移动设备部署的该规模模型,取得新的端到端延迟和分数,建立移动视频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12940 2026-07-28 cs.CV 版本更新 70%

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

循环自回归扩散:全局记忆与局部注意力相结合

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

机构 * Peking University(北京大学) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。

Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏