arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-07-24 至 2026-07-24 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2607.21594 2026-07-24 cs.CV 新提交 70%

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

具有世界状态寄存器的流式多智能体自回归扩散模型

Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。

Comments Project page: https://vail-ucla.github.io/worldweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20628 2026-07-24 cs.CV cs.AI 新提交 70%

RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring

RealVDeblur:用于通用真实世界视频去模糊的一步扩散法

Renbiao Jin, Mingxin Yang, Yutian Chen, Junhao Zhuang, Xin Cai, Mulin Yu, Linning Xu, Wenxian Yu, Danping Zou, Shi Guo, Tianfan Xue

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多媒体实验室) CPII under InnoHK(创新香港研究院下的CPII) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。

Comments Project page with code: https://rbjin.github.io/RealVDeblur/

详情

展开后加载摘要…

URL PDF HTML 收藏