arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-25 至 2026-03-25 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2603.23491 2026-03-25 cs.CV 79%

Foveated Diffusion: Efficient Spatially Adaptive Image and Video Generation

视网膜扩散:高效的视空适应图像和视频生成

Brian Chao, Lior Yariv, Howard Xiao, Gordon Wetzstein

机构 * Stanford University, USA(斯坦福大学,美国)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出视网膜扩散模型,通过非均匀分配token提高生成效率,利用人类视觉的视网膜区域高分辨率特性,在保持视觉质量的同时显著减少token数量和生成时间。

Comments Project website at https://bchao1.github.io/foveated-diffusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03044 2026-03-25 cs.RO 78%

Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling

Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模

Yueru Jia, Jiaming Liu, Shengbang Liu, Rui Zhou, Wanhe Yu, Yuyang Yan, Xiaowei Chi, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) AI 2 Robotics(AI与机器人) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract)

AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23246 2026-03-25 cs.CV 74%

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

GO-Renderer: 基于3D感知的可控视频扩散模型生成物体渲染

Zekai Gu, Shuoxuan Feng, Yansong Wang, Hanzhuo Huang, Zhongshuo Du, Chengfeng Zhao, Chengwei Ren, Peng Wang, Yuan Liu

机构 * HKUST(香港科技大学) VAST(中国航空无线电电子研究所) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) ShanghaiTech University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 本文提出GO-Renderer框架,结合重建的3D模型引导视频生成模型,实现高质物体在任意视角和光照下的渲染,无需显式建模复杂材质和光照。

Comments Project page: https://igl-hkust.github.io/GO-Renderer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23326 2026-03-25 cs.CV 70%

ViBe: Ultra-High-Resolution Video Synthesis Born from Pure Images

ViBe:源自纯图像的超高清视频合成

Yunfeng Wu, Hongying Cheng, Zihao He, Songhua Liu

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Jilin University(吉林大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出纯图像适应框架,通过两阶段LoRA策略提升视频扩散模型生成超高清视频的能力,无需视频训练数据,在VBench基准上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏