arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-08 至 2026-05-08 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 5 篇

2605.06658 2026-05-08 cs.CV 57%

Relit-LiVE: Relight Video by Jointly Learning Environment Video

Relit-LiVE: 通过联合学习环境视频实现视频照明

Weiqing Xiao, Hong Li, Xiuyu Yang, Houyuan Chen, Wenyi Li, Tianqi Liu, Shaocong Xu, Chongjie Ye, Hao Zhao, Beibei Wang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Relit-LiVE通过引入原始参考图像和环境视频预测方法,实现了无需相机姿态先验知识的物理一致视频照明,提升了真实场景下的照明效果和时间稳定性。

Comments Accepted at SIGGRAPH 2026. Project site: https://github.com/zhuxing0/Relit-LiVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06388 2026-05-08 cs.CV cs.LG cs.RO 57%

Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models

重建还是语义?什么使潜在空间对机器人世界模型有用

Nilaksh, Saurav Jha, Artem Zholus, Sarath Chandar

机构 * Chandar Research Lab(昌达尔研究实验室) Mila – Quebec AI Institute(魁北克人工智能研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文评估了不同潜在空间在机器人世界模型中的有效性,发现语义潜在空间在规划和下游政策性能方面优于重建潜在空间。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26694 2026-05-08 cs.RO cs.AI cs.CV 57%

Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

从视频先验构建统一的4D世界动作模型

Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, Huaping Liu

机构 * Tsinghua University(清华大学) Xiaomi Robotics(小米机器人) Peking University(北京大学) CASIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出X-WAM,统一了实时机器人动作执行与高保真的4D世界合成,在单一框架中解决传统统一世界模型仅建模2D像素空间且无法平衡动作效率与世界建模质量的问题。

Comments Project website: https://sharinka0715.github.io/X-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19202 2026-05-08 cs.CV 57%

UniE2F: A Unified Diffusion Framework for Event-to-Frame Reconstruction with Video Foundation Models

UniE2F: 一种基于视频基础模型的统一扩散框架用于事件到帧重建

Gang Xu, Zhiyu Zhu, Junhui Hou

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Department of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学系)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出UniE2F框架,利用预训练视频扩散模型的生成先验,从稀疏事件数据中重建高保真视频帧,通过引入事件基帧间残差引导提升重建精度,并扩展到零样本视频帧插值与预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07322 2026-05-08 cs.RO cs.AI 50%

Action-to-Action Flow Matching

动作到动作流匹配

Jindou Jia, Gen Li, Xiangyu Chen, Tuo An, Yuxuan Hu, Jingliang Li, Xinying Guo, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出A2A方法,通过利用前一动作的本体感知信息进行初始化,避免了随机噪声采样带来的高延迟问题,提升了动作生成的效率和鲁棒性。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏