arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-06 至 2026-08-06 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2511.08633 2026-08-06 cs.CV cs.AI cs.GR cs.LG cs.MM 81%

Time-to-Move: Training-Free Motion Controlled Video Generation via Dual-Clock Denoising

Assaf Singer, Noam Rotstein, Amir Mann, Ron Kimmel, Or Litany

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) NVIDIA(NVIDIA公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19161 2026-08-06 cs.CV 版本更新 74%

Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation

Flash-VAED: 用于高效视频生成的即插即用VAE解码器

Lunjie Zhu, Yushi Huang, Xingtong Ge, Yufei Xue, Zhening Liu, Yumeng Zhang, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05070 2026-08-06 cs.CV 新提交 57%

HelloWorld: Enabling Socially Interactive Characters in Video World Models

HelloWorld:在视频世界模型中实现具有社交互动性的角色

Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato

机构 * The University of Tokyo(东京大学) Alaya Lab(阿莱亚实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究提出HelloWorld视频世界模型,通过自蒸馏流水线和训练模块实现角色与用户的社交互动,构建含400样本的基准,其互动质量优于基线且保持顶尖图像美学。

Comments Project page: https://github.com/AlayaLab/HelloWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04426 2026-08-06 cs.CV cs.CL 新提交 57%

Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

预测再检索:从视频前缀中进行跨实例未来状态检索

Quynh Vo, Thong Nguyen, Vinh-Hien Do, Cong-Duy Nguyen, Anh-Tuan Luu

机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 该研究提出PSR任务,构建含多数据集的基准,提出LFTR模型,发现预测而非感知是核心挑战,LFTR缩小差距且成本低,相关资源已公开。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04224 2026-08-06 cs.CV 新提交 57%

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

OmniVR:用于恢复退化历史影片的联合视频-音频条件生成模型

Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出首个联合音视频生成修复模型OmniVR,通过三项关键设计解决历史影片的音视频共同退化问题,在多类指标上超越现有方法,还发布了相关基准OmniVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏