arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-15 至 2026-05-15 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 6 篇

2605.14136 2026-05-15 cs.CV 85%

TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion

TeDiO:基于时间对角优化的训练自由一致视频扩散

Nurislam Tursynbek, Zhiqiang Lao, Heather Yu, Gedas Bertasius, Marc Niethammer

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Futurewei Technologies Inc(未来科技有限公司) UCSD(加州大学圣迭戈分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 TeDiO通过优化内部注意力模式提升视频生成的时序一致性,无需训练或外部监督,实现更流畅的动态表现。

Comments CVPR'26 Workshop on Agentic AI for Visual Media

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14274 2026-05-15 cs.CV 79%

CreFlow: Corrective Reflow for Sparse-Reward Embodied Video Diffusion RL

CreFlow:稀疏奖励具身视频扩散强化学习的纠正回流

Zhenyang Ni, Yijiang Li, Ruochen Jiao, Simon Sinong Zhan, Sipeng Chen, Zhenfei Yin, Minshuo Chen, Philip Torr, Zhaoran Wang, Qi Zhu

机构 * Northwestern University(西北大学) University of California, San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出CreFlow框架,通过信用感知NFT损失和纠正回流损失提升高维视频生成性能,有效解决稀疏奖励下的具身任务执行问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13857 2026-05-15 cs.GR cs.CV cs.LG 74%

MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

MoZoo:释放视频扩散在动物毛发和肌肉模拟中的潜力

Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

机构 * tabular c 1 Tsinghua University 2 University of Glasgow 3 The Chinese University of Hong Kong 4 HUIJING Digital Media \& Entertainment Group 2mm Project Page: tabular

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 MoZoo通过引入Role-Aware RoPE和Asymmetric Decoupled Attention,实现高保真动物视频生成,同时构建了MoZoo-Data和MoZooBench进行评估,提升了毛发和肌肉动态模拟的效率与质量。

Comments Github Page:https://dongxialiu15.github.io/MoZoo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15190 2026-05-15 cs.CV 57%

RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO

RAVEN: 实时自回归视频外推与一致性模型GRPO

Yanzuo Lu, Ronglai Zuo, Jiankang Deng

机构 * Imperial College London(伦敦帝国学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 RAVEN通过将自回归视频扩散模型的训练与测试过程结合,提升长时视频生成质量。CM-GRPO方法优化一致性采样,提高生成效果。

Comments Project Page: https://yanzuo.lu/raven

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14894 2026-05-15 cs.CV 57%

SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer

SEDiT: 一种基于单步扩散变换器的无掩膜视频字幕擦除方法

Zheng Hui, Yunlong Bai

机构 * Baidu Inc.(百度公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SEDiT提出一种单步扩散变换器方法,实现无掩膜视频字幕擦除,通过理论证明和实验验证,解决字幕擦除中的局部编辑问题和长期时间一致性挑战。

Comments Project page:http://zheng222.github.io/SEDiT_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14191 2026-05-15 cs.CV 57%

CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers

CoReDiT:基于空间一致性引导的令牌剪枝与重建用于高效的扩散变换器

Zhuojin Li, Hsin-Pai Cheng, Hong Cai, Shizhong Han, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 CoReDiT通过空间一致性引导的令牌剪枝与重建,显著降低扩散变换器的计算量,提升推理速度,同时保持高质量视觉输出。

Comments 8 pages, 8 figures, CVPR workshop

Journal ref 2026 CVPR Workshop of EDGE

详情

展开后加载摘要…

URL PDF HTML 收藏