arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-09 至 2026-04-09 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2603.17812 2026-04-09 cs.CV cs.AI cs.LG 83%

ChopGrad: Pixel-Wise Losses for Latent Video Diffusion via Truncated Backpropagation

ChopGrad:通过截断反向传播实现基于像素的潜在视频扩散模型

Dmitriy Rivkin, Parker Ewen, Lili Gao, Julian Ost, Stefanie Walz, Rasika Kangutkar, Mario Bijelic, Felix Heide

机构 * Torc Robotics Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出ChopGrad,通过截断反向传播减少视频生成的内存消耗,实现高效的像素级损失微调,适用于视频超分辨率、修复和增强等任务。

Comments Project website: https://light.princeton.edu/chopgrad

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07026 2026-04-09 cs.CV 70%

Not all tokens contribute equally to diffusion learning

并非所有标记对扩散学习贡献相等

Guoqing Zhang, Lu Shi, Wanru Xu, Linna Zhang, Sen Wang, Fangfang Wang, Yigang Cen

机构 * School of Mechanical Engineering, Guizhou University, Guizhou, China(贵州大学机械工程学院) School of Information Science and Technology, Hangzhou Normal University, Zhejiang, China(杭州师范大学信息科学与技术学院)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出DARE框架,通过分布偏见缓解和空间一致性提升扩散模型的语义引导,解决训练数据长尾分布和交叉注意力空间对齐问题,提升文本到视频生成的准确性和语义对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19121 2026-04-09 cs.CV cs.AI 70%

MSG Score: Automated Video Verification for Reliable Multi-Scene Generation

MSG Score: 多场景生成的自动化视频验证

Daewon Yoon, Hyeongseok Lee, Wonsik Shin, Sangyu Han, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出MSG Score用于评估长视频生成的叙事和视觉一致性,结合Implicit Insight Distillation解决评估与推理速度的平衡,实现可靠且可扩展的视频生成。

Comments 8 pages, 5 figures, 1 table, Accepted AAAI 2026 CVM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏