arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-04 至 2026-03-04 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 6 篇

2603.02882 2026-03-04 cs.CV 83%

SIGMark: Scalable In-Generation Watermark with Blind Extraction for Video Diffusion

SIGMark: 用于视频扩散模型的可扩展生成内水印与盲提取

Xinjie Zhu, Zijing Zhao, Hui Jin, Qingxiao Guo, Yilong Ma, Yunhao Wang, Xiaobing Guo, Weifeng Zhang

机构 * Lenovo Research(联想研究院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 SIGMark是一种用于视频扩散模型的可扩展生成内水印框架,通过盲提取技术实现无损水印并提升鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17561 2026-03-04 cs.CV cs.AI 83%

Model Already Knows the Best Noise: Bayesian Active Noise Selection via Attention in Video Diffusion Model

模型已知最佳噪声:通过注意力的贝叶斯主动噪声选择在视频扩散模型中

Kwanyoung Kim, Sanghyun Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合系,光州科学技术院) Samsung Research(三星研究所)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 通过注意力机制的贝叶斯主动噪声选择方法,提升视频扩散模型的生成质量与时间一致性。

Comments Cam ready version of ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07177 2026-03-04 cs.CV cs.AI 79%

Frame Guidance: Training-Free Guidance for Frame-Level Control in Video Diffusion Models

帧引导:基于帧级信号的无训练引导用于视频扩散模型的可控生成

Sangwon Jang, Taekyung Ki, Jaehyeong Jo, Jaehong Yoon, Soo Ye Kim, Zhe Lin, Sung Ju Hwang

机构 * KAIST(韩国国立科学技术院) NTU Singapore(南洋理工大学) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 帧引导通过帧级信号实现无训练的视频生成控制,支持多种任务如关键帧引导、风格化和循环,无需训练即可生成高质量视频。

Comments ICLR 2026. Project page: https://frame-guidance-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02256 2026-03-04 cs.CV 57%

CamDirector: Towards Long-Term Coherent Video Trajectory Editing

CamDirector: 向长期一致的视频轨迹编辑迈进

Zhihao Shi, Kejia Yin, Weilin Wan, Yuhongze Zhou, Yuanhao Yu, Xinxin Zuo, Qiang Sun, Juwei Lu

机构 * McMaster University(麦克 master 大学) University of Toronto(多伦多大学) The University of Hong Kong(香港大学) McGill University(麦吉尔大学) Concordia University(Concordia 大学) MBZUAI

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 CamDirector通过混合变形方案和历史引导的自回归扩散模型,实现长期一致的视频轨迹编辑,并提出新的VTE基准iPhone-PTZ。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16397 2026-03-04 cs.CV 57%

Scale-wise Distillation of Diffusion Models

扩散模型的分层蒸馏

Nikita Starodubcev, Ilya Drobyshevskiy, Denis Kuznedelev, Artem Babenko, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) HSE University(俄罗斯高等经济大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SwD通过分层蒸馏框架提升扩散模型效率,引入MMD补丁级目标改进收敛性,实现更快采样和更高性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02646 2026-03-04 cs.RO 50%

Compositional Visual Planning via Inference-Time Diffusion Scaling

通过推理时扩散缩放进行组合式视觉规划

Yixin Zhang, Yunhao Luo, Utkarsh Aashu Mishra, Woo Chul Shin, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Michigan(密歇根大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出通过推理时扩散缩放进行组合式视觉规划,利用Tweedie估计强制边界一致,实现长时间范围的稳定规划。

详情

展开后加载摘要…

URL PDF HTML 收藏