VGMShield: Mitigating Misuse of Video Generative Models
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
Comments 18 pages
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
Comments 18 pages
机构 * Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学) ; Department of Automation, Tsinghua University(自动化系,清华大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments Project page: https://liuff19.github.io/DreamCinema
机构 * Hong Kong University of Science(香港科学与技术大学) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
机构 * Stony Brook University(石溪布鲁克大学) ; Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
Comments MICCAI 2025 Early Accept. First two authors contributed equally
专题命中 视频生成 :long video(abstract);分类 cs.CV、cs.MM
Comments 18 pages, 16 figures
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM
Comments Accepted at ICLR 2025. Code: https://github.com/boschresearch/VSTAR and project page: https://yumengli007.github.io/VSTAR
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
Comments 16 pages
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments Published in Transactions on Machine Learning Research (TMLR 2024) (11/2024)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM
Comments Accepted for EMNLP 2024 (Demo track)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
Comments "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM
Comments 19 pages, 24 figures (65 images)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments Project page: https://ai-forever.github.io/Kandinsky-3
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments PhD thesis
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
Comments 5 pages, 3 figures
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments 22 pages, 13 figures
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
Comments ICPR 2022
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments 4 pages, 4 figures, ICIP 2022
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
Comments ACM MM 2021
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
Comments 9 pages, 7 tables, 4 figures
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
MAViS:一个用于长序列视频叙事的多智能体框架
机构 * Virginia Tech(弗吉尼亚理工大学) ; Nanyang Technological University(南洋理工大学) ; Eyeline Studios(Eyeline工作室)
专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV
AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。
Comments Video Generation Agent
机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) ; ByteDance(字节跳动)
专题命中 视频生成 :video generation(abstract);分类 cs.CV;video understanding(comments)
Comments NeurIPS 2025. (v3: update to include video understanding, OneIG, and more ablation study results)
专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV
Comments This paper should be a refined version of arXiv:2412.02259, "VideoGen-of-Thought: A Collaborative Framework for Multi-Shot Video Generation", but I mistakenly submit it as a new paper
Qwen-Video-Edit:通过复用图像编辑模型实现基于指令的视频编辑
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; Reve(Reve公司)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV
AI总结 该研究提出Qwen-Video-Edit,通过复用Qwen-Image-Edit图像编辑模型,经少量适配实现基于指令的视频编辑,证明图像编辑先验可迁移至视频编辑任务。
Comments Project Page: https://yunpeng1998.github.io/Qwen-Video-Edit-Page Code: https://github.com/yunpeng1998/Qwen-Video-Edit Model: https://huggingface.co/yunpeng1998/Qwen-Video-Edit
SimWAM:一种用于端到端自动驾驶的简单世界动作模型
机构 * Huazhong University of Science & Technology(华中科技大学) ; Dongfeng Research & Development Institute(东风研发院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。
Comments The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/
DrivingWorld:通过视频GPT构建自动驾驶领域的世界模型
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出名为DrivingWorld的自动驾驶GPT风格世界模型,通过时空融合等策略提升视频生成质量与时长,实现更优的可控未来视频生成效果。
Journal ref ICPR 2026