VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
Comments COLM 2024; Project page: https://videodirectorgpt.github.io
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
Comments COLM 2024; Project page: https://videodirectorgpt.github.io
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
Comments Project page at https://www.shengshu-ai.com/vidu
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.MM
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Webpage: https://lumiere-video.github.io/ | Video: https://www.youtube.com/watch?v=wxLr02Dz2Sc
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project Page: https://rq-wu.github.io/projects/LAMP
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments See accompanying website: https://imagen.research.google/video/
TalkVerse:民主化分钟级音频驱动视频生成
机构 * The Chinese University of Hong Kong(香港中文大学) ; Snap Inc.(Snap公司)
专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM
AI总结 TalkVerse通过大规模开放数据和高效模型,实现了分钟级音频驱动视频生成,降低研究门槛,提升生成质量与效率。
Comments open-sourced single-person full-body talking video generation dataset, training code and checkpoints
惊喜强制:长视频生成中该记住什么、何时跳过
机构 * Alaya Lab(阿莱雅实验室) ; The University of Tokyo(东京大学)
专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV
AI总结 研究长视频生成中资源分配问题,提出惊喜强制框架,含惊喜门控内存库、基于优先级的替换和相关性感知路由,以及惊喜感知去噪,实验证明该框架提高了长时一致性、视觉质量并保持实时流吞吐量。
Comments Technical report
GroundShot: 通过实体锚定镜头调度实现视觉一致的多镜头长视频生成
机构 * Fudan University(复旦大学) ; Baidu(百度)
专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV
AI总结 提出GroundShot框架,通过在线构建实体级视觉记忆并调度镜头生成顺序,无需训练即可提升多镜头视频中实体的一致性。
CineLOG: 一种无需训练的电影长视频生成方法
机构 * Sharif University of Technology(沙斐大学)
专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV
AI总结 CineLOG通过构建高质量、平衡的数据集和创新的生成管道,实现了对电影长视频中摄像机轨迹和类型等属性的精准控制,优于现有端到端模型。
专题命中 视频生成 :video generation(title);text-to-video(title);分类 cs.CV
Comments Project page: https://follow-your-pose.github.io/; Github repository: https://github.com/mayuelala/FollowYourPose
用于序列动作视频生成的关键帧锚定身份保留
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 针对身份保留文本到视频生成任务中主体身份保持和动作执行的挑战,提出无训练三阶段管道框架,包括动作感知提示优化、身份保留生成和身份感知推理增强,该方法在官方排行榜上排名第三,性能和通用性强。
视频生成中的运动归因
机构 * NVIDIA ; Princeton University(普林斯顿大学) ; MIT(麻省理工学院) ; University of Michigan(密歇根大学) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 研究视频生成模型中数据对运动影响,提出基于梯度的运动归因框架Motive,通过运动加权损失掩码分离静态外观和时间动态,用于研究微调剪辑对时间动态的影响及指导数据策划,提升视频运动质量。
Comments See the project website at https://research.nvidia.com/labs/sil/projects/MOTIVE/
面向内存高效的自回归视频生成:基于实例特定参数吸收
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; The University of Hong Kong(香港大学) ; AMAP, Alibaba Group(阿里巴巴集团高德地图)
专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM
AI总结 提出ISPA框架,通过将历史上下文吸收到模型权重中,将部分注意力层从全局注意力转换为局部注意力,在保持视觉质量的同时减少50%的KV缓存。
Comments ECCV 2026 Camera Ready
Echo-Infinity: 学习演化记忆用于实时无限视频生成
机构 * The Chinese University of Hong Kong(香港中文大学) ; Joy Future Academy, JD(京东探索研究院) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 提出Echo-Infinity框架,通过可学习的演化记忆以恒定成本动态过滤、抽象和压缩任意长度历史,结合统一相对RoPE方案,首次实现24小时实时无限视频生成。
Comments Website: https://echo-team-joy-future-academy-jd.github.io/Echo-Infinity/
UniVid:金字塔扩散模型用于高质量视频生成
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。
通过文本到骨骼级联实现可控的复杂人类运动视频生成
机构 * Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) ; Munich Center for Machine Learning (MCML) and Technical University of Munich (TUM)(慕尼黑机器学习中心(MCML)和技术大学慕尼黑(TUM)) ; School of Information Technology, Murdoch University(信息科技学院,墨尔本大学) ; Department of Electrical, Electronics and Computer Engineering, The University of Western Australia(电子、电子与计算机工程系,西澳大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本文提出通过文本到骨骼级联框架生成可控复杂人类运动视频,解决文本条件模糊和姿态控制成本高的问题,引入合成数据集并展示模型在多个指标上的优越性能。
EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架
机构 * Alibaba Cloud(阿里云)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。
Comments 10 pages, 8 figures, ACM MM 2025
LayerT2V: 一个统一的多层视频生成框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; Hong Kong Polytechnic University(香港理工大学) ; OPPO Research Institute(OPPO研究院) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 LayerT2V通过统一的多层视频生成框架,实现了多层输出并提升了视频生成的语义一致性和时间一致性。
Comments Project Page is https://layert2v.github.io/
机构 * Purdue University(普渡大学) ; Baidu USA(百度美国公司) ; University of Rochester(罗切斯特大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments Accepted by CVPR 2025 AI4CC Workshop
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、eess.IV
Comments Project Page: https://snap-research.github.io/SF-V
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、eess.IV
Comments Accepted by ECCV2024. Project page: https://jingyunliang.github.io/MoVideo
专题命中 视频生成 :video generation(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM
Comments 16 pages, 10 figures, 4 tables
超越文本条件:面向视频生成的MLLM-DiT融合系统研究
机构 * Chinese Academy of Sciences(中国科学院) ; Microsoft Research(微软研究院) ; Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。
SafeCA:用于文本到视频越狱防御的安全交叉注意力定位与调控
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
AI总结 SafeCA是一种特征级T2V越狱防御机制,通过分析交叉注意力特征差异提出,可降低主流模型越狱成功率约20%,仅增0.1s推理开销且保持语义一致性,提供架构级可部署防护范式。
Comments 10 pages, 4 figures
流强制:构建用于鲁棒流视频生成的统一训练轨迹
机构 * Huazhong University of Science & Technology(华中科技大学) ; Horizon Robotics(地平线机器人) ; Anyverse Dynamics
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。
Comments 15 pages,6 figures
VideoCoCo:基于智能体双引擎系统的、以代码为思维链(CoT)的物理一致性视频生成方法
机构 * CUHK(香港中文大学) ; USTC(中国科学技术大学) ; SCUT(华南理工大学) ; HKU(香港大学) ; NTU(南洋理工大学) ; PKU(北京大学) ; SJTU(上海交通大学) ; CMU(卡内基梅隆大学) ; THU(清华大学) ; HUST(华中科技大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 VideoCoCo作为智能体双引擎框架,以可执行Blender代码为过程级思维链,构建专属数据集提升视频编辑器适配性,在两个基准上显著优于基线,实现了高质量物理一致性视频生成。
Comments 15 pages, 3 figures, and 3 tables