TransPixeler: Advancing Text-to-Video Generation with Transparency
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments Project page: https://wileewang.github.io/TransPixar/
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments Project page: https://wileewang.github.io/TransPixar/
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments 22 pages, 14 figures, 11 tables
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments Accepted at NeurIPS 2024, code available at https://github.com/PR-Ryan/DEMO
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments (NeurIPS 2024 Spotlight) Project page at https://jianzongwu.github.io/projects/motionbooth
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV
Comments Preprint
机构 * Apple(苹果公司) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV、cs.MM
机构 * DAMO Academy, Alibaba Group(阿里达摩院) ; Hupan Lab(华盘实验室) ; INSAIT ; Zhejiang University(浙江大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV、eess.IV
Comments Project page: https://jingyunliang.github.io/RealisMotion
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV、eess.IV
Comments CVPR 2025 (poster); project page: https://motionprompt.github.io/
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV、eess.IV
Comments technical report
专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV
Comments Homepage: https://www.amd.com/en/developer/resources/technical-articles/amd-hummingbird-0-9b-text-to-video-diffusion-model-with-4-step-inferencing.html| GitHub: https://github.com/AMD-AIG-AIMA/AMD-Hummingbird-T2V
SCMAPR: 自校正多智能体提示精修用于复杂场景文本到视频生成
机构 * HiThink Research(HiThink研究院) ; East China Normal University(华东师范大学) ; Guangzhou University(广州大学) ; Tsinghua University(清华大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title)
AI总结 本文提出SCMAPR框架,通过多智能体分阶段精修提升复杂场景下的文本到视频生成质量,实验表明在VBench和EvalCrafter等基准上平均得分提升显著。
机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新技术实验室,自动化研究所,中国科学院(CASIA)) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Kuaishou Technology(快手科技) ; Nanjing University(南京大学)
专题命中 视频生成 :text-to-video(title,abstract);video generation(title)
Comments Accepted to Findings of ACL 2025
SQuad:用于高效视频生成的次二次注意力蒸馏
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对视频扩散Transformer自注意力的二次复杂度瓶颈,提出SQuad次二次注意力蒸馏框架,通过两阶段蒸馏适配预训练模型,在保持生成质量的同时大幅提升效率。
用于快速图像和视频生成的并行解码蒸馏
机构 * NVIDIA(英伟达) ; Weizmann Institute of Science(魏茨曼科学研究所)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对视频扩散或流模型生成计算昂贵问题,提出并行解码蒸馏方法PDD,兼容预训练模型,通过预测多去噪步骤加速生成,在多个数据集上达SOTA性能,提升视频多样性。
Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成
机构 * Brown University(布朗大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Meta
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。
用于快速视频生成的过渡匹配蒸馏
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 研究针对大型视频模型多步采样低效问题,提出过渡匹配蒸馏框架TMD,将扩散模型多步去噪轨迹与少步概率过渡过程匹配,分解扩散主干为组件,经实验验证TMD在速度和质量权衡上表现出色,优于现有蒸馏模型。
Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 4645-4655
追踪噪声,移动世界:用于可控视频生成的3D地面运动一致噪声
机构 * Qualcomm AI Research(高通人工智能研究中心) ; Trinity College Dublin(都柏林三一学院)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 研究如何在视频生成中实现对物体和相机运动的精确统一控制。核心方法是构建统一框架UniCaMo,直接构造扩散模型输入噪声。主要贡献是在视频质量和运动可控性上取得先进成果,且无需对基础模型做大改动。
Comments Project Page: https://phongnhhn.info/Unicamo/
数据强制蒸馏:恢复少步视频生成中的多样性和保真度
机构 * University of Michigan(密歇根大学) ; NVIDIA(英伟达) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。
UniTemp: 通过双向蒸馏实现任意时间顺序的视频生成
机构 * University of Wisconsin Madison(威斯康星大学麦迪逊分校) ; Adobe Research(Adobe 研究院) ; University of California Los Angeles(加利福尼亚大学洛杉矶分校) ; University of California Davis(加利福尼亚大学戴维斯分校)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 提出UniTemp框架,通过双向蒸馏训练单个自回归模型,支持任意时间方向(前向、后向、中间插值)的视频生成,解决因果3D VAE在后向生成中的不连续性,提升可控性。
VideoWeave: 通过联合几何-视频建模解锁视频生成中的几何一致性
机构 * Nanjing University(南京大学) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) ; Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出VideoWeave,一种在潜在空间后训练框架,利用隐式几何模型特征约束生成分布,缓解几何重建误差,提升视频几何一致性。
TetherCache: 基于门控召回与可信对齐的自回归长视频生成稳定性方法
机构 * Tsinghua University(清华大学) ; D-INFK, ETH Zürich(苏黎世联邦理工学院计算机科学系)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 提出TetherCache,一种无需训练、即插即用的缓存管理策略,通过门控召回(GRAB)和可信对齐编辑(TAME)缓解自回归视频扩散模型中的上下文漂移,实现稳定长视频生成。
Comments 17 pages, 8 figures
PARE:面向高效视频生成的剪枝与自适应路由
机构 * The University of Sydney(悉尼大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出PARE方法,通过结构感知剪枝压缩宽度和输入自适应路由压缩深度,联合减少视频扩散Transformer的计算量,在Wan2.1-14B上实现每步计算大幅降低且质量保持。
Tempered Self-Similarity Alignment for Physically Plausible Video Generation
机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)
专题命中 视频生成 :video generation(title,title_cn);分类 cs.CV
AI总结 提出Tempered Self-Similarity Alignment (TSA)损失函数,通过将视觉基础模型中的时空自相似性关系知识迁移到视频生成模型中,以改善视频的物理合理性。
Comments Accepted to the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE)
通过混合注意力与解耦蒸馏实现长时域流式视频生成
机构 * The Hong Kong Polytechnic University(香港理工大学) ; ByteDance(字节跳动) ; City University of Hong Kong(香港城市大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出混合强制方法,通过混合注意力设计联合优化时序信息保留与计算效率,采用轻量线性时序注意力和块稀疏注意力,实现高效稳定流式视频生成,实测在单块H100 GPU上达到29.5 FPS的实时832x480视频生成