Flexible Diffusion Modeling of Long Videos
专题命中 视频扩散模型 :long video(title,abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :long video(title,abstract);分类 cs.CV
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
Comments NeurIPS 2022 ; 10 pages, 4 figures, 7 tables
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV、cs.MM
Comments 16 pages, 8 figures, 11 tables
CODA:通过启用NMP的计算-缓存算子分解实现边缘视频扩散的算法-硬件协同设计
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 研究在边缘设备部署视频扩散模型时速度慢的问题,提出CODA架构,通过计算-缓存算子分解,分离计算与缓存路径、重组缓存活动并利用分支独立性,实现端到端加速和能源效率提升,且保持生成质量。
Comments 15 pages, 14 figures, accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)
Kaleido:通过利用潜在空间相关性对视频扩散变压器进行算法-硬件协同设计
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Jiao Tong University, Shanghai Qi Zhi Institute(上海交通大学、上海颀智研究所) ; Huawei Technologies(华为技术有限公司) ; ICT, Chinese Academy of Sciences(信息科技研究所、中国科学院)
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 针对视频扩散变压器计算成本高的问题,提出Kaleido算法-硬件协同设计,利用潜在空间通道级时空相关性加速操作,有轻量级重用算法,设计了加速器,实验表明其相比现有加速器有显著加速和节能效果。
通过视频扩散模型实现目标驱动的奖励用于强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) ; Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) ; Zhongguancun Academy(中关村学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。
Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward
Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) ; AI 2 Robotics(AI与机器人) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。
基于物理的视频扩散用于浅水方程
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 本文提出一种结合物理约束的视频扩散框架,直接在生成过程中整合物理定律,实现同时预测物理状态和真实视频,提升生成视频的物理合理性和效率。
Comments 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing
Vidarc:用于闭环控制的具身视频扩散模型
机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 Vidarc 提出了一种基于视频扩散的具身模型,通过掩码反向动力学模型实现快速准确的闭环控制,提升了现实部署中的成功率和效率。
通过视频表示正则化缓解复合误差
机构 * Peking University(北京大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。
生成器即跟踪器:通过绘制持久身份颜色进行多目标跟踪
机构 * Cornell University(康奈尔大学)
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
AI总结 研究多目标跟踪问题,核心方法是用轻量级LoRA微调文本到视频扩散模型生成带持久身份颜色的视频,无需传统跟踪组件。主要贡献是在DanceTrack测试服务器上达到40.3 HOTA,有独特错误分布,颜色分配可在遮挡后重新识别身份。
FlashDecoder:基于Transformer的实时潜空间到像素流解码器
机构 * Pika Labs(皮卡实验室) ; POSTECH(浦项科技大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 研究针对实时视频生成中潜视频扩散模型解码慢、内存占用大的问题,提出FlashDecoder,一种基于Transformer的纯视频解码器,通过滚动KV缓存和顺序处理帧实现快速解码,在重建质量匹配卷积解码器的同时大幅提升速度并减少内存占用。
Comments CVPR2026
Vera: 一种用于内容保持视频编辑的分层扩散模型
机构 * California Institute of Technology(加州理工学院) ; Netflix, Inc(Netflix公司)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出Vera分层扩散框架,通过生成编辑层和alpha遮罩与源视频合成,利用混合Transformer架构和高质量分层数据集,在保持内容的同时实现高质量编辑。
视频模型可以借助可验证的奖励进行推理
机构 * University of California, Davis(加州大学戴维斯分校) ; Microsoft Research(微软研究院) ; University of Southern California(南加州大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);video reasoning(abstract);分类 cs.CV
AI总结 本文提出VideoRLVR方法,通过规则反馈优化视频扩散模型,提升可验证推理能力,在Maze、FlowFree和Sokoban任务中优于监督微调基线,证明可验证RL能推动视频模型超越感知模仿。
Comments Website: https://darthzhu.github.io/VideoRLVR-page/
Inferix:基于块扩散的下一代世界模拟推理引擎
机构 * Inferix Team(Inferix 团队)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 Inferix 是一种基于块扩散的下一代推理引擎,通过优化半自回归解码过程实现沉浸式世界合成,支持交互式视频流和性能分析,结合 LV-Bench 提供高效评估。
GenHSI: 可控生成人类-场景交互视频
机构 * Brown University(布朗大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 GenHSI提出一种无需训练的可控生成长人类-场景交互视频方法,通过剧本写作、预可视化和动画三阶段生成3D-aware视频,保留人物身份并提供合理交互。
GRAN-TED: 生成稳健、对齐且细腻的文本嵌入以用于扩散模型
机构 * Peking University(北京大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Xi’an Jiaotong University(西安交通大学) ; School of Artificial Intelligence, UCAS(清华大学人工智能学院)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 GRAN-TED提出了一种生成稳健、对齐且细腻的文本嵌入以用于扩散模型的范式,通过TED-6K基准提升文本编码器性能,显著加快扩散模型训练速度。
机构 * Sun Yat-sen University(中山大学) ; Kuaishou Technology(快手科技) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project Page: https://yuzhou914.github.io/ConceptMaster/. Update and release MCVC Evaluation Set
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments ICLR 2025; Project page: https://vibidsampler.github.io/
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments AAAI 2025, Project page: https://geonyeong-park.github.io/spectral-motion-alignment/
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
Comments Project released at: https://github.com/TencentARC/Divot
专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
Comments Project Page: https://jjihwan.github.io/projects/FIFO-Diffusion
Journal ref NeurIPS 2024
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
Comments CVPR 2023. Project page: https://sihyun.me/PVDM
视频扩散模型能否预测过去帧?双向循环一致性用于可逆插值
机构 * School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) ; School of Computer and Information Science, Hefei University of Technology(合肥工业大学计算机与信息科学学院) ; Faculty of Science and Technology, University of Macau(澳门大学科技学院)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV、cs.MM
AI总结 本文提出双向循环一致性框架,通过双向生成轨迹对称性提升视频插值的时序一致性,实验表明在37帧和73帧任务中取得最佳性能。
UniAnimate-DiT:基于大规模视频扩散变换器的人像图像动画
机构 * Key Laboratory of Image Processing and Intelligent Control, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学图像处理与智能控制重点实验室,人工智能与自动化学院) ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV、cs.MM
AI总结 本文提出UniAnimate-DiT,利用Wan2.1模型实现一致的人像动画,通过LoRA技术优化参数,设计轻量姿态编码器并整合参考外观,实验表明其能生成高质量且时间一致的动画,支持从480p到720P的超分辨率。
Comments The training and inference code (based on Wan2.1) is available at https://github.com/ali-vilab/UniAnimate-DiT
EchoLVFM: 通过潜在流匹配实现单步视频生成用于超声心动图合成
专题命中 视频扩散模型 :video generation(title);分类 cs.CV、eess.IV
AI总结 本文提出EchoLVFM框架,通过潜在空间单步生成可控的超声心动图视频,提升效率并保持视觉质量,实验证明其在单帧条件下的视频质量与专家判断准确率。
Comments Submitted to MICCAI 2026; Under Review
专题命中 视频扩散模型 :video generation(title);分类 cs.CV、cs.MM
Comments ICLR 2025