AV-DiT: Efficient Audio-Visual Diffusion Transformer for Joint Audio and Video Generation
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
Comments Project page: https://liuff19.github.io/Physics3D
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
Comments Project page: https://vita-group.github.io/Diffusion4D
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
Comments Project page: https://sv3d.github.io/
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
Comments Code available at https://github.com/heheyas/V3D Project page: https://heheyas.github.io/V3D/
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV
Comments Published in MICCAI 2023 proceedings. https://link.springer.com/chapter/10.1007/978-3-031-43999-5_14
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
Comments Project page: https://jgkwak95.github.io/ViVid-1-to-3/
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV
Comments Accepted to CVPR2023
专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV
Comments Accepted by CVPR 2023
专题命中 视频扩散模型 :long video(title,abstract);分类 cs.CV
专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV
Comments NeurIPS 2022 ; 10 pages, 4 figures, 7 tables
专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV、cs.MM
Comments 16 pages, 8 figures, 11 tables
CODA:通过启用NMP的计算-缓存算子分解实现边缘视频扩散的算法-硬件协同设计
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 研究在边缘设备部署视频扩散模型时速度慢的问题,提出CODA架构,通过计算-缓存算子分解,分离计算与缓存路径、重组缓存活动并利用分支独立性,实现端到端加速和能源效率提升,且保持生成质量。
Comments 15 pages, 14 figures, accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)
Kaleido:通过利用潜在空间相关性对视频扩散变压器进行算法-硬件协同设计
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Jiao Tong University, Shanghai Qi Zhi Institute(上海交通大学、上海颀智研究所) ; Huawei Technologies(华为技术有限公司) ; ICT, Chinese Academy of Sciences(信息科技研究所、中国科学院)
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 针对视频扩散变压器计算成本高的问题,提出Kaleido算法-硬件协同设计,利用潜在空间通道级时空相关性加速操作,有轻量级重用算法,设计了加速器,实验表明其相比现有加速器有显著加速和节能效果。
通过视频扩散模型实现目标驱动的奖励用于强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) ; Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) ; Zhongguancun Academy(中关村学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。
Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward
Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) ; AI 2 Robotics(AI与机器人) ; Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。
基于物理的视频扩散用于浅水方程
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 本文提出一种结合物理约束的视频扩散框架,直接在生成过程中整合物理定律,实现同时预测物理状态和真实视频,提升生成视频的物理合理性和效率。
Comments 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing
Vidarc:用于闭环控制的具身视频扩散模型
机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学)
专题命中 视频扩散模型 :video diffusion(title,abstract)
AI总结 Vidarc 提出了一种基于视频扩散的具身模型,通过掩码反向动力学模型实现快速准确的闭环控制,提升了现实部署中的成功率和效率。
通过视频表示正则化缓解复合误差
机构 * Peking University(北京大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。
生成器即跟踪器:通过绘制持久身份颜色进行多目标跟踪
机构 * Cornell University(康奈尔大学)
专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV
AI总结 研究多目标跟踪问题,核心方法是用轻量级LoRA微调文本到视频扩散模型生成带持久身份颜色的视频,无需传统跟踪组件。主要贡献是在DanceTrack测试服务器上达到40.3 HOTA,有独特错误分布,颜色分配可在遮挡后重新识别身份。
FlashDecoder:基于Transformer的实时潜空间到像素流解码器
机构 * Pika Labs(皮卡实验室) ; POSTECH(浦项科技大学)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 研究针对实时视频生成中潜视频扩散模型解码慢、内存占用大的问题,提出FlashDecoder,一种基于Transformer的纯视频解码器,通过滚动KV缓存和顺序处理帧实现快速解码,在重建质量匹配卷积解码器的同时大幅提升速度并减少内存占用。
Comments CVPR2026
Vera: 一种用于内容保持视频编辑的分层扩散模型
机构 * California Institute of Technology(加州理工学院) ; Netflix, Inc(Netflix公司)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV
AI总结 提出Vera分层扩散框架,通过生成编辑层和alpha遮罩与源视频合成,利用混合Transformer架构和高质量分层数据集,在保持内容的同时实现高质量编辑。
视频模型可以借助可验证的奖励进行推理
机构 * University of California, Davis(加州大学戴维斯分校) ; Microsoft Research(微软研究院) ; University of Southern California(南加州大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);video reasoning(abstract);分类 cs.CV
AI总结 本文提出VideoRLVR方法,通过规则反馈优化视频扩散模型,提升可验证推理能力,在Maze、FlowFree和Sokoban任务中优于监督微调基线,证明可验证RL能推动视频模型超越感知模仿。
Comments Website: https://darthzhu.github.io/VideoRLVR-page/
Inferix:基于块扩散的下一代世界模拟推理引擎
机构 * Inferix Team(Inferix 团队)
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV
AI总结 Inferix 是一种基于块扩散的下一代推理引擎,通过优化半自回归解码过程实现沉浸式世界合成,支持交互式视频流和性能分析,结合 LV-Bench 提供高效评估。