arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1298 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1298 篇

2604.02979 2026-08-11 cs.CV 版本更新 83%

Not All Frames Deserve Full Computation: Accelerating Autoregressive Video Generation via Selective Computation and Predictive Extrapolation

并非所有帧都值得完全计算:通过选择性计算和预测外推加速自回归视频生成

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Fanshuai Meng, Weijia Jia, Wei Zhao

机构 * Institute of Artificial Intelligence and Future Networks, Beijing Normal University(北京师范大学人工智能与未来网络研究院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Shenzhen University of Advanced Technology(深圳理工大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出SCOPE框架,通过三模式调度器和选择性计算,提升自回归视频扩散模型效率,在保持质量的同时实现4.73倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10671 2026-08-05 cs.CV 版本更新 83%

FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion

FadeMem: 面向自回归视频扩散的距离感知记忆巩固

Yu Lu, Junjie Yang, Piotr Koniusz, YuXin Song, Yi Yang

机构 * Zhejiang University(浙江大学) University of New South Wales (UNSW)(新南威尔士大学) Data61/CSIRO Baidu Inc(百度公司)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);long video(abstract);分类 cs.CV

AI总结 提出FadeMem,一种距离感知的KV记忆巩固机制,在固定缓存预算下将历史KV块组织成时间层次,通过幂律分配实现近密远疏的记忆,提升长视频生成中的主体一致性和时间连贯性。

Comments 14 pages, 9 figures. Substantially revised manuscript with expanded experiments and integrated supplementary material. Project page: https://fademem.github.io/FadeMem_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21541 2026-08-04 cs.GR cs.CV 版本更新 83%

ControlHair: Synergizing Physics Simulator and Video Diffusion for Controllable Dynamic Hair Rendering

ControlHair:协同物理模拟器与视频扩散实现可控动态毛发渲染

Weikai Lin, Haoxiang Li, Yuhao Zhu

机构 * University of Rochester(罗切斯特大学) Pixocial Technology(Pixocial技术)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 研究针对毛发模拟渲染难题,提出ControlHair框架,融合物理模拟器与视频扩散,通过三阶段管道实现可控动态毛发渲染,性能优于基线并展示多种应用。

Comments Accepted to ECCV 2026. 21 pages. Project page: https://linwk20.github.io/controlhair-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16870 2026-08-03 cs.CV cs.AI 版本更新 83%

Demystifying Video Reasoning

揭秘视频推理

Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang, Ran Ji, Chenyang Gu, Bo Li, Ziqi Huang, Hokin Deng, Dahua Lin, Ziwei Liu, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频扩散模型 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文通过实验揭示视频扩散模型中的推理主要发生在去噪步骤中,提出链式步骤(CoS)机制,并发现工作记忆、自我修正和感知先行等涌现行为,最后提出一种无需训练的集成策略来提升推理能力。

Comments Homepage: https://www.wruisi.com/demystifying_video_reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06173 2026-07-28 cs.CV 版本更新 83%

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan:弥合移动视频扩散的质量差距

Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 研究旨在弥合移动视频扩散质量差距,提出将5B参数视频扩散Transformer通过循环重公式化等方法高效部署在移动硬件上,经多种优化,成为首个可商用移动设备部署的该规模模型,取得新的端到端延迟和分数,建立移动视频生成新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15849 2026-07-20 cs.CV cs.AI 新提交 83%

Test-Time Noise Guided Adaptation for Realistic Autoregressive Video Generation

用于逼真自回归视频生成的测试时噪声引导适应

Dimitrios Karageorgiou, Symeon Papadopoulos, Ioannis Kompatsiaris, Efstratios Gavves

机构 * Information Technologies Institute, CERTH(信息技术研究所,希腊研究与技术中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对自回归视频扩散模型误差积累问题,提出TANGO方法,通过噪声引导优化避免模型陷入终点,在VBench上有显著改进,降低了弗雷歇视频距离。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03509 2026-07-07 cs.CV 新提交 83%

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

Flex-Forcing:迈向统一的自回归和双向视频扩散模型

Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

机构 * NVIDIA(英伟达)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 研究针对现有视频生成方法推理范式僵化的问题,提出Flex-Forcing框架。核心是灵活分块机制,可依设备预算灵活分块,跨块双向推理与块内自回归生成,实验表明该框架提升了视频质量、稳定性并加快推理速度。

Comments Project page: https://research.nvidia.com/labs/genair/flex-forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01677 2026-07-03 cs.CV 新提交 83%

ICDepth: Taming Video Diffusion Models for Video Depth Estimation via In-Context Conditioning

ICDepth: 通过上下文条件化驯服视频扩散模型用于视频深度估计

Xuanhua He, Jiaxin Xie, Mingzhe Zheng, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出ICDepth框架,利用上下文条件化(ICC)将预训练文本到视频扩散Transformer适配到视频深度估计,通过SAND-Attention确保时空对齐和SRFM注入语义分辨率先验,仅用0.8M帧训练数据即达到SOTA并展现强零样本泛化。

Comments Accepted to ECCV 2026. Project page: https://xuanhuahe.github.io/ICDepth/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14526 2026-06-30 cs.CV 83%

LatSearch: Latent Reward-Guided Search for Faster Inference-Time Scaling in Video Diffusion

LatSearch:基于潜在奖励的搜索以加速推理时间扩展在视频扩散中

Zengqun Zhao, Ziquan Liu, Yu Cao, Shaogang Gong, Zhensong Zhang, Jifei Song, Jiankang Deng, Ioannis Patras

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出LatSearch,通过潜在奖励引导的重采样和剪枝机制,提升视频扩散的推理效率和生成质量,验证其在VBench-2.0基准上的优越性。

Comments Accepted at ECCV 2026. Project page: see https://zengqunzhao.github.io/LatSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20310 2026-06-19 cs.CV 新提交 83%

Through the PRISM: Preference Representation in Intermediate States of Video Diffusion Models

通过PRISM:视频扩散模型中间状态中的偏好表示

Haoxuan Wu, Lai Man Po, Mengyang Liu, Kun Li, Hongzheng Yang, Wei Liu

机构 * City University of Hong Kong(香港城市大学) Video Rebirth The Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出PRISM方法,利用冻结的视频扩散骨干网络和轻量级查询聚合头从噪声潜变量中解码偏好信号,实现高精度偏好预测和噪声鲁棒性,支持早期最佳采样以降低计算成本并提升视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13655 2026-06-16 cs.CV cs.GR 新提交 83%

Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction

Flex4DHuman:面向4D人体重建的灵活多视角视频扩散模型

Jen-Hao Cheng, Yipeng Wang, Hao Zhang, Gengshan Yang, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学) World Labs

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出Flex4DHuman,一种基于相对相机位姿条件化的多视角视频扩散模型,无需显式几何先验即可将单目或稀疏多视角视频转换为密集多视角视频,并用于4D高斯溅射重建。

Comments Project Page: https://andy-cheng.github.io/Flex4DHuman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25449 2026-06-16 cs.CV 版本更新 83%

Pantheon360: Taming Digital Twin Generation via 3D-Aware 360° Video Diffusion

Pantheon360: 通过3D感知的360°视频扩散驯服数字孪生生成

Ting-Hsuan Chen, Ying-Huan Chen, Tao Tu, Jie-Ying Lee, Cho-Ying Wu, Fangzhou Lin, Hengyuan Zhang, David Paz, Xinyu Huang, Yuliang Guo, Yu-Lun Liu, Yue Wang, Liu Ren

机构 * University of Southern California(南加州大学) National Yang Ming Chiao Tung University(国家阳明交通大学) Cornell University(康奈尔大学) Bosch Research(博世研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出Pantheon360框架,利用显式3D缓存从稀疏360°输入生成高保真视频,实现全局几何一致性和可控相机路径,解决传统透视视频生成器视野受限导致的跨视图不一致和时间漂移问题。

Comments Accepted to CVPR 2026. Project page: https://koi953215.github.io/pantheon360_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06853 2026-06-08 cs.CV cs.AI 新提交 83%

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) School of Computer Science, Peking University(北京大学计算机学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07583 2026-06-05 cs.CV cs.AI 83%

Mobile Video Diffusion

移动视频扩散

Haitam Ben Yahia, Denis Korzhenkov, Ioannis Lelekas, Amir Ghodrati, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种移动优化的视频扩散模型MobileVD,通过降低帧分辨率、引入多尺度时间表示和两种新的剪枝方案,显著降低了内存和计算成本,同时在移动设备上实现了高效的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31590 2026-06-01 cs.CV cs.AI 83%

TunerDiT: Training-free Progressive Steering of Diffusion Transformer for Multi-Event Video Generation

TunerDiT: 无需训练的多事件视频生成扩散变压器渐进式引导

Ruotong Liao, Guowen Huang, Qing Cheng, Guangyao Zhai, Lei Zhang, Xun Xiao, Thomas Seidl, Daniel Cremers, Volker Tresp

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) MCML University of Hamburg(汉堡大学) Huawei European Research Institute(华为欧洲研究院)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对长视频多事件生成难题,提出无需额外训练的TunerDiT方法,通过事件分区掩码和跨事件提示融合实现渐进式引导,在8项指标上达到最优。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30325 2026-05-29 cs.CV 83%

Veda: Scalable Video Diffusion via Distilled Sparse Attention

Veda: 通过蒸馏稀疏注意力实现可扩展的视频扩散

Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

机构 * ByteDance Inc.(字节跳动公司) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出Veda蒸馏稀疏注意力框架,通过统计感知的tile评分和头感知tile选择,在保持生成质量的同时实现视频扩散模型的高效加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15264 2026-05-26 cs.CV 83%

DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion

DriveGen3D: 通过高效视频扩散提升前馈驾驶场景生成

Weijie Wang, Jiagang Zhu, Zeyu Zhang, Xiaofeng Wang, Zheng Zhu, Guosheng Zhao, Chaojun Ni, Haoxiao Wang, Guan Huang, Xinze Chen, Yukun Zhou, Wenkang Qin, Duochao Shi, Haoyun Li, Yicheng Xiao, Donny Y. Chen, Jiwen Lu

机构 * Zhejiang University(浙江大学) GigaAI Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Monash University(墨尔本大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出DriveGen3D框架,结合快速视频扩散Transformer(FastDrive-DiT)和前馈3D重建模块(FastRecon3D),实现高质量、可控的动态3D驾驶场景生成,在长视频和3D一致性上达到最优。

Comments ICME 2026 Oral, Project Page: https://lhmd.top/drivegen3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21072 2026-05-21 cs.CV 83%

Q-ARVD: Quantizing Autoregressive Video Diffusion Models

Q-ARVD: 对自回归视频扩散模型进行量化

Siao Tang, Xinyin Ma, Gongfan Fang, Xingyi Yang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文针对自回归视频扩散模型(ARVD)的量化问题,提出了一种新的框架Q-ARVD,解决了帧间量化敏感度不平衡和权重中异质性异常模式的问题,从而提高了模型效率。

Comments Code: https://github.com/tsa18/Q-ARVD

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04068 2026-05-21 cs.CV cs.AI 83%

Mind the Generative Details: Direct Localized Detail Preference Optimization for Video Diffusion Models

注意生成细节:面向视频扩散模型的直接局部化细节偏好优化

Zitong Huang, Kaidong Zhang, Yukang Ding, Chao Gao, Rui Ding, Ying Chen, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Alibaba Group - Taobao & Tmall Group(阿里巴巴集团-淘宝 & 天猫集团)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出LocalDPO,一种新的后训练框架,通过从真实视频中构建局部偏好对,并在时空区域层面优化对齐,以提高视频生成的质量和人类偏好评分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18346 2026-05-19 cs.CV cs.AI 83%

Focused Forcing: Content-Aware Per-Frame KV Selection for Efficient Autoregressive Video Diffusion

聚焦强制:面向内容的每帧KV选择用于高效的自回归视频扩散

Peiliang Cai, Evelyn Zhang, Jiacheng Liu, Hao Lin, Ruiqi Zhang, Weile Mo, Yue Ma, Shikang Zheng, Jiehang Huang, Dongrui Liu, Linfeng Zhang

机构 * SJTU(上海交通大学) SDU(山东大学) HUST(华中科技大学) UTokyo(东京大学) HKUST(香港科技大学) SCUT(上海大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出了一种无需训练的KV选择方法,通过结合注意力分数和历史帧的多样性分数,保留最相关和有区别的历史帧,从而在不牺牲质量的情况下提高自回归视频扩散的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13724 2026-05-14 cs.CV cs.AI 83%

AnyFlow: Any-Step Video Diffusion Model with On-Policy Flow Map Distillation

AnyFlow: 任意步视频扩散模型与在线策略流图蒸馏

Yuchao Gu, Guian Fang, Yuxin Jiang, Weijia Mao, Song Han, Han Cai, Mike Zheng Shou

机构 * NVIDIA Show Lab, National University of Singapore(新加坡国立大学Show实验室) MIT(麻省理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 AnyFlow通过优化完整ODE采样轨迹,解决一致性蒸馏在任意步视频生成中的性能退化问题,实现高效在线蒸馏以减少测试时误差。

Comments Project page at https://nvlabs.github.io/AnyFlow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12587 2026-05-14 cs.CV 83%

TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking

TrackCraft3R:将视频扩散变换器重新用于密集3D跟踪

Jisu Nam, Jahyeok Koo, Soowon Son, Jaewoo Jung, Honggyu An, Junhwa Hur, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出TrackCraft3R,通过重新利用预训练的视频扩散变换器,实现了基于单目视频的密集3D跟踪,采用双潜表示和时间RoPE对齐设计,提升了跟踪性能和效率。

Comments Project page and code are available at https://cvlab-kaist.github.io/TrackCraft3r/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11628 2026-05-13 cs.CV 83%

Single-Shot HDR Recovery via a Video Diffusion Prior

单次曝光HDR恢复通过视频扩散先验

Chinmay Talegaonkar, Jinshi He, Christopher McKenna, Nicholas Antipa

机构 * University of California San Diego(加州大学圣地亚哥分校) Creare LLC(Creare公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出通过视频扩散模型生成曝光序列并融合生成HDR图像,提升单次曝光HDR重建的保真度和可解释性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09681 2026-05-12 cs.CV 83%

Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models

Forcing-KV:用于高效自回归视频扩散模型的混合KV缓存压缩

Yicheng Ji, Zhizhou Zhong, Jun Zhang, Qin Yang, XiTai Jin, Ying Qin, Wenhan Luo, Shuiyang Mao, Wei Liu, Huan Li

机构 * ZJU(浙江大学) Video Rebirth(视频重生) HKUST(香港科技大学) BJTU(北京理工大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出Forcing-KV方法,通过混合KV缓存压缩技术,提升自回归视频扩散模型的生成速度和内存效率,实现高达2.82倍的速度提升。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17812 2026-04-09 cs.CV cs.AI cs.LG 83%

ChopGrad: Pixel-Wise Losses for Latent Video Diffusion via Truncated Backpropagation

ChopGrad:通过截断反向传播实现基于像素的潜在视频扩散模型

Dmitriy Rivkin, Parker Ewen, Lili Gao, Julian Ost, Stefanie Walz, Rasika Kangutkar, Mario Bijelic, Felix Heide

机构 * Torc Robotics Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出ChopGrad,通过截断反向传播减少视频生成的内存消耗,实现高效的像素级损失微调,适用于视频超分辨率、修复和增强等任务。

Comments Project website: https://light.princeton.edu/chopgrad

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04451 2026-04-07 cs.CV 83%

Beyond Few-Step Inference: Accelerating Video Diffusion Transformer Model Serving with Inter-Request Caching Reuse

超越少量步骤推理:利用跨请求缓存重用加速视频扩散变换器模型服务

Hao Liu, Ye Huang, Chenghuan Huang, Zhenyi Zheng, Jiangsu Du, Ziyang Ma, Jing Lyu, Yutong Lu

机构 * Sun Yat-sen University, China(中山大学) Independent Researcher(独立研究者)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出Chorus方法,通过跨请求缓存重用加速视频扩散模型服务,实现45%的速度提升,特别在中间去噪步骤中结合Token-Guided Attention Amplification提升语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03552 2026-04-07 cs.RO cs.AI cs.CV cs.LG 83%

CRAFT: Video Diffusion for Bimanual Robot Data Generation

CRAFT:基于视频扩散的双臂机器人数据生成

Jason Chen, I-Chun Arthur Liu, Gaurav Sukhatme, Daniel Seita

机构 * University of Southern California(南加州大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 CRAFT通过视频扩散生成双臂机器人演示数据,利用边缘结构线索提升生成多样性与鲁棒性,提升多视角任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16296 2026-03-24 cs.CV cs.AI cs.LG 83%

Memory-V2V: Memory-Augmented Video-to-Video Diffusion for Consistent Multi-Turn Editing

Memory-V2V: 通过记忆增强的视频到视频扩散模型实现一致的多轮编辑

Dohun Lee, Chun-Hao Paul Huang, Xuelin Chen, Jong Chul Ye, Duygu Ceylan, Hyeonho Jeong

机构 * Adobe Research(Adobe研究实验室) KAIST AI(韩国科学技术院人工智能研究所) Adobe Internship(Adobe实习) Project Lead(项目负责人)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(abstract);分类 cs.CV

AI总结 Memory-V2V通过引入外部记忆模块,解决多轮视频编辑中的跨轮一致性问题,提升编辑连贯性并保持视觉质量,优于现有基线模型。

Comments Project page: https://dohunlee1.github.io/MemoryV2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02284 2026-03-24 cs.CV cs.AI cs.LG 83%

Learning to Generate Rigid Body Interactions with Video Diffusion Models

通过视频扩散模型学习生成刚体交互

David Romero, Ariana Bermudez, Viacheslav Iablochnikov, Hao Li, Fabio Pizzati, Ivan Laptev

机构 * MBZUAI

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出KineMask方法,通过视频生成实现刚体交互的逼真控制与模拟,结合低级运动控制与高级文本条件,提升动态现象合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15478 2026-03-17 cs.CV 83%

ViFeEdit: A Video-Free Tuner of Your Video Diffusion Transformer

ViFeEdit:一种无需视频的视频扩散变换器调谐器

Ruonan Yu, Zhenxiong Tan, Zigeng Chen, Songhua Liu, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出ViFeEdit框架,通过2D图像实现视频生成与编辑,无需视频训练数据,采用架构重参数化解耦空间独立性与全3D注意力,实现高质量视频编辑与生成。

Comments Working in progress, code is at https://github.com/Lexie-YU/ViFeEdit

详情

展开后加载摘要…

URL PDF HTML 收藏