arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

2512.00408 2026-04-07 cs.CV cs.AI 57%

Low-Bitrate Video Compression through Semantic-Conditioned Diffusion

基于语义的低比特率视频压缩

Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出DiSCo框架,通过语义条件扩散模型在低比特率下实现高质量视频压缩,采用文本描述、空间时间退化视频和可选草图等模态,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02828 2026-04-06 cs.CV cs.AI 57%

NavCrafter: Exploring 3D Scenes from a Single Image

NavCrafter:从单张图像探索3D场景

Hongbo Duan, Peiyu Zhuang, Yi Liu, Zhengyang Zhang, Yuxin Zhang, Pengting Luo, Fangming Liu, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院人工智能与机器人中心) Peng Cheng Laboratory(鹏城实验室) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Central Media Technology Institute, Huawei Incorporated Company(华为技术有限公司中央媒体技术研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 NavCrafter通过合成新颖视角视频序列,实现从单张图像生成灵活的3D场景,采用视频扩散模型和几何感知扩展策略,提升可控多视角合成与3D重建精度。

Comments 8 pages accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 57%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV 57%

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01053 2026-04-02 cs.CV 57%

PHASOR: Anatomy- and Phase-Consistent Volumetric Diffusion for CT Virtual Contrast Enhancement

PHASOR:基于解剖和相位一致的体积扩散用于CT虚拟对比增强

Zilong Li, Dongyang Li, Chenglong Ma, Zhan Feng, Dakai Jin, Junping Zhang, Hao Luo, Fan Wang, Hongming Shan

机构 * Shanghai Key Lab of Intelligent Information Processing, School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院上海市智能信息处理重点实验室) Institute of Science and Technology for Brain-inspired Intelligence and MOE Frontiers Center for Brain Science, Fudan University(复旦大学类脑智能科学与技术研究院及教育部脑科学前沿中心) Shanghai Center for Brain Science and Brain-inspired Technology(上海脑科学与类脑研究中心) Department of Radiology, First Affiliated Hospital of College of Medical Science, Zhejiang University(浙江大学医学院附属第一医院放射科) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出PHASOR框架,通过体积扩散模型提升CT虚拟对比增强质量,引入解剖路由混合专家和强度-相位意识表示对齐模块,解决解剖异质性和空间偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00853 2026-04-02 cs.CV 57%

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

MotionGrounder: 通过扩散变换器实现多物体运动迁移

Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电气工程学院) Adobe Research(Adobe研究院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出MotionGrounder,一种基于扩散变换器的多物体运动迁移框架,通过流式运动信号和对象-描述对齐损失实现稳定运动先验和空间对齐,实验显示其在定量、定性和人类评估中均优于现有方法。

Comments Please visit our project page at https://kaist-viclab.github.io/motiongrounder-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00792 2026-04-02 cs.CV 57%

HICT: High-precision 3D CBCT reconstruction from a single X-ray

HICT: 从单张X射线实现高精度3D CBCT重建

Wen Ma, Jiaxiang Liu, Zikai Xiao, Ziyang Wang, Feng Yang, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Angelalign Technology Inc.(时代天使科技有限公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出HICT框架,通过视频扩散模型生成多视角投影并结合动态注意力网络与X射线采样策略,实现高精度CBCT重建,实验表明其在临床应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30043 2026-04-01 cs.CV 57%

Video Models Reason Early: Exploiting Plan Commitment for Maze Solving

视频模型早起推理:利用计划承诺解决迷宫

Kaleb Newman, Tyler Zhu, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究通过2D迷宫解决探讨视频模型生成过程中的规划动态,发现模型在早期步骤中承诺高层运动计划,并揭示路径长度而非障碍密度是迷宫难度的主要预测因素,提出ChEaP方法提升复杂迷宫解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29036 2026-04-01 cs.CV 57%

Generating Humanless Environment Walkthroughs from Egocentric Walking Tour Videos

从第一人称行走游览视频生成无人类环境 walkthroughs

Yujin Ham, Junho Kim, Vivek Boominathan, Guha Balakrishnan

机构 * Rice University(莱斯大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种生成算法,通过去除行走视频中的人和阴影效果,提升环境建模应用,使用半合成数据集训练Casper模型,实现高质量的无人类视频生成,进而构建三维/四维城市模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11423 2026-04-01 cs.CV 57%

JoyStreamer-Flash: Real-time and Infinite Audio-Driven Avatar Generation with Autoregressive Diffusion

JoyStreamer-Flash: 基于自回归扩散的实时和无限音频驱动化身生成

Chaochao Li, Ruikui Wang, Liangbo Zhou, Jinheng Feng, Huaishao Luo, Huan Zhang, Youzheng Wu, Xiaodong He

机构 * JD Technology(京东科技)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出JoyStreamer-Flash,一种能实现实时推断和无限长度视频生成的音频驱动自回归模型,通过渐进式步进 bootstrap、运动条件注入和无界RoPE via Cache-Resetting提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27209 2026-03-31 cs.CV cs.CL cs.GR cs.LG 57%

LightMover: Generative Light Movement with Color and Intensity Controls

LightMover:具有颜色和强度控制的生成式光移动

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen

机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) Adobe Research(Adobe研究院) University of Hong Kong(香港大学) Yale University(耶鲁大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。

Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC 57%

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22854 2026-03-27 cs.CV cs.GR cs.LG 57%

ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning

ByteLoom: 通过渐进课程学习编织几何一致的人-物体交互

Bangya Liu, Xinyu Gong, Zelin Zhao, Ziyang Song, Yulei Lu, Suhui Wu, Jun Zhang, Suman Banerjee, Hao Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ByteDance(字节跳动) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出ByteLoom框架,通过简化的人类条件和3D物体输入生成几何一致的人-物体交互视频,解决多视角信息注入和手部网格标注依赖的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24260 2026-03-26 cs.CV cs.AI 57%

Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

通过异构缓存加速基于扩散的视频编辑:超越采样去噪时间步的全计算

Tianyi Liu, Ye Lu, Linfeng Zhang, Chen Cai, Jianjun Gao, Yi Wang, Kim-Hui Yap, Lap-Pui Chau

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出HetCache框架,通过利用扩散基于掩码视频到视频生成中的异构性,减少冗余注意力运算,提升视频编辑效率与质量。

Comments 10 pages, 6 figures, accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22533 2026-03-26 cs.CV 57%

Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration

Fast3Dcache: 无训练3D几何合成加速

Mengyu Yang, Yanming Yang, Chenyi Xu, Chenxi Song, Yufan Zuo, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) University of Electronic Science and Technology of China(电子科学与技术大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出Fast3Dcache,一种无训练的几何感知缓存框架,通过动态缓存调度和时空稳定性准则,显著加速3D扩散模型推理,同时保持几何精度。

Comments Accepted by CVPR 2026; Project page: https://fast3dcache-agi.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04090 2026-03-24 cs.CV 57%

Gen3R: 3D Scene Generation Meets Feed-Forward Reconstruction

Gen3R:3D场景生成与前馈重建的结合

Jiaxin Huang, Yuanbo Yang, Bangbang Yang, Lin Ma, Yuewen Ma, Yiyi Liao

机构 * Zhejiang University(浙江大学) ByteDance Project(字节跳动项目)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Gen3R通过结合基础重建模型的强先验与视频扩散模型,实现3D场景生成,生成RGB视频及3D几何数据,实验显示其在单图和多图条件下达到SOTA结果。

Comments Project page: https://xdimlab.github.io/Gen3R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15130 2026-03-24 cs.GR cs.AI cs.CV 57%

Taming Video Models for 3D and 4D Generation via Zero-Shot Camera Control

通过零样本相机控制驯服视频模型以实现3D和4D生成

Chenxi Song, Yanming Yang, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldForge框架,通过推理时的三重组件实现零样本3D/4D生成,解决视频扩散模型在空间任务中的控制不足问题,提升视觉真实性与轨迹一致性。

Comments Accepted to CVPR 2026. Project Webpage: https://worldforge-agi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16736 2026-03-19 cs.CV 57%

World Reconstruction From Inconsistent Views

从不一致视角重建世界

Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich, Germany(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种非刚性对齐方法,通过全局一致坐标框架生成清晰点云,提升视频扩散模型在3D世界重建中的性能。

Comments project website: https://lukashoel.github.io/video_to_world video: https://www.youtube.com/watch?v=qXnUwhVmBzA code: https://github.com/lukasHoel/video_to_world

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16871 2026-03-18 cs.CV 57%

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

WorldCam: 交互式自回归3D游戏世界与相机姿态作为统一的几何表示

Jisu Nam, Yicong Hong, Chun-Hao Paul Huang, Feng Liu, JoungBin Lee, Jiyoung Kim, Siyoon Jin, Yunsung Lee, Jaeyoon Jung, Suhwan Choi, Seungryong Kim, Yang Zhou

机构 * Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldCam,通过将相机姿态作为统一的几何表示,解决交互式游戏世界中动作控制与长时序3D一致性问题,结合物理连续动作空间和全局相机姿态索引提升导航与视觉质量。

Comments Project page is available at https://cvlab-kaist.github.io/WorldCam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16566 2026-03-18 cs.CV cs.GR 57%

VideoMatGen: PBR Materials through Joint Generative Modeling

VideoMatGen:基于联合生成模型的PBR材质

Jon Hasselgren, Zheng Zeng, Milos Hasan, Jacob Munkberg

机构 * NVIDIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于视频扩散变压器架构的方法,通过输入几何和文本描述联合生成物理合理的PBR材质,包含基础颜色、粗糙度、金属度和高度图等属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15415 2026-03-17 cs.CV 57%

AnyCrowd: Instance-Isolated Identity-Pose Binding for Arbitrary Multi-Character Animation

AnyCrowd:实例隔离的身份-姿态绑定用于任意多角色动画

Zhenyu Xie, Ji Xia, Michael Kampffmeyer, Panwen Hu, Zehua Ma, Yujian Zheng, Jing Wang, Zheng Chong, Xujie Zhang, Xianhang Cheng, Xiaodan Liang, Hao Li

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) University of Tromsø (UiT) – The Arctic University of Norway, Norway(特罗姆瑟大学(UiT)——挪威北极大学,挪威) Shenzhen campus of Sun Yet-sen University, China(孙中山大学深圳校区,中国)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出AnyCrowd框架,通过实例隔离潜在表示和三阶段解耦注意力机制,解决多角色动画中身份与姿态绑定不一致的问题,提升生成视频的可控性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15279 2026-03-17 cs.LG cs.CV 57%

Faster Inference of Flow-Based Generative Models via Improved Data-Noise Coupling

通过改进的数据-噪声耦合实现流基生成模型的更快推理

Aram Davtyan, Leello Tadesse Dadi, Volkan Cevher, Paolo Favaro

机构 * University of Bern(伯尔尼大学) EPFL(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出LOOM-CFM方法,通过优化 minibatch OT 跨 minibatch 的 assignments,提升流基生成模型在样本速度与质量间的平衡,支持高分辨率潜在空间合成和蒸馏初始化。

Comments Patched from ICLR2025. Code: https://github.com/araachie/loom-cfm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20673 2026-03-16 cs.CV 57%

GA-Drive: Geometry-Appearance Decoupled Modeling for Free-viewpoint Driving Scene Generation

GA-Drive:用于自由视角驾驶场景生成的几何-外观解耦建模

Hao Zhang, Lue Fan, Qitai Wang, Wenbo Li, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(CUHK的MMLab) CASIA Shanghai Jiaotong University(上海交通大学) SenseTime Research(商汤科技研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 GA-Drive通过几何-外观解耦和扩散生成技术,生成可编辑的高保真驾驶场景,提升自动驾驶训练和评估的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12250 2026-03-13 cs.CV 57%

DVD: Deterministic Video Depth Estimation with Generative Priors

DVD:利用生成先验的确定性视频深度估计

Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Jing He, Zixin Zhang, Haodong Li, Yihao Liang, Kanghao Chen, Bin Ren, Xu Zheng, Shuai Yang, Kun Zhou, Yinchuan Li, Nicu Sebe, Ying-Cong Chen

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DVD通过确定性方法将预训练视频扩散模型转化为单次通过深度回归器,解决视频深度估计中的生成与判别模型权衡问题,实现零样本性能提升并释放开源训练套件。

Comments Project: https://dvd-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24161 2026-03-13 cs.CV 57%

GeoDiff4D: Geometry-Aware Diffusion for 4D Head Avatar Reconstruction

GeoDiff4D: 基于几何的扩散模型用于4D头像重建

Chao Xu, Xiaochen Zhao, Xiang Deng, Jingxiang Sun, Donglin Di, Zhuo Su, Yebin Liu

机构 * Tsinghua University(清华大学) Li Auto(利亚自动)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 GeoDiff4D通过几何感知扩散模型,结合表面法线和表情编码器,实现了高保真的4D头像重建,提升了视觉质量和跨身份泛化能力。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10256 2026-03-12 cs.SD cs.CV cs.GR 57%

ID-LoRA: Identity-Driven Audio-Video Personalization with In-Context LoRA

ID-LoRA:基于身份的音频视频个性化与上下文LoRA

Aviad Dahan, Moran Yanuka, Noa Kraicer, Lior Wolf, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ID-LoRA通过联合生成音频和视频实现身份驱动的个性化,利用上下文LoRA技术在单次生成过程中提升语音与视觉的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07700 2026-03-10 cs.CV cs.AI 57%

TDM-R1: Reinforcing Few-Step Diffusion Models with Non-Differentiable Reward

TDM-R1: 通过非可微奖励强化少步扩散模型

Yihong Luo, Tianyang Hu, Weijian Luo, Jing Tang

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 TDM-R1通过非可微奖励强化少步扩散模型,提升文本到图像生成性能

Comments https://luo-yihong.github.io/TDM-R1-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22654 2026-03-09 cs.CV 57%

Denoising as Path Planning: Training-Free Acceleration of Diffusion Models with DPCache

去噪作为路径规划:通过DPCache实现扩散模型的训练免费加速

Bowen Cui, Yuanbin Wang, Huajiang Xu, Biaolong Chen, Aixi Zhang, Hao Jiang, Zhengzheng Jin, Xu Liu, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 DPCache通过全局路径规划框架实现扩散模型的高效加速,减少计算开销并提升生成质量。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05315 2026-03-06 cs.CV 57%

Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers

面向频率的误差有界缓存用于加速扩散变换器

Guandong Li

机构 * iFLYTEK

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 SpectralCache通过统一缓存框架提升扩散变换器推理速度,实现2.46倍加速,质量与TeaCache相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19210 2026-03-06 cs.CV 57%

Track Anything Behind Everything: Zero-Shot Amodal Video Object Segmentation

在一切之后跟踪任何东西:零样本无遮挡视频对象分割

Finlay G. C. Hudson, William A. P. Smith

机构 * Department of Computer Science University of York(计算机科学系约克大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 TABE通过单个查询掩码实现零样本无遮挡视频对象分割,利用预训练视频扩散模型进行生成补全,无需重新训练模型即可处理完全遮挡场景。

详情

展开后加载摘要…

URL PDF HTML 收藏