Conditional diffusion model with spatial attention and latent embedding for medical image segmentation
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV
Comments 13 pages, 5 figures, 3 tables, Accepted in MICCAI 2024
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV
Comments 13 pages, 5 figures, 3 tables, Accepted in MICCAI 2024
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、cs.MM
Comments Project Page: https://sunzey.github.io/Bootstrap3D/
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV
Comments 4 pages
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM
Comments submitted to IEEE Transactions on Image Processing(TIP)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV、eess.IV
Comments 7 pages, 4 figures
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、cs.MM
Comments ICLR 2024
专题命中 视频扩散模型 :long video(abstract);分类 cs.CV、cs.MM
Comments ICCV 2023; Code available at https://github.com/sauradip/DiffusionTAD
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV
机构 * AI Yapım Hagia Labs Singapore(AI Yapım 赫亚实验室新加坡) ; AI Engineer Hagia Labs İstanbul(AI工程师 赫亚实验室伊斯坦布尔) ; Full Stack Engineer Hagia Labs İstanbul(全栈工程师 赫亚实验室伊斯坦布尔) ; Chief Creator Hagia Labs İstanbul(首席创作者 赫亚实验室伊斯坦布尔)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV;video generation(comments)
Comments video generation, image-to-video, dif- fusion transformer, LoRA, fine-tuning, cinematic scene synthesis, multi-GPU inference, fully sharded data parallelism, computational efficiency
为文本-音频-视频模型添加带单个零初始化层的语音克隆功能
机构 * Kandinsky Lab(坎丁斯基实验室)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.MM
AI总结 本文在基础文本-音频-视频模型上添加单个零初始化线性层,经微调后实现语音克隆,在674个说话人-文本对基准上优于5个基线,且推理时可跳过视频路径提速约30倍。
重新思考逐令牌特征缓存:通过双特征缓存加速扩散Transformer
机构 * Shanghai Jiao Tong University(上海交通大学) ; South China University of Technology(南方科技大学) ; Beihang University(北航) ; Huawei Technologies Ltd(华为技术有限公司) ; Shanghai AI Lab(上海人工智能实验室) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文针对逐令牌特征缓存的核心问题提出质疑,提出双特征缓存方法DuCa,在DiT等生成模型上实现了优于现有逐令牌特征缓存的性能。
PickStyle:基于上下文-风格适配器的视频到视频风格迁移
机构 * Pickford AI ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 PickStyle是一种视频到视频风格迁移框架,通过在预训练视频扩散骨干中插入低秩适配器、构建合成训练片段并提出CS-CFG,实现了优于现有基线的视频风格迁移效果。
Comments Accepted to the European Conference on Computer Vision (ECCV) 2026 Workshops
InfiniVerse: 面向自动驾驶的占用引导无界场景生成
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; University of New South Wales(新南威尔士大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出InfiniVerse统一框架,通过3D占用表示和视频扩散模型实现从单帧到长距离、2D-3D对齐的动态城市场景可控生成,在Waymo和nuScenes上达到SOTA。
Comments Paper accepted as poster at ECCV workshop SPAD
SNM-VFI:对称非线性运动引导的生成式视频帧插值
机构 * Qualcomm(高通公司)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 提出无需训练的SNM-VFI框架,结合预训练光流与视频扩散模型,用对称非线性运动模型引导生成过程,经多基准评估实现了优质视频帧插值效果。
Comments ECCVW 2026
从局部失配到全局影响:优化缓存重用策略以实现高效扩散模型
机构 * Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院) ; School of Data Science, Fudan University(复旦大学数据科学学院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 针对扩散模型缓存策略与生成质量失配问题,提出GCache双层优化框架,在Wan2.1模型上实现2.17倍加速且LPIPS降至0.0316,性能优于现有缓存策略。
LiveAnimate:稳定的长时长流驱动人体动画实时生成系统
机构 * The Chinese University of Hong Kong(香港中文大学) ; Qwen Applications Business Group of Alibaba(阿里巴巴通义千问应用业务组) ; Liblib AI
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 LiveAnimate基于14B参数视频DiT,经两阶段训练结合PR-Sink等设计,实现19.63 FPS长时长流人体动画生成,兼顾实时性、质量与稳定性,优于现有系统。
基于分层参考的生成式视频压缩
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出基于分层参考的生成式视频压缩方法GVCHR,通过分层结构优化潜在编码与生成重建,在多个基准数据集上较现有最优方法实现LPIPS和DISTS指标下50.5%、54.0%的BD-rate增益,视觉质量显著提升。
连接事件流与DiT:事件引导的视频帧插值
机构 * The University of Tokyo(东京大学) ; South China University of Technology(华南理工大学) ; Wuhan University(武汉大学) ; Singapore Management University(新加坡管理大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出基于适配器的框架,将事件衍生提示融入预训练图像转视频扩散模型,利用IWEs与双向稀疏光流引导生成,提升视频帧插值质量,效果优于现有SOTA方法。
Comments https://joseph-lin-tech.github.io/BridgeEventDiT-VFI/
TC-Padé:轨迹一致的Padé近似用于扩散加速
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang Gongshang University(浙江工商大学) ; ByteDance Intelligent Creation(字节跳动智能创作)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 提出轨迹一致的Padé近似方法,通过有理函数建模特征演变,实现低步数下的高效扩散模型加速。
Comments CVPR 2026
超越像素:从视频先验到4D世界
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出Latent-to-4D方法,利用共享VAE的视频模型去噪潜在变量作为接口实现4D生成,在两个数据集上的DINO-F1指标优于对比方法,且受人类评估者认可。
Comments Project page: https://hayd-zju.github.io/Beyond-Pixels
学习世界如何演化:基于潜动态推理的外推视频世界模型
机构 * UCSD(加利福尼亚大学圣迭戈分校) ; Adobe(奥多比公司)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 针对主流视频扩散模型未建模像素时间转换的问题,提出LDR方法,在PhyWorld基准上实现更优动态外推,参数更少、速度更快,是首个能泛化至训练分布外的视频世界模型
Comments Project page: https://lat-dyn-reason.github.io/
GeoRoute:面向交通未来帧预测的几何感知混合推理方法
机构 * Vietnamese-German University(越南-德国大学) ; University of Science, Ho Chi Minh City(胡志明市科学大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。
Comments accepted to the ECCV 2026 AI City Challenge Workshop
InstructionCrafter:生成一致且高保真的视觉指令
机构 * University of Tsukuba(筑波大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本研究提出基于扩散的InstructionCrafter框架,通过空间冻结训练和两种适配器优化,实现了文本到分步视觉指令的生成,在多基准数据集上达成了最优性能且减少了噪声等问题,代码和模型将公开。
BRACE:利用重心有理预测控制快速扩散Transformer推理中的尖锐不规则性
机构 * Sichuan University(四川大学) ; School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本研究针对扩散Transformer(DiTs)高加速推理时的质量下降问题,提出带切比雪夫增强的重心有理预测方法BRACE,通过特征驱动的有理预测实现最优质量-效率权衡,且计算开销极低。
Comments 10 pages, 6 figures, 5 tables. Project page: https://youngkinlon.github.io/BRACE-Taming-Sharp-Irregularities-via-Barycentric-Rational-Forecasting-for-Fast-DiT-Inference/
预测以跳过:线性多步特征预测用于高效的扩散变换器
机构 * School of Artificial Intelligence, Beijing Normal University, Beijing 100875, China(人工智能学院,北京师范大学,北京) ; Institute of Artificial Intelligence(人工智能研究所) ; Future Networks, Beijing Normal University, Zhuhai 519087, China(未来网络,北京师范大学,珠海)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 PrediT通过线性多步特征预测方法,在不训练的情况下加速扩散变换器,实现显著的延迟降低同时保持生成质量。
面向不确定性引导的扩散模型后训练的样本自适应潜在奖励
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出\textsc{SURE}框架,含\textsc{SURE-LRM}与\textsc{SURE-REFL},通过样本自适应潜在奖励与不确定性引导反馈优化扩散模型,在偏好预测、SOTA性能及VBench指标上表现优异。
从理解到擦除:迈向完全且稳定的视频对象移除
机构 * Peking University(北京大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出通过外部和内部指导机制,结合视觉基础模型与视频扩散模型,提升视频对象移除的物理和语义理解能力,实现清晰且连贯的移除效果,并建立首个真实世界基准测试。
Comments Code: https://github.com/WeChatCV/UnderEraser
在扩散噪声中寻求物理规律
机构 * Brown University(布朗大学) ; University of Edinburgh(爱丁堡大学) ; MIT(麻省理工学院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 研究通过分析预训练扩散变换器的中间去噪表示,发现物理合理与不合理视频在中层特征空间部分可分离,提出渐进轨迹选择策略提升物理一致性并降低推理成本。
Comments 15 pages
Place-it-R1: 解锁多模态大语言模型在视频物体插入中的环境感知推理潜力
机构 * HKUST(香港科技大学) ; Tencent Video(腾讯视频) ; Peking University(北京大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 Place-it-R1通过多模态大语言模型的环境感知推理能力,实现物理一致的视频物体插入,提供两种模式以平衡保真度与合理性。