VFMF: World Modeling by Forecasting Vision Foundation Model Features
VFMF:通过预测视觉基础模型特征进行世界建模
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出了一种基于VFM特征的生成预测器,通过自回归流匹配在潜在空间中实现更准确的预测,提升世界建模的效率和效果。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
VFMF:通过预测视觉基础模型特征进行世界建模
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出了一种基于VFM特征的生成预测器,通过自回归流匹配在潜在空间中实现更准确的预测,提升世界建模的效率和效果。
无标签的运动条件化扩散模型用于心脏超声合成
机构 * Department AIBE, FAU Erlangen-Nürnberg(AIBE部门,埃尔朗根-纽伦堡大学) ; Department of Computing, Imperial College London(计算系,伦敦帝国理工学院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出无标签的运动条件化扩散模型,通过自监督运动特征生成逼真的心脏超声视频,无需手动标注。
Comments Accepted at MICAD 2025
DirectSwap: 无掩码跨身份训练与基准测试用于表情一致的视频头部交换
机构 * MBZUAI(马克斯·普朗克智能研究院) ; UAEU(阿拉伯联合酋长国大学) ; AIQ(人工智能量子研究所) ; SYSU(南方大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 DirectSwap通过无掩码直接视频头部交换框架,结合运动和表情感知重建损失,实现了跨身份视频头部交换的高质量和一致性。
H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式
机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。
Comments 13 pages, 6 figures
视频数据集压缩与扩散模型
机构 * Department AIBE FAU Erlangen-Nürnberg(FAU埃尔朗根-纽伦堡AIBE部门) ; Department of Computing Imperial College London(伦敦帝国理工学院计算系)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出基于扩散模型和VST-UNet的视频数据集压缩方法,结合训练免费聚类算法,有效提升视频数据集蒸馏性能,达到10.61%的性能提升。
Comments Accepted at BMVC 2025
为流匹配强化学习中的系数保持采样
机构 * CreateAI
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 通过系数保持采样方法,减少流匹配强化学习中的噪声伪影,提升奖励建模精度和优化器收敛稳定性。
Comments work in progress
EVCtrl: 用于视觉生成的高效控制适配器
机构 * UESTC(电子科技大学) ; HKUST(香港科技大学) ; SJTU(上海交通大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 EVCtrl通过轻量级控制适配器提升视觉生成效率,实现高效可控生成,无需重新训练模型。
DreamingComics: 通过主体和布局定制生成实现故事可视化管道
机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 DreamingComics通过结合视频模型和布局生成技术,实现了基于主体和布局定制的高效故事可视化方法,提升了角色一致性和风格相似性。
ChronosObserver: 用超空间扩散采样驯服4D世界
机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 ChronosObserver通过超空间表示和引导采样,实现无需训练的高质量多视角时间同步视频生成,解决4D世界生成难题。
图像生成作为机器人操作的视觉规划器
机构 * Southern China University of Technology(华南理工大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出利用图像生成模型作为机器人视觉规划器,通过轻度微调实现时间连贯的机器人操作视频生成。
Comments 11 pages 9 figures Under review at CVPR 2026
使用手持相机生成符合检查的视频
机构 * University of Washington(华盛顿大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种基于视频扩散模型的方法,利用手持设备和静态照片生成逼真的全身视频,通过多参考注意力机制和图像微调策略提升视频真实感。
基于扩散噪声优化的连续流序列适应视频预测
机构 * University of Bonn(波恩大学) ; Toyota Motor Europe(丰田欧洲公司) ; University of Wuerzburg(乌尔姆大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)
专题命中 视频扩散模型 :long video(abstract);分类 cs.CV
AI总结 本文提出了一种基于扩散噪声优化的连续流序列适应视频预测方法,通过在推理过程中细化扩散噪声以提升视频预测性能。
M2SVid:单目到立体视频转换的端到端修复与细化
机构 * Google(谷歌) ; Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) ; Goethe University Frankfurt(法兰克福歌德大学) ; MPI for Informatics, Saarland Informatics Campus(信息研究所,萨尔兰信息校区) ; Technical University of Munich(慕尼黑技术大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 M2SVid通过端到端修复和细化技术,实现单目到立体视频转换,生成高质量右视图并提升效率。
Comments To be published at 3DV 2026, project webpage https://m2svid.github.io/
STCDiT:一种时空一致的扩散变换器用于高质量视频超分辨率
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 STCDiT通过结合运动感知的VAE重建和锚帧指导方法,实现了高质量视频超分辨率,提升了结构保真度和时间一致性。
Comments Project page: https://jychen9811.github.io/STCDiT_page
InstantViR: 基于蒸馏扩散先验的实时视频逆问题求解器
机构 * Peking University(北京大学) ; Huaqiao University(华侨大学) ; Kuaishou Technology(快手科技)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 InstantViR通过蒸馏扩散先验实现高效实时视频重建,以35 FPS速度在NVIDIA A100 GPU上达到与基线相当的重建质量。
VividFace: 高质量和高效的一步扩散用于视频面部增强
机构 * South China University of Technology(华南理工大学) ; Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) ; University of Science and Technology of China(中国科学技术大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University of Science and Technology(南京理工大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 VividFace通过单步扩散框架和联合训练策略,高效提升视频面部增强的高质量与效率。
机构 * Tsinghua University(清华大学) ; UC Berkeley(伯克利大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院(FNii-深圳)) ; Chinese University of Hong Kong at Shenzhen (CUHKSZ)(香港中文大学(深圳)) ; Sun Yat-sen University(中山大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments Project Link: https://zyqz97.github.io/CloseUpShot/
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments Project page: https://readportrait.github.io/READ/
机构 * SJTU(上海交通大学) ; AgiBot ; Shanghai AI Lab(上海人工智能实验室) ; CUHK MMLab(香港大学多模态实验室) ; LV-NUS Lab(南洋理工大学-立陶宛实验室)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025. Website: https://sites.google.com/view/enerverse
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments 7pages; 7figures; 3 tables
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments Work done in Nov 2024, during an internship at the University of Pennsylvania. Project page: https://stereodiff.github.io/
机构 * Simon Fraser University(西蒙弗雷泽大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments 3DV 2026, Project Page: https://mingrui-zhao.github.io/ACT-R/
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) ; China Mobile Research Institute(中国移动研究院) ; Westlake University(西湖大学) ; Huawei Consumer Business Group(华为消费者业务集团)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025. Code is available at: https://github.com/zhengchen1999/DOVE
机构 * AgiBot Genie Team(AgiBot Genie团队) ; LV-NUS Lab(LV-NUS实验室) ; BUAA(北京航空航天大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments https://genie-envisioner.github.io/
机构 * Computer Vision Group, University of Bern(伯尔尼大学计算机视觉组) ; VITA Lab, EPFL(苏黎世联邦理工学院VITA实验室)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments Updated version from preprint arXiv:2506.07280 (Gen2Gen) focused on visual intelligence. This work can be considered as v2
机构 * Stability AI ; University of Tübingen(图宾根大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments Accepted by International Conference on Computer Vision (ICCV 2025). Project page: http://svim3d.aengelhardt.com
机构 * Nankai University(南开大学) ; Nanjing University, Suzhou(南京大学苏州校区)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; Tencent(腾讯) ; Yes Lab, Fudan University(复旦大学Yes实验室)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
Comments Project Page: https://imlixinyang.github.io/FlashWorld-Project-Page/