Orthogonal Spatial-temporal Distributional Transfer for 4D Generation
正交时空分布式转移用于4D生成
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出正交时空分布式转移机制,通过解耦空间和时间潜在变量提升4D生成的质量和一致性。
Comments 9 pages, 6 figures, 3 tables, AAAI
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
正交时空分布式转移用于4D生成
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出正交时空分布式转移机制,通过解耦空间和时间潜在变量提升4D生成的质量和一致性。
Comments 9 pages, 6 figures, 3 tables, AAAI
NeuralRemaster: 保留相位的扩散用于结构对齐生成
机构 * Toyota Research Institute(丰田研究院) ; University of Texas, Austin(德克萨斯大学奥斯汀分校) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 NeuralRemaster通过保留相位并随机化幅度,实现结构对齐的图像和视频生成,提升模拟到现实的转换性能。
ArtHOI: 通过视频先验进行4D重建的可变形人-物交互合成
机构 * School of AIA, Huazhong University of Science and Technology(华中科技大学人工智能学院) ; the S-Lab, Nanyang Technological University (NTU)(南洋理工大学S实验室) ; the Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) ; Zhejiang University (ZJU)(浙江大学) ; the Institute for AI Industry Research (AIR), Tsinghua University (THU)(清华大学人工智能产业研究院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 ArtHOI通过4D重建从视频先验生成可变形人-物交互,提升接触精度和物理合理性。
Comments Project Page: https://arthoi.github.io/
MatPedia: 一种通用生成基础,用于高保真材料合成
机构 * Nankai University(南开大学) ; Tencent Hunyuan(腾讯文言) ; Xi’an Jiaotong University(西安交通大学) ; Nanjing University(南京大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 MatPedia是一种基于联合RGB-PBR表示的生成模型,能够统一处理多种材料生成任务,实现高质量的高保真材料合成。
扩散变换器的扩展定律
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文研究了扩散变换器的扩展定律,通过实验验证了模型大小、数据需求与计算预算之间的幂律关系,并展示了预训练损失与生成性能的一致性,为模型性能和数据质量评估提供了可预测的基准。
CamDirector: 向长期一致的视频轨迹编辑迈进
机构 * McMaster University(麦克 master 大学) ; University of Toronto(多伦多大学) ; The University of Hong Kong(香港大学) ; McGill University(麦吉尔大学) ; Concordia University(Concordia 大学) ; MBZUAI
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 CamDirector通过混合变形方案和历史引导的自回归扩散模型,实现长期一致的视频轨迹编辑,并提出新的VTE基准iPhone-PTZ。
扩散模型的分层蒸馏
机构 * Yandex Research(Yandex研究院) ; HSE University(俄罗斯高等经济大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 SwD通过分层蒸馏框架提升扩散模型效率,引入MMD补丁级目标改进收敛性,实现更快采样和更高性能
LiftAvatar:基于运动空间的表达控制3D高斯人偶动画
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Institute of Artificial Intelligence of China Telecom(中国电信人工智能研究院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 LiftAvatar通过多粒度表达控制和多参考条件机制,提升3D人偶动画的质量和可控性。
Comments 19 pages, 11 figures
通过概念空间对齐实现统一的视觉-语言建模
机构 * University of Edinburgh(爱丁堡大学) ; FAIR at Meta(Meta公司FAIR团队)
专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV
AI总结 通过概念空间对齐实现统一的视觉-语言建模,V-SONAR在多语言和多模态任务中超越现有模型。
Comments ICLR 2026
HorizonForge: 通过任意轨迹和任意车辆驱动场景编辑
机构 * NEC Labs America(NEC美国实验室) ; Stony Brook University(石溪大学) ; UC San Diego(圣地亚哥大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 HorizonForge通过任意轨迹和车辆实现驾驶场景的可控编辑,利用高斯溅射体和网格表示,结合视频扩散技术,提升生成场景的真实性和可控性。
Comments Accepted by CVPR 2026
通过累积误差最小化实现扩散变换器加速的即插即用保真优化
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 通过累积误差最小化实现扩散变换器加速的即插即用保真优化,提升生成保真度并优于现有方法。
Comments 29 pages, ICLR2026 accepted
SenCache: 通过敏感性感知缓存加速扩散模型推理
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 SenCache通过敏感性感知缓存策略,提升扩散模型推理效率与视觉质量。
HumanOrbit:3D人体重建作为360°轨道生成
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Qualcomm(高通公司)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 HumanOrbit通过视频扩散模型实现多视角人体生成,生成360°轨道视频并重建高保真3D模型。
Comments CVPR 2026 Findings
G4Splat:基于生成先验的几何引导高斯点云法
机构 * Tsinghua University(清华大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; BIGAI ; Peking University(北京大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 G4Splat通过几何引导的生成先验提升3D场景重建,有效解决多视角不一致性问题,实现高质量场景补全。
Comments ICLR'26. Project page: https://dali-jack.github.io/g4splat-web/
视频变形到掩码:用于指认视频分割的流匹配
机构 * SGIT AI Lab, State Grid Corporation of China(国网信通研究院) ; University of California, San Diego(加州大学圣地亚哥分校) ; The Hong Kong University of Science and Technology(香港科技大学) ; The University of Tokyo(东京大学) ; University of Cambridge(剑桥大学) ; Zhejiang University of Technology(浙江工业大学) ; Baidu(百度)
专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV
AI总结 本文提出FlowRVS框架,将指认视频分割视为条件连续流问题,通过学习视频整体表示到目标掩码的直接语言引导变形,在多个基准上取得新突破。
BetterScene: 一种基于表示对齐生成模型的3D场景合成
机构 * Dept. of Electrical and Computer Engineering, The Ohio State University(电气与计算机工程系,俄亥俄州立大学) ; USACE ERDC GRL(美国陆军工程兵队ERDC GRL)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 BetterScene通过引入时间等价性正则化和视觉基础模型对齐的表示,提升3D场景合成的视角一致性与质量。
Ani3DHuman:基于自引导随机采样的逼真3D人体动画
机构 * City University of Hong Kong(香港城市大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 Ani3DHuman通过结合运动学动画与视频扩散先验,利用自引导随机采样实现逼真3D人体动画生成。
Comments CVPR 2026
DDiT: 动态补丁调度用于高效的扩散变换器
机构 * Boston University(波士顿大学) ; Amazon(亚马逊)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 DDiT通过动态调整补丁大小,在保持生成质量的同时显著提升扩散变换器的推理效率。
大规模扩散蒸馏的连续时间一致性 via 分数正则化
机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, AI Institute, Tsinghua(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,人工智能研究院) ; NVIDIA
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 本文提出分数正则化的连续时间一致性模型(rCM),通过引入分数蒸馏作为长跳正则化器,改进了sCM在细节生成和多样性方面的性能,适用于大规模图像和视频扩散任务。
Comments ICLR 2026
SpargeAttention2: 通过混合Top-k+Top-p掩码和蒸馏微调实现可训练稀疏注意力
机构 * Tsinghua University(清华大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 SpargeAttention2通过混合Top-k+Top-p掩码和蒸馏微调,实现高稀疏性且不降低生成质量。
SurfPhase:从稀疏视频中重建两相流三维界面动力学
机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) ; Aerospace Engineering, University of California, Irvine(加州大学伊藤分校航空航天工程系) ; School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 SurfPhase通过动态高斯surfels和视频扩散模型,从稀疏视频中重建两相流的三维界面动力学,实现高质量视角合成和速度估计。
Comments The first two authors contributed equally. Project website: https://yuegao.me/SurfPhase
FastFlow: 通过多臂老虎机推断加速生成流匹配模型
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) ; Amazon(亚马逊)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 FastFlow通过多臂老虎机推断方法,实现流匹配模型生成过程的加速,同时保持生成质量。
Comments Accepted at International Conference on Learning Representations (ICLR) 2026
ArtisanGS: 带有AI和人机协作的高斯点选择交互工具
机构 * NVIDIA ; NVIDIA Canada(NVIDIA 加拿大) ; University of Toronto Canada(多伦多大学 加拿大) ; NVIDIA France(NVIDIA 法国) ; University of Toronto(多伦多大学) ; Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所 俄亥俄州 大致) ; Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) ; Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉吉夫·甘地大学 亚当穆克 阿鲁纳恰尔邦 印度) ; Tsinghua University Haidian Qu Beijing Shi China(清华大学 海淀区 北京市 中国) ; Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心 肯塔基州 威斯康星州 美国)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 ArtisanGS通过交互式工具实现高斯点选择与分割,结合AI与人工干预,提供灵活的局部编辑功能,适用于真实场景中的可控编辑。
Comments 12 pages, includes supplementary material
AdaTSQ: 通过时间敏感量化推动扩散变换器的帕累托前沿
机构 * Shanghai Jiaotong University(上海交通大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 AdaTSQ通过时间敏感量化方法提升扩散变换器的效率与质量,优于现有方法。
Comments Code will be released at https://github.com/Qiushao-E/AdaTSQ/
重新思考扩散变换器中的全局文本条件化
机构 * Yandex Research(Yandex研究院) ; Adobe Research(Adobe研究院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文重新思考扩散变换器中的全局文本条件化,发现传统调制机制贡献有限,但通过不同视角使用池化嵌入可带来显著性能提升。
Comments Accepted at ICLR26
无条件先验很重要!改进细调扩散模型的条件生成
机构 * KAIST(韩国科学技术院)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 本文提出通过替换无条件噪声提升条件生成质量,验证了使用其他扩散模型进行无条件噪声预测的有效性。
Comments WACV 2026; Project Page: https://unconditional-priors-matter.github.io/
通过谱约束的长跳连接实现稳定高效的扩散变换器
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) ; Huazhong University of Science and Technology(华中科技大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 通过引入长跳连接和谱约束,Skip-DiT实现了图像和视频生成中的稳定高效扩散变换器,显著提升了训练和推理效率。
Comments 17 pages, 8 figures
FastPhysGS: 通过内部补全与自适应优化加速基于物理的动态3DGS仿真
机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学智能系统工程学院) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Guangdong Provincial Key Laboratory of Fire Science(广东省消防科学与智能应急技术重点实验室) ; Guangdong Provincial Key Laboratory of Robotics(广东省机器人与数字智能制造技术重点实验室)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 FastPhysGS通过内部补全与自适应优化,实现了基于物理的动态3DGS仿真的高效与稳健,提升了仿真精度和效率。
MTC-VAE:具有内容意识的多级时间压缩
机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学)
专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV
AI总结 MTC-VAE通过多级时间压缩技术提升视频压缩效率,结合内容意识方法实现高效压缩与性能优化。
FlowCast: 为可扩展的零成本推测性流匹配进行轨迹预测
机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔分校) ; University of California, Berkeley(加州大学伯克利分校) ; Inception Labs(Inception实验室) ; Adobe Research India(Adobe印度研究)
专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV
AI总结 FlowCast通过利用流匹配模型保持恒定速度的特性,实现无需训练的高效推理,提升图像生成等任务的速度2.5倍,同时保持质量。
Comments Accepted at International Conference on Learning Representations (ICLR 2026)