arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

2603.05081 2026-03-06 cs.CV 57%

Orthogonal Spatial-temporal Distributional Transfer for 4D Generation

正交时空分布式转移用于4D生成

Wei Liu, Shengqiong Wu, Bobo Li, Haoyu Zhao, Hao Fei, Mong-Li Lee, Wynne Hsu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出正交时空分布式转移机制,通过解耦空间和时间潜在变量提升4D生成的质量和一致性。

Comments 9 pages, 6 figures, 3 tables, AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05106 2026-03-06 cs.CV cs.GR cs.LG cs.RO 57%

NeuralRemaster: Phase-Preserving Diffusion for Structure-Aligned Generation

NeuralRemaster: 保留相位的扩散用于结构对齐生成

Yu Zeng, Charles Ochoa, Mingyuan Zhou, Vishal M. Patel, Vitor Guizilini, Rowan McAllister

机构 * Toyota Research Institute(丰田研究院) University of Texas, Austin(德克萨斯大学奥斯汀分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 NeuralRemaster通过保留相位并随机化幅度,实现结构对齐的图像和视频生成,提升模拟到现实的转换性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04338 2026-03-05 cs.CV 57%

ArtHOI: Articulated Human-Object Interaction Synthesis by 4D Reconstruction from Video Priors

ArtHOI: 通过视频先验进行4D重建的可变形人-物交互合成

Zihao Huang, Tianqi Liu, Zhaoxi Chen, Shaocong Xu, Saining Zhang, Lixing Xiao, Zhiguo Cao, Wei Li, Hao Zhao, Ziwei Liu

机构 * School of AIA, Huazhong University of Science and Technology(华中科技大学人工智能学院) the S-Lab, Nanyang Technological University (NTU)(南洋理工大学S实验室) the Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) Zhejiang University (ZJU)(浙江大学) the Institute for AI Industry Research (AIR), Tsinghua University (THU)(清华大学人工智能产业研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ArtHOI通过4D重建从视频先验生成可变形人-物交互,提升接触精度和物理合理性。

Comments Project Page: https://arthoi.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16957 2026-03-05 cs.CV 57%

MatPedia: A Universal Generative Foundation for High-Fidelity Material Synthesis

MatPedia: 一种通用生成基础,用于高保真材料合成

Di Luo, Shuhui Yang, Mingxin Yang, Jiawei Lu, Yixuan Tang, Xintong Han, Zhuo Chen, Beibei Wang, Chunchao Guo

机构 * Nankai University(南开大学) Tencent Hunyuan(腾讯文言) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 MatPedia是一种基于联合RGB-PBR表示的生成模型,能够统一处理多种材料生成任务,实现高质量的高保真材料合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08184 2026-03-05 cs.CV 57%

Scaling Laws For Diffusion Transformers

扩散变换器的扩展定律

Zhengyang Liang, Hao He, Ceyuan Yang, Bo Dai

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文研究了扩散变换器的扩展定律,通过实验验证了模型大小、数据需求与计算预算之间的幂律关系,并展示了预训练损失与生成性能的一致性,为模型性能和数据质量评估提供了可预测的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02256 2026-03-04 cs.CV 57%

CamDirector: Towards Long-Term Coherent Video Trajectory Editing

CamDirector: 向长期一致的视频轨迹编辑迈进

Zhihao Shi, Kejia Yin, Weilin Wan, Yuhongze Zhou, Yuanhao Yu, Xinxin Zuo, Qiang Sun, Juwei Lu

机构 * McMaster University(麦克 master 大学) University of Toronto(多伦多大学) The University of Hong Kong(香港大学) McGill University(麦吉尔大学) Concordia University(Concordia 大学) MBZUAI

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 CamDirector通过混合变形方案和历史引导的自回归扩散模型,实现长期一致的视频轨迹编辑,并提出新的VTE基准iPhone-PTZ。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16397 2026-03-04 cs.CV 57%

Scale-wise Distillation of Diffusion Models

扩散模型的分层蒸馏

Nikita Starodubcev, Ilya Drobyshevskiy, Denis Kuznedelev, Artem Babenko, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) HSE University(俄罗斯高等经济大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SwD通过分层蒸馏框架提升扩散模型效率,引入MMD补丁级目标改进收敛性,实现更快采样和更高性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02129 2026-03-03 cs.CV cs.AI 57%

LiftAvatar: Kinematic-Space Completion for Expression-Controlled 3D Gaussian Avatar Animation

LiftAvatar:基于运动空间的表达控制3D高斯人偶动画

Hualiang Wei, Shunran Jia, Jialun Liu, Wenhui Li

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Institute of Artificial Intelligence of China Telecom(中国电信人工智能研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LiftAvatar通过多粒度表达控制和多参考条件机制,提升3D人偶动画的质量和可控性。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01096 2026-03-03 cs.CV cs.AI cs.CL cs.LG 57%

Unified Vision-Language Modeling via Concept Space Alignment

通过概念空间对齐实现统一的视觉-语言建模

Yifu Qiu, Paul-Ambroise Duquenne, Holger Schwenk

机构 * University of Edinburgh(爱丁堡大学) FAIR at Meta(Meta公司FAIR团队)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

AI总结 通过概念空间对齐实现统一的视觉-语言建模,V-SONAR在多语言和多模态任务中超越现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21333 2026-03-03 cs.CV 57%

HorizonForge: Driving Scene Editing with Any Trajectories and Any Vehicles

HorizonForge: 通过任意轨迹和任意车辆驱动场景编辑

Yifan Wang, Francesco Pittaluga, Zaid Tasneem, Chenyu You, Manmohan Chandraker, Ziyu Jiang

机构 * NEC Labs America(NEC美国实验室) Stony Brook University(石溪大学) UC San Diego(圣地亚哥大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 HorizonForge通过任意轨迹和车辆实现驾驶场景的可控编辑,利用高斯溅射体和网格表示,结合视频扩散技术,提升生成场景的真实性和可控性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23258 2026-03-03 cs.CV 57%

Plug-and-Play Fidelity Optimization for Diffusion Transformer Acceleration via Cumulative Error Minimization

通过累积误差最小化实现扩散变换器加速的即插即用保真优化

Tong Shao, Yusen Fu, Guoying Sun, Jingde Kong, Zhuotao Tian, Jingyong Su

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 通过累积误差最小化实现扩散变换器加速的即插即用保真优化,提升生成保真度并优于现有方法。

Comments 29 pages, ICLR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24208 2026-03-02 cs.CV cs.LG 57%

SenCache: Accelerating Diffusion Model Inference via Sensitivity-Aware Caching

SenCache: 通过敏感性感知缓存加速扩散模型推理

Yasaman Haghighi, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 SenCache通过敏感性感知缓存策略,提升扩散模型推理效率与视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24148 2026-03-02 cs.CV 57%

HumanOrbit: 3D Human Reconstruction as 360° Orbit Generation

HumanOrbit:3D人体重建作为360°轨道生成

Keito Suzuki, Kunyao Chen, Lei Wang, Bang Du, Runfa Blark Li, Peng Liu, Ning Bi, Truong Nguyen

机构 * University of California, San Diego(加州大学圣地亚哥分校) Qualcomm(高通公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 HumanOrbit通过视频扩散模型实现多视角人体生成,生成360°轨道视频并重建高保真3D模型。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12099 2026-02-27 cs.CV 57%

G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior

G4Splat:基于生成先验的几何引导高斯点云法

Junfeng Ni, Yixin Chen, Zhifei Yang, Yu Liu, Ruijie Lu, Song-Chun Zhu, Siyuan Huang

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI Peking University(北京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 G4Splat通过几何引导的生成先验提升3D场景重建,有效解决多视角不一致性问题,实现高质量场景补全。

Comments ICLR'26. Project page: https://dali-jack.github.io/g4splat-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06139 2026-02-27 cs.CV 57%

Deforming Videos to Masks: Flow Matching for Referring Video Segmentation

视频变形到掩码:用于指认视频分割的流匹配

Zanyi Wang, Dengyang Jiang, Liuzhuozheng Li, Sizhe Dang, Chengzu Li, Harry Yang, Guang Dai, Mengmeng Wang, Jingdong Wang

机构 * SGIT AI Lab, State Grid Corporation of China(国网信通研究院) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong University of Science and Technology(香港科技大学) The University of Tokyo(东京大学) University of Cambridge(剑桥大学) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV

AI总结 本文提出FlowRVS框架,将指认视频分割视为条件连续流问题,通过学习视频整体表示到目标掩码的直接语言引导变形,在多个基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22596 2026-02-27 cs.CV cs.AI 57%

BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model

BetterScene: 一种基于表示对齐生成模型的3D场景合成

Yuci Han, Charles Toth, John E. Anderson, William J. Shuart, Alper Yilmaz

机构 * Dept. of Electrical and Computer Engineering, The Ohio State University(电气与计算机工程系,俄亥俄州立大学) USACE ERDC GRL(美国陆军工程兵队ERDC GRL)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 BetterScene通过引入时间等价性正则化和视觉基础模型对齐的表示,提升3D场景合成的视角一致性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19089 2026-02-24 cs.CV cs.GR cs.LG 57%

Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling

Ani3DHuman:基于自引导随机采样的逼真3D人体动画

Qi Sun, Can Wang, Jiaxiang Shang, Yingchun Liu, Jing Liao

机构 * City University of Hong Kong(香港城市大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Ani3DHuman通过结合运动学动画与视频扩散先验,利用自引导随机采样实现逼真3D人体动画生成。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16968 2026-02-20 cs.CV cs.AI 57%

DDiT: Dynamic Patch Scheduling for Efficient Diffusion Transformers

DDiT: 动态补丁调度用于高效的扩散变换器

Dahye Kim, Deepti Ghadiyaram, Raghudeep Gadde

机构 * Boston University(波士顿大学) Amazon(亚马逊)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 DDiT通过动态调整补丁大小,在保持生成质量的同时显著提升扩散变换器的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08431 2026-02-17 cs.CV cs.LG 57%

Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency

大规模扩散蒸馏的连续时间一致性 via 分数正则化

Kaiwen Zheng, Yuji Wang, Qianli Ma, Huayu Chen, Jintao Zhang, Yogesh Balaji, Jianfei Chen, Ming-Yu Liu, Jun Zhu, Qinsheng Zhang

机构 * Dept. of Comp. Sci. & Tech., BNRist Center, THU-Bosch ML Center, AI Institute, Tsinghua(清华大学计算机科学与技术系,BNRist中心,THU-Bosch机器学习中心,人工智能研究院) NVIDIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出分数正则化的连续时间一致性模型(rCM),通过引入分数蒸馏作为长跳正则化器,改进了sCM在细节生成和多样性方面的性能,适用于大规模图像和视频扩散任务。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13515 2026-02-17 cs.CV cs.LG 57%

SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning

SpargeAttention2: 通过混合Top-k+Top-p掩码和蒸馏微调实现可训练稀疏注意力

Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SpargeAttention2通过混合Top-k+Top-p掩码和蒸馏微调,实现高稀疏性且不降低生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11154 2026-02-12 cs.CV 57%

SurfPhase: 3D Interfacial Dynamics in Two-Phase Flows from Sparse Videos

SurfPhase:从稀疏视频中重建两相流三维界面动力学

Yue Gao, Hong-Xing Yu, Sanghyeon Chang, Qianxi Fu, Bo Zhu, Yoonjin Won, Juan Carlos Niebles, Jiajun Wu

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Aerospace Engineering, University of California, Irvine(加州大学伊藤分校航空航天工程系) School of Interactive Computing, Georgia Institute of Technology(佐治亚理工学院交互计算学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SurfPhase通过动态高斯surfels和视频扩散模型,从稀疏视频中重建两相流的三维界面动力学,实现高质量视角合成和速度估计。

Comments The first two authors contributed equally. Project website: https://yuegao.me/SurfPhase

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11105 2026-02-12 cs.CV 57%

FastFlow: Accelerating The Generative Flow Matching Models with Bandit Inference

FastFlow: 通过多臂老虎机推断加速生成流匹配模型

Divya Jyoti Bajpai, Dhruv Bhardwaj, Soumya Roy, Tejas Duseja, Harsh Agarwal, Aashay Sandansing, Manjesh Kumar Hanawal

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Amazon(亚马逊)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 FastFlow通过多臂老虎机推断方法,实现流匹配模型生成过程的加速,同时保持生成质量。

Comments Accepted at International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10173 2026-02-12 cs.CV 57%

ArtisanGS: Interactive Tools for Gaussian Splat Selection with AI and Human in the Loop

ArtisanGS: 带有AI和人机协作的高斯点选择交互工具

Clement Fuji Tsang, Anita Hu, Or Perel, Carsten Kolve, Maria Shugrina

机构 * NVIDIA NVIDIA Canada(NVIDIA 加拿大) University of Toronto Canada(多伦多大学 加拿大) NVIDIA France(NVIDIA 法国) University of Toronto(多伦多大学) Institute for Clarity in Documentation Dublin Ohio USA(文档清晰研究所 俄亥俄州 大致) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University Doimukh Arunachal Pradesh India(拉吉夫·甘地大学 亚当穆克 阿鲁纳恰尔邦 印度) Tsinghua University Haidian Qu Beijing Shi China(清华大学 海淀区 北京市 中国) Palmer Research Laboratories San Antonio Texas USA(帕勒研究中心 肯塔基州 威斯康星州 美国)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ArtisanGS通过交互式工具实现高斯点选择与分割,结合AI与人工干预,提供灵活的局部编辑功能,适用于真实场景中的可控编辑。

Comments 12 pages, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09883 2026-02-11 cs.CV 57%

AdaTSQ: Pushing the Pareto Frontier of Diffusion Transformers via Temporal-Sensitivity Quantization

AdaTSQ: 通过时间敏感量化推动扩散变换器的帕累托前沿

Shaoqiu Zhang, Zizhong Ding, Kaicheng Yang, Junyi Wu, Xianglong Yan, Xi Li, Bingnan Duan, Jianping Fang, Yulun Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 AdaTSQ通过时间敏感量化方法提升扩散变换器的效率与质量,优于现有方法。

Comments Code will be released at https://github.com/Qiushao-E/AdaTSQ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09268 2026-02-11 cs.CV 57%

Rethinking Global Text Conditioning in Diffusion Transformers

重新思考扩散变换器中的全局文本条件化

Nikita Starodubcev, Daniil Pakhomov, Zongze Wu, Ilya Drobyshevskiy, Yuchen Liu, Zhonghao Wang, Yuqian Zhou, Zhe Lin, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文重新思考扩散变换器中的全局文本条件化,发现传统调制机制贡献有限,但通过不同视角使用池化嵌入可带来显著性能提升。

Comments Accepted at ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20240 2026-02-11 cs.CV 57%

Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion Models

无条件先验很重要!改进细调扩散模型的条件生成

Prin Phunyaphibarn, Phillip Y. Lee, Jaihoon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出通过替换无条件噪声提升条件生成质量,验证了使用其他扩散模型进行无条件噪声预测的有效性。

Comments WACV 2026; Project Page: https://unconditional-priors-matter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17616 2026-02-10 cs.CV 57%

Towards Stabilized and Efficient Diffusion Transformers through Long-Skip-Connections with Spectral Constraints

通过谱约束的长跳连接实现稳定高效的扩散变换器

Guanjie Chen, Xinyu Zhao, Yucheng Zhou, Xiaoye Qu, Tianlong Chen, Yu Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 通过引入长跳连接和谱约束,Skip-DiT实现了图像和视频生成中的稳定高效扩散变换器,显著提升了训练和推理效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01723 2026-02-03 cs.CV 57%

FastPhysGS: Accelerating Physics-based Dynamic 3DGS Simulation via Interior Completion and Adaptive Optimization

FastPhysGS: 通过内部补全与自适应优化加速基于物理的动态3DGS仿真

Yikun Ma, Yiqing Li, Jingwen Ye, Zhongkai Wu, Weidong Zhang, Lin Gao, Zhi Jin

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学智能系统工程学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Guangdong Provincial Key Laboratory of Fire Science(广东省消防科学与智能应急技术重点实验室) Guangdong Provincial Key Laboratory of Robotics(广东省机器人与数字智能制造技术重点实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 FastPhysGS通过内部补全与自适应优化,实现了基于物理的动态3DGS仿真的高效与稳健,提升了仿真精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01340 2026-02-03 cs.CV 57%

MTC-VAE: Multi-Level Temporal Compression with Content Awareness

MTC-VAE:具有内容意识的多级时间压缩

Yubo Dong, Linchao Zhu

机构 * ReLER, CCAI, Zhejiang University(ReLER、CCAI、浙江大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 MTC-VAE通过多级时间压缩技术提升视频压缩效率,结合内容意识方法实现高效压缩与性能优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01329 2026-02-03 cs.CV 57%

FlowCast: Trajectory Forecasting for Scalable Zero-Cost Speculative Flow Matching

FlowCast: 为可扩展的零成本推测性流匹配进行轨迹预测

Divya Jyoti Bajpai, Shubham Agarwal, Apoorv Saxena, Kuldeep Kulkarni, Subrata Mitra, Manjesh Kumar Hanawal

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔分校) University of California, Berkeley(加州大学伯克利分校) Inception Labs(Inception实验室) Adobe Research India(Adobe印度研究)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 FlowCast通过利用流匹配模型保持恒定速度的特性,实现无需训练的高效推理,提升图像生成等任务的速度2.5倍,同时保持质量。

Comments Accepted at International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏