arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

1303.5913 2013-03-26 cs.CV cs.LG cs.RO stat.ML 57%

A Diffusion Process on Riemannian Manifold for Visual Tracking

Marcus Chen, Cham Tat Jen, Pang Sze Kim, Alvina Goh

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18804 2026-08-10 stat.ML cs.LG math.ST stat.TH 版本更新 50%

Convergence of Diffusion Models Under the Manifold Hypothesis in High-Dimensions

高维流形假设下扩散模型的收敛性

Iskander Azangulov, George Deligiannidis, Judith Rousseau

专题命中 视频扩散模型 :video generation(abstract)

AI总结 该研究在流形假设下证明 DDPM 的分数学习和采样复杂度均实现与高维 ambient 空间维度无关的速率,通过建立扩散模型与高斯过程极值理论的新框架完成,解释了其经验成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01150 2026-08-04 cs.DC 新提交 50%

Zellige: Moldable Sequence Placement for Mixed Image-Video DiT Training

Zellige:用于混合图像-视频DiT训练的可塑序列放置

Guangyu Xiang, Xueze Kang, Minwei Zhao, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 视频扩散模型 :video generation(abstract)

AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15846 2026-07-20 cs.AR 新提交 50%

DSTAR: Accelerating Diffusion Transformers via Spatial and Temporal Redundancy Reduction

DSTAR:通过减少空间和时间冗余加速扩散变换器

Chi Zhang, Jieru Zhao, Yu Feng, Chen Zhang, Quan Chen, Minyi Guo

专题命中 视频扩散模型 :video generation(abstract)

AI总结 研究针对扩散变换器多迭代推理低效耗能问题,提出软硬件协同设计框架DSTAR。算法上用细粒度混合精度量化和稀疏注意力重用机制,架构上设计专用硬件加速器,经评估在多个典型DiTs上实现显著延迟加速和节能,且不降低精度。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21210 2026-07-01 cs.LG cs.CE 版本更新 50%

Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows

预训练视频模型作为可微物理模拟器用于城市风流

Janne Perini, Rafael Bischof, Moab Arar, Ayça Duran, Michael A. Kraus, Siddhartha Mishra, Bernd Bickel

机构 * ETH Zurich(苏黎世联邦理工学院) Tel Aviv University(特拉维夫大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出WinDiNet,一种预训练视频扩散模型,用于快速模拟城市风流,通过反向传播优化建筑布局以提升风安全性和行人舒适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11025 2026-06-30 cs.LG 新提交 50%

Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

Flow-DPPO:用于流匹配模型的散度近端策略优化

Bowen Ping, Xiangxin Zhou, Penghui Qi, Minnan Luo, Liefeng Bo, Tianyu Pang

机构 * Xi’an Jiaotong University(西安交通大学) Tencent Hunyuan(腾讯混元) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 针对流匹配模型中PPO比率裁剪的结构性缺陷,提出Flow-DPPO方法,利用高斯策略的精确KL散度计算实现散度近端约束,提升奖励和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28237 2026-06-29 cs.RO 新提交 50%

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

释放无限运动:通过生成式视频先验扩展富有表现力的四足运动

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19163 2026-06-18 cs.DC 新提交 50%

Pulse: Training Acceleration for Large Diffusion Models with Automatic Pipeline Parallelism

Pulse: 面向大规模扩散模型的自动流水线并行训练加速

Boran Sun, Guoyong Jiang, Lin Zhang, Chen Chen, Yuechen Tao, Zhishu Che, Jieling Yu, Shan Chang, Huaxi Gu, Fangming Liu, Bo Li

专题命中 视频扩散模型 :video generation(abstract)

AI总结 提出PULSE自动流水线并行策略,通过将跳跃连接层同设备放置、局部缓存激活值,消除跨流水线通信,结合动态规划分区器、ILP调度合成器和混合并行调优器,在通信受限硬件上实现最高2.3倍吞吐提升。

Comments Accepted by International Conference on Distributed Computing Systems(ICDCS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17566 2026-06-17 cs.DC cs.LG 新提交 50%

AoiZora: Topology-Aware Auto-Parallel Optimization for Inference of Diffusion Transformers

AoiZora: 面向扩散变换器推理的拓扑感知自动并行优化

Kaijian Wang, Yuanyuan Xu, Fanjiang Ye, Ye Cao, Jingwei Zuo, T. S. Eugene Ng, Yarong Mu, Yuke Wang

机构 * Rice University(里士大学) Independent Researcher(独立研究者) Google(谷歌)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 针对扩散变换器推理中的低延迟需求,提出AoiZora编译器,通过拓扑感知的物理布局优化自动并行策略,在TPU子片上实现高达1.42倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14988 2026-06-16 cs.GR 新提交 50%

Toward Richer Material Generation via Procedural Data Enhancement

通过程序化数据增强实现更丰富的材质生成

Yunchen Yu, Jacob Munkberg, Jon Hasselgren, Chris Cummings, Steve Marschner, Andrea Weidlich

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出一种程序化数据增强方法,将简单PBR材质的单瓣GGX镜面反射扩展为多层模型,以捕获更丰富的非漫反射效果,并通过神经材质编码和扩散模型生成实现更丰富的材质生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01205 2026-06-09 cs.RO 版本更新 50%

ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning

ImagineUAV:通过世界-动作建模和动力学规划实现空中视觉语言导航

Xuchen Liu, Jiawei Huang, Shihao Xia, Bingxi Liu, Jinqiang Cui, Jiankun Yang

机构 * Pengcheng Laboratory(鹏城实验室) School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) Guangzhou University(广州大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 针对无人机视觉语言导航中几何不一致和动力学失配问题,提出基于潜视频扩散模型的世界-动作建模框架,通过生成未来观测推断6自由度运动并规划无碰撞轨迹,以1.3B参数在基准和实际飞行中超越先前方法。

Comments Video demo: https://www.youtube.com/watch?v=Ng1alP0yhc0

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29864 2026-05-29 cs.RO 50%

LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation

LLM引导的未来假设用于多步机器人操作中的视野感知探索

Mohammad Khoshnazar, Andrew Melnik, Michael Beetz

机构 * Institute of Artificial Intelligence, University of Bremen(人工智能研究所,不莱梅大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出未来经验条件化(FEC)框架,利用LLM生成短期未来视频作为结构化先验,结合行为克隆和强化学习微调,提升多步机器人操作中的探索和策略适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17119 2026-05-25 cs.LG cs.AI 50%

Diffusion and Flow Matching Models for Tabular Data: A Survey

表格数据的扩散与流匹配模型:综述

Zhong Li, Qi Huang, Lincen Yang, Jiayang Shi, Zhao Yang, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen

机构 * Great Bay University(大湾大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) LIACS, Leiden University(莱顿大学LIACS)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文系统综述了扩散模型和流匹配模型在表格数据生成、缺失值填补、可信数据生成和异常检测等任务中的应用,分析了数据工程挑战、设计选择、评估维度及开放问题。

Comments We substantially updated the previous version "Diffusion Models for Tabular Data: Challenges, Current Progress, and Future Directions" by including flow matching models for tabular data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03924 2026-05-20 cs.LG cs.AI physics.ao-ph 50%

WIND: Weather Inverse Diffusion for Zero-Shot Atmospheric Modeling

WIND:用于零样本大气建模的天气反向扩散

Michael Aich, Andreas Fürst, Florian Sestak, Carlos Ruiz-Gonzalez, Niklas Boers, Johannes Brandstetter

机构 * Munich Climate Center(慕尼黑气候中心) Earth System Modelling Group, TUM School of Engineering(地球系统建模组,技术大学工程学院) Design, Technical University of Munich, Germany(设计,慕尼黑技术大学,德国) ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz, Austria(ELLIS单元,LIT人工智能实验室,机器学习研究所,JKU林茨,奥地利) Emmi AI GmbH, Linz, Austria(Emmi AI GmbH,林茨,奥地利) Potsdam Institute for Climate Impact Research, Potsdam, Germany(波茨坦气候影响研究所,波茨坦,德国) Department of Mathematics, University of Exeter, Exeter, United Kingdom(数学系,埃克塞特大学,埃克塞特,英国)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出WIND,一种统一的预训练基础模型,能够无需任务特定微调即可替代各种任务的专用基线,通过自监督视频重建目标预训练,实现了对大气的鲁棒、任务无关的先验学习,从而解决天气和气候问题,如概率预报、空间时间降尺度、从稀疏观测重建空间场以及强制全球干空气质量守恒。

Comments Published at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21893 2026-05-19 cs.LG cs.AI 50%

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

SIPO: 用于对齐扩散模型的人类偏好优化的稳定与改进方法

Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li

机构 * Shanghai Science and Intelligence Institute, Shanghai, China(上海科学与智能研究所) Fudan University, Shanghai, China(复旦大学) Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本研究提出SIPO框架,通过时间步感知的重要性重新加权和梯度稳定技术,解决扩散模型对齐中训练不稳定和策略偏差问题,提升了对齐效果和稳定性。

Comments This version supplements with more detailed content on reasoning and proof, additional experimental results, and ablation studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07322 2026-05-08 cs.RO cs.AI 50%

Action-to-Action Flow Matching

动作到动作流匹配

Jindou Jia, Gen Li, Xiangyu Chen, Tuo An, Yuxuan Hu, Jingliang Li, Xinying Guo, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出A2A方法,通过利用前一动作的本体感知信息进行初始化,避免了随机噪声采样带来的高延迟问题,提升了动作生成的效率和鲁棒性。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27871 2026-05-01 cs.GR 50%

D-Rex : Diffusion Rendering for Relightable Expressive Avatars

D-Rex:基于扩散的可重新照明表达性人体虚拟角色

Timo Teufel, Xilong Zhou, Umar Iqbal, Jan Kautz, Marc Habermann, Vladislav Golyanik, Christian Theobalt

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 D-Rex提出一种人特定框架,实现真实感、可重新照明、表达性和可动画化的全身体虚拟角色,通过图像空间后处理实现与虚拟角色建模的解耦,优于基于物理的可重新照明虚拟角色基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27443 2026-05-01 cs.LG cs.AI 50%

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

ABC:通过非马尔可夫扩散桥实现连续时间和空间中的任意子集自回归

Gabe Guo, Thanawat Sornwanee, Lutong Hao, Elon Litman, Stefano Ermon, Jose Blanchet

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ABC模型,通过非马尔可夫扩散桥在连续时间和空间中实现任意子集的自回归,解决了传统方法在结构相似性捕捉、噪声注入和条件化任意子集方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19683 2026-04-23 cs.RO 50%

Mask World Model: Predicting What Matters for Robust Robot Policy Learning

遮罩世界模型:为鲁棒机器人策略学习预测重要的内容

Yunfan Lou, Xiaowei Chi, Xiaojie Zhang, Zezhong Qian, Chengxuan Li, Rongyu Zhang, Yaoxu Lyu, Guoyu Song, Chuyao Fu, Haoxuan Xu, Pengwei Wang, Shanghang Zhang

机构 * Peking University, Beijing, China State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University Beijing Academy of Artificial Intelligence, Beijing, China National University of Singapore, Singapore The Hong Kong University of Science Nanjing University, Nanjing, China

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出Mask World Model,通过预测语义遮罩而非像素,提升机器人策略学习的鲁棒性与泛化能力,实验证明其在仿真和现实任务中均优于现有方法。

Comments 16 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18611 2026-04-21 cs.LG cs.AI 50%

Flow marching for a generative PDE foundation model

基于生成PDE基础模型的流推进

Zituo Chen, Sili Deng

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出Flow Marching算法,结合物理动力学误差分析,构建生成PDE基础模型,通过联合采样噪声和时间步长,学习统一速度场以减少长期漂移并实现不确定性感知的生成。同时引入P2VAE和FMT提升效率,实现大规模预训练。

Comments This work has been substantially expanded and superseded by arXiv:2602.11229

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04335 2026-04-10 cs.DC 50%

GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads

GENSERVE:高效共服务异构扩散模型工作负载

Fanjiang Ye, Zhangke Li, Xinrui Zhong, Ethan Ma, Russell Chen, Kaijian Wang, Jingwei Zuo, Desen Sun, Ye Cao, Triston Cao, Myungjin Lee, Arvind Krishnamurthy, Yuke Wang

专题命中 视频扩散模型 :text-to-video(abstract)

AI总结 GENSERVE通过利用扩散过程的可预测性,优化共服务效率,解决异构工作负载下的延迟SLA问题,实验表明其在多种配置下将SLA达成率提升44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22486 2026-04-10 stat.ML cs.LG math.ST stat.TH 50%

Flow Matching is Adaptive to Manifold Structures

流匹配适应于流形结构

Shivam Kumar, Yixin Wang, Lizhen Lin

机构 * Booth School of Business, University of Chicago(芝加哥大学布斯商学院) Department of Statistics, University of Michigan(密歇根大学统计系) Department of Mathematics, University of Maryland, College Park(马里兰大学帕克分校数学系)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文研究流匹配在流形支持下的收敛性,证明其在高维数据中适应数据几何并避免维度灾难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01552 2026-04-03 cs.LG 50%

ZEUS: Accelerating Diffusion Models with Only Second-Order Predictor

ZEUS:仅使用二阶预测器加速扩散模型

Yixiao Wang, Ting Jiang, Zishan Shao, Hancheng Ye, Jingwei Sun, Mingyuan Ma, Jianyi Zhang, Yiran Chen, Hai Li

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Computer Science, Duke University(杜克大学计算机科学系) Department of Statistical Science, Duke University(杜克大学统计科学系)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ZEUS方法,通过二阶预测器减少去噪器调用,结合交错方案稳定连续跳过,实现高效加速,提升速度-保真度性能,达到3.2倍端到端提速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06623 2026-03-10 cs.LG 50%

Advances in GRPO for Generation Models: A Survey

生成模型中GRPO的进展:综述

Zexiang Liu, Xianglong He, Yangguang Li

机构 * SJTU(上海交通大学) THU(清华大学) CUHK(香港大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02646 2026-03-04 cs.RO 50%

Compositional Visual Planning via Inference-Time Diffusion Scaling

通过推理时扩散缩放进行组合式视觉规划

Yixin Zhang, Yunhao Luo, Utkarsh Aashu Mishra, Woo Chul Shin, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Michigan(密歇根大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出通过推理时扩散缩放进行组合式视觉规划,利用Tweedie估计强制边界一致,实现长时间范围的稳定规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06597 2026-02-09 cs.LG 50%

DiTS: Multimodal Diffusion Transformers Are Time Series Forecasters

DiTS:多模态扩散变换器是时间序列预测器

Haoran Zhang, Haixuan Liu, Yong Liu, Yunzhong Qiu, Yuxuan Wang, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 DiTS通过双流Transformer块处理时间序列的内生和外生变量依赖,实现高效生成预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16163 2026-01-23 cs.AI cs.RO 50%

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

Cosmos Policy: 为视觉运动控制和规划微调视频模型

Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, Jinwei Gu

机构 * NVIDIA Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 Cosmos Policy通过单阶段后训练将预训练视频模型转化为高效机器人策略,实现视觉运动控制与规划的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04332 2025-12-25 cs.LG 50%

Data-regularized Reinforcement Learning for Diffusion Models at Scale

大规模扩散模型中的数据正则化强化学习

Haotian Ye, Kaiwen Zheng, Jiashu Xu, Puheng Li, Huayu Chen, Jiaqi Han, Sheng Liu, Qinsheng Zhang, Hanzi Mao, Zekun Hao, Prithvijit Chattopadhyay, Dinghao Yang, Liang Feng, Maosheng Liao, Junjie Bai, Ming-Yu Liu, James Zou, Stefano Ermon

机构 * Stanford University(斯坦福大学) NVIDIA Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 DDRL通过数据正则化方法提升扩散模型的奖励表现,有效缓解奖励黑客问题,实现高分辨率视频生成中的高人偏好和可扩展训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14133 2025-12-17 cs.GR 50%

AnimaMimic: Imitating 3D Animation from Video Priors

AnimaMimic:从视频先验模仿3D动画

Tianyi Xie, Yunuo Chen, Yaowei Guo, Yin Yang, Bolei Zhou, Demetri Terzopoulos, Ying Jiang, Chenfanfu Jiang

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 AnimaMimic通过视频扩散模型学习的运动先验,实现静态3D网格的自动动画生成,结合物理模拟提升真实感,整合进标准动画流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15979 2025-11-18 cs.GR cs.AI 50%

Dream, Lift, Animate: From Single Images to Animatable Gaussian Avatars

Marcel C. Bühler, Ye Yuan, Xueting Li, Yangyi Huang, Koki Nagano, Umar Iqbal

机构 * ETH Zurich(苏黎世联邦理工学院) NVIDIA(英伟达) Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video diffusion(abstract)

Comments Accepted to 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏