A Diffusion Process on Riemannian Manifold for Visual Tracking
专题命中 视频扩散模型 :long video(abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频扩散模型 :long video(abstract);分类 cs.CV
高维流形假设下扩散模型的收敛性
专题命中 视频扩散模型 :video generation(abstract)
AI总结 该研究在流形假设下证明 DDPM 的分数学习和采样复杂度均实现与高维 ambient 空间维度无关的速率,通过建立扩散模型与高斯过程极值理论的新框架完成,解释了其经验成功。
Zellige:用于混合图像-视频DiT训练的可塑序列放置
专题命中 视频扩散模型 :video generation(abstract)
AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。
DSTAR:通过减少空间和时间冗余加速扩散变换器
专题命中 视频扩散模型 :video generation(abstract)
AI总结 研究针对扩散变换器多迭代推理低效耗能问题,提出软硬件协同设计框架DSTAR。算法上用细粒度混合精度量化和稀疏注意力重用机制,架构上设计专用硬件加速器,经评估在多个典型DiTs上实现显著延迟加速和节能,且不降低精度。
Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)
预训练视频模型作为可微物理模拟器用于城市风流
机构 * ETH Zurich(苏黎世联邦理工学院) ; Tel Aviv University(特拉维夫大学) ; TU Darmstadt(达姆施塔特工业大学)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 本文提出WinDiNet,一种预训练视频扩散模型,用于快速模拟城市风流,通过反向传播优化建筑布局以提升风安全性和行人舒适度。
Flow-DPPO:用于流匹配模型的散度近端策略优化
机构 * Xi’an Jiaotong University(西安交通大学) ; Tencent Hunyuan(腾讯混元) ; National University of Singapore(新加坡国立大学)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 针对流匹配模型中PPO比率裁剪的结构性缺陷,提出Flow-DPPO方法,利用高斯策略的精确KL散度计算实现散度近端约束,提升奖励和训练稳定性。
释放无限运动:通过生成式视频先验扩展富有表现力的四足运动
机构 * Amap, Alibaba Group(高德,阿里巴巴集团)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。
Pulse: 面向大规模扩散模型的自动流水线并行训练加速
专题命中 视频扩散模型 :video generation(abstract)
AI总结 提出PULSE自动流水线并行策略,通过将跳跃连接层同设备放置、局部缓存激活值,消除跨流水线通信,结合动态规划分区器、ILP调度合成器和混合并行调优器,在通信受限硬件上实现最高2.3倍吞吐提升。
Comments Accepted by International Conference on Distributed Computing Systems(ICDCS'26)
AoiZora: 面向扩散变换器推理的拓扑感知自动并行优化
机构 * Rice University(里士大学) ; Independent Researcher(独立研究者) ; Google(谷歌)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 针对扩散变换器推理中的低延迟需求,提出AoiZora编译器,通过拓扑感知的物理布局优化自动并行策略,在TPU子片上实现高达1.42倍的加速。
通过程序化数据增强实现更丰富的材质生成
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 提出一种程序化数据增强方法,将简单PBR材质的单瓣GGX镜面反射扩展为多层模型,以捕获更丰富的非漫反射效果,并通过神经材质编码和扩散模型生成实现更丰富的材质生成。
ImagineUAV:通过世界-动作建模和动力学规划实现空中视觉语言导航
机构 * Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) ; Guangzhou University(广州大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 针对无人机视觉语言导航中几何不一致和动力学失配问题,提出基于潜视频扩散模型的世界-动作建模框架,通过生成未来观测推断6自由度运动并规划无碰撞轨迹,以1.3B参数在基准和实际飞行中超越先前方法。
Comments Video demo: https://www.youtube.com/watch?v=Ng1alP0yhc0
LLM引导的未来假设用于多步机器人操作中的视野感知探索
机构 * Institute of Artificial Intelligence, University of Bremen(人工智能研究所,不莱梅大学)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 提出未来经验条件化(FEC)框架,利用LLM生成短期未来视频作为结构化先验,结合行为克隆和强化学习微调,提升多步机器人操作中的探索和策略适应能力。
表格数据的扩散与流匹配模型:综述
机构 * Great Bay University(大湾大学) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; LIACS, Leiden University(莱顿大学LIACS)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 本文系统综述了扩散模型和流匹配模型在表格数据生成、缺失值填补、可信数据生成和异常检测等任务中的应用,分析了数据工程挑战、设计选择、评估维度及开放问题。
Comments We substantially updated the previous version "Diffusion Models for Tabular Data: Challenges, Current Progress, and Future Directions" by including flow matching models for tabular data
WIND:用于零样本大气建模的天气反向扩散
机构 * Munich Climate Center(慕尼黑气候中心) ; Earth System Modelling Group, TUM School of Engineering(地球系统建模组,技术大学工程学院) ; Design, Technical University of Munich, Germany(设计,慕尼黑技术大学,德国) ; ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz, Austria(ELLIS单元,LIT人工智能实验室,机器学习研究所,JKU林茨,奥地利) ; Emmi AI GmbH, Linz, Austria(Emmi AI GmbH,林茨,奥地利) ; Potsdam Institute for Climate Impact Research, Potsdam, Germany(波茨坦气候影响研究所,波茨坦,德国) ; Department of Mathematics, University of Exeter, Exeter, United Kingdom(数学系,埃克塞特大学,埃克塞特,英国)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 本文提出WIND,一种统一的预训练基础模型,能够无需任务特定微调即可替代各种任务的专用基线,通过自监督视频重建目标预训练,实现了对大气的鲁棒、任务无关的先验学习,从而解决天气和气候问题,如概率预报、空间时间降尺度、从稀疏观测重建空间场以及强制全球干空气质量守恒。
Comments Published at the 43rd International Conference on Machine Learning (ICML 2026)
SIPO: 用于对齐扩散模型的人类偏好优化的稳定与改进方法
机构 * Shanghai Science and Intelligence Institute, Shanghai, China(上海科学与智能研究所) ; Fudan University, Shanghai, China(复旦大学) ; Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 本研究提出SIPO框架,通过时间步感知的重要性重新加权和梯度稳定技术,解决扩散模型对齐中训练不稳定和策略偏差问题,提升了对齐效果和稳定性。
Comments This version supplements with more detailed content on reasoning and proof, additional experimental results, and ablation studies
动作到动作流匹配
机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 本文提出A2A方法,通过利用前一动作的本体感知信息进行初始化,避免了随机噪声采样带来的高延迟问题,提升了动作生成的效率和鲁棒性。
Comments 20 pages, 19 figures
D-Rex:基于扩散的可重新照明表达性人体虚拟角色
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 D-Rex提出一种人特定框架,实现真实感、可重新照明、表达性和可动画化的全身体虚拟角色,通过图像空间后处理实现与虚拟角色建模的解耦,优于基于物理的可重新照明虚拟角色基线。
ABC:通过非马尔可夫扩散桥实现连续时间和空间中的任意子集自回归
机构 * Stanford University(斯坦福大学)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 本文提出ABC模型,通过非马尔可夫扩散桥在连续时间和空间中实现任意子集的自回归,解决了传统方法在结构相似性捕捉、噪声注入和条件化任意子集方面的不足。
遮罩世界模型:为鲁棒机器人策略学习预测重要的内容
机构 * Peking University, Beijing, China ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University ; Beijing Academy of Artificial Intelligence, Beijing, China ; National University of Singapore, Singapore ; The Hong Kong University of Science ; Nanjing University, Nanjing, China
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 本文提出Mask World Model,通过预测语义遮罩而非像素,提升机器人策略学习的鲁棒性与泛化能力,实验证明其在仿真和现实任务中均优于现有方法。
Comments 16 pages,5 figures
基于生成PDE基础模型的流推进
机构 * Department of Mechanical Engineering(机械工程系) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 本文提出Flow Marching算法,结合物理动力学误差分析,构建生成PDE基础模型,通过联合采样噪声和时间步长,学习统一速度场以减少长期漂移并实现不确定性感知的生成。同时引入P2VAE和FMT提升效率,实现大规模预训练。
Comments This work has been substantially expanded and superseded by arXiv:2602.11229
GENSERVE:高效共服务异构扩散模型工作负载
专题命中 视频扩散模型 :text-to-video(abstract)
AI总结 GENSERVE通过利用扩散过程的可预测性,优化共服务效率,解决异构工作负载下的延迟SLA问题,实验表明其在多种配置下将SLA达成率提升44%。
流匹配适应于流形结构
机构 * Booth School of Business, University of Chicago(芝加哥大学布斯商学院) ; Department of Statistics, University of Michigan(密歇根大学统计系) ; Department of Mathematics, University of Maryland, College Park(马里兰大学帕克分校数学系)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 本文研究流匹配在流形支持下的收敛性,证明其在高维数据中适应数据几何并避免维度灾难。
ZEUS:仅使用二阶预测器加速扩散模型
机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) ; Department of Computer Science, Duke University(杜克大学计算机科学系) ; Department of Statistical Science, Duke University(杜克大学统计科学系)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 本文提出ZEUS方法,通过二阶预测器减少去噪器调用,结合交错方案稳定连续跳过,实现高效加速,提升速度-保真度性能,达到3.2倍端到端提速。
生成模型中GRPO的进展:综述
机构 * SJTU(上海交通大学) ; THU(清华大学) ; CUHK(香港大学)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。
通过推理时扩散缩放进行组合式视觉规划
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Michigan(密歇根大学)
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 本文提出通过推理时扩散缩放进行组合式视觉规划,利用Tweedie估计强制边界一致,实现长时间范围的稳定规划。
DiTS:多模态扩散变换器是时间序列预测器
机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 DiTS通过双流Transformer块处理时间序列的内生和外生变量依赖,实现高效生成预测。
Cosmos Policy: 为视觉运动控制和规划微调视频模型
机构 * NVIDIA ; Stanford University(斯坦福大学)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 Cosmos Policy通过单阶段后训练将预训练视频模型转化为高效机器人策略,实现视觉运动控制与规划的先进性能。
大规模扩散模型中的数据正则化强化学习
机构 * Stanford University(斯坦福大学) ; NVIDIA ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 DDRL通过数据正则化方法提升扩散模型的奖励表现,有效缓解奖励黑客问题,实现高分辨率视频生成中的高人偏好和可扩展训练。
AnimaMimic:从视频先验模仿3D动画
专题命中 视频扩散模型 :video diffusion(abstract)
AI总结 AnimaMimic通过视频扩散模型学习的运动先验,实现静态3D网格的自动动画生成,结合物理模拟提升真实感,整合进标准动画流程。
机构 * ETH Zurich(苏黎世联邦理工学院) ; NVIDIA(英伟达) ; Chinese University of Hong Kong(香港中文大学)
专题命中 视频扩散模型 :video diffusion(abstract)
Comments Accepted to 3DV 2026