arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 92 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 92 篇

2608.09493 2026-08-11 cs.CV 新提交 57%

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

GeoRoute:面向交通未来帧预测的几何感知混合推理方法

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) University of Science, Ho Chi Minh City(胡志明市科学大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08460 2026-08-11 cs.CV 新提交 57%

InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions

InstructionCrafter:生成一致且高保真的视觉指令

Shun Okamoto, Satoshi Iizuka, Kazuhiro Fukui

机构 * University of Tsukuba(筑波大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本研究提出基于扩散的InstructionCrafter框架,通过空间冻结训练和两种适配器优化,实现了文本到分步视觉指令的生成,在多基准数据集上达成了最优性能且减少了噪声等问题,代码和模型将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07572 2026-08-11 cs.CV cs.AI 新提交 57%

BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference

BRACE:利用重心有理预测控制快速扩散Transformer推理中的尖锐不规则性

Jinlong Yang, Jinke Wu, Lizilin, Yao Zhou

机构 * Sichuan University(四川大学) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本研究针对扩散Transformer(DiTs)高加速推理时的质量下降问题,提出带切比雪夫增强的重心有理预测方法BRACE,通过特征驱动的有理预测实现最优质量-效率权衡,且计算开销极低。

Comments 10 pages, 6 figures, 5 tables. Project page: https://youngkinlon.github.io/BRACE-Taming-Sharp-Irregularities-via-Barycentric-Rational-Forecasting-for-Fast-DiT-Inference/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06125 2026-08-07 cs.CV 新提交 57%

Sample-Adaptive Latent Rewards for Uncertainty-Guided Diffusion Post-Training

面向不确定性引导的扩散模型后训练的样本自适应潜在奖励

Rui Li, Yuanzhi Liang, Ke Hao, Ziqiao Weng, Haibin Huang, Chi Zhang, XueLong Li

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出\textsc{SURE}框架,含\textsc{SURE-LRM}与\textsc{SURE-REFL},通过样本自适应潜在奖励与不确定性引导反馈优化扩散模型,在偏好预测、SOTA性能及VBench指标上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28737 2026-08-03 cs.LG cs.CV cs.RO 新提交 57%

Mirror Learning

镜像学习

Yunpeng Liu, Matthew Niedoba, Oluwanifemi A. Adekanye, Jason Yoo, Yingchen He, Berend Zwartsenberg, Frank Wood

机构 * University of British Columbia(不列颠哥伦比亚大学) Inverted AI Amii

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 该研究提出镜像学习框架,通过视频扩散模型的视角变换与逆动力学模型合成镜像数据,用其增强行为克隆训练可提升策略性能,为数据收集提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28611 2026-07-31 cs.CV 新提交 57%

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer

Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan

机构 * Adobe Research(奥多比研究院)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27749 2026-07-31 cs.CV cs.RO 新提交 57%

Articulated Object Reconstruction from Rest-State Observation

从静止状态观测的关节对象重建

Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

机构 * Seoul National University(首尔大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 该研究针对需多关节状态运动观测的现有关节对象重建方法的局限,提出从单一静止闭合配置重建关节对象的方法,通过显式网格融合多模型输出,结合视频扩散模型实现无运动观测下的关节参数估计,性能与多种基线相当。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19522 2026-07-23 cs.LG cs.CV 新提交 57%

Geospatial Diffusion-based Evolution Synthesis (GeoDES) for Storm-Centered Weather Augmentation

基于地理空间扩散的风暴中心天气增强演化合成(GeoDES)

Sonia Cromp, Satya Sai Srinath Namburi GNVV, Youran Wang, Grace Kisslinger, Frederic Sala, James Booth, Allegra LeGrande

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究针对机器学习天气模型预测风暴结构难题,提出基于地理空间扩散的演化合成(GeoDES)模型,该模型能合成高保真天气事件,经评估在关键指标上优于先前方法,可用于测试预测模型和扩展气象数据集。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18539 2026-07-22 cs.CV 新提交 57%

AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation

AniGS:弥合3D场景动画的渲染与扩散先验

Yen-Chi Cheng, Chen Gao, Chuhan Chen, Tuotuo Li, Rajvi Shah, Ayush Saraf, Changil Kim, Liangyan Gui, Alexander Schwing, Johannes Kopf, Hung-Yu Tseng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Waymo(Waymo公司) Carnegie Mellon University(卡内基梅隆大学) Meta

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 AniGS旨在为3DGS重建的大型场景添加动画,用规范3DGS表示场景,借时间条件变形场建模运动,利用预训练视频扩散模型及迭代更新策略,防止静态区域运动伪影,实验证明该方法能产生自然动态和高质量新视图视频。

Comments Preprint. Project page: https://yccyenchicheng.github.io/AniGS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14521 2026-07-17 cs.CV 新提交 57%

Uni-AdaVD: Universal Concept Erasure for Visual Generation via Orthogonal Value Decomposition

Uni-AdaVD:通过正交值分解实现视觉生成的通用概念擦除

Qifan Zhou, Yuan Wang, Yanbin Hao, Xiang Wang, Kuien Liu, Richang Hong, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

AI总结 针对视觉生成模型吸收不良概念问题,提出Uni-AdaVD框架,将多模态注意力值空间作为干预空间,结合正交值分解与自适应擦除移位抑制目标语义方向,实验证明其在单多概念擦除且保留非目标先验方面性能强大,为视觉生成模型提供安全机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13927 2026-07-16 cs.CV 新提交 57%

Cyclone: Diffusion Model for Cycle-Consistent Weather Editing from Unpaired Driving Data

Cyclone:基于未配对驱动数据的循环一致天气编辑扩散模型

Thang-Anh-Quan Nguyen, Moussab Bennehar, Luis Guillermo Roldao Jimenez, Nathan Piasco, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond

机构 * Huawei Paris Research Center(华为巴黎研究中心) Gustave Eiffel University(古斯塔夫·埃菲尔大学) IGN-ENSG(法国国家地理信息与森林和环境信息研究所)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对自动驾驶系统在不同天气条件下可靠感知的挑战,提出Cyclone框架,基于潜在扩散,利用循环一致约束和图像-文本模型知识,无需配对数据生成多种天气条件,实验表明其输出更优,还可提炼为视频扩散模型。

Comments Project page: https://ntaquan0125.github.io/weather-cyclone/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09125 2026-07-13 cs.CV 新提交 57%

4D Human-Scene Reconstruction from Low-Overlap Captures

从低重叠度捕获中进行4D人体场景重建

Minhyuk Hwang, Sangmin Kim, Seunguk Do, Daneul Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对现实场景中低重叠度相机的4D人体场景重建问题,提出StudioRecon方法,通过解耦背景和人体,利用视频扩散模型强化背景监督,结合跨视图关联等初始化人体,经递归增强模块避免伪影,实现了高水准新视图合成及相关应用。

Comments Accepted to SIGGRAPH Conference Papers '26. First two authors contributed equally. Project page: https://sisyphm.github.io/studiorecon-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04653 2026-07-09 cs.CV 新提交 57%

Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising

通过角色感知联合训练和模态解耦去噪增强视频物理一致性

Guangting Zheng, Haojing Chen, Hao Li, Jingtao Zhang, Zhen Yang, Xiaosong Jia, Xue Yang, Shaofeng Zhang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究针对视频扩散模型长程物理一致性挑战,提出VPT微调框架。通过角色感知信号清晰建模不同物理角色,采用模态解耦去噪策略及损失权重衰减,引入跨步自动引导,增强物理动力学,提升物理一致性与视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06555 2026-07-08 cs.CV 新提交 57%

ProxyPose: 6-DoF Pose Tracking via Video-to-Video Translation

ProxyPose:通过视频到视频转换进行六自由度姿态跟踪

Ruihang Zhang, Felix Taubner, Pooja Ravi, Kiriakos N. Kutulakos, David B. Lindell

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究旨在解决单目视频中6-DoF姿态跟踪问题,核心方法是将其转化为视频到视频转换,利用视频扩散模型生成代理视频,通过现成求解器恢复姿态。主要贡献是在无额外输入下实现高精度,且可扩展到多种场景。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03524 2026-07-07 cs.CV 新提交 57%

Perceptual Flow Matching for Few-Step Generative Modeling

用于少步生成建模的感知流匹配

Chuyang Zhao, Yifei Song, Hongfa Wang, Jianlong Yuan, Yuan Zhang, Siming Fu, Zhineng Chen, Huilin Deng, Haoyang Huang, Nan Duan

机构 * Joy Future Academy(京东探索研究院) Fudan University(复旦大学) Tsinghua University(清华大学) USTC(中国科学技术大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 提出感知流匹配框架,在感知特征空间监督流匹配,改进少步生成能力,减少采样步骤,无需教师模型和辅助分数网络,实验表明其能产生高质量结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00310 2026-07-02 cs.CV cs.AI 新提交 57%

RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail

RetailSMV:零售场景中基础视频世界模型的外视角与内视角适应

Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar, Anoop M. Namboodiri, Sashi P. Reddi

机构 * DreamVu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究零售场景下基础视频世界模型的外视角与内视角适应,发现仅用外视角数据训练的模型在多项指标上优于或等同于联合训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27277 2026-06-26 cs.AI cs.CV 新提交 57%

EO-WM: A Physically Informed World Model for Probabilistic Earth Observation Forecasting

EO-WM: 一种用于概率性地球观测预测的物理信息世界模型

Junwei Luo, Shuai Yuan, Zhenya Yang, Yansheng Li, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Wuhan University(武汉大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出EO-WM,一种视频扩散变换器,通过物理信息条件框架(气候基线、天气异常和累积应力)实现多光谱地球观测的概率性预测,在极端天气和季节匹配基准上优于现有方法。

Comments 28 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25430 2026-06-25 cs.CV 新提交 57%

PRISM: Feed-Forward Single-Image 3D Reconstruction via Geometric Warp-Residual Modeling

PRISM: 基于几何扭曲残差建模的前馈式单图像三维重建

Zhijie Zheng, Xinhao Xiang, Jiawei Zhang

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出PRISM前馈框架,将多视角潜在预测分解为无参数几何先验和可学习残差校正,无需扩散采样,推理时间仅36秒/场景,重建质量与扩散方法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24876 2026-06-24 cs.CV 新提交 57%

FLAT: Feedforward Latent Triangle Splatting for Geometrically Accurate Scene Generation

FLAT: 前馈潜在三角形泼溅用于几何精确的场景生成

Orest Kupyn, Goutam Bhat, Philipp Henzler, Fabian Manhardt, Christian Rupprecht, Federico Tombari

机构 * Google Research(谷歌研究院) University of Oxford, Visual Geometry Group(牛津大学视觉几何组) TU Munich(慕尼黑工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出FLAT方法,首次从视频扩散潜在表示中直接解码三角形泼溅,通过射线中心旋转参数化和乘积窗口函数解决梯度流问题,在保持视觉质量的同时显著提升几何精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23254 2026-06-23 cs.CV cs.AI 新提交 57%

SteerVTE: Seamless Video Text Editing with Style and Glyph Control

SteerVTE: 具有风格和字形控制的无缝视频文本编辑

Kai Zeng, Moran Li, Zhengwei Wang, Yingchen Yu, Yiheng Lin, Ruichuan An, Ming Lu, Qi She, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出SteerVTE框架,通过风格编码器和双粒度字形编码器控制冻结视频扩散模型,结合字形感知空间焦点损失和三阶段渐进训练,实现精确、连贯的视频文本编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17310 2026-06-17 cs.CV 新提交 57%

SierpinskiCam: Camera-Controlled Video Retaking with Sierpinski Triangle Pattern Cues

SierpinskiCam: 基于谢尔宾斯基三角形图案线索的相机控制视频重拍

Suttisak Wizadwongsa, Hyelin Nam, Supasorn Suwajanakorn, Jeong Joon Park

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) VISTEC, Thailand(泰国威斯泰克科学技术研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出SierpinskiCam方法,通过谢尔宾斯基圆顶纹理线索增强几何引导,并引入参考视频条件机制,解决单目视频重拍中相机大角度偏离时的稀疏区域问题,提升相机可控性、几何一致性和视频质量。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14972 2026-06-16 cs.CV 新提交 57%

ReGenHuman: Re-Generating Human Appearances for Realistic Full-Body Video Anonymization

ReGenHuman: 重新生成人体外观以实现逼真的全身视频匿名化

Adam Sun, Eshaan Barkataki, Arnold Milstein, Gordon Wetzstein, Ehsan Adeli

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出ReGenHuman,首个同时实现逼真、时间一致且天生匿名的全身视频匿名化流水线,采用“重新生成而非编辑”范式,利用结构条件微调视频扩散模型合成人体区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11180 2026-06-10 cs.CV 新提交 57%

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Lip Forcing: 用于实时唇部同步的少步自回归扩散

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park, Chulmin Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) AIPARK

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。

Comments Project Page: https://cvlab-kaist.github.io/LipForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09243 2026-06-09 cs.CV cs.AI 新提交 57%

EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric Video

EgoTactile: 从自我中心视频学习日常物体的抓取压力

Yuan Zeng, Yujia Shi, Tiao Tan, Xingting Li, Yaqi Qin, Zongqing Lu, Wenming Yang, Jing-Hao Xue, Qingmin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出EgoTactile基准和条件扩散框架EgoPressureDiff,从自我中心视频估计全手抓取压力,解决视觉-物理歧义,实现鲁棒迁移。

Comments Accepted to ICML2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09187 2026-06-09 cs.CV 新提交 57%

CP4D: Compositional Physics-aware 4D Scene Generation

CP4D: 组合式物理感知4D场景生成

Hanxin Zhu, Cong Wang, Tianyu He, Long Chen, Xin Jin, Chen Gao, Zhibo Chen

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Zhongguancun Academy(中关村学院) the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) Eastern Institute of Technology(东部技术研究所) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出CP4D范式,通过静态环境与物理动态对象组合,结合物理模拟器与视频扩散模型生成轨迹,实现高保真、物理一致的4D场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01150 2026-08-04 cs.DC 新提交 50%

Zellige: Moldable Sequence Placement for Mixed Image-Video DiT Training

Zellige:用于混合图像-视频DiT训练的可塑序列放置

Guangyu Xiang, Xueze Kang, Minwei Zhao, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 视频扩散模型 :video generation(abstract)

AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15846 2026-07-20 cs.AR 新提交 50%

DSTAR: Accelerating Diffusion Transformers via Spatial and Temporal Redundancy Reduction

DSTAR:通过减少空间和时间冗余加速扩散变换器

Chi Zhang, Jieru Zhao, Yu Feng, Chen Zhang, Quan Chen, Minyi Guo

专题命中 视频扩散模型 :video generation(abstract)

AI总结 研究针对扩散变换器多迭代推理低效耗能问题,提出软硬件协同设计框架DSTAR。算法上用细粒度混合精度量化和稀疏注意力重用机制,架构上设计专用硬件加速器,经评估在多个典型DiTs上实现显著延迟加速和节能,且不降低精度。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11025 2026-06-30 cs.LG 新提交 50%

Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

Flow-DPPO:用于流匹配模型的散度近端策略优化

Bowen Ping, Xiangxin Zhou, Penghui Qi, Minnan Luo, Liefeng Bo, Tianyu Pang

机构 * Xi’an Jiaotong University(西安交通大学) Tencent Hunyuan(腾讯混元) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 针对流匹配模型中PPO比率裁剪的结构性缺陷,提出Flow-DPPO方法,利用高斯策略的精确KL散度计算实现散度近端约束,提升奖励和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28237 2026-06-29 cs.RO 新提交 50%

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

释放无限运动:通过生成式视频先验扩展富有表现力的四足运动

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19163 2026-06-18 cs.DC 新提交 50%

Pulse: Training Acceleration for Large Diffusion Models with Automatic Pipeline Parallelism

Pulse: 面向大规模扩散模型的自动流水线并行训练加速

Boran Sun, Guoyong Jiang, Lin Zhang, Chen Chen, Yuechen Tao, Zhishu Che, Jieling Yu, Shan Chang, Huaxi Gu, Fangming Liu, Bo Li

专题命中 视频扩散模型 :video generation(abstract)

AI总结 提出PULSE自动流水线并行策略,通过将跳跃连接层同设备放置、局部缓存激活值,消除跨流水线通信,结合动态规划分区器、ILP调度合成器和混合并行调优器,在通信受限硬件上实现最高2.3倍吞吐提升。

Comments Accepted by International Conference on Distributed Computing Systems(ICDCS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏