arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2606.01538 2026-06-12 cs.GR cs.CV cs.LG 版本更新 57%

MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics

MPMWorlds: 用于推断和外推物理动力学的物质点法模拟

Žiga Kovačič, Kevin Ellis

机构 * Cornell University(康奈尔大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 通过构建2D物质点法(MPM)模拟数据集,研究从视频推断物理动力学并外推时间演化的能力,比较代码生成与视频扩散方法的优劣。

Comments 16 pages, 13 figures. Project page: https://zzigak.github.io/mpmworlds/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11180 2026-06-10 cs.CV 新提交 57%

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Lip Forcing: 用于实时唇部同步的少步自回归扩散

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park, Chulmin Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) AIPARK

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。

Comments Project Page: https://cvlab-kaist.github.io/LipForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09243 2026-06-09 cs.CV cs.AI 新提交 57%

EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric Video

EgoTactile: 从自我中心视频学习日常物体的抓取压力

Yuan Zeng, Yujia Shi, Tiao Tan, Xingting Li, Yaqi Qin, Zongqing Lu, Wenming Yang, Jing-Hao Xue, Qingmin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出EgoTactile基准和条件扩散框架EgoPressureDiff,从自我中心视频估计全手抓取压力,解决视觉-物理歧义,实现鲁棒迁移。

Comments Accepted to ICML2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09187 2026-06-09 cs.CV 新提交 57%

CP4D: Compositional Physics-aware 4D Scene Generation

CP4D: 组合式物理感知4D场景生成

Hanxin Zhu, Cong Wang, Tianyu He, Long Chen, Xin Jin, Chen Gao, Zhibo Chen

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Zhongguancun Academy(中关村学院) the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) Eastern Institute of Technology(东部技术研究所) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出CP4D范式,通过静态环境与物理动态对象组合,结合物理模拟器与视频扩散模型生成轨迹,实现高保真、物理一致的4D场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02919 2026-06-08 cs.CV 版本更新 57%

Pixel Cube: Diffusion-based Portrait Video Relighting Through Realistic Lighting Reproduction

Pixel Cube: 基于扩散的肖像视频重光照通过真实感光照再现

Yufan Zhang, Yu Ji, Ayo Ajiboye, Rundi Wu, Yu Guo, Changxi Zheng, Jinwei Ye

机构 * George Mason University(乔治·马歇尔大学) LightThought LLC Columbia University(哥伦比亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出一种基于扩散的方法,利用混合训练数据集和HDR环境图控制,实现动态肖像视频的真实感重光照,保持时间一致性和身份特征。

Comments ACM SIGGRAPH 2026 Journal Track / ACM Transactions on Graphics, 17 pages. Project page: https://yufanzhang82.github.io/PixelCube/

Journal ref ACM Trans. Graph. 45, 4, Article 119 (July 2026), 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02577 2026-06-02 cs.RO cs.CV 57%

RoboDream: Compositional World Models for Scalable Robot Data Synthesis

RoboDream: 用于可扩展机器人数据合成的组合世界模型

Junjie Ye, Rong Xue, Basile Van Hoorick, Runhao Li, Harshitha Rajaprakash, Pavel Tokmakov, Muhammad Zubair Irshad, Vitor Guizilini, Yue Wang

机构 * USC Physical Superintelligence (PSI) Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出一种以具身为中心的组合世界模型,通过将轨迹执行与环境合成解耦,实现从新视角、新场景和新物体中合成逼真演示数据,并展示其在数据扩展和减少真实数据需求方面的有效性。

Comments Project page: https://junjieye.com/RoboDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00664 2026-06-02 cs.RO cs.CV 57%

SKIP: Sparse Keyframe Interpolation Paradigm for Efficient Embodied World Models

SKIP: 用于高效具身世界模型的稀疏关键帧插值范式

Ziheng He, Yixiang Chen, Ning Yang, Zhanqian Wu, Qisen Ma, Yuan Xu, Jiabing Yang, Peiyan Li, Xiangnan Wu, Xiaofeng Wang, Zheng Zhu, Jing Liu, Nianfeng Liu, Yan Huang

机构 * UCAS(中国科学院自动化研究所) CASIA(中国科学院自动化研究所) NJU(南京大学) GigaAI THU(清华大学) FiveAges

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出稀疏关键帧插值范式(SKIP),通过识别任务相关关键帧并仅生成这些帧,再基于机器人动作插值缺失帧,实现高效视频生成,在LIBERO上速度提升4.16倍,FVD降低89%,且生成视频作为训练数据时策略性能下降极小。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05435 2026-06-02 cs.CV 57%

Stable Velocity: A Variance Perspective on Flow Matching

稳定速度:流匹配的方差视角

Donglin Yang, Yongxing Zhang, Xin Yu, Liang Hou, Xin Tao, Pengfei Wan, Xiaojuan Qi, Renjie Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

AI总结 针对流匹配中单样本条件速度导致的高方差训练目标,提出稳定速度框架,通过方差表征识别高低方差区域,并引入无偏方差缩减目标(StableVM)、方差感知表示对齐(VA-REPA)以及免微调加速采样(StableVS),在多个大规模模型上实现训练效率提升和超过2倍采样加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31595 2026-06-01 cs.CV 57%

Learning Global Motion with Compact Gaussians for Feed-Forward 4D Reconstruction

利用紧凑高斯体学习全局运动的前馈式4D重建

Mungyeom Kim, Minkyeong Jeon, Honggyu An, Jaewoo Jung, Hyuna Ko, Jisang Han, Hyeonseo Yu, Donghwan Shin, Sunghwan Hong, Takuya Narihira, Kazumi Fukuda, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) ETH Zürich, ETH AI Center(苏黎世联邦理工学院,ETH人工智能中心) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出C4G框架,通过紧凑的可学习高斯查询令牌和视频扩散模型增强渲染,实现无需相机位姿的前馈式4D动态场景重建,显著减少高斯数量并提升运动建模鲁棒性。

Comments Project Page: see https://cvlab-kaist.github.io/C4G

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30311 2026-05-29 cs.CV cs.AI 57%

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

Archon:面向整体数字人生成的统一多模态模型

Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出Archon,一个完全预训练的以人为中心的统一多模态模型,通过模态特定分词器、语义视频重参数化和“模态思维”策略,实现文本、音频、动作和视觉等七种模态的整体数字人生成。

Comments Accepted to CVPR 2026. Project Page: https://zju3dv.github.io/archon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03550 2026-05-29 cs.CV 57%

Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!

流式拖拽导向的交互式视频操作:随时拖动任何物体!

Junbao Zhou, Yuan Zhou, Kesen Zhao, Qingshan Xu, Beier Zhu, Richang Hong, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出REVEL任务和DragStream方法,通过自适应分布自校正和空间频率选择性优化,实现自回归视频扩散模型的流式拖拽交互操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23345 2026-05-29 cs.CV 57%

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

SCOPE: 在可玩环境中模拟跨游戏操作以构建FPS世界模型

Zizhao Tong, Yeying Jin, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室) Tencent(腾讯) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出SCOPE方法,通过在每个Transformer块中插入条件模块,将特征重塑为逐像素时间序列,以分离FPS游戏中局部作用域(scope)内的操作效果与全局生成,并引入跨游戏数据集CrossFPS,实现零样本迁移。

Comments Project page: https://z2tong.github.io/SCOPE/. Code is available at https://github.com/z2tong/SCOPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28811 2026-05-28 cs.CV 57%

HarmoVid: Relightful Video Portrait Harmonization

HarmoVid: 可重光照的视频人像协调

Jun Myeong Choi, Jae Shin Yoon, Luchao Qi, Roni Sengupta, Joon-Young Lee

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出一种基于视频扩散模型和光照去闪烁方法,实现前景视频与目标背景场景在阴影、色调和光照强度上的协调,解决视频时域抖动问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27003 2026-05-27 cs.CV cs.AI 57%

Timestep-Aware SVDQuant-GPTQ for W4A4 Quantization of Wan2.2-I2V

时间步感知的 SVDQuant-GPTQ 用于 Wan2.2-I2V 的 W4A4 量化

Junhao Wu, Dezhong Yao, Hai Jin

机构 * National Engineering Research Center for Big Data Technology and System(大数据技术与系统国家工程研究中心) Services Computing Technology and System Lab(服务计算技术与系统实验室) Cluster and Grid Computing Lab(集群与网格计算实验室) School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 针对 Wan2.2-I2V 视频扩散 Transformer 的 W4A4 量化,提出结合 SVDQuant 低秩异常补偿、GPTQ 重建感知残差权重量化和时间步分箱逐层激活裁剪比搜索的后训练量化框架,在 OpenS2V-Eval 上降低 59.3% 峰值显存且仅损失 0.9% VBench 平均分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25500 2026-05-26 cs.CV 57%

Full-4D: Generating Full-Scope 4D Scenes from a Single-View Video

Full-4D:从单视角视频生成全范围4D场景

Tingxi Chen, Ke Hao, Yabo Chen, Zhengxue Cheng, Rong Xie, Li Song, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出一种将单视角视频转换为全范围4D场景的框架,通过多视角视频合成和基于优化的4D重建,引入大规模数据集Real-MV-4D、融合时间-视图注意力的扩散模型和流匹配蒸馏损失,实现高保真度和几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20273 2026-05-26 cs.DC cs.CV 57%

SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs

SwiftFusion: 面向GPU上扩散Transformer分布式推理的可扩展序列并行

Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

机构 * University of Toronto \&\ Institute Amazon University of Toronto \& Vector Institute \& NVIDIA

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 针对扩散Transformer推理中序列并行方法的通信和同步瓶颈,提出拓扑感知的StreamFusion引擎,通过Torus Attention和单边通信实现平均1.35倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23245 2026-05-25 cs.CV cs.AI 57%

SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion

SimInsert: 通过区域稀疏注意力融合实现无缝视频对象插入

Xinyu Chen, Yuyi Qian, Jiang Lin, Shenyi Wang, Gao Wang, Zhiqiu Zhang, Jizhi Zhang, Mingjie Wang, Qiang Tang, Qian Wang, Song Wu, Zili Yi

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) JIUTIAN Research(JIUTIAN研究机构) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Zhejiang Sci-Tech University(浙江科技学院) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出SimInsert,一种无需训练的视频对象插入方法,利用图像到视频扩散模型的先验和区域稀疏注意力融合,实现时空一致和交互真实感,在PSNR、SSIM和LPIPS上分别提升18.8%、20.1%和降低44.1%。

Comments Accepted by ICME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00948 2026-05-25 cs.CV 57%

InfVSR: Toward Consistency-Driven Streaming Generative Video Super-Resolution

InfVSR:迈向一致性驱动的流式生成视频超分辨率

Ziqing Zhang, Kai Liu, Zheng Chen, Xi Li, Yucong Chen, Bingnan Duan, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出InfVSR,通过自回归单步扩散范式与流式推理,实现长视频的高效、一致超分辨率,速度提升达58倍。

Comments Code and model are available at https://github.com/Kai-Liu001/InfVSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17991 2026-05-22 cs.LG cs.CV 57%

Demystifying Transition Matching: When and Why It Can Beat Flow Matching

解开转换匹配之谜:何时以及为何它能超越流匹配

Jaihoon Kim, Rajarshi Saha, Minhyuk Sung, Youngsuk Park

机构 * KAIST(韩国科学技术院) Amazon Web Services(亚马逊网络服务)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文研究了转换匹配(TM)在何时以及为何能超越流匹配(FM),通过证明在单峰高斯分布下TM具有更低的KL散度,并分析了在高斯混合分布中TM在局部单峰区域的优势,以及在目标方差非可忽略时TM的优越性。

Comments Code: https://github.com/amazon-science/TransitionFlowMatching (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17623 2026-05-22 cs.CV cs.GR 57%

ViPS: Video-informed Pose Spaces for Auto-Rigged Meshes

ViPS: 为自动绑定网格的视频感知姿态空间

Honglin Chen, Karran Pandey, Rundi Wu, Matheus Gadelha, Yannick Hold-Geoffroy, Ayush Tewari, Niloy J. Mitra, Changxi Zheng, Paul Guerrero

机构 * Columbia University(哥伦比亚大学) University of Toronto(多伦多大学) Adobe Research(Adobe研究) University of Cambridge(剑桥大学) University College London(伦敦大学学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出ViPS,一种通过视频扩散模型提取运动先验来发现自动绑定网格有效姿态分布的前馈框架,实现了对多样形状变化、逆向运动学和动画的关键帧生成的支持。

Comments Project page: https://honglin-c.github.io/vips/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20961 2026-05-21 cs.CV 57%

Preserve, Reveal, Expand: Faithful 4D Video Editing with Region-Aware Conditioning

保留、揭示、扩展:基于区域感知的4D视频编辑

Zhangchi Hu, Wenzhang Sun, Xiangchen Yin, Jiahui Yuan, Chunfeng Wang, Hao Li, Kun Zhan, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(利汽车公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出PREX框架,通过区域感知分解目标时空体积,解决4D视频编辑中区域保持、揭示和扩展的问题,提升了视频编辑的准确性和稳定性。

Comments 23 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20624 2026-05-21 cs.CV cs.AI cs.LG 57%

Accelerating Video Inverse Problem Solvers with Autoregressive Diffusion Models

用自回归扩散模型加速视频逆问题求解器

Taesung Kwon, Jonghyun Park, Hyungjin Chung, Jong Chul Ye

机构 * KAIST(韩国科学技术院) EverEx

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出自回归视频逆问题求解器(AVIS),通过自回归扩散模型实现流式视频恢复,显著降低初始延迟并提高吞吐量,同时保持高质量的恢复效果,并进一步提出加速变体AVIS Flash,实现更高的吞吐量和更优的效率-性能权衡,为实时部署铺平道路。

Comments Project page is available here: https://avis-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16530 2026-05-21 cs.CV 57%

SWoMo: Neuro-Symbolic World Model for Cataract Surgery Simulation

SWoMo:用于白内障手术模拟的神经符号世界模型

Ssharvien Kumar Sivakumar, Akwele Johnson, Anirudh Dhingra, Yannik Frisch, Ghazal Ghazaei, Anirban Mukhopadhyay

机构 * Technical University Darmstadt(德累斯顿技术大学) Carl Zeiss AG(蔡司股份有限公司) AICM, Medical Faculty of Heidelberg University(海德堡大学医学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出SWoMo,一种用于白内障手术模拟的神经符号世界模型,通过分离运动生成与视觉真实性,结合规则基模拟器和场景图表示来建模运动动态和工具-组织交互,同时使用扩散模型生成逼真的视觉效果,从而提升手术模拟的真实性和临床适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19949 2026-05-20 cs.CV 57%

Feed-Forward Gaussian Splatting from Sparse Aerial Views

从稀疏航拍视图进行前馈高斯点扩散

Dongli Wu, Zhuoxiao Li, Tongyan Hua, Yinrui Ren, Xiaobao Wei, Rongjun Qin, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Peking University(北京大学) The Ohio State University(俄亥俄州立大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出AnyCity框架,通过观察驱动的生成重建方法,解决稀疏航拍视图中大规模城市场景重建中的证据不平衡问题,通过几何潜在表示和条件化空中完成标记预测,实现高质量的3D高斯点场重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19726 2026-05-20 cs.CV 57%

Efficient Long-Context Modeling in Diffusion Language Models via Block Approximate Sparse Attention

通过块近似稀疏注意力实现扩散语言模型的高效长上下文建模

Wenhu Zhang, Yiming Wu, Huanyu Wang, Yaoyang Liu, Huanzhang Dou, Senqiao Yang, Sitong Wu, Hanbin Zhao, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种块近似稀疏注意力框架(BA-Att),通过块级预下采样操作识别信息区域,避免依赖脆弱的位置先验,从而在保持高性能的同时提升计算效率,实验表明其在注意力计算上比FlashAttention快6.95倍,并在50%稀疏度下保持接近全注意力性能。

Comments CVPR 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19378 2026-05-20 cs.CV 57%

Sparse Mixture-of-Experts Routing in Visual Diffusion Transformers:Diagnosis, Boundary Calibration and Evolutionary Roadmap from Routing Collapse to Selective Deadlock

视觉扩散变换器中稀疏专家混合路由的稀疏性:从路由崩溃到选择性死锁的诊断、边界校准和进化路线图

Haiying Sha

机构 * Haiying Sha(海ying Sha)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文系统诊断了Token-Choice稀疏混合专家(MoE)在视频扩散变换器中的训练失败模式,通过分析超过6500万个标记的路由决策时间序列,提出了功能冗余假说,并总结了从视觉统一到世界模型的三步进化路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12598 2026-05-19 cs.CV 57%

Setting the Stage: Text-Driven Scene-Consistent Image Generation

设定舞台:基于文本的场景一致图像生成

Cong Xie, Che Wang, Yan Zhang, Ruiqi Yu, Han Zou, Zheng Pan, Zhenpeng Zhan

机构 * Global Business Unit, Baidu Inc.(百度公司全球业务部)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文研究了场景构建任务,通过结合参考场景图像和文本条件生成符合空间关系的演员图像,提出了一种新的数据构建管道和对应关系引导的注意力损失,以提高场景一致性和文本-图像一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07272 2026-05-19 cs.CV cs.GR 57%

VideoNeuMat: Neural Material Extraction from Generative Video Models

VideoNeuMat: 从生成视频模型中提取神经材料

Bowen Xue, Saeed Hadadan, Zheng Zeng, Fabrice Rousselle, Zahra Montazeri, Milos Hasan

机构 * University of Manchester(曼彻斯特大学) NVIDIA(NVIDIA公司) University of California Santa Barbara(加州大学圣巴bara分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 VideoNeuMat通过两阶段流程从视频扩散模型中提取可重用的神经材料,利用可控相机和光照轨迹生成材料样本视频,并通过大型重建模型重建紧凑的神经材料,实现超越合成训练数据的现实感和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15190 2026-05-15 cs.CV 57%

RAVEN: Real-time Autoregressive Video Extrapolation with Consistency-model GRPO

RAVEN: 实时自回归视频外推与一致性模型GRPO

Yanzuo Lu, Ronglai Zuo, Jiankang Deng

机构 * Imperial College London(伦敦帝国学院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 RAVEN通过将自回归视频扩散模型的训练与测试过程结合,提升长时视频生成质量。CM-GRPO方法优化一致性采样,提高生成效果。

Comments Project Page: https://yanzuo.lu/raven

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14894 2026-05-15 cs.CV 57%

SEDiT: Mask-Free Video Subtitle Erasure via One-step Diffusion Transformer

SEDiT: 一种基于单步扩散变换器的无掩膜视频字幕擦除方法

Zheng Hui, Yunlong Bai

机构 * Baidu Inc.(百度公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SEDiT提出一种单步扩散变换器方法,实现无掩膜视频字幕擦除,通过理论证明和实验验证,解决字幕擦除中的局部编辑问题和长期时间一致性挑战。

Comments Project page:http://zheng222.github.io/SEDiT_project

详情

展开后加载摘要…

URL PDF HTML 收藏