arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2605.14191 2026-05-15 cs.CV 57%

CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers

CoReDiT:基于空间一致性引导的令牌剪枝与重建用于高效的扩散变换器

Zhuojin Li, Hsin-Pai Cheng, Hong Cai, Shizhong Han, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 CoReDiT通过空间一致性引导的令牌剪枝与重建,显著降低扩散变换器的计算量,提升推理速度,同时保持高质量视觉输出。

Comments 8 pages, 8 figures, CVPR workshop

Journal ref 2026 CVPR Workshop of EDGE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13182 2026-05-14 cs.CV 57%

DiffST: Spatiotemporal-Aware Diffusion for Real-World Space-Time Video Super-Resolution

DiffST: 用于现实世界时空视频超分辨率的时空感知扩散模型

Zheng Chen, Ruofan Yang, Jin Han, Dehua Song, Zichen Zou, Chunming He, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Duke University(杜克大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DiffST提出一种高效时空感知视频扩散框架,通过跨帧上下文聚合和视频表示引导提升时空信息利用,实现高效实时世界时空视频超分辨率。

Comments Code is available at: https://github.com/zhengchen1999/DiffST

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00990 2026-05-14 cs.RO cs.AI cs.CV 57%

Robotic Manipulation by Imitating Generated Videos Without Physical Demonstrations

通过模仿生成视频实现机器人操作

Shivansh Patel, Shraddhaa Mohan, Hanlin Mai, Unnat Jain, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学香槟分校) UC Irvine(加州大学尔湾分校) Columbia University(哥伦比亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出RIGVid系统,通过模仿AI生成视频使机器人完成复杂操作任务,无需物理示范或特定机器人训练。系统利用视频扩散模型生成潜在示范视频,并通过视觉语言模型筛选符合指令的视频,再通过6D姿态跟踪器提取轨迹并映射到机器人。实验表明生成视频效果与真实示范相当,且性能随生成质量提升。

Comments In ICLR 2026. Website: https://rigvid-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12431 2026-05-13 cs.CV 57%

GaitProtector: Impersonation-Driven Gait De-Identification via Training-Free Diffusion Latent Optimization

GaitProtector: 通过无训练扩散潜在优化实现基于伪装的步态去标识

Huiran Duan, Qian Zhou, Zhongliang Guo, Junhao Dong, Yuqi Li, Guoying Zhao, Yingli Tian

机构 * City University of New York(纽约城市大学) Wuhan University(武汉大学) University of Aberdeen(阿伯丁大学) Nanyang Technological University(南洋理工大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Oulu(奥卢大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出GaitProtector框架,通过无训练扩散潜在优化实现基于伪装的步态去标识,通过伪装和伪装两个紧密耦合组件,在保持主导身体形状和运动动态的同时减少识别准确率。

Comments Accepted to the 20th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22143 2026-05-12 cs.GR cs.CV 57%

JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion

JUST-DUB-IT: 通过联合音频-视觉扩散进行视频配音

Anthony Chen, Naomi Ken Korem, Gal Zeevi, Tavi Halperin, Matan Ben Yosef, Urska Jelercic, Ofir Bibi, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出JUST-DUB-IT方法,利用轻量LoRA调整基础音频-视频扩散模型,实现视频到视频的高质量配音,提升视觉保真度和唇同步性能。

Comments Project webpage available at https://justdubit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09622 2026-05-12 cs.CV cs.AI 57%

Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study

任意到任意的3D扩散模型与知识转移:放射治疗计划研究

Yuhan Wang, Zihan Li, Han Liu, Simon Arberet, Martin Kraus, Yuyin Zhou, Florin-Cristian Ghesu, Dorin Comaniciu, Ali Kamen, Riqiang Gao

机构 * UC Santa Cruz(加州大学圣克ruz分校) Siemens Healthineers(西门子医疗) University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。

Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19222 2026-05-12 cs.CV cs.LG 57%

Spectrally-Guided Diffusion Noise Schedules

基于光谱引导的扩散噪声调度

Carlos Esteves, Ameesh Makadia

机构 * Google Research(谷歌研究)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出基于图像光谱特性设计实例特定噪声调度的方法,通过理论界限优化噪声级别,提升单阶段像素扩散模型生成质量,尤其在低步数情况下表现更佳。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08050 2026-05-11 cs.CV 57%

MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation

MoCoTalk: 多条件扩散与自适应路由的可控说话头生成

Xinyan Ye, Jiankang Deng, Abbas Edalat

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 MoCoTalk通过统一身份、头部姿态、面部表情和嘴部动态四个控制信号,提出自适应多条件路由框架,解决异构条件干扰问题,提升可控说话头生成的性能与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07079 2026-05-11 cs.CV cs.AI cs.LG cs.RO 57%

Learning Visual Feature-Based World Models via Residual Latent Action

通过残差潜在动作学习基于视觉特征的世界模型

Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias

机构 * Rutgers University(罗格斯大学) Purdue University(普渡大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出RLA-WM世界模型,通过流匹配预测残差潜在动作,优于现有特征和视频扩散模型,且在速度和效率上更优,同时开发了两项机器人学习技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13837 2026-05-11 cs.CV 57%

A Causal Diffusion Model for Video Reconstruction from Ultra-Low-Bitrate Representations

一种用于从超低比特率表示中重建视频的因果扩散模型

Cem Eteke, Batuhan Tosun, Martin Piccolrovazzi, Alexander Griessel, Wolfgang Kellerer, Eckehard Steinbach

机构 * Chair of Media Technology(媒体技术系) Chair of Communication Networks(通信网络系) Munich Institute of Robotics and Machine Intelligence(慕尼黑机器人与智能机械研究所) School of Computation Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种因果扩散模型,用于从超低比特率语义和高度压缩帧中重建视频,通过联合建模互补信息,提升重建质量,优于传统、神经、生成和语义基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06658 2026-05-08 cs.CV 57%

Relit-LiVE: Relight Video by Jointly Learning Environment Video

Relit-LiVE: 通过联合学习环境视频实现视频照明

Weiqing Xiao, Hong Li, Xiuyu Yang, Houyuan Chen, Wenyi Li, Tianqi Liu, Shaocong Xu, Chongjie Ye, Hao Zhao, Beibei Wang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学) University of Chinese Academy of Sciences(中国科学院大学) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Relit-LiVE通过引入原始参考图像和环境视频预测方法,实现了无需相机姿态先验知识的物理一致视频照明,提升了真实场景下的照明效果和时间稳定性。

Comments Accepted at SIGGRAPH 2026. Project site: https://github.com/zhuxing0/Relit-LiVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06388 2026-05-08 cs.CV cs.LG cs.RO 57%

Reconstruction or Semantics? What Makes a Latent Space Useful for Robotic World Models

重建还是语义?什么使潜在空间对机器人世界模型有用

Nilaksh, Saurav Jha, Artem Zholus, Sarath Chandar

机构 * Chandar Research Lab(昌达尔研究实验室) Mila – Quebec AI Institute(魁北克人工智能研究院) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文评估了不同潜在空间在机器人世界模型中的有效性,发现语义潜在空间在规划和下游政策性能方面优于重建潜在空间。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26694 2026-05-08 cs.RO cs.AI cs.CV 57%

Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

从视频先验构建统一的4D世界动作模型

Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, Huaping Liu

机构 * Tsinghua University(清华大学) Xiaomi Robotics(小米机器人) Peking University(北京大学) CASIA

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出X-WAM,统一了实时机器人动作执行与高保真的4D世界合成,在单一框架中解决传统统一世界模型仅建模2D像素空间且无法平衡动作效率与世界建模质量的问题。

Comments Project website: https://sharinka0715.github.io/X-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19202 2026-05-08 cs.CV 57%

UniE2F: A Unified Diffusion Framework for Event-to-Frame Reconstruction with Video Foundation Models

UniE2F: 一种基于视频基础模型的统一扩散框架用于事件到帧重建

Gang Xu, Zhiyu Zhu, Junhui Hou

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Department of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学系)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出UniE2F框架,利用预训练视频扩散模型的生成先验,从稀疏事件数据中重建高保真视频帧,通过引入事件基帧间残差引导提升重建精度,并扩展到零样本视频帧插值与预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27322 2026-05-01 cs.CV 57%

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

YOSE: 你只选择本质的标记以实现高效的DiT基于视频对象移除

Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Huawei Noah’s Ark Lab(华为诺亚实验室) NKIARI, Shenzhen Futian(深圳南山研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 YOSE通过引入BVI和DiffSim模块,实现了高效的DiT视频对象移除,通过动态选择关键标记和模拟扩散过程,使推理时间与遮挡区域线性相关,从而在70%的情况下达到2.5倍的加速,同时保持视觉质量。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23858 2026-04-28 cs.CV 57%

Latent Inter-Frame Pruning: A Training-Free Method Bridging Traditional Video Compression and Modern Diffusion Transformers for Efficient Generation

潜在帧剪枝:一种无训练方法,连接传统视频压缩与现代扩散变换器以实现高效生成

Dennis Menn, Chih-Hsien Chou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Futurewei Technologies, Inc.(未来科技公司)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种无训练的潜在帧剪枝方法,通过剪枝重复的潜在块来减少计算负担并提高生成速度,同时引入注意力恢复机制以解决训练与推理间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24086 2026-04-21 cs.CV 57%

RainFusion2.0: Temporal-Spatial Awareness and Hardware-Efficient Block-wise Sparse Attention

RainFusion2.0: 基于时序-空间感知与硬件高效性的块状稀疏注意力

Aiyue Chen, Yaofu Liu, Junjian Huang, Guang Lian, Yiwu Yao, Wangli Lan, Jing Lin, Zhixin Ma, Tingting Zhou

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出RainFusion2.0,通过块状均值代表token预测稀疏掩码、时空感知token排列及首帧sink机制,实现视频和图像生成模型的高效稀疏注意力,实验表明在保持视频质量的同时,达到80%的稀疏度和1.5~1.8倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11331 2026-04-14 cs.CV cs.CG 57%

Any 3D Scene is Worth 1K Tokens: 3D-Grounded Representation for Scene Generation at Scale

任何3D场景都值得1000个标记:面向大规模场景生成的3D grounded表示

Dongxu Wei, Qi Xu, Zhiqi Li, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Zhaopeng Cui, Peidong Liu

机构 * Westlake University(西湖大学) Afari Intelligent Drive(阿法里智能驾驶) Zhejiang University(浙江大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出在隐式3D潜在空间中直接生成3D场景,解决传统2D方法在3D空间扩展中的不足,通过3DRAE和3DDiT实现高效且一致的3D生成。

Comments Under Review. Project Page: https://wswdx.github.io/3DRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10632 2026-04-13 cs.CV 57%

CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos

CoMoVi:3D人类动作与真实视频的联合生成

Chengfeng Zhao, Jiazhi Shu, Yubo Zhao, Tianyu Huang, Jiahao Lu, Zekai Gu, Chengwei Ren, Zhiyang Dou, Qing Shuai, Yuan Liu

机构 * HKUST(香港科技大学) SCUT(华南理工大学) HKU(香港大学) MIT(麻省理工学院) ZJU(浙江大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出CoMoVi框架,通过单个扩散去噪循环同步生成3D人类动作和视频,采用双分支扩散模型实现动作与视频生成的互惠特征交互和3D-2D交叉注意力。

Comments Project Page: https://igl-hkust.github.io/CoMoVi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08500 2026-04-10 cs.CV 57%

Novel View Synthesis as Video Completion

新颖视角合成作为视频补全

Qi Wu, Khiem Vuong, Minsik Jeon, Srinivasa Narasimhan, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出将稀疏新颖视角合成视为低帧率视频补全任务,通过改进架构实现视角不变性,证明视频模型能以最少监督生成竞争性稀疏视角合成结果。

Comments Project page: https://frame-crafter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17445 2026-04-10 cs.CV 57%

LangDriveCTRL: Natural Language Controllable Driving Scene Editing with Multi-modal Agents

LangDriveCTRL: 通过多模态代理实现自然语言可控的驾驶场景编辑

Yun He, Francesco Pittaluga, Ziyu Jiang, Matthias Zwicker, Manmohan Chandraker, Zaid Tasneem

机构 * University of Maryland, College Park(马里兰大学帕克分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣迭戈分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LangDriveCTRL通过多模态代理实现驾驶视频的自然语言可控编辑,生成多样化的交通场景,提升真实感和交通场景的真实性。

Comments Project Page: https://yunhe24.github.io/langdrivectrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04934 2026-04-07 cs.CV 57%

Vanast: Virtual Try-On with Human Image Animation via Synthetic Triplet Supervision

Vanast:通过合成三元监督实现的人像虚拟试穿

Hyunsoo Cha, Wonjung Woo, Byungjun Kim, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Vanast通过统一框架直接从单张人体图像、服装图像和姿态引导视频生成服装转移的人形动画视频,解决传统两阶段流程导致的身份漂移、服装扭曲和前后不一致问题。

Comments Accepted to CVPR 2026, Project Page: https://hyunsoocha.github.io/vanast/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00408 2026-04-07 cs.CV cs.AI 57%

Low-Bitrate Video Compression through Semantic-Conditioned Diffusion

基于语义的低比特率视频压缩

Lingdong Wang, Guan-Ming Su, Divya Kothandaraman, Tsung-Wei Huang, Mohammad Hajiesmaili, Ramesh K. Sitaraman

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出DiSCo框架,通过语义条件扩散模型在低比特率下实现高质量视频压缩,采用文本描述、空间时间退化视频和可选草图等模态,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02828 2026-04-06 cs.CV cs.AI 57%

NavCrafter: Exploring 3D Scenes from a Single Image

NavCrafter:从单张图像探索3D场景

Hongbo Duan, Peiyu Zhuang, Yi Liu, Zhengyang Zhang, Yuxin Zhang, Pengting Luo, Fangming Liu, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院人工智能与机器人中心) Peng Cheng Laboratory(鹏城实验室) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络空间安全学院) Central Media Technology Institute, Huawei Incorporated Company(华为技术有限公司中央媒体技术研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 NavCrafter通过合成新颖视角视频序列,实现从单张图像生成灵活的3D场景,采用视频扩散模型和几何感知扩展策略,提升可控多视角合成与3D重建精度。

Comments 8 pages accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 57%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV 57%

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01053 2026-04-02 cs.CV 57%

PHASOR: Anatomy- and Phase-Consistent Volumetric Diffusion for CT Virtual Contrast Enhancement

PHASOR:基于解剖和相位一致的体积扩散用于CT虚拟对比增强

Zilong Li, Dongyang Li, Chenglong Ma, Zhan Feng, Dakai Jin, Junping Zhang, Hao Luo, Fan Wang, Hongming Shan

机构 * Shanghai Key Lab of Intelligent Information Processing, School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院上海市智能信息处理重点实验室) Institute of Science and Technology for Brain-inspired Intelligence and MOE Frontiers Center for Brain Science, Fudan University(复旦大学类脑智能科学与技术研究院及教育部脑科学前沿中心) Shanghai Center for Brain Science and Brain-inspired Technology(上海脑科学与类脑研究中心) Department of Radiology, First Affiliated Hospital of College of Medical Science, Zhejiang University(浙江大学医学院附属第一医院放射科) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出PHASOR框架,通过体积扩散模型提升CT虚拟对比增强质量,引入解剖路由混合专家和强度-相位意识表示对齐模块,解决解剖异质性和空间偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00853 2026-04-02 cs.CV 57%

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

MotionGrounder: 通过扩散变换器实现多物体运动迁移

Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电气工程学院) Adobe Research(Adobe研究院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出MotionGrounder,一种基于扩散变换器的多物体运动迁移框架,通过流式运动信号和对象-描述对齐损失实现稳定运动先验和空间对齐,实验显示其在定量、定性和人类评估中均优于现有方法。

Comments Please visit our project page at https://kaist-viclab.github.io/motiongrounder-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00792 2026-04-02 cs.CV 57%

HICT: High-precision 3D CBCT reconstruction from a single X-ray

HICT: 从单张X射线实现高精度3D CBCT重建

Wen Ma, Jiaxiang Liu, Zikai Xiao, Ziyang Wang, Feng Yang, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Angelalign Technology Inc.(时代天使科技有限公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出HICT框架,通过视频扩散模型生成多视角投影并结合动态注意力网络与X射线采样策略,实现高精度CBCT重建,实验表明其在临床应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30043 2026-04-01 cs.CV 57%

Video Models Reason Early: Exploiting Plan Commitment for Maze Solving

视频模型早起推理:利用计划承诺解决迷宫

Kaleb Newman, Tyler Zhu, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 研究通过2D迷宫解决探讨视频模型生成过程中的规划动态,发现模型在早期步骤中承诺高层运动计划,并揭示路径长度而非障碍密度是迷宫难度的主要预测因素,提出ChEaP方法提升复杂迷宫解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏