arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-02 至 2026-04-02 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2604.01129 2026-04-02 cs.CV 57%

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01053 2026-04-02 cs.CV 57%

PHASOR: Anatomy- and Phase-Consistent Volumetric Diffusion for CT Virtual Contrast Enhancement

PHASOR:基于解剖和相位一致的体积扩散用于CT虚拟对比增强

Zilong Li, Dongyang Li, Chenglong Ma, Zhan Feng, Dakai Jin, Junping Zhang, Hao Luo, Fan Wang, Hongming Shan

机构 * Shanghai Key Lab of Intelligent Information Processing, School of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院上海市智能信息处理重点实验室) Institute of Science and Technology for Brain-inspired Intelligence and MOE Frontiers Center for Brain Science, Fudan University(复旦大学类脑智能科学与技术研究院及教育部脑科学前沿中心) Shanghai Center for Brain Science and Brain-inspired Technology(上海脑科学与类脑研究中心) Department of Radiology, First Affiliated Hospital of College of Medical Science, Zhejiang University(浙江大学医学院附属第一医院放射科) Alibaba DAMO Academy(阿里巴巴达摩院)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出PHASOR框架,通过体积扩散模型提升CT虚拟对比增强质量,引入解剖路由混合专家和强度-相位意识表示对齐模块,解决解剖异质性和空间偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00853 2026-04-02 cs.CV 57%

MotionGrounder: Grounded Multi-Object Motion Transfer via Diffusion Transformer

MotionGrounder: 通过扩散变换器实现多物体运动迁移

Samuel Teodoro, Yun Chen, Agus Gunawan, Soo Ye Kim, Jihyong Oh, Munchurl Kim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院电气工程学院) Adobe Research(Adobe研究院) CMLab, Chung-Ang University(中央大学CMLab)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出MotionGrounder,一种基于扩散变换器的多物体运动迁移框架,通过流式运动信号和对象-描述对齐损失实现稳定运动先验和空间对齐,实验显示其在定量、定性和人类评估中均优于现有方法。

Comments Please visit our project page at https://kaist-viclab.github.io/motiongrounder-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00792 2026-04-02 cs.CV 57%

HICT: High-precision 3D CBCT reconstruction from a single X-ray

HICT: 从单张X射线实现高精度3D CBCT重建

Wen Ma, Jiaxiang Liu, Zikai Xiao, Ziyang Wang, Feng Yang, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Angelalign Technology Inc.(时代天使科技有限公司)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出HICT框架,通过视频扩散模型生成多视角投影并结合动态注意力网络与X射线采样策略,实现高精度CBCT重建,实验表明其在临床应用中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏