arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2512.03619 2026-03-31 cs.CV 79%

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

LAMP:语言辅助运动规划用于可控视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科奇大学) University College London(伦敦大学学院) Hacettepe University(哈斯特帕大学) Adobe Research(Adobe研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LAMP通过大语言模型生成3D轨迹,实现基于自然语言的视频生成,提升运动可控性和用户意图对齐。

Comments CVPR 2026. Project Page: https://cyberiada.github.io/LAMP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26610 2026-03-30 cs.CV cs.AI 79%

Think over Trajectories: Leveraging Video Generation to Reconstruct GPS Trajectories from Cellular Signaling

轨迹思考:利用视频生成从蜂窝信号中重建GPS轨迹

Ruixing Zhang, Hanzhang Jiang, Leilei Sun, Liangzhe Han, Jibin Wang, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(北京航空航天大学复杂与关键软件环境国家重点实验室) H3I, Beihang University(北京航空航天大学H3I) China Mobile Information Technology Center(中国移动信息技术中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Sig2GPS方法,通过视频生成技术从蜂窝信号中重建高精度GPS轨迹,利用地图视觉域直接生成连续路径,提升轨迹数据挖掘的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25188 2026-03-27 cs.CV 79%

AnyID: Ultra-Fidelity Universal Identity-Preserving Video Generation from Any Visual References

AnyID: 从任意视觉参考生成超保真度的通用身份保持视频

Jiahao Wang, Hualian Sheng, Sijia Cai, Yuxiao Yang, Weizhan Zhang, Caixia Yan, Bing Deng, Jieping Ye

机构 * School of Computer Science and Technology, MOEKLINNS, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院、MOEKLINNS) Alibaba Cloud Computing(阿里云计算有限公司) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnyID通过引入可扩展的多参考架构和主参考生成范式,实现从多种异构身份输入生成高保真的视频,通过大规模数据集训练和强化学习微调提升身份保真度和属性可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03334 2026-03-25 cs.CV 79%

UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal Interactions

UniAVGen:基于非对称跨模态交互的统一音频视频生成

Guozhen Zhang, Zixiang Zhou, Teng Hu, Ziqiao Peng, Youliang Zhang, Yi Chen, Yuan Zhou, Qinglin Lu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Tencent Hunyuan(腾讯文英) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UniAVGen通过非对称跨模态交互机制和双分支联合合成架构,实现了音频视频的统一生成,提升同步精度和语义一致性,实验表明其在较少训练样本下表现更优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21872 2026-03-24 cs.CV cs.AI 79%

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

面向流形的探索用于视频生成的强化学习

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo, Qifeng Chen, Harry Yang

机构 * Tencent Hunyuan(腾讯文脉)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11438 2026-03-24 cs.CV cs.AI 79%

Flowception: Temporally Expansive Flow Matching for Video Generation

Flowception:用于视频生成的时序扩展流匹配

Tariq Berrada Ifriqi, John Nguyen, Karteek Alahari, Jakob Verbeek, Ricky T. Q. Chen

机构 * FAIR at Meta Univ.\ Grenoble Alpes, Inria, CNRS, Grenoble INP, LJK, France

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Flowception提出了一种非自回归且可变长度的视频生成框架,通过交替插入离散帧与连续去噪帧学习概率路径,减少误差积累并提升长序列处理效率,实验显示其在FVD和VBench指标上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07901 2026-03-23 cs.CV 79%

Stand-In: A Lightweight and Plug-and-Play Identity Control for Video Generation

Stand-In: 一种轻量级且即插即用的身份控制方法用于视频生成

Bowen Xue, Zheng-Peng Duan, Qixin Yan, Wenjing Wang, Hao Liu, Chun-Le Guo, Chongyi Li, Chen Li, Jing Lyu

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉实验室) VCIP, CS, Nankai University(南开大学计算机科学与技术学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Stand-In框架,通过引入条件图像分支和受限自注意力机制,实现轻量级身份控制,仅用1%额外参数和2000训练对即可提升视频质量和身份保持性,并支持多种视频生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18524 2026-03-20 cs.CV 79%

3DreamBooth: High-Fidelity 3D Subject-Driven Video Generation Model

3DreamBooth:高保真3D主体驱动视频生成模型

Hyun-kyu Ko, Jihyeon Park, Younghyun Kim, Dongheok Park, Eunbyung Park

机构 * Yonsei University(延世大学) Sungkyunkwan University(成均馆大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出3DreamBooth和3Dapter框架,通过单帧优化解耦空间几何与时间运动,构建鲁棒3D先验,提升纹理细节并加速收敛,解决3D主体定制中的空间先验不足问题。

Comments Project page: https://ko-lani.github.io/3DreamBooth Code: https://github.com/Ko-Lani/3DreamBooth

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 79%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01419 2026-03-19 cs.CV 79%

Towards One-step Causal Video Generation via Adversarial Self-Distillation

基于对抗自蒸馏的单步因果视频生成

Yongqi Yang, Huayang Huang, Xu Peng, Xiaobin Hu, Donghao Luo, Jiangning Zhang, Chengjie Wang, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tencent YouTu Lab(腾讯优图实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出基于蒸馏的高效因果视频生成框架,通过对抗自蒸馏策略提升生成质量,结合首帧增强策略减少误差传播,实验表明在单步和双步视频生成中优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13506 2026-03-18 cs.CV 79%

LibraGen: Playing a Balance Game in Subject-Driven Video Generation

LibraGen:在以主题驱动的视频生成中进行平衡游戏

Jiahao Zhu, Shanshan Lao, Lijie Liu, Gen Li, Tianhao Qi, Wei Han, Bingchuan Li, Fangfang Liu, Zhuowei Chen, Tianxiang Ma, Qian HE, Yi Zhou, Xiaohua Xie

机构 * Pazhou Laboratory (Huangpu)(黄埔实验室( Pazhou))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LibraGen通过平衡视频生成基础模型的内在先验与主题到视频能力,提出了一种新的框架,采用质量优先策略和动态分类器自由引导方案,提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14938 2026-03-17 cs.CV 79%

FAR-Drive: Frame-AutoRegressive Video Generation in Closed-Loop Autonomous Driving

FAR-Drive:闭环自动驾驶中的帧自回归视频生成

Yaoru Li, Federico Landi, Marco Godi, Xin Jin, Ruiju Fu, Yufei Ma, Muyang Sun, Heyu Si, Qi Guo

机构 * Zhejiang University(浙江大学) Huawei(华为)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出FAR-Drive,一种用于自动驾驶的帧级自回归视频生成框架,通过多视角扩散变换器实现几何一致的多摄像机生成,解决闭环模拟中的长时程一致性、自回归退化和低延迟问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13438 2026-03-17 cs.CV cs.AI 79%

Draft-and-Target Sampling for Video Generation Policy

视频生成策略的草稿与目标采样

Qikang Zhang, Yingjie Lei, Wei Liu, Daochang Liu

机构 * South China Normal University(华南师范大学) University of Western Australia(西澳大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种无训练的扩散推理范式,通过自play去噪方法提升视频生成效率,实验表明在三个基准上实现2.1倍加速,同时保持高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00511 2026-03-16 cs.CV 79%

ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation

ID-Crafter:基于视觉语言模型的在线强化学习多主体视频生成框架

Panwang Pan, Jingjing Zhao, Yuchen Lin, Chenguo Lin, Chenxin Li, Hengyu Liu, Tingting Shen, Yadong MU

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出ID-Crafter框架,通过层次化注意力机制、预训练视觉语言模型和在线强化学习,提升多主体视频生成中身份保持与语义一致性。

Comments Project page: https://angericky.github.io/ID-Crafter, Code: https://github.com/paulpanwang/IDCrafter

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00547 2026-03-16 cs.CV cs.AI 79%

Motion Dreamer: Boundary Conditional Motion Reasoning for Physically Coherent Video Generation

Motion Dreamer:基于物理一致视频生成的边界条件运动推理

Tianshuo Xu, Zhifei Chen, Leyi Wu, Hao Lu, Yuying Chen, Lihui Jiang, Bingbing Liu, Yingcong Chen

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Motion Dreamer框架,通过分离运动推理与视觉合成,解决视频生成中边界条件运动推理的问题,提升运动合理性与视觉真实性。

Comments The authors have decided to withdraw this article due to the following reasons identified after publication: Experimental Errors: Significant inaccuracies were discovered in the experimental results concerning segmentation and depth estimation. Authorship Disputes: In addition to the technical issues, there are unresolved disagreements regarding the author sequence and contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01685 2026-03-13 cs.CV 79%

FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters

FastLightGen: 用更少的步骤和参数实现快速轻量视频生成

Shitong Shao, Yufei Gu, Zeke Xie

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 FastLightGen通过同时压缩模型大小和推理步骤,实现快速轻量视频生成,实验表明其在受限预算下达到最优视觉质量并超越现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05927 2026-03-12 cs.CV cs.AI cs.RO 79%

World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty

能识别不确定性的世界模型 - 可控视频生成中的校准不确定性

Zhiting Mei, Tenny Yin, Micah Baker, Ola Shorinwa, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出C3方法,通过校准不确定性量化提升可控视频生成的可靠性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09883 2026-03-11 cs.CV 79%

DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary

DISPLAY:通过稀疏运动引导和多任务辅助实现可直接控制的人机交互视频生成

Jiazhi Guan, Quanwei Yang, Luying Huang, Junhao Liang, Borong Liang, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou, Jingdong Wang

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DISPLAY通过稀疏运动引导和多任务辅助训练,实现高保真且可控的人机交互视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08850 2026-03-11 cs.CV 79%

HECTOR: Hybrid Editable Compositional Object References for Video Generation

HECTOR:混合可编辑组合对象引用用于视频生成

Guofeng Zhang, Angtian Wang, Jacob Zhiyuan Fang, Liming Jiang, Haotian Yang, Alan Yuille, Chongyang Ma

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 HECTOR通过混合可编辑组合对象引用,实现了视频生成中对复杂时空约束的高保真度满足和运动可控性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00586 2026-03-10 cs.CV 79%

WildActor: Unconstrained Identity-Preserving Video Generation

WildActor: 无约束身份保持视频生成

Qin Guo, Tianyu Yang, Xuanhua He, Fei Shen, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Dan Xu

机构 * The Hong Kong University of Science(香港科学与技术大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 WildActor通过不对称注意力机制和视点自适应采样策略,在无约束视角下实现身份保持的人类视频生成。

Comments Project Page: https://wildactor.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07028 2026-03-10 cs.CR cs.CV 79%

Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking

两个框架至关重要:一种针对文本到视频模型劫持的时序攻击

Moyang Chen, Zonghao Ying, Wenzhuo Xu, Quancheng Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * College of Science, Mathematics and Technology, Wenzhou-Kean University(科学、数学与技术学院,温州市凯恩大学) State Key Laboratory of Complex & Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) AI Security Lab(360人工智能安全实验室)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出TFM攻击方法,通过碎片化提示和隐式替换,提高文本到视频模型的劫持效果,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12719 2026-03-10 cs.CV 79%

S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation

S2DiT:用于移动流媒体视频生成的 Sandwich Diffusion Transformer

Lin Zhao, Yushu Wu, Aleksei Lebedev, Dishani Lahiri, Meng Dong, Arpit Sahni, Michael Vasilkovsky, Hao Chen, Ju Hu, Aliaksandr Siarohin, Sergey Tulyakov, Yanzhi Wang, Anil Kag, Yanyu Li

机构 * Snap Inc. Northeastern University(东北大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 S2DiT 通过高效注意力机制和 2-in-1 深度学习框架,在移动设备上实现高质量、高速度的流式视频生成。

Comments https://snap-research.github.io/S2DiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05449 2026-03-06 cs.CV cs.AI cs.GR 79%

RealWonder: Real-Time Physical Action-Conditioned Video Generation

RealWonder: 基于实时物理动作的视频生成

Wei Liu, Ziyu Chen, Zizhang Li, Yue Wang, Hong-Xing Yu, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 RealWonder通过物理模拟实现实时动作条件视频生成,利用3D重建、物理模拟和简化视频生成器,在单张图像基础上生成高质量视频,适用于多种物理场景。

Comments The first two authors contributed equally. The last two authors advised equally. Project website: https://liuwei283.github.io/RealWonder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04291 2026-03-05 cs.CV cs.AI 79%

CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video

CubeComposer: 从视角视频生成空间-时间自回归4K 360°视频

Lingen Li, Guangzhi Wang, Xiaoyu Li, Zhaoyang Zhang, Qi Dou, Jinwei Gu, Tianfan Xue, Ying Shan

机构 * The Chinese University of Hong Kong(香港中文大学) ARC Lab, Tencent PCG Project lead(腾讯PCG项目负责人)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 CubeComposer通过空间-时间自回归扩散模型实现4K分辨率360°视频生成,提升VR沉浸体验

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00976 2026-03-04 cs.CV 79%

PreciseCache: Precise Feature Caching for Efficient and High-fidelity Video Generation

PreciseCache: 用于高效且高保真的视频生成的精确特征缓存

Jiangshan Wang, Kang Zhao, Jiayi Guo, Jiayu Wang, Hang Guo, Chenyang Zhu, Xiu Li, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Tsinghua University(清华大学) Tongyi Lab, Alibaba(阿里巴巴通义实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PreciseCache通过精确检测和跳过冗余计算,实现视频生成的高效且高质量推理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00438 2026-03-04 cs.CV 79%

BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

BindWeave:通过跨模态整合实现主体一致的视频生成

Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, Zehuan Yuan

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance(字节跳动) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 BindWeave通过跨模态整合解决主体一致视频生成难题,利用MLLM-DiT框架提升生成视频的主体一致性和自然度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20999 2026-03-03 cs.CV 79%

VII: Visual Instruction Injection for Jailbreaking Image-to-Video Generation Models

VII: 视觉指令注入用于劫持图像到视频生成模型

Bowen Zheng, Yongli Xiang, Ziming Hong, Zerong Lin, Chaojian Yu, Tongliang Liu, Xinge You

机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学反伪工程研究中心) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Sydney AI Centre, The University of Sydney(悉尼大学AI中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 VII通过将恶意意图伪装为良性视觉指令,有效劫持图像到视频生成模型,实现高攻击成功率并降低拒绝率。

Comments Project page: https://Zbwwwwwwww.github.io/VII

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00466 2026-03-03 cs.CV 79%

DreamWorld: Unified World Modeling in Video Generation

DreamWorld: 视频生成中的统一世界建模

Boming Tan, Xiangdong Zhang, Ning Liao, Yuqing Zhang, Shaofeng Zhang, Xue Yang, Qi Fan, Yanyong Zhang

机构 * University of Science(科学技术大学) Shanghai Jiao Tong University, Shanghai, China.(上海交通大学) Nanjing University, Suzhou, China.(南京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreamWorld通过联合世界建模范式和约束退火技术,提升视频生成的世界一致性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22745 2026-03-02 cs.CV 79%

SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation

SPATIALALIGN: 视频生成中动态空间关系的对齐

Fengming Liu, Tat-Jen Cham, Chuanxia Zheng

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, 50 Nanyang Avenue, Singapore 639798(数据科学,南洋理工大学,50 Nanyang Avenue,新加坡639798)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 SPATIALALIGN通过引入DSR-SCORE和DPO方法,提升文本到视频生成中动态空间关系的对齐能力。

Comments Project page: https://fengming001ntu.github.io/SpatialAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23203 2026-02-27 cs.CV cs.AI 79%

ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation

ColoDiff:整合动态一致性与内容感知用于结肠镜视频生成

Junhu Fu, Shuyu Liang, Wutong Li, Chen Ma, Peng Huang, Kehao Wang, Ke Chen, Shengli Lin, Pinghong Zhou, Zeju Li, Yuanyuan Wang, Yi Guo

机构 * College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院) Fudan University Shanghai Cancer Center(复旦大学上海肿瘤中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学中山医院内窥镜中心和内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海内窥镜协同创新中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ColoDiff通过整合动态一致性与内容感知,生成高质量的结肠镜视频,以缓解数据短缺并辅助临床分析。

详情

展开后加载摘要…

URL PDF HTML 收藏