arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2601.09255 2026-01-15 cs.CV 79%

PhyRPR: Training-Free Physics-Constrained Video Generation

PhyRPR: 无训练物理约束视频生成

Yibo Zhao, Hengjia Li, Xiaofei He, Boxi Wu

机构 * State Key Lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PhyRPR提出一种无训练的三阶段视频生成方法,通过解耦物理理解和视觉合成,提升生成视频的物理合理性和运动可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21541 2026-01-12 cs.CV 79%

Video Generation Models Are Good Latent Reward Models

视频生成模型是良好的潜在奖励模型

Xiaoyue Mi, Wenqing Yu, Jiesong Lian, Shibo Jie, Ruizhe Zhong, Zijun Liu, Guozhen Zhang, Zixiang Zhou, Zhiyong Xu, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文元) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PRFL框架,利用预训练视频生成模型在噪声潜在空间中进行奖励建模,实现高效去噪和降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05239 2026-01-09 cs.CV 79%

Plenoptic Video Generation

光场视频生成

Xiao Fu, Shitao Tang, Min Shi, Xian Liu, Jinwei Gu, Ming-Yu Liu, Dahua Lin, Chen-Hsuan Lin

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PlenopticDreamer通过多输入单输出视频条件模型和相机引导检索策略,实现高质量多视角视频重绘,提升时空一致性和视角转换能力。

Comments Project Page: https://research.nvidia.com/labs/dir/plenopticdreamer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04359 2026-01-09 cs.CV 79%

PackCache: A Training-Free Acceleration Method for Unified Autoregressive Video Generation via Compact KV-Cache

PackCache: 一种无需训练的统一自回归视频生成加速方法通过紧凑的KV缓存

Kunyang Li, Mubarak Shah, Yuzhang Shang

机构 * Institute of Artificial Intelligence, University of Central Florida(人工智能学院,中央佛罗里达大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PackCache通过动态压缩KV缓存提升统一自回归视频生成效率,显著加速长序列生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03665 2026-01-08 cs.CV 79%

PhysVideoGenerator: Towards Physically Aware Video Generation via Latent Physics Guidance

PhysVideoGenerator: 通过潜在物理引导实现物理感知的视频生成

Siddarth Nilol Kundur Satish, Devesh Jaiswal, Hongyu Chen, Abhishek Bakshi

机构 * Center for Data Science New York University(数据科学中心 新 York 大学) Department of Computer Science New York University(计算机科学系 新 York 大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PhysVideoGenerator通过在视频生成过程中引入可学习的物理先验,实现物理感知的视频生成,展示了联合训练范式的可行性。

Comments 9 pages, 2 figures, project page: https://github.com/CVFall2025-Project/PhysVideoGenerator

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24766 2026-01-01 cs.RO cs.AI cs.CV 79%

Dream2Flow: Bridging Video Generation and Open-World Manipulation with 3D Object Flow

Dream2Flow: 通过3D物体流连接视频生成与开放世界操控

Karthik Dharmarajan, Wenlong Huang, Jiajun Wu, Li Fei-Fei, Ruohan Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Dream2Flow通过3D物体流连接视频生成与开放世界操控,实现零样本操控不同类别的物体。

Comments Project website: https://dream2flow.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22310 2025-12-30 cs.CV 79%

MoFu: Scale-Aware Modulation and Fourier Fusion for Multi-Subject Video Generation

MoFu: 多主体视频生成的尺度感知调制与傅里叶融合

Run Ling, Ke Cao, Jian Lu, Ao Ma, Haowei Liu, Runze He, Changwei Wang, Rongtao Xu, Yihua Shao, Zhanjie Zhang, Peng Wu, Guibing Guo, Wei Feng, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Xingwei Wang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MoFu通过尺度感知调制和傅里叶融合解决多主体视频生成中的尺度不一致和排列敏感性问题,提升生成质量。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21252 2025-12-29 cs.CV 79%

DreaMontage: Arbitrary Frame-Guided One-Shot Video Generation

DreaMontage:任意帧引导的一次生成视频

Jiawei Liu, Junqiao Li, Jiangfan Deng, Gen Li, Siyu Zhou, Zetao Fang, Shanshan Lao, Zengde Deng, Jianing Zhu, Tingting Ma, Jiayi Li, Yunqiu Wang, Qian He, Xinglong Wu

机构 * Intelligence Creation Team, ByteDance(字节跳动智能创作团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreaMontage通过任意帧引导生成技术,实现高效且高质量的一次生成视频,提升电影制作的视觉表现力和内容连贯性。

Comments Project Page: https://dreamontage.github.io/DreaMontage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21338 2025-12-29 cs.CV 79%

HiStream: Efficient High-Resolution Video Generation via Redundancy-Eliminated Streaming

HiStream: 通过消除冗余的流式传输实现高效的高分辨率视频生成

Haonan Qiu, Shikun Liu, Zijian Zhou, Zhaochong An, Weiming Ren, Zhiheng Liu, Jonas Schult, Sen He, Shoufa Chen, Yuren Cong, Tao Xiang, Ziwei Liu, Juan-Manuel Perez-Rua

机构 * Meta AI Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 HiStream通过空间、时间及时间步压缩优化,实现高分辨率视频生成的高效去噪,相比基线模型提升107.5倍速度并保持高质量。

Comments Project Page: http://haonanqiu.com/projects/HiStream.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21559 2025-12-23 cs.CV 79%

X-CoT: Explainable Text-to-Video Retrieval via LLM-based Chain-of-Thought Reasoning

X-CoT:基于LLM链式推理的可解释文本到视频检索

Prasanna Reddy Pulakurthi, Jiamian Wang, Majid Rabbani, Sohail Dianat, Raghuveer Rao, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工学院) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 X-CoT通过基于LLM的链式推理实现文本到视频检索的可解释性,提升检索性能并提供详细的推理依据。

Comments 12 pages, 7 figures. Accepted at EMNLP 2025 (Main Conference)

Journal ref Proc. EMNLP 2025, pages 31172-31183, Suzhou, China, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13704 2025-12-23 cs.CV 79%

TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models

TiViBench: 用于视频生成模型的视频推理基准测试

Harold Haodong Chen, Disen Lan, Wen-Jie Shu, Qingyang Liu, Zihan Wang, Sirui Chen, Wenkai Cheng, Kanghao Chen, Hongfei Zhang, Zixin Zhang, Rongjin Guo, Yu Cheng, Ying-Cong Chen

专题命中 视频生成 :video reasoning(title);video generation(abstract);分类 cs.CV

AI总结 TiViBench提出用于评估视频生成模型的推理能力,结合VideoTPO提升推理性能,揭示商业与开源模型在推理潜力上的差异。

Comments Project: https://haroldchen19.github.io/TiViBench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15716 2025-12-18 cs.CV cs.AI 79%

Spatia: Video Generation with Updatable Spatial Memory

基于可更新空间记忆的视频生成

Jinjing Zhao, Fangyun Wei, Zhening Liu, Hongyang Zhang, Chang Xu, Yan Lu

机构 * The University of Sydney(悉尼大学) Microsoft Research(微软研究院) HKUST(香港科技大学) University of Waterloo(滑铁卢大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Spatia通过可更新的空间记忆机制,实现视频生成中的长期空间与时间一致性,支持动态实体生成和3D交互编辑。

Comments Project page: https://zhaojingjing713.github.io/Spatia/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13492 2025-12-16 cs.CV 79%

Transform Trained Transformer: Accelerating Naive 4K Video Generation Over 10$\times$

训练变换器:加速 naive 4K 视频生成超过 10$\times$

Jiangning Zhang, Junwei Zhu, Teng Hu, Yabiao Wang, Donghao Luo, Weijian Cao, Zhenye Gan, Xiaobin Hu, Zhucun Xue, Chengjie Wang

机构 * Youtu Lab, Tencent(腾讯优设实验室) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 T3-Video 通过优化全注意力机制,显著提升 4K 视频生成效率,实现性能与速度的双重突破

Comments Project page: https://zhangzjn.github.io/projects/T3-Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13465 2025-12-16 cs.CV 79%

PoseAnything: Universal Pose-guided Video Generation with Part-aware Temporal Coherence

PoseAnything: 通用姿态引导视频生成与部分感知时间一致性

Ruiyan Wang, Teng Hu, Kaihui Huang, Zihan Su, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PoseAnything是一种通用姿态引导视频生成框架,能够处理人类和非人类角色,通过引入部分感知时间一致性模块和解耦CFG策略,提升了视频生成的精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12751 2025-12-16 cs.CV 79%

GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。

Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05103 2025-12-15 cs.LG cs.AI cs.CL cs.CV 79%

TV2TV: A Unified Framework for Interleaved Language and Video Generation

TV2TV:一种用于交错语言和视频生成的统一框架

Xiaochuang Han, Youssef Emad, Melissa Hall, John Nguyen, Karthik Padthe, Liam Robbins, Amir Bar, Delong Chen, Michal Drozdzal, Maha Elbayad, Yushi Hu, Shang-Wen Li, Sreya Dutta Roy, Jakob Verbeek, XuDong Wang, Marjan Ghazvininejad, Luke Zettlemoyer, Emily Dinan

机构 * Meta FAIR

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 TV2TV通过统一框架实现语言与视频生成的交错过程,提升视频生成的视觉质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24379 2025-12-15 cs.CV cs.AI 79%

Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation

Any2Caption:任何条件到字幕以实现可控视频生成

Shengqiong Wu, Weicai Ye, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Shuicheng Yan, Hao Fei, Tat-Seng Chua

机构 * Kuaishou Technology(快手科技) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Any2Caption通过多模态大语言模型实现任何条件到字幕的可控视频生成,提升视频生成的可控性和质量。

Comments Project Page: https://sqwu.top/Any2Cap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10943 2025-12-12 cs.CV cs.AI 79%

AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

AlcheMinT:多参考一致视频生成的细粒度时间控制

Sharath Girish, Viacheslav Ivanov, Tsai-Shien Chen, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov

机构 * Snap Inc. UC Merced(加州大学默塞德分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AlcheMinT通过引入显式时间戳条件化,实现了多主体视频生成中的细粒度时间控制,提升了视频生成的精确性和保真度。

Comments Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10286 2025-12-12 cs.CV 79%

ShotDirector: Directorially Controllable Multi-Shot Video Generation with Cinematographic Transitions

ShotDirector: 电影化可控多镜头视频生成

Xiaoxue Wu, Xinyuan Chen, Yaohui Wang, Yu Qiao

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ShotDirector通过整合参数级相机控制和分层编辑模式感知提示,实现了电影化可控的多镜头视频生成。

Comments Project Page: https://uknowsth.github.io/ShotDirector/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09363 2025-12-12 cs.CV 79%

StereoWorld: Geometry-Aware Monocular-to-Stereo Video Generation

StereoWorld: 一种基于几何的单目到立体视频生成方法

Ke Xing, Xiaojie Jin, Longfei Li, Yuyang Yin, Hanwen Liang, Guixun Luo, Chen Fang, Jue Wang, Konstantinos N. Plataniotis, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Dzine AI University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 StereoWorld通过几何感知正则化和时空拼接方案,实现高效高质量的单目到立体视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI 79%

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07831 2025-12-09 cs.CV 79%

UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成

Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港中文大学) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。

Comments Project Website https://jackailab.github.io/Projects/UnityVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07821 2025-12-09 cs.CV cs.AI 79%

WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling

WorldReel:基于一致几何和运动建模的4D视频生成

Shaoheng Fang, Hanwen Jiang, Yunpeng Bai, Niloy J. Mitra, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究) University College London(伦敦大学学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 WorldReel通过联合生成RGB帧和4D场景表示,实现了动态场景和移动摄像机下的4D一致视频生成,提升了几何一致性与运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07802 2025-12-09 cs.CV 79%

OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

OneStory: 通过自适应记忆实现连贯的多镜头视频生成

Zhaochong An, Menglin Jia, Haonan Qiu, Zijian Zhou, Xiaoke Huang, Zhiheng Liu, Weiming Ren, Kumara Kahatapitiya, Ding Liu, Sen He, Chenyang Zhang, Tao Xiang, Fanny Yang, Serge Belongie, Tian Xie

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 OneStory通过自适应记忆实现多镜头视频生成,提升叙事连贯性和生成质量。

Comments Project Page: https://zhaochongan.github.io/projects/OneStory

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06905 2025-12-09 cs.CV 79%

Scaling Zero-Shot Reference-to-Video Generation

缩放零样本参考到视频生成

Zijian Zhou, Shikun Liu, Haozhe Liu, Haonan Qiu, Zhaochong An, Weiming Ren, Zhiheng Liu, Xiaoke Huang, Kam Woh Ng, Tian Xie, Xiao Han, Yuren Cong, Hang Li, Chuyan Zhu, Aditya Patel, Tao Xiang, Sen He

机构 * Meta AI King's College London

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Saber通过零样本框架实现高效参考到视频生成,无需显式数据,通过掩码训练和注意力模型提升泛化能力。

Comments Website: https://franciszzj.github.io/Saber/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09476 2025-12-08 cs.CV 79%

Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses

视频生成中的协作面部专家融合:提升大面部姿态下的身份一致性

Yuji Wang, Moran Li, Xiaobin Hu, Ran Yi, Jiangning Zhang, Chengming Xu, Weijian Cao, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出协作面部专家融合方法,通过动态融合身份、语义和细节专家信号,提升大姿态下视频生成的身份一致性,并构建了大规模姿态标注数据集。

Comments Project page: https://rain152.github.io/CoFE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05076 2025-12-05 cs.CV 79%

BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

BulletTime: 分离时间与相机姿态的视频生成控制

Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。

Comments Project Page: https://19reborn.github.io/Bullet4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03453 2025-12-04 cs.CV 79%

GeoVideo: Introducing Geometric Regularization into Video Generation Model

GeoVideo: 在视频生成模型中引入几何正则化

Yunpeng Bai, Shaoheng Fang, Chaohui Yu, Fan Wang, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(鸿篇实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeoVideo通过引入几何正则化损失,提升视频生成的时空一致性和几何结构合理性。

Comments Project Page: https://geovideo.github.io/GeoVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03451 2025-12-04 cs.CV cs.AI cs.LG 79%

GalaxyDiT: Efficient Video Generation with Guidance Alignment and Adaptive Proxy in Diffusion Transformers

GalaxyDiT:通过引导对齐和自适应代理实现高效的视频生成

Zhiye Song, Steve Dai, Ben Keller, Brucek Khailany

机构 * Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GalaxyDiT通过引导对齐和自适应代理选择,提升视频生成效率,实现高达2.37倍的速度提升并保持高质量输出

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03041 2025-12-03 cs.CV 79%

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

MultiShotMaster: 一种可控的多镜头视频生成框架

Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, Xu Jia

机构 * Dalian University of Technology(大连理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MultiShotMaster通过引入两种新型RoPE变体和自动化数据标注管道,实现多镜头视频的灵活生成与可控性。

Comments Project Page: https://qinghew.github.io/MultiShotMaster

详情

展开后加载摘要…

URL PDF HTML 收藏