arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2309.15091 2024-07-16 cs.CV cs.AI cs.CL cs.LG 85%

VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning

Han Lin, Abhay Zala, Jaemin Cho, Mohit Bansal

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments COLM 2024; Project page: https://videodirectorgpt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06304 2024-07-10 cs.CV cs.AI cs.CL 85%

VIMI: Grounding Video Generation through Multi-modal Instruction

Yuwei Fang, Willi Menapace, Aliaksandr Siarohin, Tsai-Shien Chen, Kuan-Chien Wang, Ivan Skorokhodov, Graham Neubig, Sergey Tulyakov

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04233 2024-05-08 cs.CV cs.LG 85%

Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models

Fan Bao, Chendong Xiang, Gang Yue, Guande He, Hongzhou Zhu, Kaiwen Zheng, Min Zhao, Shilong Liu, Yaole Wang, Jun Zhu

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);long video(abstract);分类 cs.CV

Comments Project page at https://www.shengshu-ai.com/vidu

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12903 2024-04-22 cs.MM 85%

ConCLVD: Controllable Chinese Landscape Video Generation via Diffusion Model

Dingming Liu, Shaowei Li, Ruoyan Zhou, Lili Liang, Yongguan Hong, Fei Chao, Rongrong Ji

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12945 2024-02-06 cs.CV 85%

Lumiere: A Space-Time Diffusion Model for Video Generation

Omer Bar-Tal, Hila Chefer, Omer Tov, Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Ephrat, Junhwa Hur, Guanghui Liu, Amit Raj, Yuanzhen Li, Michael Rubinstein, Tomer Michaeli, Oliver Wang, Deqing Sun, Tali Dekel, Inbar Mosseri

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Webpage: https://lumiere-video.github.io/ | Video: https://www.youtube.com/watch?v=wxLr02Dz2Sc

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04468 2024-01-10 cs.CV cs.AI 85%

MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation

Weimin Wang, Jiawei Liu, Zhijie Lin, Jiangqiao Yan, Shuo Chen, Chetwin Low, Tuyen Hoang, Jie Wu, Jun Hao Liew, Hanshu Yan, Daquan Zhou, Jiashi Feng

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10769 2023-10-18 cs.CV 85%

LAMP: Learn A Motion Pattern for Few-Shot-Based Video Generation

Ruiqi Wu, Liangyu Chen, Tong Yang, Chunle Guo, Chongyi Li, Xiangyu Zhang

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://rq-wu.github.io/projects/LAMP

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02303 2022-10-06 cs.CV cs.LG 85%

Imagen Video: High Definition Video Generation with Diffusion Models

Jonathan Ho, William Chan, Chitwan Saharia, Jay Whang, Ruiqi Gao, Alexey Gritsenko, Diederik P. Kingma, Ben Poole, Mohammad Norouzi, David J. Fleet, Tim Salimans

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments See accompanying website: https://imagen.research.google/video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14938 2025-12-18 cs.CV cs.AI cs.MM cs.SD 84%

TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation

TalkVerse:民主化分钟级音频驱动视频生成

Zhenzhi Wang, Jian Wang, Ke Ma, Dahua Lin, Bing Zhou

机构 * The Chinese University of Hong Kong(香港中文大学) Snap Inc.(Snap公司)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 TalkVerse通过大规模开放数据和高效模型,实现了分钟级音频驱动视频生成,降低研究门槛,提升生成质量与效率。

Comments open-sourced single-person full-body talking video generation dataset, training code and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18436 2026-07-22 cs.CV 新提交 84%

Surprise Forcing: What to Remember, When to Skip in Long Video Generation

惊喜强制:长视频生成中该记住什么、何时跳过

Shuwei Shi, Zhen Li, Muyao Niu, Chuanhao Li, Bo Zheng, Kaipeng Zhang, Yinqiang Zheng

机构 * Alaya Lab(阿莱雅实验室) The University of Tokyo(东京大学)

专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV

AI总结 研究长视频生成中资源分配问题,提出惊喜强制框架,含惊喜门控内存库、基于优先级的替换和相关性感知路由,以及惊喜感知去噪,实验证明该框架提高了长时一致性、视觉质量并保持实时流吞吐量。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20799 2026-07-21 cs.CV cs.AI 版本更新 84%

GroundShot: Visually Consistent Multi-Shot Long Video Generation via Entity-Grounded Shot Scheduling

GroundShot: 通过实体锚定镜头调度实现视觉一致的多镜头长视频生成

Yixuan Lai, Tianjia Shao, Weijia Dou, Siyu Zhu, Jingdong Wang

机构 * Fudan University(复旦大学) Baidu(百度)

专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV

AI总结 提出GroundShot框架,通过在线构建实体级视觉记忆并调度镜头生成顺序,无需训练即可提升多镜头视频中实体的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12209 2025-12-16 cs.CV 84%

CineLOG: A Training Free Approach for Cinematic Long Video Generation

CineLOG: 一种无需训练的电影长视频生成方法

Zahra Dehghanian, Morteza Abolghasemi, Hamid Beigy, Hamid R. Rabiee

机构 * Sharif University of Technology(沙斐大学)

专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV

AI总结 CineLOG通过构建高质量、平衡的数据集和创新的生成管道,实现了对电影长视频中摄像机轨迹和类型等属性的精准控制,优于现有端到端模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01186 2024-01-04 cs.CV 84%

Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos

Yue Ma, Yingqing He, Xiaodong Cun, Xintao Wang, Siran Chen, Ying Shan, Xiu Li, Qifeng Chen

专题命中 视频生成 :video generation(title);text-to-video(title);分类 cs.CV

Comments Project page: https://follow-your-pose.github.io/; Github repository: https://github.com/mayuelala/FollowYourPose

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17985 2026-07-21 cs.CV cs.MM 新提交 84%

Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation

用于序列动作视频生成的关键帧锚定身份保留

Zhenjie Liu, Binyan Chen, Hao Chen, Tong Pan, Shangfei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 针对身份保留文本到视频生成任务中主体身份保持和动作执行的挑战,提出无训练三阶段管道框架,包括动作感知提示优化、身份保留生成和身份感知推理增强,该方法在官方排行榜上排名第三,性能和通用性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08828 2026-07-07 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新 84%

Motion Attribution for Video Generation

视频生成中的运动归因

Xindi Wu, Despoina Paschalidou, Jun Gao, Antonio Torralba, Laura Leal-Taixé, Olga Russakovsky, Sanja Fidler, Jonathan Lorraine

机构 * NVIDIA Princeton University(普林斯顿大学) MIT(麻省理工学院) University of Michigan(密歇根大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 研究视频生成模型中数据对运动影响,提出基于梯度的运动归因框架Motive,通过运动加权损失掩码分离静态外观和时间动态,用于研究微调剪辑对时间动态的影响及指导数据策划,提升视频运动质量。

Comments See the project website at https://research.nvidia.com/labs/sil/projects/MOTIVE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00712 2026-07-02 cs.CV cs.MM 新提交 84%

Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

面向内存高效的自回归视频生成:基于实例特定参数吸收

Xiaomeng Fu, Jia Li, Yiming Hu, Yong Wang, Hayden Kwok-Hay So, Jiao Dai, Xiangxiang Chu, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) The University of Hong Kong(香港大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 提出ISPA框架,通过将历史上下文吸收到模型权重中,将部分注意力层从全局注意力转换为局部注意力,在保持视觉质量的同时减少50%的KV缓存。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04527 2026-06-04 cs.MM cs.CV cs.GR 84%

Echo-Infinity: Learning Evolving Memory for Real-Time Infinite Video Generation

Echo-Infinity: 学习演化记忆用于实时无限视频生成

Yuxuan Bian, Zeyue Xue, Songchun Zhang, Shiyi Zhang, Weiyang Jin, Yaowei Li, Junhao Zhuang, Haoran Li, Jie Huang, Haoyang Huang, Nan Duan, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Joy Future Academy, JD(京东探索研究院) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 提出Echo-Infinity框架,通过可学习的演化记忆以恒定成本动态过滤、抽象和压缩任意长度历史,结合统一相对RoPE方案,首次实现24小时实时无限视频生成。

Comments Website: https://echo-team-joy-future-academy-jd.github.io/Echo-Infinity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13739 2026-03-17 cs.CV cs.AI cs.MM 84%

UniVid: Pyramid Diffusion Model for High Quality Video Generation

UniVid:金字塔扩散模型用于高质量视频生成

Xinyu Xiao, Binbin Yang, Tingtian Li, Yipeng Yu, Sen Lei

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08028 2026-03-10 cs.CV cs.MM 84%

Controllable Complex Human Motion Video Generation via Text-to-Skeleton Cascades

通过文本到骨骼级联实现可控的复杂人类运动视频生成

Ashkan Taghipour, Morteza Ghahremani, Zinuo Li, Hamid Laga, Farid Boussaid, Mohammed Bennamoun

机构 * Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学) Munich Center for Machine Learning (MCML) and Technical University of Munich (TUM)(慕尼黑机器学习中心(MCML)和技术大学慕尼黑(TUM)) School of Information Technology, Murdoch University(信息科技学院,墨尔本大学) Department of Electrical, Electronics and Computer Engineering, The University of Western Australia(电子、电子与计算机工程系,西澳大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出通过文本到骨骼级联框架生成可控复杂人类运动视频,解决文本条件模糊和姿态控制成本高的问题,引入合成数据集并展示模型在多个指标上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18991 2026-03-06 cs.CV cs.CL cs.MM 84%

EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation

EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架

Jiaqi Xu, Kunzhe Huang, Xinyi Zou, Yunkuo Chen, Bo Liu, MengLi Cheng, Jun Huang, Xing Shi

机构 * Alibaba Cloud(阿里云)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。

Comments 10 pages, 8 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04228 2026-02-27 cs.CV cs.AI cs.LG cs.MM 84%

LayerT2V: A Unified Multi-Layer Video Generation Framework

LayerT2V: 一个统一的多层视频生成框架

Guangzhao Li, Kangrui Cen, Baixuan Zhao, Yi Xin, Siqi Luo, Guangtao Zhai, Lei Zhang, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 LayerT2V通过统一的多层视频生成框架,实现了多层输出并提升了视频生成的语义一致性和时间一致性。

Comments Project Page is https://layert2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10453 2025-05-06 cs.CV cs.GR cs.MM 84%

Kubrick: Multimodal Agent Collaborations for Synthetic Video Generation

Liu He, Yizhi Song, Hejun Huang, Pinxin Liu, Yunlong Tang, Daniel Aliaga, Xin Zhou

机构 * Purdue University(普渡大学) Baidu USA(百度美国公司) University of Rochester(罗切斯特大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted by CVPR 2025 AI4CC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14158 2024-12-31 cs.CV cs.AI cs.MM 84%

AKiRa: Augmentation Kit on Rays for optical video generation

Xi Wang, Robin Courant, Marc Christie, Vicky Kalogeiton

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04324 2024-10-28 cs.CV eess.IV 84%

SF-V: Single Forward Video Generation Model

Zhixing Zhang, Yanyu Li, Yushu Wu, Yanwu Xu, Anil Kag, Ivan Skorokhodov, Willi Menapace, Aliaksandr Siarohin, Junli Cao, Dimitris Metaxas, Sergey Tulyakov, Jian Ren

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、eess.IV

Comments Project Page: https://snap-research.github.io/SF-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11325 2024-07-31 cs.CV eess.IV 84%

MoVideo: Motion-Aware Video Generation with Diffusion Models

Jingyun Liang, Yuchen Fan, Kai Zhang, Radu Timofte, Luc Van Gool, Rakesh Ranjan

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、eess.IV

Comments Accepted by ECCV2024. Project page: https://jingyunliang.github.io/MoVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16038 2024-04-26 cs.CV cs.AI cs.MM 84%

A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming

Pengyuan Zhou, Lin Wang, Zhi Liu, Yanbin Hao, Pan Hui, Sasu Tarkoma, Jussi Kangasharju

专题命中 视频生成 :video generation(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

Comments 16 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14043 2026-08-17 cs.CV 新提交 83%

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

超越文本条件:面向视频生成的MLLM-DiT融合系统研究

Yanbo Ding, Yijia Fan, Caihua Shan, Yifan Yang, Yifei Shen, Weijie Wang, Xirui Hu, Dongsheng Li, Lili Qiu, Yuqing Yang, Yali Wang

机构 * Chinese Academy of Sciences(中国科学院) Microsoft Research(微软研究院) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10933 2026-08-12 cs.CV 新提交 83%

SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense

SafeCA:用于文本到视频越狱防御的安全交叉注意力定位与调控

Siyuan Liang, Yupeng Qiu, Junfeng Fang, Rong-Cheng Tu, Jiaxing Huang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 SafeCA是一种特征级T2V越狱防御机制,通过分析交叉注意力特征差异提出,可降低主流模型越狱成功率约20%,仅增0.1s推理开销且保持语义一致性,提供架构级可部署防护范式。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10439 2026-08-12 cs.CV 新提交 83%

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

流强制:构建用于鲁棒流视频生成的统一训练轨迹

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics(地平线机器人) Anyverse Dynamics

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。

Comments 15 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27380 2026-08-11 cs.CV cs.AI 版本更新 83%

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System

VideoCoCo:基于智能体双引擎系统的、以代码为思维链(CoT)的物理一致性视频生成方法

Haodong Li, Tianfei Ren, Xiaoxiao Ma, Chunmei Qing, Zhen Fang, Sipeng He, Ziyu Guo, Haoyu Wu, Juanxi Tian, Yihang Zou, Ruichuan An, Dongzhi Jiang, Boxue Yang, Ji Xie, Xu Huang, Wenhao Yan, Jialv Zou, Zhengrong Yue, Yaxin Luo, Xiaotong Li, Yuzhu Wang, Junyan Ye, Jinjing Zhao, Zehui Chen, Lin Chen, Renye Yan, Feng Zhao, Pheng-Ann Heng

机构 * CUHK(香港中文大学) USTC(中国科学技术大学) SCUT(华南理工大学) HKU(香港大学) NTU(南洋理工大学) PKU(北京大学) SJTU(上海交通大学) CMU(卡内基梅隆大学) THU(清华大学) HUST(华中科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 VideoCoCo作为智能体双引擎框架,以可执行Blender代码为过程级思维链,构建专属数据集提升视频编辑器适配性,在两个基准上显著优于基线,实现了高质量物理一致性视频生成。

Comments 15 pages, 3 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏