arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2126 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2126 篇

2410.06241 2025-02-28 cs.CV 88%

ByTheWay: Boost Your Text-to-Video Generation Model to Higher Quality in a Training-free Way

Jiazi Bu, Pengyang Ling, Pan Zhang, Tong Wu, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Dahua Lin, Jiaqi Wang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14505 2025-01-16 cs.CV 88%

T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation

Kaiyue Sun, Kaiyi Huang, Xian Liu, Yue Wu, Zihan Xu, Zhenguo Li, Xihui Liu

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://t2v-compbench-2025.github.io/ Code: https://github.com/KaiyueSun98/T2V-CompBench/tree/V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01987 2025-01-13 cs.CV cs.AI cs.CY cs.LG 88%

Gender Bias in Text-to-Video Generation Models: A case study of Sora

Mohammad Nadeem, Shahab Saquib Sohail, Erik Cambria, Björn W. Schuller, Amir Hussain

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00234 2024-12-31 cs.CV 88%

Grid Diffusion Models for Text-to-Video Generation

Taegyeong Lee, Soyeong Kwon, Taehwan Kim

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments This paper is being withdrawn due to issues of misconduct in the experiments presented in Table 1 and 5. We recognize this as an ethical concern and sincerely apologize to the research community for any inconvenience it may have caused

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09283 2024-12-13 cs.CV cs.AI 88%

InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption

Tiehan Fan, Kepan Nan, Rui Xie, Penghao Zhou, Zhenheng Yang, Chaoyou Fu, Xiang Li, Jian Yang, Ying Tai

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04440 2024-12-06 cs.CV 88%

GenMAC: Compositional Text-to-Video Generation with Multi-Agent Collaboration

Kaiyi Huang, Yukun Huang, Xuefei Ning, Zinan Lin, Yu Wang, Xihui Liu

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project website: https://karine-h.github.io/GenMAC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04277 2024-10-15 cs.CV 88%

VideoTetris: Towards Compositional Text-to-Video Generation

Ye Tian, Ling Yang, Haotian Yang, Yuan Gao, Yufan Deng, Jingmin Chen, Xintao Wang, Zhaochen Yu, Xin Tao, Pengfei Wan, Di Zhang, Bin Cui

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments NeurIPS 2024. Code: https://github.com/YangLing0818/VideoTetris

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00330 2024-09-13 cs.CV cs.AI 88%

StyleCrafter: Enhancing Stylized Text-to-Video Generation with Style Adapter

Gongye Liu, Menghan Xia, Yong Zhang, Haoxin Chen, Jinbo Xing, Yibo Wang, Xintao Wang, Yujiu Yang, Ying Shan

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments SIGGRAPH Asia 2024 (Journal Track). Project: https://gongyeliu.github.io/StyleCrafter.github.io/ ; GitHub: https://github.com/GongyeLiu/StyleCrafter

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11788 2024-08-22 cs.AI cs.CL cs.CV cs.SE 88%

DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework

Zhifei Xie, Daniel Tang, Dingwei Tan, Jacques Klein, Tegawend F. Bissyand, Saad Ezzini

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02629 2024-08-06 cs.CV 88%

VidGen-1M: A Large-Scale Dataset for Text-to-video Generation

Zhiyu Tan, Xiaomeng Yang, Luozheng Qin, Hao Li

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments project page: https://sais-fuxi.github.io/projects/vidgen-1m

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01921 2024-07-08 cs.CV 88%

GVDIFF: Grounded Text-to-Video Generation with Diffusion Models

Huanzhang Dou, Ruixiang Li, Wei Su, Xi Li

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00949 2024-06-11 cs.CV 88%

POS: A Prompts Optimization Suite for Augmenting Text-to-Video Generation

Shijie Ma, Huayi Xu, Mengjian Li, Weidong Geng, Yaxiong Wang, Meng Wang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07697 2024-05-24 cs.CV 88%

ConditionVideo: Training-Free Condition-Guided Text-to-Video Generation

Bo Peng, Xinyuan Chen, Yaohui Wang, Chaochao Lu, Yu Qiao

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12796 2024-05-22 cs.CV 88%

DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control

Hong Chen, Xin Wang, Yipeng Zhang, Yuwei Zhou, Zeyang Zhang, Siao Tang, Wenwu Zhu

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08720 2024-05-15 cs.CV 88%

The Lost Melody: Empirical Observations on Text-to-Video Generation From A Storytelling Perspective

Andrew Shin, Yusuke Mori, Kunitake Kaneko

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments To appear at CVPR 2024 Workshop on AI for Content Creation (AI4CC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18620 2024-04-30 cs.CV 88%

FlexiFilm: Long Video Generation with Flexible Conditions

Yichen Ouyang, jianhao Yuan, Hao Zhao, Gaoang Wang, Bo zhao

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12631 2024-04-24 cs.CV 88%

GPT4Motion: Scripting Physical Motions in Text-to-Video Generation via Blender-Oriented GPT Planning

Jiaxi Lv, Yi Huang, Mingfu Yan, Jiancheng Huang, Jianzhuang Liu, Yifan Liu, Yafei Wen, Xiaoxin Chen, Shifeng Chen

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16407 2024-03-26 cs.CV 88%

A Survey on Long Video Generation: Challenges, Methods, and Prospects

Chengxuan Li, Di Huang, Zeyu Lu, Yang Xiao, Qingqi Pei, Lei Bai

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14330 2024-02-07 cs.CV cs.AI cs.CL 88%

DirecT2V: Large Language Models are Frame-Level Directors for Zero-Shot Text-to-Video Generation

Susung Hong, Junyoung Seo, Heeseong Shin, Sunghwan Hong, Seungryong Kim

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments The code and demo will be available at https://github.com/KU-CVLAB/DirecT2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07781 2024-01-17 cs.CV 88%

Towards A Better Metric for Text-to-Video Generation

Jay Zhangjie Wu, Guian Fang, Haoning Wu, Xintao Wang, Yixiao Ge, Xiaodong Cun, David Junhao Zhang, Jia-Wei Liu, Yuchao Gu, Rui Zhao, Weisi Lin, Wynne Hsu, Ying Shan, Mike Zheng Shou

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://showlab.github.io/T2VScore/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00869 2024-01-03 cs.CV 88%

FlashVideo: A Framework for Swift Inference in Text-to-Video Generation

Bin Lei, le Chen, Caiwen Ding

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08316 2024-01-02 cs.CV 88%

Dual-Stream Diffusion Net for Text-to-Video Generation

Binhui Liu, Xin Liu, Anbo Dai, Zhiyong Zeng, Dan Wang, Zhen Cui, Jian Yang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments 8pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18829 2024-01-01 cs.CV 88%

MicroCinema: A Divide-and-Conquer Approach for Text-to-Video Generation

Yanhui Wang, Jianmin Bao, Wenming Weng, Ruoyu Feng, Dacheng Yin, Tao Yang, Jingxu Zhang, Qi Dai Zhiyuan Zhao, Chunyu Wang, Kai Qiu, Yuhui Yuan, Chuanxin Tang, Xiaoyan Sun, Chong Luo, Baining Guo

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://wangyanhui666.github.io/MicroCinema.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15770 2023-12-27 cs.CV cs.AI 88%

A Recipe for Scaling up Text-to-Video Generation with Text-free Videos

Xiang Wang, Shiwei Zhang, Hangjie Yuan, Zhiwu Qing, Biao Gong, Yingya Zhang, Yujun Shen, Changxin Gao, Nong Sang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://tf-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01813 2023-12-27 cs.CV 88%

FETV: A Benchmark for Fine-Grained Evaluation of Open-Domain Text-to-Video Generation

Yuanxin Liu, Lei Li, Shuhuai Ren, Rundong Gao, Shicheng Li, Sishuo Chen, Xu Sun, Lu Hou

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments NeurIPS 2023 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04483 2023-12-08 cs.CV 88%

Hierarchical Spatio-temporal Decoupling for Text-to-Video Generation

Zhiwu Qing, Shiwei Zhang, Jiayu Wang, Xiang Wang, Yujie Wei, Yingya Zhang, Changxin Gao, Nong Sang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

Comments Project page: https://higen-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18834 2023-12-01 cs.CV 88%

ART$\boldsymbol{\cdot}$V: Auto-Regressive Text-to-Video Generation with Diffusion Models

Wenming Weng, Ruoyu Feng, Yanhui Wang, Qi Dai, Chunyu Wang, Dacheng Yin, Zhiyuan Zhao, Kai Qiu, Jianmin Bao, Yuhui Yuan, Chong Luo, Yueyi Zhang, Zhiwei Xiong

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);long video(abstract);分类 cs.CV

Comments 24 pages, 21 figures. Project page at https://warranweng.github.io/art.v

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14792 2022-09-30 cs.CV cs.AI cs.LG 88%

Make-A-Video: Text-to-Video Generation without Text-Video Data

Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, Devi Parikh, Sonal Gupta, Yaniv Taigman

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.15868 2022-06-01 cs.CV cs.CL cs.LG 88%

CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers

Wenyi Hong, Ming Ding, Wendi Zheng, Xinghan Liu, Jie Tang

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02958 2026-05-05 cs.LG 88%

Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization

Quant VideoGen:通过2位KV缓存量化实现自回归长视频生成

Haocheng Xi, Shuo Yang, Yilong Zhao, Muyang Li, Han Cai, Xingyang Li, Yujun Lin, Zhuoyang Zhang, Jintao Zhang, Xiuyu Li, Zhiying Xu, Jun Wu, Chenfeng Xu, Ion Stoica, Song Han, Kurt Keutzer

机构 * University of California, Berkeley(加州大学伯克利分校) NVIDIA Massachusetts Institute of Technology(麻省理工学院) Amazon(亚马逊) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract)

AI总结 本文提出Quant VideoGen,通过语义感知平滑和渐进残差量化技术,有效降低KV缓存内存消耗,提升长视频生成质量与效率。

Comments Accepted by ICML 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏