arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2403.06845 2024-04-12 cs.CV 79%

DriveDreamer-2: LLM-Enhanced World Models for Diverse Driving Video Generation

Guosheng Zhao, Xiaofeng Wang, Zheng Zhu, Xinze Chen, Guan Huang, Xiaoyi Bao, Xingang Wang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project Page: https://drivedreamer2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00896 2024-04-10 cs.CV 79%

TrailBlazer: Trajectory Control for Diffusion-Based Video Generation

Wan-Duo Kurt Ma, J. P. Lewis, W. Bastiaan Kleijn

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

Comments 14 pages, 18 figures, Project Page: https://hohonu-vicml.github.io/Trailblazer.Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03459 2024-03-29 cs.CV 79%

F3-Pruning: A Training-Free and Generalized Pruning Strategy towards Faster and Finer Text-to-Video Synthesis

Sitong Su, Jianzhi Liu, Lianli Gao, Jingkuan Song

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11050 2024-03-19 cs.CV 79%

Endora: Video Generation Models as Endoscopy Simulators

Chenxin Li, Hengyu Liu, Yifan Liu, Brandon Y. Feng, Wuyang Li, Xinyu Liu, Zhen Chen, Jing Shao, Yixuan Yuan

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://endora-medvidgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09194 2024-03-19 cs.CV 79%

Intention-driven Ego-to-Exo Video Generation

Hongchen Luo, Kai Zhu, Wei Zhai, Yang Cao

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.07687 2024-03-14 cs.CV cs.AI cs.LG stat.ML 79%

Stochastic Video Generation with a Learned Prior

Remi Denton, Rob Fergus

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06356 2024-03-12 cs.CV cs.AI 79%

Video Generation with Consistency Tuning

Chaoyi Wang, Yaozhe Song, Yafeng Zhang, Jun Pei, Lijie Xia, Jianpo Liu

专题命中 视频生成 :video generation(title);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02827 2024-03-06 cs.CV 79%

Tuning-Free Noise Rectification for High Fidelity Image-to-Video Generation

Weijie Li, Litong Gong, Yiran Zhu, Fanda Fan, Biao Wang, Tiezheng Ge, Bo Zheng

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01800 2024-03-06 cs.CV 79%

AtomoVideo: High Fidelity Image-to-Video Generation

Litong Gong, Yiran Zhu, Weijie Li, Xiaoyang Kang, Biao Wang, Tiezheng Ge, Bo Zheng

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Technical report. Page: https://atomo-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05922 2024-03-04 cs.CV 79%

FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing

Yuren Cong, Mengmeng Xu, Christian Simon, Shoufa Chen, Jiawei Ren, Yanping Xie, Juan-Manuel Perez-Rua, Bodo Rosenhahn, Tao Xiang, Sen He

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted by ICLR2024. Project page: https://flatten-video-editing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15977 2024-02-01 cs.CV 79%

Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion Modeling

Xiaoyu Shi, Zhaoyang Huang, Fu-Yun Wang, Weikang Bian, Dasong Li, Yi Zhang, Manyuan Zhang, Ka Chun Cheung, Simon See, Hongwei Qin, Jifeng Dai, Hongsheng Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://xiaoyushi97.github.io/Motion-I2V/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09084 2024-01-18 cs.CV 79%

UniVG: Towards UNIfied-modal Video Generation

Ludan Ruan, Lei Tian, Chuanwei Huang, Xu Zhang, Xinyan Xiao

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03988 2024-01-17 cs.CV cs.AI 79%

Learn the Force We Can: Enabling Sparse Motion Control in Multi-Object Video Generation

Aram Davtyan, Paolo Favaro

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted to AAAI 2024. Project website: https://araachie.github.io/yoda

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00701 2024-01-02 cs.CV 79%

Towards Efficient and Effective Text-to-Video Retrieval with Coarse-to-Fine Visual Representation Learning

Kaibin Tian, Yanhua Cheng, Yi Liu, Xinglin Hou, Quan Chen, Han Li

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05107 2023-12-12 cs.CV 79%

DreaMoving: A Human Video Generation Framework based on Diffusion Models

Mengyang Feng, Jinlin Liu, Kai Yu, Yuan Yao, Zheng Hui, Xiefan Guo, Xianhui Lin, Haolan Xue, Chen Shi, Xiaowen Li, Aojie Li, Xiaoyang Kang, Biwen Lei, Miaomiao Cui, Peiran Ren, Xuansong Xie

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 5 pages, 5 figures, Tech. Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04561 2023-12-08 cs.CV 79%

GenDeF: Learning Generative Deformation Field for Video Generation

Wen Wang, Kecheng Zheng, Qiuyu Wang, Hao Chen, Zifan Shi, Ceyuan Yang, Yujun Shen, Chunhua Shen

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://aim-uofa.github.io/GenDeF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00777 2023-12-04 cs.CV 79%

VideoBooth: Diffusion-based Video Generation with Image Prompts

Yuming Jiang, Tianxing Wu, Shuai Yang, Chenyang Si, Dahua Lin, Yu Qiao, Chen Change Loy, Ziwei Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://vchitect.github.io/VideoBooth-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00298 2023-11-02 cs.CV 79%

An Empirical Study of Frame Selection for Text-to-Video Retrieval

Mengxia Wu, Min Cao, Yang Bai, Ziyin Zeng, Chen Chen, Liqiang Nie, Min Zhang

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted by 2023 EMNLP findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12964 2023-10-20 cs.CV 79%

Audio-Enhanced Text-to-Video Retrieval using Text-Conditioned Feature Alignment

Sarah Ibrahimi, Xiaohang Sun, Pichao Wang, Amanmeet Garg, Ashutosh Sanan, Mohamed Omar

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Proceedings of the IEEE/CVF International Conference on Computer Vision. 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05825 2023-10-10 cs.MM cs.HC 79%

Write What You Want: Applying Text-to-video Retrieval to Audiovisual Archives

Yuchen Yang

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13274 2023-09-26 cs.CV 79%

GLOBER: Coherent Non-autoregressive Video Generation via GLOBal Guided Video DecodER

Mingzhen Sun, Weining Wang, Zihan Qin, Jiahui Sun, Sihan Chen, Jing Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04509 2023-09-12 cs.SD cs.CV cs.GR eess.AS 79%

The Power of Sound (TPoS): Audio Reactive Video Generation with Stable Diffusion

Yujin Jeong, Wonjeong Ryoo, Seunghyun Lee, Dabin Seo, Wonmin Byeon, Sangpil Kim, Jinkyu Kim

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments ICCV2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16909 2023-09-01 cs.CV cs.AI 79%

StyleInV: A Temporal Style Modulated Inversion Network for Unconditional Video Generation

Yuhan Wang, Liming Jiang, Chen Change Loy

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments ICCV 2023. Code: https://github.com/johannwyh/StyleInV Project page: https://www.mmlab-ntu.com/project/styleinv/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09906 2023-08-21 cs.CV cs.AI 79%

Implicit Identity Representation Conditioned Memory Compensation Network for Talking Head video Generation

Fa-Ting Hong, Dan Xu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted by ICCV2023, update the reference and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08089 2023-08-17 cs.CV 79%

DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory

Shengming Yin, Chenfei Wu, Jian Liang, Jie Shi, Houqiang Li, Gong Ming, Nan Duan

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06457 2023-08-15 cs.CV cs.CL 79%

Text-to-Video: a Two-stage Framework for Zero-shot Identity-agnostic Talking-head Generation

Zhichao Wang, Mengyu Dai, Keld Lundgaard

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01217 2023-08-03 cs.CV 79%

TeachCLIP: Multi-Grained Teaching for Efficient Text-to-Video Retrieval

Kaibin Tian, Ruixiang Zhao, Hu Hu, Runquan Xie, Fengzong Lian, Zhanhui Kang, Xirong Li

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06384 2023-06-22 cs.CV 79%

PV3D: A 3D Generative Model for Portrait Video Generation

Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew, Wenqing Zhang, Song Bai, Jiashi Feng, Mike Zheng Shou

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted to ICLR2023, Project Page https://showlab.github.io/pv3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11173 2023-06-21 cs.CV cs.AI cs.LG 79%

GD-VDM: Generated Depth for better Diffusion-based Video Generation

Ariel Lapid, Idan Achituve, Lior Bracha, Ethan Fetaya

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02396 2023-06-02 cs.CV cs.AI cs.LG 79%

Temporally Consistent Transformers for Video Generation

Wilson Yan, Danijar Hafner, Stephen James, Pieter Abbeel

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project website: https://wilson1yan.github.io/teco

详情

展开后加载摘要…

URL PDF HTML 收藏