arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6765 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2506.17201 2025-06-23 cs.CV 79%

Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition

Jiaqi Li, Junshu Tang, Zhiyong Xu, Longhuang Wu, Yuan Zhou, Shuai Shao, Tianbao Yu, Zhiguo Cao, Qinglin Lu

机构 * Tencent Hunyuan(腾讯 Hunyuan)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://hunyuan-gamecraft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06679 2025-06-18 cs.CV 79%

T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks

Jiayang Liu, Siyuan Liang, Shiqian Zhao, Rongcheng Tu, Wenbo Zhou, Aishan Liu, Dacheng Tao, Siew Kei Lam

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15371 2025-06-17 cs.CV cs.AI cs.LG 79%

FrameBridge: Improving Image-to-Video Generation with Bridge Models

Yuji Wang, Zehua Chen, Xiaoyu Chen, Yixiang Wei, Jun Zhu, Jianfei Chen

机构 * Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07713 2025-06-16 cs.CV cs.AI 79%

Consistent Video Editing as Flow-Driven Image-to-Video Generation

Ge Wang, Songlin Fan, Hangxu Liu, Quanjian Song, Hewei Wang, Jinfeng Xu

机构 * Fudan University(复旦大学) Xiamen University(厦门大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10096 2025-06-16 cs.CV 79%

A Self-supervised Motion Representation for Portrait Video Generation

Qiyuan Zhang, Chenyu Wu, Wenzhang Sun, Huaize Liu, Donglin Di, Wei Chen, Changqing Zou

机构 * Zhejiang University(浙江大学) Li Auto(利汽车) Zhejiang Lab(浙江实验室) Hangzhou Institute for Advanced Study,University of Chinese Academy of Sciences(杭州高等研究 institute, 中国科学院大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22944 2025-06-11 cs.CV cs.AI 79%

ATI: Any Trajectory Instruction for Controllable Video Generation

Angtian Wang, Haibin Huang, Jacob Zhiyuan Fang, Yiding Yang, Chongyang Ma

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19009 2025-06-11 cs.CV cs.IR 79%

Video-ColBERT: Contextualized Late Interaction for Text-to-Video Retrieval

Arun Reddy, Alexander Martin, Eugene Yang, Andrew Yates, Kate Sanders, Kenton Murray, Reno Kriz, Celso M. de Melo, Benjamin Van Durme, Rama Chellappa

机构 * Johns Hopkins Applied Physics Laboratory(约翰霍普金斯应用物理实验室) Johns Hopkins University(约翰霍普金斯大学) Human Language Technology Center of Excellence(人类语言技术卓越中心) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted at CVPR 2025. 13 pages, 4 figures. Approved for public release: distribution unlimited

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08003 2025-06-10 cs.CV cs.AI 79%

Audio-Sync Video Generation with Multi-Stream Temporal Control

Shuchen Weng, Haojie Zheng, Zheng Chang, Si Li, Boxin Shi, Xinlong Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Nat’l Key Lab of General AI, School of Intelligence Science and Technology, Peking University(国家通用人工智能实验室,北京大学智能科学与技术学院) Nat’l Eng. Research Ctr. of Visual Tech., School of Computer Science, Peking University(国家视觉技术工程研究中心,北京大学计算机学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07848 2025-06-10 cs.CV cs.AI 79%

PolyVivid: Vivid Multi-Subject Video Generation with Cross-Modal Interaction and Enhancement

Teng Hu, Zhentao Yu, Zhengguang Zhou, Jiangning Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯文英) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21036 2025-06-10 cs.CV cs.AI 79%

RainFusion: Adaptive Video Generation Acceleration via Multi-Dimensional Visual Redundancy

Aiyue Chen, Bin Dong, Jingru Li, Jing Lin, Kun Tian, Yiwu Yao, Gongyi Wang

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06173 2025-06-10 cs.CV 79%

VideoAuteur: Towards Long Narrative Video Generation

Junfei Xiao, Feng Cheng, Lu Qi, Liangke Gui, Jiepeng Cen, Zhibei Ma, Alan Yuille, Lu Jiang

机构 * Johns Hopkins University(约翰霍普金斯大学) ByteDance Project(字节跳动项目)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Preprint, https://videoauteur.github.io/; V2: Method is updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05806 2025-06-09 cs.CV 79%

LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models

Haojie Yu, Zhaonian Wang, Yihan Pan, Meng Cheng, Hao Yang, Chao Wang, Tao Xie, Xiaoming Xu, Xiaoming Wei, Xunliang Cai

机构 * Meituan Inc.(美团公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19901 2025-06-04 cs.CV 79%

Dynamic-I2V: Exploring Image-to-Video Generation Models via Multimodal LLM

Peng Liu, Xiaoming Ren, Fengkai Liu, Qingsong Xie, Quanlong Zheng, Yanhao Zhang, Haonan Lu, Yujiu Yang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16506 2025-06-03 cs.CV 79%

Alignment is All You Need: A Training-free Augmentation Strategy for Pose-guided Video Generation

Xiaoyu Jin, Zunnan Xu, Mingwen Ou, Wenming Yang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted to CVG@ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23952 2025-06-02 cs.CV 79%

Leveraging Auxiliary Information in Text-to-Video Retrieval: A Review

Adriano Fragomeni, Dima Damen, Michael Wray

机构 * University of Bristol(布里斯托大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22647 2025-05-29 cs.CV 79%

Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation

Zhe Kong, Feng Gao, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Xunliang Cai, Guanying Chen, Wenhan Luo

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Meituan(美团) AMC and Department of ECE, HKUST(香港科技大学AMC及电子与计算机工程系)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Homepage: https://meigen-ai.github.io/multi-talk Github: https://github.com/MeiGen-AI/MultiTalk

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15800 2025-05-27 cs.CV 79%

Interspatial Attention for Efficient 4D Human Video Generation

Ruizhi Shao, Yinghao Xu, Yujun Shen, Ceyuan Yang, Yang Zheng, Changan Chen, Yebin Liu, Gordon Wetzstein

机构 * Tsinghua University(清华大学) Stanford University(斯坦福大学) Ant Research(蚂蚁研究) ByteDance Inc.(字节跳动公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://dsaurus.github.io/isa4d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18078 2025-05-26 cs.CV 79%

DanceTogether! Identity-Preserving Multi-Person Interactive Video Generation

Junhao Chen, Mingjin Chen, Jianjin Xu, Xiang Li, Junting Dong, Mingze Sun, Puhua Jiang, Hongxiang Li, Yuhang Yang, Hao Zhao, Xiaoxiao Long, Ruqi Huang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Our video demos and code are available at https://DanceTog.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17618 2025-05-26 cs.CV cs.AI cs.LG 79%

Scaling Image and Video Generation via Test-Time Evolutionary Search

Haoran He, Jiajun Liang, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Ling Pan

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 37 pages. Project: https://tinnerhrhe.github.io/evosearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14709 2025-05-22 cs.CV cs.AI 79%

FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge

Xuan Shen, Weize Ma, Yufa Zhou, Enhao Tang, Yanyue Xie, Zhengang Li, Yifan Gong, Quanyi Wang, Henghui Ding, Yiwei Wang, Yanzhi Wang, Pu Zhao, Jun Lin, Jiuxiang Gu

机构 * Northeastern University(东北大学) Nanjing University(南京大学) Duke University(杜克大学) Adobe Research(Adobe研究) NUIST(南京信息工程大学) Fudan University(复旦大学) UCM(乌拉尔联邦大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Preprint Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08189 2025-05-22 cs.CV 79%

AnyCharV: Bootstrap Controllable Character Video Generation with Fine-to-Coarse Guidance

Zhao Wang, Hao Wen, Lingting Zhu, Chenming Shang, Yujiu Yang, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 18 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06985 2025-05-13 cs.CV 79%

BridgeIV: Bridging Customized Image and Video Generation through Test-Time Autoregressive Identity Propagation

Panwen Hu, Jiehui Huang, Qiang Sun, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·泽亚德人工智能大学) Sun Yat-sen University(孙中山大学) University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04512 2025-05-09 cs.CV 79%

HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation

Teng Hu, Zhentao Yu, Zhengguang Zhou, Sen Liang, Yuan Zhou, Qin Lin, Qinglin Lu

机构 * Tencent Hunyuan(腾讯文汇)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08685 2025-05-06 cs.CV cs.AI 79%

Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model

Team Seawead, Ceyuan Yang, Zhijie Lin, Yang Zhao, Shanchuan Lin, Zhibei Ma, Haoyuan Guo, Hao Chen, Lu Qi, Sen Wang, Feng Cheng, Feilong Zuo, Xuejiao Zeng, Ziyan Yang, Fangyuan Kong, Meng Wei, Zhiwu Qing, Fei Xiao, Tuyen Hoang, Siyu Zhang, Peihao Zhu, Qi Zhao, Jiangqiao Yan, Liangke Gui, Sheng Bi, Jiashi Li, Yuxi Ren, Rui Wang, Huixia Li, Xuefeng Xiao, Shu Liu, Feng Ling, Heng Zhang, Houmin Wei, Huafeng Kuang, Jerry Duncan, Junda Zhang, Junru Zheng, Li Sun, Manlin Zhang, Renfei Sun, Xiaobin Zhuang, Xiaojie Li, Xin Xia, Xuyan Chi, Yanghua Peng, Yuping Wang, Yuxuan Wang, Zhongkai Zhao, Zhuo Chen, Zuquan Song, Zhenheng Yang, Jiashi Feng, Jianchao Yang, Lu Jiang

机构 * ByteDance Seed(字节跳动种子)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Technical report (some typos fixed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18810 2025-04-29 cs.CV cs.AI 79%

Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning

Yifan Xie, Fei Ma, Yi Bin, Ying He, Fei Yu

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济发展实验室) Shenzhen University(深圳大学) Tongji University(同济大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18448 2025-04-28 cs.CV 79%

NoiseController: Towards Consistent Multi-view Video Generation via Noise Decomposition and Collaboration

Haotian Dong, Xin Wang, Di Lin, Yipeng Wu, Qin Chen, Ruonan Liu, Kairui Yang, Ping Li, Qing Guo

机构 * Tianjin University(天津大学) The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16720 2025-04-28 cs.CV 79%

Importance-Based Token Merging for Efficient Image and Video Generation

Haoyu Wu, Jingyi Xu, Hieu Le, Dimitris Samaras

机构 * Stony Brook University(石溪大学) EPFL(苏黎世联邦理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17267 2025-04-25 cs.HC cs.MM 79%

MV-Crafter: An Intelligent System for Music-guided Video Generation

Chuer Chen, Shengqi Dang, Yuqi Liu, Nanxuan Zhao, Yang Shi, Nan Cao

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15932 2025-04-23 cs.CV 79%

Reasoning Physical Video Generation with Diffusion Timestep Tokens via Reinforcement Learning

Wang Lin, Liyu Jia, Wentao Hu, Kaihang Pan, Zhongqi Yue, Wei Zhao, Jingyuan Chen, Fei Wu, Hanwang Zhang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Huawei Singapore Research Center(华为新加坡研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11603 2025-04-21 cs.CV 79%

LaMD: Latent Motion Diffusion for Image-Conditional Video Generation

Yaosi Hu, Zhenzhong Chen, Chong Luo

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏