arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2145 篇

2407.09111 2024-10-02 cs.AI cs.LG 50%

Inference Optimization of Foundation Models on AI Accelerators

Youngsuk Park, Kailash Budhathoki, Liangfu Chen, Jonas Kübler, Jiaji Huang, Matthäus Kleindessner, Jun Huan, Volkan Cevher, Yida Wang, George Karypis

专题命中 视频生成 :video generation(abstract)

Comments [v2] Tutorial website added [v1] Tutorial published at KDD 2024. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00851 2024-09-04 cs.IR cs.LG cs.SD eess.AS 50%

Dissecting Temporal Understanding in Text-to-Audio Retrieval

Andreea-Maria Oncescu, João F. Henriques, A. Sophia Koepke

专题命中 视频生成 :text-to-video(abstract)

Comments 9 pages, 5 figures, ACM Multimedia 2024, https://www.robots.ox.ac.uk/~vgg/research/audio-retrieval/dtu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12843 2024-05-22 cs.CY cs.LG 50%

OpenCarbonEval: A Unified Carbon Emission Estimation Framework in Large-Scale AI Models

Zhaojian Yu, Yinghao Wu, Zhuotao Deng, Yansong Tang, Xiao-Ping Zhang

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03986 2024-05-08 cs.AI cs.HC 50%

Factors Influencing User Willingness To Use SORA

Gustave Florentin Nkoulou Mvondo, Ben Niu

专题命中 视频生成 :text-to-video(abstract)

Comments 27 pages, 3 figures, 7 tables, 2 authors; first author* corresponding author,

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13358 2024-04-23 cs.SD cs.AI eess.AS 50%

Music Consistency Models

Zhengcong Fei, Mingyuan Fan, Junshi Huang

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03516 2024-02-27 cs.IR 50%

Generative Recommendation: Towards Next-generation Recommender Paradigm

Wenjie Wang, Xinyu Lin, Fuli Feng, Xiangnan He, Tat-Seng Chua

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00430 2024-01-04 cs.AI 50%

Brain-Conditional Multimodal Synthesis: A Survey and Taxonomy

Weijian Mai, Jian Zhang, Pengfei Fang, Zhijun Zhang

专题命中 视频生成 :text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11216 2023-08-23 cs.LG 50%

Hamiltonian GAN

Christine Allen-Blanchette

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08691 2023-07-18 cs.LG 50%

FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning

Tri Dao

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05243 2022-10-12 cs.IR 50%

Cross-modal Search Method of Technology Video based on Adversarial Learning and Feature Fusion

Xiangbin Liu, Junping Du, Meiyu Liang, Ang Li

专题命中 视频生成 :text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03825 2022-10-11 cs.AI cs.RO 50%

See, Plan, Predict: Language-guided Cognitive Planning with Video Prediction

Maria Attarian, Advaya Gupta, Ziyi Zhou, Wei Yu, Igor Gilitschenski, Animesh Garg

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.13500 2022-05-27 quant-ph 50%

Quantum generative adversarial learning for simultaneous multiparameter estimation

Zichao Huang, Yuanyuan Chen, Lixiang Chen

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.12827 2021-12-24 quant-ph 50%

Realizing a quantum generative adversarial network using a programmable superconducting processor

Kaixuan Huang, Zheng-An Wang, Chao Song, Kai Xu, Hekang Li, Zhen Wang, Qiujiang Guo, Zixuan Song, Zhi-Bo Liu, Dongning Zheng, Dong-Ling Deng, H. Wang, Jian-Guo Tian, Heng Fan

专题命中 视频生成 :video generation(abstract)

Journal ref npj Quantum Inf 7, 165 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.07496 2021-01-20 cs.LG cs.AI 50%

Disentangled Recurrent Wasserstein Autoencoder

Jun Han, Martin Renqiang Min, Ligong Han, Li Erran Li, Xuan Zhang

专题命中 视频生成 :video generation(abstract)

Comments ICLR 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.14133 2020-09-30 cs.LG stat.ML 50%

EEG to fMRI Synthesis: Is Deep Learning a candidate?

David Calhas, Rui Henriques

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.02893 2019-02-05 quant-ph cond-mat.dis-nn cond-mat.supr-con 50%

Quantum generative adversarial learning in a superconducting quantum circuit

Ling Hu, Shu-Hao Wu, Weizhou Cai, Yuwei Ma, Xianghao Mu, Yuan Xu, Haiyan Wang, Yipu Song, Dong-Ling Deng, Chang-Ling Zou, Luyan Sun

专题命中 视频生成 :video generation(abstract)

Comments 5 pages, 4 figures, Comments are welcome

Journal ref Sci. Adv. 5, eaav2761 (2019)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 1305 篇

2211.13221 2023-03-21 cs.CV cs.AI 92%

Latent Video Diffusion Models for High-Fidelity Long Video Generation

Yingqing He, Tianyu Yang, Yong Zhang, Ying Shan, Qifeng Chen

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);long video(title,abstract);text-to-video(abstract)

Comments Project Page: https://yingqinghe.github.io/LVDM/ Github: https://github.com/YingqingHe/LVDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21545 2026-03-31 cs.CV cs.LG 92%

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练

Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(title);video understanding(abstract)

AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。

Comments ICLR 2026 ReALM-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09019 2025-01-16 cs.CV 90%

Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video Diffusion

Jingyuan Chen, Fuchen Long, Jie An, Zhaofan Qiu, Ting Yao, Jiebo Luo, Tao Mei

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01316 2025-04-01 cs.CV cs.AI cs.MM 90%

Long Video Diffusion Generation with Segmented Cross-Attention and Content-Rich Video Data Curation

Xin Yan, Yuxuan Cai, Qiuyue Wang, Yuan Zhou, Wenhao Huang, Huan Yang

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);分类 cs.CV、cs.MM

Comments This paper is accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13840 2024-08-13 cs.CV cs.AI cs.LG cs.MM 90%

Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning

Weifeng Chen, Yatai Ji, Jie Wu, Hefeng Wu, Pan Xie, Jiashi Li, Xin Xia, Xuefeng Xiao, Liang Lin

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00194 2026-03-03 cs.CV cs.AI cs.CR 89%

SKeDA: A Generative Watermarking Framework for Text-to-video Diffusion Models

SKeDA:一种面向文本到视频扩散模型的生成水印框架

Yang Yang, Xinze Zou, Zehua Ma, Han Fang, Weiming Zhang

机构 * School of Electronic and Information Engineering, Anhui University(安徽大学电子与信息工程学院) Anhui Province Key Laboratory of Digital Security and the CAS Key Laboratory of Electromagnetic Space Information, University of Science and Technology of China(安徽省数字安全重点实验室和中国科学院电磁空间信息重点实验室,中国科学技术大学) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 SKeDA是一种专为文本到视频扩散模型设计的生成水印框架,通过分布保持采样和差分注意机制提升水印的鲁棒性和可靠性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03931 2025-11-25 cs.CV 89%

MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers

MagicMirror: 视频扩散变换器中的身份保留视频生成

Yuechen Zhang, Yaoyang Liu, Bin Xia, Bohao Peng, Zexin Yan, Eric Lo, Jiaya Jia

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MagicMirror通过双分支特征提取器和两阶段训练策略,在视频扩散变换器中实现高质量身份保留视频生成,优于现有方法。

Comments ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14209 2025-08-29 cs.LG cs.CV 89%

Unlearning Concepts from Text-to-Video Diffusion Models

Shiqi Liu, Yihua Tan

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05484 2025-01-13 cs.CV 89%

Tuning-Free Long Video Generation via Global-Local Collaborative Diffusion

Yongjia Ma, Junlin Chen, Donglin Di, Qi Xie, Lei Fan, Wei Chen, Xiaofei Gou, Na Zhao, Xun Yang

专题命中 视频扩散模型 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02332 2024-11-12 cs.CV 89%

UniCtrl: Improving the Spatiotemporal Consistency of Text-to-Video Diffusion Models via Training-Free Unified Attention Control

Tian Xia, Xuweiyi Chen, Sihan Xu

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments Accepted to TMLR | Project Page: https://unified-attention-control.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06098 2024-10-01 cs.CV cs.CL 89%

VidProM: A Million-scale Real Prompt-Gallery Dataset for Text-to-Video Diffusion Models

Wenhao Wang, Yi Yang

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);video generation(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05082 2024-06-10 cs.CV 89%

CoNo: Consistency Noise Injection for Tuning-free Long Video Diffusion

Xingrui Wang, Xin Li, Zhibo Chen

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(title,abstract);video generation(abstract);分类 cs.CV

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06578 2024-05-13 cs.CV 89%

360DVD: Controllable Panorama Video Generation with 360-Degree Video Diffusion Model

Qian Wang, Weiqi Li, Chong Mou, Xinhua Cheng, Jian Zhang

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2307.04725 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16306 2024-04-26 cs.CV 89%

TI2V-Zero: Zero-Shot Image Conditioning for Text-to-Video Diffusion Models

Haomiao Ni, Bernhard Egger, Suhas Lohit, Anoop Cherian, Ye Wang, Toshiaki Koike-Akino, Sharon X. Huang, Tim K. Marks

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract);long video(abstract)

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏