arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2012.07304 2020-12-15 cs.CV 79%

Multi Modal Adaptive Normalization for Audio to Video Generation

Neeraj Kumar, Srishti Goel, Ankur Narang, Brejesh Lall

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.02631 2020-11-06 cs.CV 79%

Lets Play Music: Audio-driven Performance Video Generation

Hao Zhu, Yi Li, Feixia Zhu, Aihua Zheng, Ran He

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments ICPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.05856 2020-08-14 cs.CV 79%

Recurrent Deconvolutional Generative Adversarial Networks with Application to Text Guided Video Generation

Hongyuan Yu, Yan Huang, Lihong Pi, Liang Wang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.09393 2020-05-22 cs.CV cs.LG 79%

Learning Temporal Coherence via Self-Supervision for GAN-based Video Generation

Mengyu Chu, You Xie, Jonas Mayer, Laura Leal-Taixé, Nils Thuerey

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://ge.in.tum.de/publications/2019-tecogan-chu/, code link: https://github.com/thunil/TecoGAN

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.10137 2020-03-06 cs.CV cs.GR 79%

Audio-driven Talking Face Video Generation with Learning-based Personalized Head Pose

Ran Yi, Zipeng Ye, Juyong Zhang, Hujun Bao, Yong-Jin Liu

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.01037 2020-01-13 cs.CV 79%

TwoStreamVAN: Improving Motion Modeling in Video Generation

Ximeng Sun, Huijuan Xu, Kate Saenko

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments WACV 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.07991 2019-12-18 cs.LG cs.CV stat.ML 79%

Jointly Trained Image and Video Generation using Residual Vectors

Yatin Dandi, Aniket Das, Soumye Singhal, Vinay P. Namboodiri, Piyush Rai

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted in 2020 Winter Conference on Applications of Computer Vision (WACV '20)

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.11106 2019-10-25 cs.CV cs.LG stat.ML 79%

Label-Conditioned Next-Frame Video Generation with Neural Flows

David Donahue

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Computer Vision class project, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.02912 2019-08-08 cs.CV 79%

Point-to-Point Video Generation

Tsun-Hsuan Wang, Yen-Chi Cheng, Chieh Hubert Lin, Hwann-Tzong Chen, Min Sun

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments To appear in ICCV 2019. The first two authors contributed equally to this work. 16 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.04480 2019-03-12 cs.CV 79%

Video Generation from Single Semantic Label Map

Junting Pan, Chengyu Wang, Xu Jia, Jing Shao, Lu Sheng, Junjie Yan, Xiaogang Wang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Paper accepted at CVPR 2019. Source code and models available at https://github.com/junting/seg2vid/tree/master

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.08682 2018-12-24 cs.CV stat.ML 79%

Deep Video Generation, Prediction and Completion of Human Action Sequences

Haoye Cai, Chunyan Bai, Yu-Wing Tai, Chi-Keung Tang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Under review for CVPR 2018. Haoye and Chunyan have equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.02419 2018-12-07 cs.CV cs.AI stat.ML 79%

Towards High Resolution Video Generation with Progressive Growing of Sliced Wasserstein GANs

Dinesh Acharya, Zhiwu Huang, Danda Pani Paudel, Luc Van Gool

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Master Thesis from ETH Zurich, May 22, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.01261 2018-12-06 cs.CV 79%

Conditional Video Generation Using Action-Appearance Captions

Shohei Yamamoto, Antonio Tejero-de-Pablos, Yoshitaka Ushiku, Tatsuya Harada

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.08085 2018-03-26 cs.CV 79%

Probabilistic Video Generation using Holistic Attribute Control

Jiawei He, Andreas Lehrmann, Joseph Marino, Greg Mori, Leonid Sigal

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.11453 2018-03-16 cs.CV 79%

Improving Video Generation for Multi-functional Applications

Bernhard Kratzwald, Zhiwu Huang, Danda Pani Paudel, Acharya Dinesh, Luc Van Gool

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.04993 2017-12-15 cs.CV 79%

MoCoGAN: Decomposing Motion and Content for Video Generation

Sergey Tulyakov, Ming-Yu Liu, Xiaodong Yang, Jan Kautz

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.09618 2017-12-04 cs.CV 79%

Hierarchical Video Generation from Orthogonal Information: Optical Flow and Texture

Katsunori Ohnishi, Shohei Yamamoto, Yoshitaka Ushiku, Tatsuya Harada

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Our supplemental material is available on http://www.mi.t.u-tokyo.ac.jp/assets/publication/hierarchical_video_generation_sup/ Accepted to AAAI2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.05980 2017-11-17 cs.CV 79%

Attentive Semantic Video Generation using Captions

Tanya Marwah, Gaurav Mittal, Vineeth N. Balasubramanian

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Journal ref Presented at ICCV 2017 (International Conference on Computer Vision)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21718 2026-04-28 cs.CV cs.AI cs.CL cs.LG cs.MM 79%

Building a Precise Video Language with Human-AI Oversight

构建具有人机监督的精确视频语言

Zhiqiu Lin, Chancharik Mitra, Siyuan Cen, Isaac Li, Yuhan Huang, Yu Tong Tiffany Ling, Hewei Wang, Irene Pi, Shihang Zhu, Ryan Rao, George Liu, Jiaxi Li, Ruojin Li, Yili Han, Yilun Du, Deva Ramanan

专题命中 视频生成 :video generation(abstract);video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM

AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。

Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25321 2026-07-29 cs.AI 新提交 78%

Physics-Grounded Fluid Video Generation with a Simulation Dataset and Dual-Stream Optical-Flow Supervision

基于模拟数据集和双流光流监督的物理基础流体视频生成

Ruijie Su, Yuanzhi Liang, Xiaohua Xie, Jianhuang Lai

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 视频生成 :video generation(title);video diffusion(abstract)

AI总结 研究流体视频生成中模型违反物理原理的问题,构建含模拟与真实视频的数据集,引入双流图像到视频架构,通过光流监督增强模型,提升视频物理常识和质量得分,使模型内化连贯运动先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01701 2026-07-03 cs.DC 新提交 78%

Arachne: Orchestrating Cascades for Efficient Text-to-Video Model Training

Arachne: 编排级联以实现高效文本到视频模型训练

Peng Yu, Yuankai Fan, Yang Qiu, Tian Li, Bihuan Chen, Yin Chen, Qizhen Weng

专题命中 视频生成 :text-to-video(title,abstract)

AI总结 提出Arachne框架,通过将训练过程分解为细粒度计算单元(级联)并协调其分布式执行与同步,解决T2V模型训练中的负载不均和硬件利用率低问题,迭代时间最多减少65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32028 2026-07-03 cs.RO 新提交 78%

DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation

DVG-WM:解耦视频生成实现高效机器人操作具身世界模型

Ziyu Shan, Zhenyu Wu, Xiaofeng Wang, Zheng Zhu, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学(新加坡)) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学(中国北京)) GigaAI

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出解耦视频生成世界模型(DVG-WM),将世界模型分解为动力学学习和视觉合成,通过流匹配直接映射动力学到视频潜变量,并引入潜变量退化机制再生接触细节,在LIBERO和真实平台实现高达3.97倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25496 2026-06-25 cs.IR 新提交 78%

Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale

推荐即生成:在工业规模上统一个性化视频生成与推荐

Yanhua Cheng, Bo Wang, Haotian Zhang, Xinyuan Gao, Zhihui Yin, Ben Xue, Yongzhi Li, Jieting Xue, Ye Ma, Minquan Wang, Jiahui Li, Tianyu Xu, Zhiqiang Liu, Xiao Lin, Shiyang Wen, Changcheng Li, Liu Liu, Quan Chen, Peng Jiang, Kun Gai

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出推荐即生成(RaG)范式,通过共享语义ID统一生成式推荐与视频生成,实现个性化视频按需生成,并在工业平台部署,广告收入提升1.87%。

Comments Project page: https://recommendation-as-generation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22363 2026-06-23 cs.AI cs.LG cs.RO 新提交 78%

Reference-Free Assessment of Physical Consistency in World Model-based Video Generation

基于世界模型的视频生成中物理一致性的无参考评估

Yun Oh, Sukmin Yun

机构 * Hanyang University ERICA(汉阳大学ERICA校区)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出结合相对与绝对方法的无参考度量,用于评估生成视频的物理一致性,无需人工投票或真实参考,通过DROID-SLAM和SEA-RAFT量化不一致性,过滤后视频任务成功率提升超8%,并实现时空定位。

Comments Accepted to the 2nd 3D-LLM/VLA Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19271 2026-06-18 cs.DC 新提交 78%

TurboServe: Serving Streaming Video Generation Efficiently and Economically

TurboServe: 高效经济地服务流式视频生成

Youhe Jiang, Haoxu Wang, Haotong Bao, Kai Jiang, Jianfei Chen, Jun Zhu, Fangcheng Fu, Jintao Zhang

专题命中 视频生成 :video generation(title,abstract)

AI总结 针对流式视频生成的会话时长和用户需求异构性,提出TurboServe系统,通过在线调度联合优化会话放置与GPU配置,采用迁移感知放置和负载驱动自动缩放,降低延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15319 2026-06-16 cs.DC 新提交 78%

Adaptive Resource Management and Quality Control for Streaming Video Generation

自适应资源管理与质量控制用于流式视频生成

Yifei Xia, Hao Yuan, Suhan Ling, Haoran Sun, Hanke Zhang, Xupeng Miao, Fangcheng Fu, Bin Cui

专题命中 视频生成 :video generation(title,abstract)

AI总结 针对自回归扩散Transformer在实时流式视频生成中的播放连续性SLO,提出基于播放余量的服务系统SlackServe,通过三级优先级队列、重新归位和弹性序列并行重新分配资源,并在质量下限下通过双模帕累托路由选择每块保真度配置,显著提升QoE并降低首块延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12576 2026-06-12 cs.CL 新提交 78%

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

帮助图表讲述它们的故事!基于论文的视频生成解释复杂科学图表

Ishani Mondal, Javad Baghirov, Jordan Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出MINARD流水线,从图表及其论文生成基于区域分解的叙述性视频,并发布FigTalk基准,在自动和人工评估中优于现有方法。

Comments Webpage: https://minard.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12028 2026-06-11 cs.RO 新提交 78%

VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network

VICX: 通过视频生成和上下文操作网络实现可泛化的机器人操作

Song Chen, Linyan Xiang, Ying Zhou, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出VICX框架,利用冻结视频生成模型生成视觉计划,并通过视频到轨迹的上下文操作网络(V2T-ICON)将其映射为机器人可执行轨迹,实现跨任务、跨本体泛化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30895 2026-06-02 cs.CE 78%

CamGeo: Sparse Camera-Conditioned Image-to-Video Generation with 3D Geometry Priors

CamGeo: 基于稀疏相机条件的图像到视频生成与3D几何先验

Xuanyi Liu, Deyi Ji, Liqun Liu, Lanyun Zhu, Xuhang Chen, Qianxiong Xu, Peng Shu, Huan Yu, Jie Jiang, Feng Gao, Siwei Ma

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出CamGeo框架,通过从预训练视频到3D模型蒸馏3D几何知识,结合关键帧轨迹蒸馏、跨帧一致性蒸馏和三阶段课程学习,解决稀疏相机条件下图像到视频生成中的姿态漂移和运动不连续问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11790 2026-06-02 cs.AI cs.CL 78%

Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation

超越端到端视频模型:基于LLM的多智能体系统用于教育视频生成

Lingyong Yan, Jiulong Wu, Dong Xie, Weixian Shi, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出LASEV,一种基于LLM的分层多智能体系统,通过将教育视频生成分解为多个专业智能体协作,解决端到端模型在逻辑严谨性和知识表示方面的不足,实现低成本、高吞吐量的自动化教学视频生产。

Comments Accepted at ACM SIGKDD 2026 (KDD '26), Applied Data Science Track. 10 pages, 2 figures, 5 tables. The project is available at \url{https://robitsg.github.io/LASEV}

详情

展开后加载摘要…

URL PDF HTML 收藏