arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

1904.07538 2021-06-02 cs.CV 74%

Long-Term Human Video Generation of Multiple Futures Using Poses

Naoya Fushishita, Antonio Tejero-de-Pablos, Yusuke Mukuta, Tatsuya Harada

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.06705 2021-03-26 cs.CV cs.LG stat.ML 74%

Unsupervised object-centric video generation and decomposition in 3D

Paul Henderson, Christoph H. Lampert

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Appeared at NeurIPS 2020. Project page: http://pmh47.net/o3v/

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.10941 2021-01-05 cs.CV cs.AI 74%

Can Everybody Sign Now? Exploring Sign Language Video Generation from 2D Poses

Lucas Ventura, Amanda Duarte, Xavier Giro-i-Nieto

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Video here: https://youtu.be/4ve1sGzWl2g

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.01434 2020-02-13 cs.CV cs.AI cs.LG 74%

VideoFlow: A Conditional Flow-Based Model for Stochastic Video Generation

Manoj Kumar, Mohammad Babaeizadeh, Dumitru Erhan, Chelsea Finn, Sergey Levine, Laurent Dinh, Durk Kingma

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments ICLR 2020 Camera-Ready. Previous title: VideoFlow: A Flow-Based Generative Model for Video

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.09139 2019-10-22 cs.CV cs.LG 74%

DwNet: Dense warp-based network for pose-guided human video generation

Polina Zablotskaia, Aliaksandr Siarohin, Bo Zhao, Leonid Sigal

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted to BMVC 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.06571 2019-09-26 cs.CV cs.LG stat.ML 74%

Adversarial Video Generation on Complex Datasets

Aidan Clark, Jeff Donahue, Karen Simonyan

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.12245 2019-05-30 cs.MM 74%

Automatic Realistic Music Video Generation from Segments of Youtube Videos

Sarah Gross, Xingxing Wei, Jun Zhu

专题命中 视频生成 :video generation(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.11521 2019-04-29 cs.CV 74%

Face Video Generation from a Single Image and Landmarks

Kritaphat Songsri-in, Stefanos Zafeiriou

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.00913 2019-03-05 cs.CV 74%

Unsupervised Bi-directional Flow-based Video Generation from one Snapshot

Lu Sheng, Junting Pan, Jiaming Guo, Jing Shao, Xiaogang Wang, Chen Change Loy

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 11 pages, 12 figures. Technical report for a project in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.11384 2019-02-01 cs.CV cs.LG stat.ML 74%

Learning to navigate image manifolds induced by generative adversarial networks for unsupervised video generation

Isabela Albuquerque, João Monteiro, Tiago H. Falk

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.11152 2018-07-31 cs.CV 74%

Pose Guided Human Video Generation

Ceyuan Yang, Zhe Wang, Xinge Zhu, Chen Huang, Jianping Shi, Dahua Lin

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted to ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.09951 2018-07-27 cs.CV 74%

Learning to Forecast and Refine Residual Motion for Image-to-Video Generation

Long Zhao, Xi Peng, Yu Tian, Mubbasir Kapadia, Dimitris Metaxas

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 17 pages, 8 figures, 4 tables, accepted by ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1710.00421 2017-10-03 cs.MM 74%

Video Generation From Text

Yitong Li, Martin Renqiang Min, Dinghan Shen, David Carlson, Lawrence Carin

专题命中 视频生成 :video generation(title);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16184 2026-06-16 cs.CV cs.MM 新提交 73%

Closed-Loop Triplet Synergistic Generation for Long-Form Video

闭环三元组协同生成用于长视频

Xinlei Yin, Xiulian Peng, Xiao Li, Zhiwei Xiong, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 提出CoTriSyGen框架,通过闭环视觉-文本-记忆协同过程,结合分析器进行镜头内和镜头间修正,解决长视频生成中的身份漂移和不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05290 2026-06-05 cs.CV cs.AI cs.MM 73%

Do Models Share Safety Representations? Cross-Model Steering for Safe Visual Generation

模型是否共享安全表示?面向安全视觉生成的跨模型引导

Tobia Poppi, Silvia Cappelletti, Sara Sarto, Florian Schiffers, Garin Kessler, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学) Amazon Prime Video(亚马逊prime视频)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 本文提出首个跨模型安全引导框架,通过源语言模型估计安全方向并迁移至目标生成器,无需目标侧不安全数据即可实现安全控制,且不牺牲生成质量。

Comments Project page: https://aimagelab.github.io/cross-model-safety-representations/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23325 2026-04-28 cs.CV cs.AI eess.IV 73%

EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

EAD-Net:具有空间细化和时间一致性的情感感知说话头生成

Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV、eess.IV

AI总结 EAD-Net通过引入同步网络监督和时空方向注意力机制,提升情感感知说话头生成的唇同步精度和时间一致性,同时利用大语言模型增强情感语义控制。

Comments Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14476 2025-09-22 cs.CV cs.AI cs.MM 73%

AToken: A Unified Tokenizer for Vision

Jiasen Lu, Liangchen Song, Mingze Xu, Byeongjoo Ahn, Yanjun Wang, Chen Chen, Afshin Dehghan, Yinfei Yang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20109 2025-03-24 cs.CV cs.AI cs.MM 73%

GiVE: Guiding Visual Encoder to Perceive Overlooked Information

Junjie Li, Jianghong Ma, Xiaofeng Zhang, Yuhang Li, Jianyang Shi

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments This paper was accepted by ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07464 2025-03-12 cs.SD cs.CV cs.MM eess.AS 73%

Video-to-Audio Generation with Hidden Alignment

Manjie Xu, Chenxing Li, Xinyi Tu, Yong Ren, Rilin Chen, Yu Gu, Wei Liang, Dong Yu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments https://sites.google.com/view/vta-ldm

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13720 2025-02-27 cs.CV cs.AI cs.LG eess.IV 73%

Movie Gen: A Cast of Media Foundation Models

Adam Polyak, Amit Zohar, Andrew Brown, Andros Tjandra, Animesh Sinha, Ann Lee, Apoorv Vyas, Bowen Shi, Chih-Yao Ma, Ching-Yao Chuang, David Yan, Dhruv Choudhary, Dingkang Wang, Geet Sethi, Guan Pang, Haoyu Ma, Ishan Misra, Ji Hou, Jialiang Wang, Kiran Jagadeesh, Kunpeng Li, Luxin Zhang, Mannat Singh, Mary Williamson, Matt Le, Matthew Yu, Mitesh Kumar Singh, Peizhao Zhang, Peter Vajda, Quentin Duval, Rohit Girdhar, Roshan Sumbaly, Sai Saketh Rambhatla, Sam Tsai, Samaneh Azadi, Samyak Datta, Sanyuan Chen, Sean Bell, Sharadh Ramaswamy, Shelly Sheynin, Siddharth Bhattacharya, Simran Motwani, Tao Xu, Tianhe Li, Tingbo Hou, Wei-Ning Hsu, Xi Yin, Xiaoliang Dai, Yaniv Taigman, Yaqiao Luo, Yen-Cheng Liu, Yi-Chiao Wu, Yue Zhao, Yuval Kirstain, Zecheng He, Zijian He, Albert Pumarola, Ali Thabet, Artsiom Sanakoyeu, Arun Mallya, Baishan Guo, Boris Araya, Breena Kerr, Carleigh Wood, Ce Liu, Cen Peng, Dimitry Vengertsev, Edgar Schonfeld, Elliot Blanchard, Felix Juefei-Xu, Fraylie Nord, Jeff Liang, John Hoffman, Jonas Kohler, Kaolin Fire, Karthik Sivakumar, Lawrence Chen, Licheng Yu, Luya Gao, Markos Georgopoulos, Rashel Moritz, Sara K. Sampson, Shikai Li, Simone Parmeggiani, Steve Fine, Tara Fowler, Vladan Petrovic, Yuming Du

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08093 2025-02-17 cs.CV cs.MM 73%

When Video Coding Meets Multimodal Large Language Models: A Unified Paradigm for Video Coding

Pingping Zhang, Jinlong Li, Kecheng Chen, Meng Wang, Long Xu, Haoliang Li, Nicu Sebe, Sam Kwong, Shiqi Wang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11621 2024-12-17 cs.CV cs.MM 73%

VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting

Muhammet Furkan Ilaslan, Ali Koksal, Kevin Qinhong Lin, Burak Satar, Mike Zheng Shou, Qianli Xu

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments Accepted for The 39th Annual AAAI Conference on Artificial Intelligence 2025 in Main Track, 19 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20500 2024-10-01 cs.CV cs.MM 73%

FreeMask: Rethinking the Importance of Attention Masks for Zero-Shot Video Editing

Lingling Cai, Kang Zhao, Hangjie Yuan, Yingya Zhang, Shiwei Zhang, Kejie Huang

专题命中 视频生成 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

Comments Video Editing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09191 2026-07-13 cs.RO cs.LG 新提交 71%

GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency

GenVid2Robot:通过刚性几何一致性从视频生成到机器人操作

Haohui Huang, Xi Yuan, Panpan Liao, Tao Teng, Chenguang Yang, Jing Guo, Yi Guo

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) University of Liverpool(利物浦大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学海洋地球科学国家重点实验室,自动化与智能感知学院)

专题命中 视频生成 :video generation(title)

AI总结 研究旨在将生成视频转换为机器人可执行操作轨迹。核心方法是GenVid2Robot框架,通过采样语义锚点、跟踪验证运动等步骤实现。主要贡献是提高了生成视频引导操作的可靠性,通过多种手段建立视觉运动先验。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23994 2026-05-19 cs.SD cs.AI 71%

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation

PhyAVBench: 一个具有挑战性的音频物理敏感性基准,用于物理基础的文本到音频视频生成

Tianxin Xie, Wentao Lei, Kai Jiang, Guanjie Huang, Pengfei Zhang, Chunhui Zhang, Fengji Ma, Haoyu He, Han Zhang, Jiangshan He, Jinting Wang, Linghan Fang, Lufei Gao, Orkesh Ablet, Peihua Zhang, Ruolin Hu, Shengyu Li, Weilin Lin, Xiaoyang Feng, Xinyue Yang, Yan Rong, Yanyun Wang, Zihang Shao, Zelin Zhao, Chenxing Li, Shan Yang, Wenfu Wang, Meng Yu, Dong Yu, Li Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯)

专题命中 视频生成 :video generation(title)

AI总结 本文提出PhyAVBench,一个用于评估文本到音频视频生成、图像到音频视频生成和视频到音频生成模型中音频-物理基础能力的基准,通过引入新的数据集和评估方法,揭示了当前模型在物理合理音频生成方面的不足。

Comments 6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09195 2026-04-13 cs.AI 71%

Camera Artist: A Multi-Agent Framework for Cinematic Language Storytelling Video Generation

Camera Artist: 一种多智能体框架用于电影语言叙事视频生成

Haobo Hu, Qi Mao, Yuanhang Li, Libiao Jin

机构 * School of Information and Communication Engineering, Communication University of China(中国传媒大学信息与通信工程学院) State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 视频生成 :video generation(title)

AI总结 Camera Artist通过引入专门的 cinematography shot agent,增强了镜头间叙事连贯性和电影语言表达,提升了视频叙事的连贯性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05757 2026-03-09 cs.RO 71%

EmboAlign: Aligning Video Generation with Compositional Constraints for Zero-Shot Manipulation

EmboAlign:通过组合约束对齐视频生成以实现零样本操控

Gehao Zhang, Zhenyang Ni, Payal Mohapatra, Han Liu, Ruohan Zhang, Qi Zhu

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(title)

AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17937 2026-02-27 cs.SD cs.AI cs.CL eess.AS 71%

Bob's Confetti: Phonetic Memorization Attacks in Music and Video Generation

Bob的彩纸:音乐和视频生成中的语音记忆攻击

Jaechul Roh, Zachary Novack, Yuefeng Peng, Niloofar Mireshghallah, Taylor Berg-Kirkpatrick, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :video generation(title)

AI总结 研究揭示了生成音乐和视频AI系统中语音记忆攻击的漏洞,通过同音替代词绕过版权过滤,展示语音结构对跨模态检索的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15512 2025-04-29 cs.CR cs.LG 71%

T2VShield: Model-Agnostic Jailbreak Defense for Text-to-Video Models

Siyuan Liang, Jiayang Liu, Jiecheng Zhai, Tianmeng Fang, Rongcheng Tu, Aishan Liu, Xiaochun Cao, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Beijing Jiaotong University(北京交通大学) National University of Singapore(国立新加坡大学) Beihang University(北航) Sun Yat-sen University(中山大学)

专题命中 视频生成 :text-to-video(title)

Comments 33 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05242 2025-03-10 cs.CL 71%

MM-StoryAgent: Immersive Narrated Storybook Video Generation with a Multi-Agent Paradigm across Text, Image and Audio

Xuenan Xu, Jiahao Mei, Chenliang Li, Yuning Wu, Ming Yan, Shaopeng Lai, Ji Zhang, Mengyue Wu

专题命中 视频生成 :video generation(title)

详情

展开后加载摘要…

URL PDF HTML 收藏