arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2605.27336 2026-05-27 cs.CV 85%

PARE: Pruning and Adaptive Routing for Efficient Video Generation

PARE:面向高效视频生成的剪枝与自适应路由

Yutong Wang, Yunke Wang, Tianfan Xue, Yu Qiao, Yaohui Wang, Xinyuan Chen, Chang Xu

机构 * The University of Sydney(悉尼大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出PARE方法,通过结构感知剪枝压缩宽度和输入自适应路由压缩深度,联合减少视频扩散Transformer的计算量,在Wan2.1-14B上实现每步计算大幅降低且质量保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24962 2026-05-26 cs.CV 85%

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Manjin Kim, Suha Kwak, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)

专题命中 视频生成 :video generation(title,title_cn);分类 cs.CV

AI总结 提出Tempered Self-Similarity Alignment (TSA)损失函数,通过将视觉基础模型中的时空自相似性关系知识迁移到视频生成模型中,以改善视频的物理合理性。

Comments Accepted to the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10103 2026-04-29 cs.CV 85%

Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation

通过混合注意力与解耦蒸馏实现长时域流式视频生成

Ruibin Li, Tao Yang, Fangzhou Ai, Tianhe Wu, Shilei Wen, Bingyue Peng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动) City University of Hong Kong(香港城市大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出混合强制方法,通过混合注意力设计联合优化时序信息保留与计算效率,采用轻量线性时序注意力和块稀疏注意力,实现高效稳定流式视频生成,实测在单块H100 GPU上达到29.5 FPS的实时832x480视频生成

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21221 2026-04-24 cs.CV cs.LG 85%

Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation

稀疏强制:用于实时自回归扩散视频生成的原生可训练稀疏注意力

Boxun Xu, Yuming Du, Zichang Liu, Siyu Yang, Ziyang Jiang, Siqi Yan, Rajasi Saha, Albert Pumarola, Wenchen Wang, Peng Li

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出稀疏强制方法,通过在训练和推理中提升长时程生成质量并降低解码延迟,采用可训练的原生稀疏机制和高效的GPU内核PBSA来加速稀疏注意力和内存更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02226 2026-04-02 cs.CV cs.AI cs.LG 85%

TempoControl: Temporal Attention Guidance for Text-to-Video Models

TempoControl: 文本到视频模型中的时间注意力引导

Shira Schiber, Ofir Lindenbaum, Idan Schwartz

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出TempoControl,通过新颖的优化方法实现文本到视频模型的时间对齐,无需重新训练,支持时间重排、动作时机控制和音频对齐等应用。

Comments Accepted CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 85%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23956 2026-03-24 cs.CV 85%

SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

SwitchCraft: 无需训练的多事件视频生成与注意力控制

Qianxun Xu, Chenxi Song, Yujun Cai, Chi Zhang

机构 * Westlake University(西湖大学) Duke Kunshan University(杜克-昆山大学) The University of Queensland(昆士兰大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 SwitchCraft通过引入事件对齐查询引导和自动平衡强度求解器,提升多事件视频生成的提示对齐、事件清晰度和场景一致性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14027 2026-03-16 cs.CV 85%

Train Short, Inference Long: Training-free Horizon Extension for Autoregressive Video Generation

训练短,推理长:无训练 horizon 延伸用于自回归视频生成

Jia Li, Xiaomeng Fu, Xurui Peng, Weifeng Chen, Youwei Zheng, Tianyu Zhao, Jiexi Wang, Fangmin Chen, Xing Wang, Hayden Kwok-Hay So

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出FLEX框架,通过频率感知RoPE调制和抗相位噪声采样,解决自回归视频扩散模型在延伸horizon时的 extrapolation失败问题,实现6倍延伸性能提升。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08820 2026-03-16 cs.CV 85%

Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing

Omni-Video 2:基于MLLM条件扩散模型的统一视频生成与编辑扩展

Hao Yang, Zhiyu Tan, Jia Gong, Luozheng Qin, Hesen Chen, Xiaomeng Yang, Yuqing Sun, Yuetan Lin, Mengping Yang, Hao Li

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出Omni-Video 2,通过连接预训练多模态大语言模型与视频扩散模型,实现视频生成与编辑的统一。核心方法是利用MLLM生成明确的目标描述以指导生成过程,并通过轻量适配器高效注入多模态条件token,提升复杂编辑任务性能。

Comments Technical Report, Project: https://howellyoung-s.github.io/Omni-Video2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01266 2026-03-06 cs.CV cs.LG 85%

MotionStream: Real-Time Video Generation with Interactive Motion Controls

MotionStream: 通过交互式运动控制实现实时视频生成

Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, Xun Huang

机构 * Seoul National University(首尔国立大学) Adobe Research(Adobe研究) Carnegie Mellon University(卡内基梅隆大学) Morpheus AI

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

AI总结 MotionStream通过交互式运动控制实现实时视频生成,利用因果注意力机制和蒸馏技术,实现亚秒延迟和高效率的无限长视频流式生成。

Comments ICLR 2026, Project webpage: https://joonghyuk.com/motionstream-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10825 2026-02-12 cs.CV cs.AI 85%

Flow caching for autoregressive video generation

流缓存用于自回归视频生成

Yuexiao Ma, Xuzhe Zheng, Jing Xu, Xiwei Xu, Feng Ling, Xiawu Zheng, Huafeng Kuang, Huixia Li, Xing Wang, Xuefeng Xiao, Fei Chao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 FlowCache通过分块缓存策略和优化的KV缓存压缩机制,显著提升了自回归视频生成的速度,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16869 2026-01-21 cs.GR cs.CV 85%

Controllable Video Generation: A Survey

可控视频生成:综述

Yue Ma, Kunyu Feng, Zhongyuan Hu, Xinyu Wang, Yucheng Wang, Mingzhe Zheng, Bingyuan Wang, Qinghe Wang, Xuanhua He, Hongfa Wang, Chenyang Zhu, Hongyu Liu, Yingqing He, Zeyu Wang, Zhifeng Li, Xiu Li, Sirui Han, Yike Guo, Wei Liu, Dan Xu, Linfeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology(Guang Zhou)(香港科技大学(广州)) Tsinghua University(清华大学) Dalian University of Technology(大连理工大学) Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文综述了可控视频生成领域,探讨了视频扩散模型中的控制机制及不同控制信号类型的方法分类。

Comments project page: https://github.com/mayuelala/Awesome-Controllable-Video-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05802 2025-12-11 cs.CV 85%

Bring Your Dreams to Life: Continual Text-to-Video Customization

让梦想成真:持续文本到视频定制

Jiahua Dong, Xudong Wang, Wenqi Liang, Zongyan Han, Meng Cao, Duzhen Zhang, Hanbin Zhao, Zhi Han, Salman Khan, Fahad Shahbaz Khan

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出CCVD模型,通过解决持续学习中的遗忘和概念忽视问题,实现文本到视频的持续定制生成。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23146 2025-12-01 cs.CV 85%

InstanceV: Instance-Level Video Generation

InstanceV: 实例级视频生成

Yuheng Chen, Teng Hu, Jiangning Zhang, Zhucun Xue, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18991 2025-11-25 cs.CV 85%

View-Consistent Diffusion Representations for 3D-Consistent Video Generation

用于3D一致视频生成的视图一致扩散表示

Duolikun Danier, Ge Gao, Steven McDonagh, Changjian Li, Hakan Bilen, Oisin Mac Aodha

机构 * University of Edinburgh(爱丁堡大学) University of Bristol(布里斯托大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 ViCoDR通过学习多视图一致的扩散表示,提升视频生成的3D一致性,适用于图像到视频、文本到视频和多视图生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03049 2025-10-06 cs.CV cs.AI 85%

When and Where do Events Switch in Multi-Event Video Generation?

Ruotong Liao, Guowen Huang, Qing Cheng, Thomas Seidl, Daniel Cremers, Volker Tresp

机构 * Ludwig-Maxilians-University of Munich(慕尼黑路德维希-马克西米利安大学) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments Work in Progress. Accepted to ICCV2025 @ LongVid-Foundations

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08248 2025-08-12 cs.CV 85%

StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Shuyuan Tu, Yueming Pan, Yinming Huang, Xintong Han, Zhen Xing, Qi Dai, Chong Luo, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) Hunyuan, Tencent Inc.(腾讯 Hunyuan 实验室)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15838 2025-06-23 cs.CV 85%

EchoShot: Multi-Shot Portrait Video Generation

Jiahao Wang, Hualian Sheng, Sijia Cai, Weizhan Zhang, Caixia Yan, Yachuang Feng, Bing Deng, Jieping Ye

机构 * Xi’an Jiaotong University(西安交通大学) Alibaba Cloud(阿里巴巴云)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04228 2025-06-05 cs.CV 85%

LayerFlow: A Unified Model for Layer-aware Video Generation

Sihui Ji, Hao Luo, Xi Chen, Yuanpeng Tu, Yiyang Wang, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) DAMO Academy, Alibaba Group(阿里云达摩院) Alibaba Group(阿里巴巴集团) Hupan Laboratory(虎跑实验室)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://sihuiji.github.io/LayerFlow-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22980 2025-05-30 cs.CV 85%

MOVi: Training-free Text-conditioned Multi-Object Video Generation

Aimon Rahman, Jiang Liu, Ze Wang, Ximeng Sun, Jialian Wu, Xiaodong Yu, Yusheng Su, Vishal M. Patel, Zicheng Liu, Emad Barsoum

机构 * Johns Hopkins University(约翰霍普金斯大学) Advanced Micro Devices(先进微器件公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07652 2025-05-13 cs.CV 85%

ShotAdapter: Text-to-Multi-Shot Video Generation with Diffusion Models

Ozgur Kara, Krishna Kumar Singh, Feng Liu, Duygu Ceylan, James M. Rehg, Tobias Hinz

机构 * UIUC(伊利诺伊大学香槟分校) Adobe(Adobe公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04606 2025-04-30 cs.CV cs.AI cs.CL cs.LG 85%

The Best of Both Worlds: Integrating Language Models and Diffusion Models for Video Generation

Aoxiong Yin, Kai Shen, Yichong Leng, Xu Tan, Xinyu Zhou, Juncheng Li, Siliang Tang

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments Our code is available at https://github.com/LanDiff/LanDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08181 2025-04-14 cs.CV cs.AI 85%

TokenMotion: Decoupled Motion Control via Token Disentanglement for Human-centric Video Generation

Ruineng Li, Daitao Xing, Huiming Sun, Yuanzhou Ha, Jinglin Shen, Chiuman Ho

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06672 2025-04-10 cs.CV 85%

RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism

Elia Peruzzo, Dejia Xu, Xingqian Xu, Humphrey Shi, Nicu Sebe

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Code available at: https://github.com/helia95/ragme

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13995 2025-02-26 cs.GR cs.CV 85%

FantasyID: Face Knowledge Enhanced ID-Preserving Video Generation

Yunpeng Zhang, Qiang Wang, Fan Jiang, Yaqi Fan, Mu Xu, Yonggang Qi

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08948 2025-02-06 cs.CV cs.CL 85%

Mojito: Motion Trajectory and Intensity Control for Video Generation

Xuehai He, Shuohang Wang, Jianwei Yang, Xiaoxia Wu, Yiping Wang, Kuan Wang, Zheng Zhan, Olatunji Ruwase, Yelong Shen, Xin Eric Wang

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08994 2025-01-16 cs.CV 85%

RepVideo: Rethinking Cross-Layer Representation for Video Generation

Chenyang Si, Weichen Fan, Zhengyao Lv, Ziqi Huang, Yu Qiao, Ziwei Liu

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://vchitect.github.io/RepVid-Webpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07760 2024-12-11 cs.CV 85%

SynCamMaster: Synchronizing Multi-Camera Video Generation from Diverse Viewpoints

Jianhong Bai, Menghan Xia, Xintao Wang, Ziyang Yuan, Xiao Fu, Zuozhu Liu, Haoji Hu, Pengfei Wan, Di Zhang

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://jianhongbai.github.io/SynCamMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01429 2024-12-03 cs.CV 85%

CPA: Camera-pose-awareness Diffusion Transformer for Video Generation

Yuelei Wang, Jian Zhang, Pengtao Jiang, Hao Zhang, Jinwei Chen, Bo Li

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05227 2024-10-11 cs.CV 85%

The Dawn of Video Generation: Preliminary Explorations with SORA-like Models

Ailing Zeng, Yuhang Yang, Weidong Chen, Wei Liu

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments project: https://ailab-cvc.github.io/VideoGen-Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏