arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2126 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2126 篇

2403.14773 2025-04-17 cs.CV cs.AI cs.CL cs.LG cs.MM eess.IV 91%

StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text

Roberto Henschel, Levon Khachatryan, Hayk Poghosyan, Daniil Hayrapetyan, Vahram Tadevosyan, Zhangyang Wang, Shant Navasardyan, Humphrey Shi

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)

Comments https://github.com/Picsart-AI-Research/StreamingT2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16371 2026-03-26 cs.CV 91%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(title);分类 cs.CV

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02497 2025-06-04 cs.CV 90%

LumosFlow: Motion-Guided Long Video Generation

Jiahao Chen, Hangjie Yuan, Yichen Qian, Jingyun Liang, Jiazheng Xing, Pengwei Liu, Weihua Chen, Fan Wang, Bing Su

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Hupan Lab(虎斑实验室) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09926 2025-03-14 cs.CV 90%

VideoMerge: Towards Training-free Long Video Generation

Siyang Zhang, Harry Yang, Ser-Nam Lim

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08605 2025-03-12 cs.CV cs.AI cs.LG 90%

Tuning-Free Multi-Event Long Video Generation via Synchronized Coupled Sampling

Subin Kim, Seoung Wug Oh, Jui-Hsien Wang, Joon-Young Lee, Jinwoo Shin

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);text-to-video(abstract)

Comments Project page with visuals: https://syncos2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18507 2025-03-25 cs.CV 90%

Can Text-to-Video Generation help Video-Language Alignment?

Luca Zanella, Massimiliano Mancini, Willi Menapace, Sergey Tulyakov, Yiming Wang, Elisa Ricci

专题命中 视频生成 :video-language(title,abstract);video generation(title);text-to-video(title);分类 cs.CV

Comments CVPR 2025. Project website at https://lucazanella.github.io/synvita/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01362 2025-09-03 cs.CV cs.MM 90%

Identity-Preserving Text-to-Video Generation via Training-Free Prompt, Image, and Guidance Enhancement

Jiayi Gao, Changcheng Hua, Qingchao Chen, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09856 2025-05-27 cs.CV cs.AI cs.LG eess.IV 90%

LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity

Hongjie Wang, Chih-Yao Ma, Yen-Cheng Liu, Ji Hou, Tao Xu, Jialiang Wang, Felix Juefei-Xu, Yaqiao Luo, Peizhao Zhang, Tingbo Hou, Peter Vajda, Niraj K. Jha, Xiaoliang Dai

机构 * Princeton University(普林斯顿大学) Meta

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV、eess.IV

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07750 2025-05-23 cs.CV 90%

Motion by Queries: Identity-Motion Trade-offs in Text-to-Video Generation

Yuval Atzmon, Rinon Gal, Yoad Tewel, Yoni Kasten, Gal Chechik

机构 * NVIDIA

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments (1) Project page: https://research.nvidia.com/labs/par/MotionByQueries/ (2) The methods and results in section 5, "Consistent multi-shot video generation", are based on the arXiv version 1 (v1) of this work. Starting version 2 (v2), we extend and further analyze those findings to efficient motion transfer (3) in v3 we added: results with WAN 2.1, baselines and more quality metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13037 2026-08-14 cs.CV 新提交 89%

Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization

基于推理时无梯度优化的空间接地文本到视频生成

Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord

机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) Obvious Research

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。

Comments Final Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05976 2026-08-07 cs.CV 新提交 89%

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model

Diff-VF:基于扩散模型的免训练高质量长视频生成

Haoning Yang, Xinyuan Chen, Yaohui Wang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。

Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26529 2026-07-30 cs.CV 新提交 89%

CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling

CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成

Yuyang Huang, Yabo Chen, Wenrui Dai, Ziyang Zheng, Haibin Huang, Chi Zhang, Junni Zou, Hongkai Xiong, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);text-to-video(abstract)

AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18789 2026-07-22 cs.CV 新提交 89%

Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

移动字母表:文本到视频生成训练数据的对照研究

Amber Yijia Zheng, Lu Liu, Raymond A. Yeh, Xi Yin

机构 * Meta Superintelligence Labs(Meta超智能实验室) Purdue University(普渡大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 研究文本到视频生成中数据分布和字幕质量对模型的影响,通过移动字母表测试平台进行对照实验,发现视频内容分布、字幕质量很关键,无分类器引导等可部分恢复模型,为相关模型开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02553 2026-06-02 cs.CV 89%

LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation

LongLive-RAG: 一种用于长视频生成的通用检索增强框架

Qixin Hu, Shuai Yang, Wei Huang, Song Han, Yukang Chen

机构 * NVIDIA USC(美国大学) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出LongLive-RAG框架,通过将自回归视频生成中的历史潜变量作为可检索记忆,利用查询嵌入检索相关历史潜变量并引入窗口时间增量损失,以减轻滑动窗口注意力导致的误差累积,提升长视频生成质量。

Comments 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26412 2026-05-29 cs.CV cs.AI 89%

LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation

LoCoT2V-Bench: 长文本与复杂文本到视频生成的基准测试

Xiangqing Zheng, Chengyue Wu, Kehai Chen, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对长视频生成在复杂文本输入下的评估挑战,提出包含多场景提示与层次元数据的基准LoCoT2V-Bench,并设计多维度评估框架LoCoT2V-Eval,实验发现模型在细粒度文本-视频对齐和角色一致性方面存在显著不足。

Comments Accepted by ICML 2026 (Regular)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20910 2026-05-21 cs.CV 89%

FlowLong: Inference-time Long Video Generation via Manifold-constrained Tweedie Matching

FlowLong: 通过流形约束的 Tweedie 匹配实现推理时的长视频生成

Jangho Park, Geon Yeong Park, Gihyun Kwon, Jong Chul Ye

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种新的推理时长视频生成方法,通过流形约束的Tweedie匹配在重叠滑动窗口中生成长视频,同时保持时间和空间一致性,并且无需额外训练。

Comments Project Page: https://flowlong-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16649 2026-05-19 cs.CV 89%

AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling

AtlasVid: 通过解耦的全局-局部建模实现高效超高清长视频生成

Ziyang Mai, Yuyao Zhang, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出AtlasVid框架,通过解耦建模提升超高清长视频生成效率,实现60.9倍加速和更低训练成本,优于原生4K生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16003 2026-05-18 cs.CV 89%

Echo-Forcing: A Scene Memory Framework for Interactive Long Video Generation

回声驱动:一种用于交互式长视频生成的场景记忆框架

Mingqiang Wu, Weilun Feng, Zhefeng Zhang, Haotong Qin, Yuqi Li, Guoxin Fan, Xiaokun Liu, Zhulin An, Libo Huang, Yongjun Xu, Chuanguang Yang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) China University of Mining & Technology, Beijing(中国矿业大学(北京)) ETH Zürich(苏黎世联邦理工学院) City College of New York, City University of New York(纽约城市学院,纽约城市大学) Xiamen Institute of Data Intelligence, Xiamen, China(厦门数据智能研究院,厦门,中国)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Echo-Forcing框架,通过分层时间记忆、场景回溯帧和差分记忆衰减机制,解决长视频生成中历史KV状态的函数纠缠问题,实现交互式视频生成的流畅过渡与长距离场景回溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06509 2026-05-08 cs.CV 89%

FreeSpec: Training-Free Long Video Generation via Singular-Spectrum Reconstruction

FreeSpec: 通过奇异谱重建实现无训练长视频生成

Fangda Chen, Shanshan Zhao, Longrong Yang, Chuanfu Xu, Zhigang Luo, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Alibaba International Digital Commerce(阿里巴巴国际数字商务) Zhejiang University(浙江大学) Xiangjiang Laboratory(湘江实验室)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 FreeSpec通过奇异谱重建方法解决长视频生成中的内容漂移和时间不一致问题,利用低秩谱引导和高秩重建基,提升空间细节和时间动态的保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04317 2025-11-07 cs.CV 89%

RISE-T2V: Rephrasing and Injecting Semantics with LLM for Expansive Text-to-Video Generation

Xiangjun Zhang, Litong Gong, Yinglin Zheng, Yansong Liu, Wentao Jiang, Mingyi Xu, Biao Wang, Tiezheng Ge, Ming Zeng

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments 17 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03997 2025-11-07 cs.CV 89%

PhysCorr: Dual-Reward DPO for Physics-Constrained Text-to-Video Generation with Automated Preference Selection

Peiyao Wang, Weining Wang, Qi Li

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09962 2025-10-29 cs.CV 89%

CustomVideo: Customizing Text-to-Video Generation with Multiple Subjects

Zhao Wang, Aoxue Li, Lingting Zhu, Yong Guo, Qi Dou, Zhenguo Li

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) Huawei Noah Ark’s Lab(华为诺亚实验室) Department of Statistics and Actuarial Science, The University of Hong Kong(统计与精算系,香港大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments IEEE TMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15818 2025-06-02 cs.CV 89%

Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation

David Junhao Zhang, Jay Zhangjie Wu, Jia-Wei Liu, Rui Zhao, Lingmin Ran, Yuchao Gu, Difei Gao, Mike Zheng Shou

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments project page is https://showlab.github.io/Show-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01172 2025-05-05 cs.CV 89%

FreePCA: Integrating Consistency Information across Long-short Frames in Training-free Long Video Generation via Principal Component Analysis

Jiangtong Tan, Hu Yu, Jie Huang, Jie Xiao, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20502 2025-04-16 cs.CV 89%

ARLON: Boosting Diffusion Transformers with Autoregressive Models for Long Video Generation

Zongyi Li, Shujie Hu, Shujie Liu, Long Zhou, Jeongsoo Choi, Lingwei Meng, Xun Guo, Jinyu Li, Hefei Ling, Furu Wei

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted at ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23796 2025-04-02 cs.CV 89%

On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices

Bosung Kim, Kyuhwan Lee, Isu Jeong, Jungmin Cheon, Yeojin Lee, Seulki Lee

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Replicated Submission. arXiv:2502.04363 submitted as second version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04363 2025-04-01 cs.CV 89%

On-device Sora: Enabling Training-Free Diffusion-based Text-to-Video Generation for Mobile Devices

Bosung Kim, Kyuhwan Lee, Isu Jeong, Jungmin Cheon, Yeojin Lee, Seulki Lee

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18150 2025-03-25 cs.CV 89%

LongDiff: Training-Free Long Video Generation in One Go

Zhuoling Li, Hossein Rahmani, Qiuhong Ke, Jun Liu

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02371 2025-02-14 cs.CV 89%

OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation

Kepan Nan, Rui Xie, Penghao Zhou, Tiehan Fan, Zhenheng Yang, Zhijie Chen, Xiang Li, Jian Yang, Ying Tai

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments 20 pages, 15 figures, Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08639 2025-02-13 cs.CV 89%

CineMaster: A 3D-Aware and Controllable Framework for Cinematic Text-to-Video Generation

Qinghe Wang, Yawen Luo, Xiaoyu Shi, Xu Jia, Huchuan Lu, Tianfan Xue, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏