Can Text-to-Video Generation help Video-Language Alignment?
专题命中 视频生成 :video-language(title,abstract);video generation(title);text-to-video(title);分类 cs.CV
Comments CVPR 2025. Project website at https://lucazanella.github.io/synvita/
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video-language(title,abstract);video generation(title);text-to-video(title);分类 cs.CV
Comments CVPR 2025. Project website at https://lucazanella.github.io/synvita/
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM
Comments 7 pages, 3 figures
机构 * Princeton University(普林斯顿大学) ; Meta
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV、eess.IV
Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025
机构 * NVIDIA
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments (1) Project page: https://research.nvidia.com/labs/par/MotionByQueries/ (2) The methods and results in section 5, "Consistent multi-shot video generation", are based on the arXiv version 1 (v1) of this work. Starting version 2 (v2), we extend and further analyze those findings to efficient motion transfer (3) in v3 we added: results with WAN 2.1, baselines and more quality metrics
基于推理时无梯度优化的空间接地文本到视频生成
机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) ; Obvious Research
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。
Comments Camera Ready Version
Diff-VF:基于扩散模型的免训练高质量长视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。
Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)
CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; China Telecom(中国电信) ; Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))
专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);text-to-video(abstract)
AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。
移动字母表:文本到视频生成训练数据的对照研究
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Purdue University(普渡大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 研究文本到视频生成中数据分布和字幕质量对模型的影响,通过移动字母表测试平台进行对照实验,发现视频内容分布、字幕质量很关键,无分类器引导等可部分恢复模型,为相关模型开发提供参考。
LongLive-RAG: 一种用于长视频生成的通用检索增强框架
机构 * NVIDIA ; USC(美国大学) ; MIT(麻省理工学院)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出LongLive-RAG框架,通过将自回归视频生成中的历史潜变量作为可检索记忆,利用查询嵌入检索相关历史潜变量并引入窗口时间增量损失,以减轻滑动窗口注意力导致的误差累积,提升长视频生成质量。
Comments 20 pages, 7 figures, 4 tables
LoCoT2V-Bench: 长文本与复杂文本到视频生成的基准测试
机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) ; The University of Hong Kong(香港大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV
AI总结 针对长视频生成在复杂文本输入下的评估挑战,提出包含多场景提示与层次元数据的基准LoCoT2V-Bench,并设计多维度评估框架LoCoT2V-Eval,实验发现模型在细粒度文本-视频对齐和角色一致性方面存在显著不足。
Comments Accepted by ICML 2026 (Regular)
FlowLong: 通过流形约束的 Tweedie 匹配实现推理时的长视频生成
机构 * KAIST(韩国科学技术院) ; Amazon(亚马逊)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出了一种新的推理时长视频生成方法,通过流形约束的Tweedie匹配在重叠滑动窗口中生成长视频,同时保持时间和空间一致性,并且无需额外训练。
Comments Project Page: https://flowlong-video.github.io/
AtlasVid: 通过解耦的全局-局部建模实现高效超高清长视频生成
机构 * Dartmouth College(达特茅斯学院)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出AtlasVid框架,通过解耦建模提升超高清长视频生成效率,实现60.9倍加速和更低训练成本,优于原生4K生成器。
回声驱动:一种用于交互式长视频生成的场景记忆框架
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室,计算技术研究所,北京,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; China University of Mining & Technology, Beijing(中国矿业大学(北京)) ; ETH Zürich(苏黎世联邦理工学院) ; City College of New York, City University of New York(纽约城市学院,纽约城市大学) ; Xiamen Institute of Data Intelligence, Xiamen, China(厦门数据智能研究院,厦门,中国)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出Echo-Forcing框架,通过分层时间记忆、场景回溯帧和差分记忆衰减机制,解决长视频生成中历史KV状态的函数纠缠问题,实现交互式视频生成的流畅过渡与长距离场景回溯。
FreeSpec: 通过奇异谱重建实现无训练长视频生成
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; Alibaba International Digital Commerce(阿里巴巴国际数字商务) ; Zhejiang University(浙江大学) ; Xiangjiang Laboratory(湘江实验室)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 FreeSpec通过奇异谱重建方法解决长视频生成中的内容漂移和时间不一致问题,利用低秩谱引导和高秩重建基,提升空间细节和时间动态的保留能力。
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments 17 pages, 16 figures
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学) ; Huawei Noah Ark’s Lab(华为诺亚实验室) ; Department of Statistics and Actuarial Science, The University of Hong Kong(统计与精算系,香港大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments IEEE TMM 2025
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments project page is https://showlab.github.io/Show-1
机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);text-to-video(abstract);分类 cs.CV
Comments Accepted at ICLR2025
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Replicated Submission. arXiv:2502.04363 submitted as second version of the paper
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments 20 pages, 15 figures, Published as a conference paper at ICLR 2025
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://blobgen-vid2.github.io/
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://xiefan-guo.github.io/i4vgen
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://yulu.net.cn/freelong
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Accepted by ECCV 2024
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV
Comments Code is available at https://github.com/YBYBZhang/ControlVideo