BlobGEN-Vid: Compositional Text-to-Video Generation with Blob Video Representations
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://blobgen-vid2.github.io/
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://blobgen-vid2.github.io/
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://xiefan-guo.github.io/i4vgen
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://yulu.net.cn/freelong
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments Accepted by ECCV 2024
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV
Comments Code is available at https://github.com/YBYBZhang/ControlVideo
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments https://latent-shift.github.io
Sora作为世界模型?文本到视频生成的全面调查
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Kyung Hee University(韩国庆熙大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Harbin Institute of Technology Shenzhen(哈尔滨工业大学深圳学院) ; Nota Inc.(Nota公司) ; Tongji University(同济大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 本文全面调查了文本到视频生成技术在世界建模中的应用,指出其在空间、行动和战略智能方面的进展,但仍需解决多样性与一致性之间的权衡问题。
Comments First complete survey on Text-to-Video Generation from World Model perspective, 35 pages
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
Comments A comprehensive list of text-to-video generation studies in this survey is available at https://github.com/soraw-ai/Awesome-Text-to-Video-Generation
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments Project page:https://hanxjing.github.io/CultureVidBench/
StreamDiT:实时流式文本到视频生成
机构 * UC Berkeley(加州大学伯克利分校) ; Meta
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、eess.IV
AI总结 本文提出StreamDiT模型,通过流匹配和混合训练提升内容一致性和视觉质量,实现16FPS实时视频生成,支持流式生成等实时应用。
Comments CVPR 2026
CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Pisa(帕尔马大学) ; Amazon Prime Video(亚马逊Prime视频)
专题命中 视频生成 :video generation(title,abstract);video-language(title,abstract);分类 cs.CV、cs.MM
AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM
Comments CVPR 2025
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM
Comments ECCV 2024. Project page: https://emu-video.metademolab.com
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM
Comments Project page: https://ai-forever.github.io/kandinsky-video/
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM
Comments 8pages, 8figures, project page: https://videogen.github.io/VideoGen/
FreqForcing:基于频谱自锚定的自回归长视频生成方法
专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);分类 cs.CV
AI总结 本文针对自回归长视频生成中的误差累积问题,提出无需训练的FreqForcing框架,通过频谱自锚定技术实现24倍外推,性能优于现有无训练方法且与有训练方法有竞争力。
Comments Code is available at: https://github.com/jiatongli2024/FreqForcing
DySink:动态帧 sinks 用于自回归长视频生成
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Key Lab. of Computer Network and Information Integration, Southeast University(东南大学计算机网络与信息集成重点实验室) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; Institute of Automation, CAS(中国科学院自动化研究所)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 本文提出 DySink,一种基于检索的框架,通过维护紧凑的记忆银行并选择视觉相关的历史帧作为动态帧 sinks,以提高自回归长视频生成的动态性和时间质量。
Visko Orbis 1.0:用于实时交互式长视频生成的实时模型
专题命中 视频生成 :video generation(title,abstract);long video(title);text-to-video(abstract);分类 cs.CV
AI总结 Visko Orbis 1.0是一款实时交互式长视频生成模型,支持多类型生成任务与实时提示词切换,靠有界多尺度记忆实现长视频生成无明显漂移,在对比测试中获最优偏好与稳定性评分。
GroupVideo:多身份定制文本到视频生成
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Ant Group(蚂蚁集团)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title);video diffusion(abstract);分类 cs.CV
AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。
在安全边界之间:利用时间一致性破解文本到视频生成模型
机构 * University of Science and Technology of China(科学技术大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.MM
AI总结 研究针对文本到视频模型的越狱攻击,提出结构化查询高效的BSB框架,利用时间一致性,通过在文本代理空间进行蒙特卡洛树搜索并结合视频级评估来校准结果,实验表明该方法超越现有基线,有效发现模型漏洞。
M4V:用于高效文本到视频生成的多模态曼巴
机构 * Meituan(美团) ; University of Technology Sydney(技术大学悉尼分校) ; Beijing Jiaotong University(北京交通大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 研究针对文本到视频生成计算量大的问题,引入多模态曼巴框架M4V。设计MM-DiM块,采用多模态令牌重新组合设计,增强时空一致性。实验表明,该框架能在降计算成本的同时生成高质量视频。
Comments CVPR 2026
迈向无错误的长视频生成
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 提出一种基于扩散模型的长视频生成框架,通过因果注意力、KV缓存和截断修正流技术解决误差累积和属性漂移问题,实现高质量、身份一致的单镜头长视频合成。
BIFE:更好的交互,更少的错误,用于分钟级视频生成
机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) ; Zhejiang University(浙江大学) ; Hupan Lab(虎扑实验室)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 提出BIFE框架,通过语义稀疏KV缓存和块强制训练策略,解决长视频生成中的长程交互保持和误差累积问题,实现稳定连贯的分钟级视频生成,在VDE指标上提升约20%。
SpecLoR: 面向运动连贯文本到视频生成的频谱前瞻矫正
机构 * ReLER, College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院ReLER实验室) ; Huawei Central Research Institute(华为中央研究院)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 提出SpecLoR,一种即插即用的推理方法,通过前瞻预测和频域矫正减少文本到视频生成中的时空不一致性,在Wan2.2上显著提升运动连贯性且仅增加4次NFE。
VideoWeaver: 评估与进化智能体长视频生成技能
机构 * Zhejiang University(浙江大学) ; ByteDance(字节跳动)
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 提出VideoWeaver框架,让智能体自主组合基础技能生成视频,并设计智能体裁判评估过程与结果,通过技能进化算法提升生成质量。
空间-时间解耦参考条件用于身份保持的文本到视频生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Zhejiang University(浙江大学)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 提出ST-DRC框架,通过空间-时间解耦参考条件、TASS-RoPE机制和身份目标,实现高保真身份保持视频生成。
OmniMem: 用于长视频生成的可扩展自适应记忆检索
机构 * Northeastern University(东北大学) ; Adobe Research
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 提出OmniMem框架,通过自适应窗口排除和查询共享KV选择等机制,在自回归视频生成中实现显式全范围稀疏KV检索,显著提升长视频动态程度并保持一致性。
Comments 22 pages, 14 figures; project page: https://wuyushuwys.github.io/OmniMem/
LongLive-2.0: 一个基于NVFP4的长视频生成并行基础设施
机构 * NVIDIA
专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 本文提出LongLive-2.0,一个基于NVFP4的并行基础设施,用于长视频生成的整个训练和推理流程,解决了速度和内存瓶颈问题。通过引入序列并行自回归训练方法,结合NVFP4精度,显著降低了GPU内存消耗并加速了训练过程。同时,该系统能够将扩散模型转换为长视频生成的自回归扩散模型,并在不同GPU架构上实现了高效的推理和训练。
Comments Code, model, and demos are available at https://github.com/NVlabs/LongLive
RAPO++: 通过数据对齐和测试时缩放实现文本到视频生成的跨阶段提示优化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV
AI总结 RAPO++通过数据对齐和测试时缩放,结合训练数据对齐、测试时迭代缩放和大语言模型微调,提升文本到视频生成效果,无需修改生成基础模型。
Comments arXiv admin note: text overlap with arXiv:2504.11739