UniVid: Pyramid Diffusion Model for High Quality Video Generation
UniVid:金字塔扩散模型用于高质量视频生成
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
UniVid:金字塔扩散模型用于高质量视频生成
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 UniVid通过融合文本提示和参考图像,结合时间金字塔交叉帧空间时间注意力模块,提升文本到视频、图像到视频及联合生成任务的时序一致性。
统一的文本-图像到视频生成:一种无训练的灵活视觉条件方法
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出无训练的FlexTI2V方法,通过局部图像块交换策略实现灵活的视觉条件,平衡创造力与保真度,验证其在文本-视频生成中的有效性。
Comments 27 pages, 10 figures, 7 tables
PhysAlign:通过特征和3D表示对齐实现物理一致的图像到视频生成
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 PhysAlign通过特征和3D表示对齐,解决图像到视频生成中的物理一致性问题,提升复杂物理推理和时间稳定性,同时保持零样本视觉质量。
SpA2V: 利用空间听觉线索进行音频驱动的空间感知视频生成
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 SpA2V通过利用空间听觉线索生成与输入音频在语义和空间上一致的视频,改进了现有方法对语义信息的依赖,提出两阶段框架实现视频场景布局生成与生成。
Comments The 33rd ACM Multimedia Conference (MM '25)
Lumos-1:从统一模型视角看基于离散扩散的自回归视频生成
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 Lumos-1提出一种基于LLM的统一模型,通过改进的MM-RoPE和离散扩散机制,在高效生成视频方面超越现有模型,适用于多种视频评估基准。
Comments ICLR 2026 Camera Ready Version. Code and Models: https://github.com/alibaba-damo-academy/Lumos
FAR-Drive:闭环自动驾驶中的帧自回归视频生成
机构 * Zhejiang University(浙江大学) ; Huawei(华为)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出FAR-Drive,一种用于自动驾驶的帧级自回归视频生成框架,通过多视角扩散变换器实现几何一致的多摄像机生成,解决闭环模拟中的长时程一致性、自回归退化和低延迟问题。
视频生成策略的草稿与目标采样
机构 * South China Normal University(华南师范大学) ; University of Western Australia(西澳大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出一种无训练的扩散推理范式,通过自play去噪方法提升视频生成效率,实验表明在三个基准上实现2.1倍加速,同时保持高成功率。
MapReduce LoRA:在生成模型多偏好优化中推进帕累托前沿
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
AI总结 本文提出MapReduce LoRA和RaTE方法,通过并行训练偏好特定的LoRA专家和学习奖励特定的token嵌入,提升生成模型在多偏好优化中的性能,实验显示在文本到图像、文本到视频及语言任务中均取得显著改进。
Comments CVPR 2026; Code: https://github.com/SHI-Labs/MapReduce-LoRA
将世界模拟模型扎根于现实世界中的城市
机构 * KAIST AI(韩国科学技术院人工智能研究中心) ; NAVER AI Lab(NAVER人工智能实验室) ; SNU AIIS(成均馆大学人工智能研究所)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出Seoul World Model,通过检索增强的条件生成真实城市场景,解决时间错位和轨迹多样性问题,生成高保真、时序一致的长时景视频。
Comments project page: https://seoul-world-model.github.io/
面向统一模型的基于推理的视频编辑:带有自我反思学习
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。
第一人称世界模型用于逼真手-物体交互合成
机构 * Texas A&M University(德克萨斯A&M大学) ; University of Minnesota(明尼苏达大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of California, Los Angeles(加州大学洛杉矶分校) ; University of Texas at Austin(得克萨斯大学奥斯汀分校) ; Amazon(亚马逊) ; State University of New York at Stony Brook(纽约州立大学石溪分校)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出EgoHOI模型,通过动作信号模拟物理一致的交互,克服了高速头部运动、严重遮挡和高自由度手部运动带来的挑战,实验验证其有效性。
EMMA: 通过生成性视觉迁移实现现实世界机器人操作的泛化
专题命中 视频生成 :video generation(abstract)
AI总结 EMMA通过生成性视觉迁移框架提升机器人操作的泛化能力,结合生成数据引擎与高效训练流程,实现多视角一致性和几何精度的提升,实验证明其在零样本场景下的显著性能提升。