KlingAvatar 2.0 Technical Report
KlingAvatar 2.0 技术报告
机构 * Kuaishou Technology(快手科技)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 KlingAvatar 2.0 通过时空级联框架和多模态指令融合技术,实现了高效且高质量的长视频生成,提升了视觉清晰度和多模态对齐能力。
Comments 14 pages, 7 figures
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
KlingAvatar 2.0 技术报告
机构 * Kuaishou Technology(快手科技)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 KlingAvatar 2.0 通过时空级联框架和多模态指令融合技术,实现了高效且高质量的长视频生成,提升了视觉清晰度和多模态对齐能力。
Comments 14 pages, 7 figures
Light-X:具有摄像机和照明控制的生成式4D视频渲染
机构 * S-Lab, NTU(NTU的S-Lab) ; BAAI ; HUST(华中科技大学) ; AIR,THU(清华大学人工智能研究院) ; FNii, CUHKSZ(CUHKSZ的FNii) ; SJTU(上海交通大学) ; EIT (Ningbo)(宁波工程学院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 Light-X通过联合控制摄像机轨迹和光照,实现高质量4D视频生成,优于现有方法。
Comments Project Page: https://lightx-ai.github.io/ , Code: https://github.com/TQTQliu/Light-X
V-RGBX:具有精确内在属性控制的视频编辑
机构 * Fudan University(复旦大学) ; Adobe Research(Adobe研究院) ; Stanford University(斯坦福大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 V-RGBX通过端到端框架实现基于内在属性的视频编辑,支持直观且物理合理的视频修改,适用于物体外观和场景重照明等应用。
Comments Project Page: https://aleafy.github.io/vrgbx
具有解耦时间和空间上下文的自回归视频自编码器
机构 * Zoom Communications(Zoom公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 ARVAE通过解耦时间和空间上下文,实现高效视频压缩与重建,具备轻量模型和小数据优势,适用于视频生成等下游任务。
MoCA-Video:面向一致视频编辑的运动感知概念对齐
机构 * Department of Computer Science(计算机科学系) ; King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术学院)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV
AI总结 MoCA-Video通过在冻结的视频扩散模型潜在空间中进行语义混合,实现无需训练的高质量视频编辑,通过动量修正和伽马残差模块提升时间稳定性和语义一致性。
UniUGP:统一理解、生成与规划以实现端到端自动驾驶
机构 * ByteDance Seed(字节跳动种子)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 UniUGP通过整合预训练视觉模型和视频生成模型,实现端到端自动驾驶中的场景推理、视频生成和轨迹规划,提升复杂场景下的性能和泛化能力。
Comments Project Page: https://seed-uniugp.github.io/
PlayerOne:第一人称真实世界模拟器
机构 * HKU(香港大学) ; DAMO Academy, Alibaba Group(阿里云达摩院) ; Hupan Lab(华盘实验室) ; HUST(华中科技大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 PlayerOne通过第一人称真实世界模拟器实现了沉浸式探索,通过粗到细的训练流程和部分解耦运动注入方案,实现了对人类运动的精确控制和多样化场景的一致建模。
Comments Project page: https://playerone-hku.github.io/
从单张图像自演化生成3D场景
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 EvoScene通过自演化框架从单张图像生成高质量3D场景,结合几何推理和视觉知识,实现结构和外观的逐步优化。
VideoVLA: 视频生成器可以成为通用的机器人操作器
机构 * IAIR, Xi’an Jiaotong University(人工智能研究院、西安交通大学) ; Microsoft Research Asia(微软亚洲研究院) ; Fudan University(复旦大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 VideoVLA通过将视频生成模型转化为机器人VLA操作器,实现了动作与视觉后果的双预测,提升机器人操作的泛化能力。
Comments Project page: https://videovla-nips2025.github.io
Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems(NeurIPS2025)
RunawayEvil: 对图像到视频生成模型的劫持
机构 * PRLab, Nanjing University(南京大学PRLab) ; Meituan(美团) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。
DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型
机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) ; Zhejiang University(浙江大学)
专题命中 视频生成 :video generation(abstract);分类 cs.MM
AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。
Comments 10 pages; Bytedance
视频模型开始解决国际象棋、迷宫、数独、心理旋转和雷文矩阵任务
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 视频模型通过强化学习提升推理能力,在多项任务上达到60%的成功率。
Comments See $\href{https://grow-ai-like-a-child.com/video-reason/}{results}$ and $\href{https://github.com/hokindeng/VMEvalKit}{code}$
火星世界模型:可控视频合成与物理准确的3D重建
机构 * BJTU(北京工业大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; HKUST(香港科技大学) ; Stanford University(斯坦福大学) ; XMU(厦门大学) ; SBU(雪城大学) ; USC(南加州大学) ; NVIDIA(英伟达)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出M3arsSynth和MarsGen,通过物理准确的3D重建生成逼真的火星视频,提升任务模拟与机器人训练的可视化效果。
Comments Project Page: https://marsgenai.github.io
DeRA: 解耦表示对齐用于视频标记化
机构 * Xi’an Jiaotong University(西安交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 DeRA通过解耦时空表示学习,提升视频标记化效率和性能,并在视频生成任务中取得新突破。
VRWKV-Editor: 降低基于变换器的视频编辑中的二次复杂度
机构 * International Artificial Intelligence Center of Morocco University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥国际人工智能中心摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) ; University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) ; Sorbonne University, LIP6 - UMR 7606 CNRS, France(索邦大学,LIP6 - UMR 7606 CNRS,法国)
专题命中 视频生成 :long video(abstract);分类 cs.CV
AI总结 VRWKV-Editor通过引入线性时空聚合模块,降低基于变换器的视频编辑模型的计算复杂度,实现3.7倍加速和60%内存节省,同时保持高质量的帧一致性和文本对齐。
上下文同步LoRA用于肖像视频编辑
机构 * Tel Aviv University(特拉维夫大学) ; Simon Fraser University(Simon Fraser大学)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV
AI总结 Sync-LoRA通过上下文LoRA实现肖像视频编辑,保持帧同步和身份一致性,支持多样化的修改如外观变化和物体添加。
Comments Project page: https://sagipolaczek.github.io/Sync-LoRA/
快速多视角一致3D编辑与视频先验
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出ViP3DE方法,利用视频生成模型的时间一致性先验,实现多视角一致的3D编辑,提升编辑质量和速度。
Comments accepted by AAAI2026
从飘落的树叶中看到风
机构 * University of Southern California(南加州大学) ; Stanford University(斯坦福大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出一种端到端可微逆图形框架,通过视频恢复不可见的物理力,应用于风场估计和基于物理的视频生成与编辑。
Comments Accepted at NeurIPS 2025
MobileI2V: 一种适用于移动设备的快速高分辨率图像到视频生成方法
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 MobileI2V通过轻量级扩散模型和优化策略,在移动设备上实现快速高分辨率图像到视频生成,生成速度提升10倍,质量与现有模型相当。
Comments Our Demo and code:https://github.com/hustvl/MobileI2V
通过分割后再融合的分层视频合成
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google(谷歌)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 StM通过分割未标注视频并融合动态前景与背景层,提升生成视频合成的控制能力和数据效率。
Comments Project Webpage: https://split-then-merge.github.io
块级级联:无训练加速块因果视频模型
机构 * Stability AI ; SketchX, University of Surrey(SketchX, Surrey大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 块级级联通过无训练并行化技术,显著提升块因果视频模型的推理速度,同时保持生成质量。
图像到视频模型是否是良好的零样本图像编辑器?
机构 * Zhejiang University(浙江大学) ; Harvard University(哈佛大学)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV
AI总结 IF-Edit通过无需微调的框架,利用预训练图像到视频扩散模型实现指令驱动的图像编辑,解决提示错位、冗余时间潜在特征和模糊后期帧问题,展现强大的推理能力和通用编辑竞争力。
Comments technical report
多模态生成式AI:多模态大语言模型、扩散模型与统一
机构 * Department of Computer Science, Beijing Information Science and Technology National Research Center, Tsinghua University(计算机系,北京信息科学与技术国家研究中心,清华大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文综述了多模态生成式AI,涵盖多模态LLMs、扩散模型及统一模型的设计与应用,探讨了统一理解和生成的方法及未来研究方向。
Comments 21 pages, 10 figures, 3 tables
Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025
MovieDreamer:用于生成连贯长视觉序列的分层生成
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 MovieDreamer通过结合自回归模型与扩散渲染,实现长时长视频生成,提升叙事连贯性和视觉质量。
Comments 30 pages, 22 figures
视频中的指令:将视觉信号作为生成控制
机构 * National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本研究提出通过视频中嵌入的视觉信号作为指令,实现可控的图像到视频生成,通过空间感知的指令分配提升多对象场景下的生成可靠性。
学习信任什么:基于贝叶斯先验引导的视觉生成优化
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出贝叶斯先验引导优化方法,通过建模奖励不确定性提升视觉生成模型的语义对齐和感知保真度。
学习原始具身世界模型:迈向可扩展的机器人学习
机构 * Shanghai AI Lab(上海人工智能实验室) ; Fudan(复旦大学) ; SJTU(上海交通大学) ; NJUST(南京理工大学) ; THU(清华大学) ; Harvard(哈佛大学) ; ZJU(浙江大学) ; NJU(南京大学) ; USTC(中国科学技术大学) ; Tongji(同济大学) ; HKUST (GZ)(香港科技大学(广州))
专题命中 视频生成 :video generation(abstract);分类 cs.MM
AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。
点到点:用于可控视频编辑的稀疏运动引导
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV
AI总结 Point-to-Point通过引入锚点标记,利用视频扩散模型的先验知识,实现可控视频编辑中运动与编辑的高质量保真度。
生成增强现实:范式、技术与未来应用
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Nanyang Technological University(南洋理工大学) ; XMax.AI Ltd.(XMax.AI有限公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
AI总结 本文提出生成增强现实(GAR)作为下一代AR范式,通过统一生成模型实现环境再合成,提升真实感与沉浸感,同时引发技术、内容生态及伦理挑战。
机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究所,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) ; Institute for Interdisciplinary Information Sciences, Tsinghua University(交叉信息学院,清华大学) ; EECS, University of California, Berkeley(电子工程与计算机科学系,加州大学伯克利分校)
专题命中 视频生成 :video generation(abstract);分类 cs.CV
Comments @inproceedings{zhang2025spargeattn, title={Spargeattn: Accurate sparse attention accelerating any model inference}, author={Zhang, Jintao and Xiang, Chendong and Huang, Haofeng and Wei, Jia and Xi, Haocheng and Zhu, Jun and Chen, Jianfei}, booktitle={International Conference on Machine Learning (ICML)}, year={2025} }
Journal ref Proceedings of the 42 nd International Conference on Machine Learning, PMLR 267, 2025 (ICML 2025)