arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2602.21929 2026-02-26 cs.CV 79%

Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

几何作为上下文:调节显式3D以在场景一致视频生成中利用几何上下文

JiaKui Hu, Jialun Liu, Liying Yang, Xinliang Zhang, Kaiwen Li, Shuang Zeng, Yuanwei Li, Haibin Huang, Chi Zhang, Yanye Lu

机构 * Institute of Medical Technology, Peking University(北京大学医学技术学院) TeleAI MUST

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出几何作为上下文的方法,通过自回归模型迭代生成3D场景,提升视频生成的场景一致性和相机控制能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17404 2026-02-25 cs.CV 79%

MoSA: Motion-Coherent Human Video Generation via Structure-Appearance Decoupling

MoSA: 通过结构-外观解耦生成运动一致的人体视频

Haoyu Wang, Hao Tang, Donglin Di, Zhilu Zhang, Wangmeng Zuo, Feng Gao, Siwei Ma, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) School of Arts(艺术学院) Li Auto(力汽车) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MoSA通过结构-外观解耦生成运动一致的人体视频,引入Human-Aware Dynamic Control模块和接触约束,提升细粒度控制与人-环境交互建模,实现更逼真的人体视频生成。

Comments Accepted by ICLR 2026. Project: https://hywang2002.github.io/MoSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19040 2026-02-24 cs.IR cs.AI cs.MM 79%

Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval

自适应多智能体推理用于文本到视频检索

Jiaxin Wu, Xiao-Yong Wei, Qing Li

机构 * Shenzhen University(深圳大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.MM

AI总结 本文提出自适应多智能体框架,通过动态协调检索、推理和查询重述智能体,提升文本到视频检索的零样本跨模态对齐与复杂查询处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18422 2026-02-23 cs.CV 79%

Generated Reality: Human-centric World Simulation using Interactive Video Generation with Hand and Camera Control

生成现实:基于交互式视频生成的人本世界模拟

Linxi Xie, Lisong C. Sun, Ashley Neall, Tong Wu, Shengqu Cai, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) NYU Shanghai(纽约大学上海分校) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于交互式视频生成的人本世界模拟系统,通过结合头部和手部姿态控制,提升虚拟环境的交互性和用户控制感。

Comments Project page here: https://codeysun.github.io/generated-reality

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17863 2026-02-19 cs.CV cs.AI 79%

A Survey: Spatiotemporal Consistency in Video Generation

综述:视频生成中的时空一致性

Zhiyu Yin, Kehai Chen, Xuefeng Bai, Ruili Jiang, Juntao Li, Hongdong Li, Jin Liu, Yang Xiang, Jun Yu, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文综述了视频生成中时空一致性的最新进展,涵盖生成模型、特征表示、训练策略等,探讨了未来研究方向和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14941 2026-02-17 cs.CV cs.AI 79%

AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories

AnchorWeave: 通过检索的局部空间记忆实现世界一致的视频生成

Zun Wang, Han Lin, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal

机构 * Department of Computer Science, University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnchorWeave通过检索局部空间记忆提升视频生成的长期场景一致性与视觉质量。

Comments Project website: https://zunwang1.github.io/AnchorWeave

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13637 2026-02-17 cs.CV 79%

DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation

DCDM:分而治之扩散模型用于保持一致性视频生成

Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DCDM通过分而治之的扩散模型,解决视频生成中的语义、几何和身份一致性问题,提升视频生成的连贯性和可控性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03796 2026-02-17 cs.CV 79%

3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation

面向视图自适应的人体视频生成的3D感知隐式运动控制

Zhixue Fang, Xu He, Songlin Tang, Haoxian Zhang, Qingfeng Li, Xiaoqiang Liu, Pengfei Wan, Kun Gai

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学) CASIA

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 3DiMo通过隐式运动表示和视图丰富监督,提升视频生成中的人体运动保真度和视觉质量。

Comments Project Page: https://hjrphoebus.github.io/3DiMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13185 2026-02-16 cs.CV cs.GR 79%

FlexAM: Flexible Appearance-Motion Decomposition for Versatile Video Generation Control

FlexAM: 一种灵活的外观-运动分解方法用于多功能视频生成控制

Mingzhi Sheng, Zekai Gu, Peng Li, Cheng Lin, Hao-Xiang Guo, Ying-Cong Chen, Yuan Liu

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MUST(澳门大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 FlexAM通过引入新型3D控制信号,实现外观与运动的解耦,提升视频生成任务的灵活性和生成质量。

Comments Codes: https://github.com/IGL-HKUST/FlexAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12160 2026-02-13 cs.CV 79%

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

DreamID-Omni: 一体化框架用于可控的人-centric音频视频生成

Xu Guo, Fulong Ye, Qichao Sun, Liyang Chen, Bingchuan Li, Pengze Zhang, Jiawei Liu, Songtao Zhao, Qian He, Xiangwang Hou

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreamID-Omni提出了一种统一框架,通过双层解耦策略和多任务训练方案,实现对可控人-centric音频视频生成的高效控制。

Comments Project: https://guoxu1233.github.io/DreamID-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03213 2026-02-11 cs.CV 79%

ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask

ConsisDrive: 用于视频生成的实例掩码驾驶世界模型

Zhuoran Yang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ConsisDrive通过实例掩码注意力和损失机制提升驾驶视频生成质量及自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05966 2026-02-06 cs.CV cs.AI 79%

LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation

LSA:局部语义对齐用于增强交通视频生成中的时间一致性

Mirlan Karimov, Teodora Spasojevic, Markus Braun, Julian Wiederer, Vasileios Belagiannis, Marc Pollefeys

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ETH Zurich(苏黎世联邦理工学院) Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LSA通过局部语义对齐提升交通视频生成的时间一致性,无需外部控制信号。

Comments Accepted to IEEE IV 2026. 8 pages, 3 figures. Code available at https://github.com/mirlanium/LSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05827 2026-02-06 cs.CV cs.RO 79%

Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation

稀疏视频生成推动现实世界超越视界视觉语言导航

Hai Zhang, Siqi Liang, Li Chen, Yuxian Li, Yukuan Xu, Yichao Zhong, Fu Zhang, Hongyang Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SparseVideoNav,通过稀疏视频生成实现现实世界超越视界导航,显著提升导航效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13462 2026-02-05 cs.SD cs.MM eess.AS 79%

SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation

SAVGBench: 多模态空间对齐音频视频生成基准测试

Kazuki Shimada, Christian Simon, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 SAVGBench提出了一种新的基准测试方法,用于评估空间对齐音频视频生成任务的性能,通过引入专门的数据集和对齐度量标准,评估不同生成模型的对齐效果。

Comments 5 pages, 2 figures, accepted for publication in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03793 2026-02-04 cs.RO cs.CV 79%

BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks

BridgeV2W: 通过具身遮罩将视频生成模型与具身世界模型 bridging

Yixiang Chen, Peiyan Li, Jiabing Yang, Keji He, Xiangnan Wu, Yuan Xu, Kai Wang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室(NLPR),自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Shandong University(山东大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 BridgeV2W 通过具身遮罩将视频生成模型与具身世界模型结合,解决坐标空间动作与像素空间视频的不匹配问题,并提升视频生成质量与跨具身统一性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03242 2026-02-04 cs.CV 79%

InstaDrive: Instance-Aware Driving World Models for Realistic and Consistent Video Generation

InstaDrive: 为真实和一致的视频生成实例感知的驾驶世界模型

Zhuoran Yang, Xi Guo, Chenjing Ding, Chiyu Wang, Wei Wu, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) SenseAuto(感etime) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 InstaDrive通过实例感知机制提升驾驶视频生成质量,增强自动驾驶任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01814 2026-02-03 cs.CV 79%

GPD: Guided Progressive Distillation for Fast and High-Quality Video Generation

GPD: 用于快速高质量视频生成的引导渐进蒸馏

Xiao Liang, Yunzhu Zhang, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GPD通过引导渐进蒸馏方法,减少视频生成的采样步骤,同时保持高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19488 2026-02-02 cs.CV 79%

Entropy-Guided k-Guard Sampling for Long-Horizon Autoregressive Video Generation

熵引导的k-guard采样用于长 Horizon 自回归视频生成

Yizhao Han, Tianxing Shi, Zhao Wang, Zifan Xu, Zhiyuan Pu, Mingxiao Li, Qian Zhang, Wei Yin, Xiao-Xiao Long

机构 * Nanjing University(南京大学) Horizon Robotics China Mobile(中国移动)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 熵引导的k-guard采样用于长Horizon自回归视频生成,通过自适应调整令牌候选集大小以提升视频生成的质量和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14256 2026-02-02 cs.CV 79%

Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning

身份保持的多人类视频生成优化:通过强化学习进行优化

Xiangyu Meng, Zixian Zhang, Zhenghao Zhang, Junchao Liao, Long Qin, Weizhi Wang

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Identity-GRPO通过强化学习优化多人类身份保持的视频生成,显著提升一致性指标。

Comments Our project and code are available at https://ali-videoai.github.io/identity_page, https://github.com/alibaba/identity-grpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21193 2026-01-30 cs.CV 79%

Generative Recall, Dense Reranking: Learning Multi-View Semantic IDs for Efficient Text-to-Video Retrieval

生成回忆,密集重排序:学习多视图语义ID以实现高效的文本到视频检索

Zecheng Zhao, Zhi Chen, Zi Huang, Shazia Sadiq, Tong Chen

机构 * The University of Queensland(昆士兰大学) The University of Southern Queensland(南部昆士兰大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 GRDR通过生成回忆和密集重排序方法,提升文本到视频检索的效率和准确性,减少存储并加速检索过程。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17756 2026-01-28 cs.CV cs.AI cs.GR 79%

MV-S2V: Multi-View Subject-Consistent Video Generation

MV-S2V:多视图主体一致视频生成

Ziyang Song, Xinyu Gong, Bangya Liu, Zelin Zhao

机构 * The Hong Kong Polytechnic University(香港理工大学) The University of Texas at Austin(德克萨斯大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出MV-S2V方法,通过多视角参考生成一致的3D主体视频,解决单视角限制并提升视频生成质量。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12945 2026-01-27 cs.CL cs.CV 79%

LLMPopcorn: Exploring LLMs as Assistants for Popular Micro-video Generation

LLMPopcorn:探索大型语言模型作为流行微视频生成助手

Junchen Fu, Xuri Ge, Kaiwen Zheng, Alexandros Karatzoglou, Ioannis Arapakis, Xin Xin, Yongxin Ni, Joemon M. Jose

机构 * University of Glasgow(格拉斯哥大学) Shandong University(山东大学) Amazon(亚马逊) Telefónica Research(Telefónica研究院) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LLMPopcorn利用大型语言模型生成流行微视频,通过实验证明先进LLM可生成高流行度内容,并优化生成效果。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17067 2026-01-27 cs.CV cs.AI 79%

A Mechanistic View on Video Generation as World Models: State and Dynamics

视频生成作为世界模型的机制视角:状态与动态

Luozhou Wang, Zhifei Chen, Yihua Du, Dongyu Yan, Wenhang Ge, Guibao Shen, Xinli Xu, Leyi Wu, Man Chen, Tianshuo Xu, Peiran Ren, Xin Tao, Pengfei Wan, Ying-Cong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tongji University(同济大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出基于状态构建和动态建模的视频生成新分类法,旨在提升视频生成模型的物理持续性和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16914 2026-01-26 cs.CV cs.AI 79%

LoL: Longer than Longer, Scaling Video Generation to Hour

LoL: 长于更长,将视频生成扩展至小时级

Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, Cho-Jui Hsieh

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LoL提出一种无需训练的方法,通过多头RoPE抖动缓解视频生成中的sink-collapse问题,实现长时长、高质量的流式视频生成。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15282 2026-01-22 cs.CV cs.AI cs.RO 79%

Rethinking Video Generation Model for the Embodied World

重新思考具身世界的视频生成模型

Yufan Deng, Zilin Pan, Hongyu Zhang, Xiaojie Li, Ruoqing Hu, Yufei Ding, Yiming Zou, Yan Zeng, Daquan Zhou

机构 * Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Rbench机器人视频生成基准和RoVid-X数据集,旨在解决高保真机器人视频生成中的数据短缺问题,推动具身AI发展。

Comments Github: https://github.com/DAGroup-PKU/ReVidgen/ Project website: https://dagroup-pku.github.io/ReVidgen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15281 2026-01-22 cs.CV 79%

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

StableWorld: 向稳定和一致的长交互视频生成迈进

Ying Yang, Zhengyao Lv, Tianlin Pan, Haofan Wang, Binxin Yang, Hubery Yin, Chen Li, Ziwei Liu, Chenyang Si

机构 * PRLab, NJU(南京大学PRLab) HKU(香港大学) UCAS(中国科学技术大学) WeChat, Tencent Inc.(腾讯公司) NTU(国立清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。

Comments 17 pages, 21 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10781 2026-01-19 cs.CV 79%

Future Optical Flow Prediction Improves Robot Control & Video Generation

未来光流预测改进机器人控制与视频生成

Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu, Caiming Xiong, Silvio Savarese, Michael S Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院) Stony Brook University(石溪大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 FOFPred通过统一的视觉-语言模型和扩散架构,实现高效的未来光流预测,提升机器人控制与视频生成的性能。

Comments Project Site (Code, Models, Demo): https://fofpred.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10103 2026-01-16 cs.CV cs.AI 79%

FlowAct-R1: Towards Interactive Humanoid Video Generation

FlowAct-R1: 向交互式人形视频生成迈进

Lizhen Wang, Yongming Zhu, Zhipeng Ge, Youwei Zheng, Longhao Zhang, Tianshu Hu, Shiyang Qin, Mingshuang Luo, Jiaxu Zhang, Xin Chen, Yulong Wang, Zerong Zheng, Jianwen Jiang, Chao Liang, Weifeng Chen, Xing Wang, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 FlowAct-R1通过分块扩散策略和高效优化,实现了实时交互式人形视频生成,具备高保真和低延迟的视频合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09697 2026-01-15 cs.CV 79%

Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering

通过稀疏扩散和3D渲染实现静态场景的高效摄像机控制视频生成

Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SRENDER方法,通过稀疏扩散和3D渲染生成静态场景的高效视频,使视频生成速度提升40倍,保持高质量和稳定性。

Comments Project page: https://ayushtewari.com/projects/srender/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05966 2026-01-15 cs.CV cs.AI 79%

VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction

VideoAR: 通过下一帧与尺度预测实现自回归视频生成

Longbin Ji, Xiaoxiong Liu, Junyuan Shang, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 VideoAR通过多尺度下一帧预测与自回归建模,实现高效、一致的视频生成,提升性能并减少计算成本。

Comments Project page: https://ernie-research.github.io/VideoAR/

详情

展开后加载摘要…

URL PDF HTML 收藏