arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6765 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2512.07821 2025-12-09 cs.CV cs.AI 79%

WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling

WorldReel:基于一致几何和运动建模的4D视频生成

Shaoheng Fang, Hanwen Jiang, Yunpeng Bai, Niloy J. Mitra, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究) University College London(伦敦大学学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 WorldReel通过联合生成RGB帧和4D场景表示,实现了动态场景和移动摄像机下的4D一致视频生成,提升了几何一致性与运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07802 2025-12-09 cs.CV 79%

OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

OneStory: 通过自适应记忆实现连贯的多镜头视频生成

Zhaochong An, Menglin Jia, Haonan Qiu, Zijian Zhou, Xiaoke Huang, Zhiheng Liu, Weiming Ren, Kumara Kahatapitiya, Ding Liu, Sen He, Chenyang Zhang, Tao Xiang, Fanny Yang, Serge Belongie, Tian Xie

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 OneStory通过自适应记忆实现多镜头视频生成,提升叙事连贯性和生成质量。

Comments Project Page: https://zhaochongan.github.io/projects/OneStory

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06905 2025-12-09 cs.CV 79%

Scaling Zero-Shot Reference-to-Video Generation

缩放零样本参考到视频生成

Zijian Zhou, Shikun Liu, Haozhe Liu, Haonan Qiu, Zhaochong An, Weiming Ren, Zhiheng Liu, Xiaoke Huang, Kam Woh Ng, Tian Xie, Xiao Han, Yuren Cong, Hang Li, Chuyan Zhu, Aditya Patel, Tao Xiang, Sen He

机构 * Meta AI King's College London

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Saber通过零样本框架实现高效参考到视频生成,无需显式数据,通过掩码训练和注意力模型提升泛化能力。

Comments Website: https://franciszzj.github.io/Saber/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09476 2025-12-08 cs.CV 79%

Collaborative Face Experts Fusion in Video Generation: Boosting Identity Consistency Across Large Face Poses

视频生成中的协作面部专家融合:提升大面部姿态下的身份一致性

Yuji Wang, Moran Li, Xiaobin Hu, Ran Yi, Jiangning Zhang, Chengming Xu, Weijian Cao, Yabiao Wang, Chengjie Wang, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Youtu Lab(腾讯优图实验室) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出协作面部专家融合方法,通过动态融合身份、语义和细节专家信号,提升大姿态下视频生成的身份一致性,并构建了大规模姿态标注数据集。

Comments Project page: https://rain152.github.io/CoFE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05076 2025-12-05 cs.CV 79%

BulletTime: Decoupled Control of Time and Camera Pose for Video Generation

BulletTime: 分离时间与相机姿态的视频生成控制

Yiming Wang, Qihang Zhang, Shengqu Cai, Tong Wu, Jan Ackermann, Zhengfei Kuang, Yang Zheng, Frano Rajič, Siyu Tang, Gordon Wetzstein

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 BulletTime通过分离时间与相机姿态,实现了视频生成的精细控制与高质量生成。

Comments Project Page: https://19reborn.github.io/Bullet4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03453 2025-12-04 cs.CV 79%

GeoVideo: Introducing Geometric Regularization into Video Generation Model

GeoVideo: 在视频生成模型中引入几何正则化

Yunpeng Bai, Shaoheng Fang, Chaohui Yu, Fan Wang, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(鸿篇实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeoVideo通过引入几何正则化损失,提升视频生成的时空一致性和几何结构合理性。

Comments Project Page: https://geovideo.github.io/GeoVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03451 2025-12-04 cs.CV cs.AI cs.LG 79%

GalaxyDiT: Efficient Video Generation with Guidance Alignment and Adaptive Proxy in Diffusion Transformers

GalaxyDiT:通过引导对齐和自适应代理实现高效的视频生成

Zhiye Song, Steve Dai, Ben Keller, Brucek Khailany

机构 * Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GalaxyDiT通过引导对齐和自适应代理选择,提升视频生成效率,实现高达2.37倍的速度提升并保持高质量输出

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03041 2025-12-03 cs.CV 79%

MultiShotMaster: A Controllable Multi-Shot Video Generation Framework

MultiShotMaster: 一种可控的多镜头视频生成框架

Qinghe Wang, Xiaoyu Shi, Baolu Li, Weikang Bian, Quande Liu, Huchuan Lu, Xintao Wang, Pengfei Wan, Kun Gai, Xu Jia

机构 * Dalian University of Technology(大连理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MultiShotMaster通过引入两种新型RoPE变体和自动化数据标注管道,实现多镜头视频的灵活生成与可控性。

Comments Project Page: https://qinghew.github.io/MultiShotMaster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02942 2025-12-03 cs.CV cs.AI 79%

Benchmarking Scientific Understanding and Reasoning for Video Generation using VideoScience-Bench

基于视频科学基准的视频生成科学理解与推理评估

Lanxiang Hu, Abhilash Shankarampeta, Yixin Huang, Zilin Dai, Haoyang Yu, Yujie Zhao, Haoqiang Kang, Daniel Zhao, Tajana Rosing, Hao Zhang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 VideoScience-Bench是首个评估视频模型科学理解和推理能力的基准测试,通过200个精心设计的提示评估模型在物理和化学领域的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02492 2025-12-03 cs.CV 79%

YingVideo-MV: Music-Driven Multi-Stage Video Generation

YingVideo-MV: 基于音乐的多阶段视频生成

Jiahui Chen, Weida Wang, Runhua Shi, Huan Yang, Chaofan Ding, Zihao Chen

机构 * AI Lab, GiantNetwork(人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 YingVideo-MV通过整合音频语义分析、时间感知扩散模型和摄像机运动控制模块,实现了基于音乐的高质量视频生成。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02273 2025-12-03 cs.CV cs.AI 79%

Progressive Image Restoration via Text-Conditioned Video Generation

通过文本条件视频生成实现渐进式图像修复

Peng Kang, Xijun Wang, Yu Yuan

机构 * Department of Computer Science, University of Illinois Springfield(伊利诺伊大学斯普林菲尔德分校计算机科学系) School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 本研究通过微调CogVideo,利用文本条件视频生成实现图像渐进式修复,提升感知度量并展示强泛化能力。

Comments First two authors contributed equally to this work. IEEE ICNC Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01960 2025-12-02 cs.CV cs.HC 79%

SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation

SpriteHand: 实时多样的手-物体交互与自回归视频生成

Zisu Li, Hengye Lyu, Jiaxin Shi, Yufeng Zeng, Mingming Fan, Hanwang Zhang, Chen Liang

机构 * HKUST (Guangzhou)(香港科技大学(广州)) XMax.AI Ltd.(XMax人工智能有限公司) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SpriteHand通过自回归视频生成框架实现实时高质量手-物体交互视频合成,支持多种物体和运动模式,具有高视觉真实性和物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00832 2025-12-02 cs.CV 79%

PanFlow: Decoupled Motion Control for Panoramic Video Generation

PanFlow:全景视频生成的解耦运动控制

Cheng Zhang, Hanwen Liang, Donny Y. Chen, Qianyi Wu, Konstantinos N. Plataniotis, Camilo Cruz Gambardella, Jianfei Cai

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PanFlow通过解耦动态摄像机旋转与输入光学流,提升全景视频生成的运动控制精度和质量。

Comments Accepted by AAAI. Code: https://github.com/chengzhag/PanFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14712 2025-12-02 cs.CV 79%

FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation

FreeSwim: 重新审视滑动窗口注意力机制以实现无训练超高清视频生成

Yunfeng Wu, Jiayi Song, Zhenxiong Tan, Zihao He, Songhua Liu

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 FreeSwim通过无训练滑动窗口注意力机制实现超高清视频生成,提升效率并保持视觉细节。

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23475 2025-12-01 cs.CV 79%

AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement

AnyTalker: 通过交互细化扩展多人物谈话视频生成

Zhizhou Zhong, Yicheng Ji, Zhe Kong, Yiying Liu, Jiarui Wang, Jiasun Feng, Lupeng Liu, Xiangyi Wang, Yanjia Li, Yuqing She, Ying Qin, Huan Li, Shuiyang Mao, Wei Liu, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Video Rebirth(视频重生) Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。

Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22974 2025-12-01 cs.CV 79%

McSc: Motion-Corrective Preference Alignment for Video Generation with Self-Critic Hierarchical Reasoning

McSc: 基于自批评分层推理的视频生成运动校正偏好对齐

Qiushi Yang, Yingjie Chen, Yuan Yao, Yifang Men, Huaizhuo Liu, Miaomiao Cui

机构 * Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 McSc通过自批评分层推理框架,提升视频生成中对人类偏好的对齐精度,减少对低运动内容的偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21136 2025-11-27 cs.CV cs.AI 79%

Efficient Training for Human Video Generation with Entropy-Guided Prioritized Progressive Learning

高效训练人类视频生成的熵引导优先级渐进学习

Changlin Li, Jiawei Zhang, Shuhao Liu, Sihao Lin, Zeyi Shi, Zhihui Li, Xiaojun Chang

机构 * Stanford University(斯坦福大学) North China Electric Power University(华北电力大学) University of Adelaide(阿德莱德大学) University of Technology Sydney(悉尼技术大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出熵引导优先级渐进学习方法,通过条件熵膨胀和自适应渐进计划,高效训练扩散模型生成人类视频,实现训练速度提升和内存消耗降低。

Comments Project page: https://github.com/changlin31/Ent-Prog

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18780 2025-11-27 cs.CV cs.AI 79%

ConceptGuard: Proactive Safety in Text-and-Image-to-Video Generation through Multimodal Risk Detection

ConceptGuard:通过多模态风险检测实现文本-图像到视频生成的主动安全

Ruize Ma, Minghong Cai, Yilei Jiang, Jiaming Han, Yi Feng, Yingshui Tan, Xiaoyong Zhu, Bo Zhang, Bo Zheng, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学多模态实验室) Future Lab, Alibaba Group(阿里巴巴集团未来实验室) Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ConceptGuard通过多模态风险检测实现文本-图像到视频生成的主动安全,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19386 2025-11-27 cs.CV cs.AI 79%

Force Prompting: Video Generation Models Can Learn and Generalize Physics-based Control Signals

力提示:视频生成模型可以学习并泛化基于物理的控制信号

Nate Gillman, Charles Herrmann, Michael Freeman, Daksh Aggarwal, Evan Luo, Deqing Sun, Chen Sun

机构 * Brown University(布朗大学) Google DeepMind(谷歌DeepMind)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出力提示方法,通过物理力信号生成逼真视频,利用视觉和运动先验实现物理控制信号的泛化,提升世界模型的物理真实性。

Comments Camera ready version (NeurIPS 2025). Code and interactive demos at https://force-prompting.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20563 2025-11-26 cs.CV 79%

A Reason-then-Describe Instruction Interpreter for Controllable Video Generation

用于可控视频生成的指令解释器

Shengqiong Wu, Weicai Ye, Yuanxing Zhang, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Hao Fei, Tat-Seng Chua

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ReaDe通过推理后再描述的方法,将模糊用户指令转化为精确规范,提升可控视频生成的准确性和质量。

Comments 27 pages, 13 figures, 13 tables, Project Page: https://sqwu.top/ReaDe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20280 2025-11-26 cs.CV 79%

Bootstrapping Physics-Grounded Video Generation through VLM-Guided Iterative Self-Refinement

通过VLM引导的迭代自优化提升物理导向的视频生成

Yang Liu, Xilin Zhao, Peisong Wen, Siran Dai, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种通过VLM引导的迭代自优化方法,提升视频生成的物理一致性,实验显示在PhyIQ基准上得分提升明显。

Comments ICCV 2025 Physics-IQ Challenge Third Place Solution

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20186 2025-11-26 cs.CV 79%

Exo2EgoSyn: Unlocking Foundation Video Generation Models for Exocentric-to-Egocentric Video Synthesis

Exo2EgoSyn: 解锁用于外视图到内视图视频合成的基础视频生成模型

Mohammad Mahdi, Yuqian Fu, Nedko Savov, Jiancheng Pan, Danda Pani Paudel, Luc Van Gool

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Exo2EgoSyn通过三个模块实现从第三人称视角生成高保真内视图视频,提升跨视角视频合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19835 2025-11-26 cs.CV cs.AI 79%

Rectified SpaAttn: Revisiting Attention Sparsity for Efficient Video Generation

校正SpaAttn:重新审视注意力稀疏性以实现高效的视频生成

Xuewen Liu, Zhikai Li, Jing Zhang, Mengjuan Chen, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Rectified SpaAttn,通过校正注意力分配提升视频生成效率,实现显著速度提升且保持生成质量。

Comments Code at https://github.com/BienLuky/Rectified-SpaAttn

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19049 2025-11-25 cs.CV 79%

Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation

超越奖励边际:通过视频生成重新思考和解决扩散模型中的似然位移

Ruojun Xu, Yu Kai, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Tianxiang Zheng, Qinhlin Lu

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PG-DPO方法,通过结合ARS和IPR缓解扩散模型中的似然位移问题,提升视频生成任务的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18684 2025-11-25 cs.CV 79%

Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation

现在你看见它,现在你又看不见 - 用于安全文本到图像和视频生成的即时概念消除

Shristi Das Biswas, Arani Roy, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 ICE通过无需训练的一次性权重修改方法,实现文本到图像和视频生成中精确且持久的概念消除,无需额外开销,提升安全性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23951 2025-11-25 cs.CV 79%

JointTuner: Appearance-Motion Adaptive Joint Training for Customized Video Generation

JointTuner: 用于定制视频生成的外观-运动自适应联合训练

Fangda Chen, Shanshan Zhao, Chuanfu Xu, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 JointTuner通过联合优化外观和运动组件,提出GLoRA和AiT Loss解决定制视频生成中的外观污染和运动模式学习问题。

Comments Project Page: https://fdchen24.github.io/JointTuner-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18102 2025-11-25 cs.CV 79%

Spotlight: Identifying and Localizing Video Generation Errors Using VLMs

Spotlight: 利用视觉语言模型识别和定位视频生成错误

Aditya Chinchure, Sahithya Ravi, Pushkar Shukla, Vered Shwartz, Leonid Sigal

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute of AI(向量人工智能研究所) The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 Spotlight任务通过定位和解释视频生成错误,揭示VLMs在错误识别和定位上的不足,并提出改进策略以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17450 2025-11-24 cs.CV cs.AI cs.CL 79%

Planning with Sketch-Guided Verification for Physics-Aware Video Generation

基于草图引导验证的物理感知视频生成规划

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) FieldAI Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SketchVerify通过草图验证和动态轨迹优化提升物理感知视频生成的效率与质量。

Comments website: https://sketchverify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03135 2025-11-24 cs.CV cs.RO 79%

Mask2IV: Interaction-Centric Video Generation via Mask Trajectories

Mask2IV: 通过遮罩轨迹实现以交互为中心的视频生成

Gen Li, Bo Zhao, Jianfei Yang, Laura Sevilla-Lara

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Mask2IV通过遮罩轨迹实现以交互为中心的视频生成,提供灵活的交互控制和高真实感的视频生成。

Comments AAAI 2026. Project page: https://reagan1311.github.io/mask2iv

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03079 2025-11-24 cs.CV 79%

ORV: 4D Occupancy-centric Robot Video Generation

ORV:基于占用的4D机器人视频生成

Xiuyu Yang, Bohan Li, Shaocong Xu, Nan Wang, Chongjie Ye, Zhaoxi Chen, Minghan Qin, Yikang Ding, Zheng Zhu, Xin Jin, Hang Zhao, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波工程技术院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) S-Lab, Nanyang Technological University(南洋理工大学S实验室) ByteDance(字节跳动) Kling, Kuaishou Technology(Kling,快手科技) GigaAI AIR, Tsinghua University(清华大学人工智能研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ORV提出一种基于占用的4D机器人视频生成框架,通过结合动作先验与占用视觉先验,提升视频生成质量与可控性,实现多视角一致合成和仿真到现实的迁移。

Comments Project page: https://orangesodahub.github.io/ORV/ ; Code: https://github.com/OrangeSodahub/ORV

详情

展开后加载摘要…

URL PDF HTML 收藏