arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2143 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2602.09600 2026-02-16 cs.CV 57%

Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures

Hand2World: 通过自由空间手势生成自主回归的视角交互

Yuxi Wang, Wenqi Ouyang, Tianyi Wei, Yi Dong, Zhiqi Shen, Xingang Pan

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Hand2World通过自由空间手势生成视角交互,利用自回归框架解决遮挡、相机运动解耦和长视频生成问题,提升视觉生成的质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11242 2026-02-13 cs.CV 57%

ReTracing: An Archaeological Approach Through Body, Machine, and Generative Systems

ReTracing:通过身体、机器和生成系统进行考古学研究

Yitong Wang, Yue Yao

机构 * Department of Machine Learning(机器学习系) Carnegie Mellon University(卡内基梅隆大学) SIPA Technology Policy and Innovation(技术政策与创新研究所) Columbia University(哥伦比亚大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 ReTracing通过AI、人类和机器人互动,探索生成系统如何通过编舞运动反映社会文化偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00148 2026-02-13 cs.CV cs.AI 57%

Learning Physics-Grounded 4D Dynamics with Neural Gaussian Force Fields

基于神经高斯力场的学习物理 grounded 4D 动力学

Shiqian Li, Ruihong Shen, Junfeng Ni, Chang Pan, Chi Zhang, Yixin Zhu

机构 * Institute for AI, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) School of EECS, Peking University(北京大学电子工程学院) Department of Automation, Tsinghua University(清华大学自动化系) Yuanpei College, Peking University(北京大学元培学院) State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出神经高斯力场(NGFF),通过结合3D高斯感知与物理动力学建模,从多视角RGB输入生成交互式、物理真实的4D视频,提升视频预测的物理 grounded 性。

Comments 43 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08368 2026-02-10 cs.MM cs.GR cs.HC cs.MA 57%

T2VTree: User-Centered Visual Analytics for Agent-Assisted Thought-to-Video Authoring

T2VTree: 以用户为中心的视觉分析用于代理辅助的思维到视频创作

Zhuoyun Zheng, Yu Dong, Gaorong Liang, Guan Li, Guihua Shan, Shiyu Cheng, Dong Tian, Jianlong Zhou, Jie Liang

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 T2VTree通过树形可视化和可编辑代理计划,支持多场景视频创作中的可靠细化、局部比较和实用重用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03915 2026-02-05 cs.CV cs.AI cs.CE cs.LG 57%

Phaedra: Learning High-Fidelity Discrete Tokenization for the Physical Science

Phaedra: 学习高保真离散标记化以用于物理科学

Levi Lingsch, Georgios Kissas, Johannes Jakubik, Siddhartha Mishra

机构 * ETH AI Center(苏黎世联邦理工学院人工智能中心) IBM Research Europe(IBM欧洲研究院) Seminar for Applied Mathematics, ETH Zurich(苏黎世联邦理工学院应用数学系) Swiss Data Science Center, ETH Zurich(瑞士数据科学中心,苏黎世联邦理工学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Phaedra通过结合经典形状增益量化和正交分解,改进了科学图像的高保真离散标记化,提升PDE数据的重建和泛化能力。

Comments 57 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01538 2026-02-04 cs.CV cs.AI cs.CL 57%

Making Avatars Interact: Towards Text-Driven Human-Object Interaction for Controllable Talking Avatars

让拟人化角色互动:面向文本驱动的人-物体交互的可控对话拟人化

Youliang Zhang, Zhengguang Zhou, Zhentao Yu, Ziyao Huang, Teng Hu, Sen Liang, Guozhen Zhang, Ziqiao Peng, Shunkai Li, Yi Chen, Zixiang Zhou, Yuan Zhou, Qinglin Lu, Xiu Li

机构 * Tsinghua University(清华大学) Tencent HY(腾讯)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出InteractAvatar框架,通过双流结构实现文本驱动的人-物体交互生成,解决环境感知与控制质量矛盾,建立GroundedInter基准验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21408 2026-02-03 cs.CV 57%

MPF-Net: Exposing High-Fidelity AI-Generated Video Forgeries via Hierarchical Manifold Deviation and Micro-Temporal Fluctuations

MPF-Net:通过分层流形偏差和微时间波动暴露高保真AI生成视频伪造

Xinan He, Kaiqing Lin, Yue Zhou, Jiaming Zhong, Wei Ye, Wenhui Yi, Bing Fan, Feng Ding, Haodong Li, Bo Cao, Bin Li

机构 * Nanchang University(南昌大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室、深圳媒体安全重点实验室) SZU AFS Joint Innovation Center for AI Technology, Shenzhen University(SZU AFS人工智能技术联合创新中心、深圳大学) Huazhong University of Science(华中科技大学) University of North Texas(北卡罗来纳州立大学) The Smart City Research institute of China Electronics Technology Group Corporation, shenzhen(中国电子科技集团有限公司智慧城市研究院,深圳)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MPF-Net通过分层流形偏差和微时间波动检测高保真AI生成视频伪造。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10942 2026-02-03 cs.CV 57%

VL-JEPA: Joint Embedding Predictive Architecture for Vision-language

VL-JEPA:面向视觉-语言的联合嵌入预测架构

Delong Chen, Mustafa Shukor, Theo Moutakanni, Willy Chung, Jade Yu, Tejaswi Kasarla, Yejin Bang, Allen Bolourchi, Yann LeCun, Pascale Fung

机构 * Meta FAIR HKUST(香港科技大学) Sorbonne Université(索邦大学) NYU(纽约大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 VL-JEPA通过联合嵌入预测架构,在减少参数的情况下实现更强的视觉-语言性能,支持多种任务且无需架构修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22086 2026-01-30 physics.flu-dyn cs.CV 57%

Learning Transient Convective Heat Transfer with Geometry Aware World Models

利用几何感知的世界模型学习瞬态对流热传递

Onur T. Doganay, Alexander Klawonn, Martin Eigel, Hanno Gottschalk

机构 * Institute of Mathematics, TU Berlin(柏林技术大学数学研究所) Siemens Energy AG(西门子能源有限公司) Weierstrass Institute for Applied Analysis and Stochastics(魏尔斯特拉斯应用分析与概率研究所)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种几何感知的世界模型架构,用于学习瞬态对流热传递,通过双重条件机制和架构适应性提升物理模拟的可控性和精度。

Comments 36 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16522 2026-01-27 cs.CV 57%

Adams Bashforth Moulton Solver for Inversion and Editing in Rectified Flow

Adams-Bashforth-Moulton 解决方案用于 rectified 流中的反向和编辑

Yongjia Ma, Donglin Di, Xuan Liu, Xiaokai Chen, Lei Fan, Tonghua Su, Yue Gao

机构 * Li Auto(利亚 Auto) Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ABM求解器,通过多步预测校正和自适应步长调整提升rectified流模型的求解精度和编辑质量,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20655 2026-01-27 cs.CV 57%

Photography Perspective Composition: Towards Aesthetic Perspective Recommendation

摄影视角构图:迈向审美视角推荐

Lujian Yao, Siming Zheng, Xinbin Yuan, Zhuoxuan Cai, Pu Wu, Jinwei Chen, Bo Li, Peng-Tao Jiang

机构 * vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出摄影视角构图(PPC)方法,通过自动化数据集构建、视频生成和视角质量评估模型,解决视角变换数据稀缺和评估标准模糊的问题,帮助普通用户提升摄影构图能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16982 2026-01-26 cs.CV cs.LG cs.RO 57%

AnyView: Synthesizing Any Novel View in Dynamic Scenes

AnyView: 动态场景中合成任意新视角

Basile Van Hoorick, Dian Chen, Shun Iwase, Pavel Tokmakov, Muhammad Zubair Irshad, Igor Vasiljevic, Swati Gupta, Fangzhou Cheng, Sergey Zakharov, Vitor Campagnolo Guizilini

机构 * Toyota Research Institute(丰田研究院) Amazon Web Services(亚马逊网络服务)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 AnyView通过动态视角合成框架实现任意视角生成,克服了传统方法在高度动态场景中的局限性,提出了新的基准测试并展示了优越的性能。

Comments Project webpage: https://tri-ml.github.io/AnyView/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10072 2026-01-26 cs.CV 57%

ToonifyGB: StyleGAN-based Gaussian Blendshapes for 3D Stylized Head Avatars

ToonifyGB: 基于StyleGAN的高斯混合形状用于3D风格化头身人偶

Rui-Yang Ju, Sheng-Yen Huang, Yi-Ping Hung

机构 * Graduate Institute of Networking and Multimedia(网络与多媒体研究生院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ToonifyGB通过改进的StyleGAN生成风格化视频并结合高斯混合形状,实现高效渲染多样化风格化的3D头身人偶。

Comments 2-Page Version Accepted as a Poster at IEEE VR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14037 2026-01-22 cs.CV 57%

Human detectors are surprisingly powerful reward models

人类检测器出人意料地强大

Kumar Ashutosh, XuDong Wang, Xi Yin, Kristen Grauman, Adam Polyak, Ishan Misra, Rohit Girdhar

机构 * Meta University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出 HuDA 模型,通过简单奖励函数提升视频生成中的人体运动质量,胜率高达 73%。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14250 2026-01-21 cs.CV 57%

OmniTransfer: All-in-one Framework for Spatio-temporal Video Transfer

OmniTransfer: 一种用于时空视频转换的综合框架

Pengze Zhang, Yanze Wu, Mengtian Li, Xu Bai, Songtao Zhao, Fulong Ye, Chong Mou, Xinghui Li, Zhuowei Chen, Qian He, Mingyuan Gao

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 OmniTransfer通过统一框架实现灵活的高保真视频生成,结合多视角和时间线索提升转换性能。

Comments Github Page: https://pangzecheung.github.io/OmniTransfer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11194 2026-01-19 cs.CV 57%

ATATA: One Algorithm to Align Them All

ATATA:一切对齐的统一算法

Boyi Pang, Savva Ignatyev, Vladimir Ippolitov, Ramil Khafizov, Yurii Melnik, Oleg Voynov, Maksim Nakhodnov, Aibek Alanov, Xiaopeng Fan, Peter Wonka, Evgeny Burnaev

机构 * Harbin Institute of Technology(哈尔滨工业大学) Applied AI Institute(应用人工智能研究所) AXXX FusionBrain Lab(融合大脑实验室) MSU(莫斯科州立大学) Constructor University(建设大学) HSE University(高等经济大学) Peng Cheng Laboratory(鹏城实验室) HIT Suzhou Research Institute(哈尔滨工业大学苏州研究 institute) KAUST(科威特大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ATATA提出一种基于Rectified Flow模型的多模态算法,实现高效结构对齐的样本生成,提升图像、视频和3D生成的质量与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11087 2026-01-19 cs.CV 57%

PhysRVG: Physics-Aware Unified Reinforcement Learning for Video Generative Models

PhysRVG: 基于物理的视频生成模型统一强化学习

Qiyuan Zhang, Biao Gong, Shuai Tan, Zheng Zhang, Yujun Shen, Xing Zhu, Yuyuan Li, Kelu Yao, Chunhua Shen, Changqing Zou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang Lab(浙江实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhysRVG通过引入基于物理的强化学习范式,统一视频生成模型,直接在高维空间中强制物理碰撞规则,提升生成视频的物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02358 2026-01-19 cs.CV 57%

VINO: A Unified Visual Generator with Interleaved OmniModal Context

VINO:一个具有交错多模态上下文的统一视觉生成器

Junyi Chen, Tong He, Zhoujie Fu, Pengfei Wan, Kun Gai, Weicai Ye

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 VINO通过统一的视觉生成框架实现图像和视频的生成与编辑,利用交错多模态上下文条件处理,提升多任务视觉创作能力。

Comments Project page: https://sotamak1r.github.io/VINO-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10061 2026-01-16 cs.CV cs.AI 57%

CoF-T2I: Video Models as Pure Visual Reasoners for Text-to-Image Generation

CoF-T2I: 视频模型作为纯视觉推理器用于文本到图像生成

Chengzhuo Tong, Mingkun Chang, Shenglong Zhang, Yuran Wang, Cheng Liang, Zhizheng Zhao, Ruichuan An, Bohan Zeng, Yang Shi, Yifan Dai, Ziming Zhao, Guanbin Li, Pengfei Wan, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 CoF-T2I通过引入链式帧推理提升文本到图像生成的质量,通过逐步视觉细化和显式推理步骤实现高质量图像生成。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07832 2026-01-15 cs.CV cs.AI 57%

MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head

MHLA: 通过令牌级多头恢复线性注意力的表达性

Kewei Zhang, Ye Huang, Yufan Deng, Jincheng Yu, Junsong Chen, Huan Ling, Enze Xie, Daquan Zhou

机构 * Peking University(北京大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MHLA通过令牌级多头机制恢复线性注意力的表达性,提升多个领域任务性能

Comments Code: https://github.com/DAGroup-PKU/MHLA/ Project website: https://dagroup-pku.github.io/MHLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02785 2026-01-07 cs.CV 57%

DreamStyle: A Unified Framework for Video Stylization

DreamStyle: 视频风格化的一个统一框架

Mengtian Li, Jinshu Chen, Songtao Zhao, Wanquan Feng, Pengqi Tu, Qian He

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 DreamStyle通过统一框架支持文本、风格图像和第一帧引导的视频风格化,提升风格一致性和视频质量。

Comments Github Page: https://lemonsky1995.github.io/dreamstyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02204 2026-01-06 cs.CV cs.AI 57%

NextFlow: Unified Sequential Modeling Activates Multimodal Understanding and Generation

NextFlow:统一的序列建模激活多模态理解和生成

Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng Dong, Shikun Sun, Xian Li, Xu Wang, Yi Jiang, Hu Ye, Bo Chen, Yiming Gao, Peng Liu, Akide Liu, Zhipeng Yang, Qili Deng, Linjie Xing, Jiyang Liu, Zhao Wang, Yang Zhou, Mingcong Liu, Yi Zhang, Qian He, Xiwei Hu, Zhongqi Qi, Jie Shao, Zhiye Fu, Shuai Wang, Fangmin Chen, Xuezhi Chai, Zhihua Wu, Yitong Wang, Zehuan Yuan, Daniel K. Du, Xinglong Wu

机构 * TsingHua University(清华大学) Monash University(墨尔本大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 NextFlow通过统一的自回归架构实现多模态理解和生成,以高效生成高分辨率图像并提升视觉质量。

Comments Project page: https://github.com/ByteVisionLab/NextFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04888 2026-01-06 cs.CV 57%

Training-Free Video Editing via Optical Flow-Enhanced Score Distillation

无需训练的视频编辑 via 光流增强的分数蒸馏

Lianghan Zhu, Yanqi Bao, Jing Huo, Jing Wu, Yu-Kun Lai, Wenbin Li, Yang Gao

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 本研究提出基于预训练文本到视频模型的分数蒸馏方法,通过迭代优化和光流增强技术,解决无需训练视频编辑中的内容保留与时间连续性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24026 2026-01-01 cs.CV cs.AI 57%

PipeFlow: Pipelined Processing and Motion-Aware Frame Selection for Long-Form Video Editing

PipeFlow: 管道处理与运动感知帧选择用于长格式视频编辑

Mustafa Munir, Md Mostafijur Rahman, Kartikeya Bhardwaj, Paul Whatmough, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Qualcomm AI Research(高通人工智能研究)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 PipeFlow通过运动感知帧选择和流水线任务调度,实现长格式视频编辑的高效处理,相比现有方法速度提升达9.6至31.7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20000 2026-01-01 cs.CV 57%

Few-Shot-Based Modular Image-to-Video Adapter for Diffusion Models

基于少样本的模块化图像到视频适配器用于扩散模型

Zhenhao Li, Shaohan Yi, Zheng Liu, Leonartinus Gao, Minh Ngoc Le, Ambrose Ling, Zhuoran Wang, Md Amirul Islam, Zhixiang Chi, Yuanhao Yu

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) University of Waterloo(滑铁卢大学) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出MIVA,一种轻量级模块化适配器,用于在扩散模型中实现更精确的运动控制,同时保持或提升生成质量。

Comments GitHub page: https://github.com/yishaohan/MIVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22096 2025-12-29 cs.CV 57%

Yume-1.5: A Text-Controlled Interactive World Generation Model

Yume-1.5:一种文本控制的交互式世界生成模型

Xiaofeng Mao, Zhen Li, Chuanhao Li, Xiaojie Xu, Kaining Ying, Tong He, Jiangmiao Pang, Yu Qiao, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Yume-1.5通过文本控制和高效框架生成交互式连续世界,解决实时性能与文本控制能力的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19949 2025-12-24 cs.CV cs.AI 57%

How Much 3D Do Video Foundation Models Encode?

视频基础模型编码多少三维信息?

Zixuan Huang, Xiang Li, Zhaoyang Lv, James M. Rehg

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Impossible, Inc(Impossible公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文研究了视频基础模型对3D世界的理解程度,提出了一种模型无关的框架来评估不同模型的3D意识,并发现最先进的视频生成模型在无3D训练数据的情况下也能表现出超越专门3D任务模型的理解能力。

Comments Project Page: https://vidfm-3d-probe.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13507 2025-12-24 cs.CV 57%

Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model

Seedance 1.5 pro: 一种原生音频视频联合生成基础模型

Team Seedance, Heyi Chen, Siyan Chen, Xin Chen, Yanfei Chen, Ying Chen, Zhuo Chen, Feng Cheng, Tianheng Cheng, Xinqi Cheng, Xuyan Chi, Jian Cong, Jing Cui, Qinpeng Cui, Qide Dong, Junliang Fan, Jing Fang, Zetao Fang, Chengjian Feng, Han Feng, Mingyuan Gao, Yu Gao, Dong Guo, Qiushan Guo, Boyang Hao, Qingkai Hao, Bibo He, Qian He, Tuyen Hoang, Ruoqing Hu, Xi Hu, Weilin Huang, Zhaoyang Huang, Zhongyi Huang, Donglei Ji, Siqi Jiang, Wei Jiang, Yunpu Jiang, Zhuo Jiang, Ashley Kim, Jianan Kong, Zhichao Lai, Shanshan Lao, Yichong Leng, Ai Li, Feiya Li, Gen Li, Huixia Li, JiaShi Li, Liang Li, Ming Li, Shanshan Li, Tao Li, Xian Li, Xiaojie Li, Xiaoyang Li, Xingxing Li, Yameng Li, Yifu Li, Yiying Li, Chao Liang, Han Liang, Jianzhong Liang, Ying Liang, Zhiqiang Liang, Wang Liao, Yalin Liao, Heng Lin, Kengyu Lin, Shanchuan Lin, Xi Lin, Zhijie Lin, Feng Ling, Fangfang Liu, Gaohong Liu, Jiawei Liu, Jie Liu, Jihao Liu, Shouda Liu, Shu Liu, Sichao Liu, Songwei Liu, Xin Liu, Xue Liu, Yibo Liu, Zikun Liu, Zuxi Liu, Junlin Lyu, Lecheng Lyu, Qian Lyu, Han Mu, Xiaonan Nie, Jingzhe Ning, Xitong Pan, Yanghua Peng, Lianke Qin, Xueqiong Qu, Yuxi Ren, Kai Shen, Guang Shi, Lei Shi, Yan Song, Yinglong Song, Fan Sun, Li Sun, Renfei Sun, Yan Sun, Zeyu Sun, Wenjing Tang, Yaxue Tang, Zirui Tao, Feng Wang, Furui Wang, Jinran Wang, Junkai Wang, Ke Wang, Kexin Wang, Qingyi Wang, Rui Wang, Sen Wang, Shuai Wang, Tingru Wang, Weichen Wang, Xin Wang, Yanhui Wang, Yue Wang, Yuping Wang, Yuxuan Wang, Ziyu Wang, Guoqiang Wei, Wanru Wei, Di Wu, Guohong Wu, Hanjie Wu, Jian Wu, Jie Wu, Ruolan Wu, Xinglong Wu, Yonghui Wu, Ruiqi Xia, Liang Xiang, Fei Xiao, XueFeng Xiao, Pan Xie, Shuangyi Xie, Shuang Xu, Jinlan Xue, Shen Yan, Bangbang Yang, Ceyuan Yang, Jiaqi Yang, Runkai Yang, Tao Yang, Yang Yang, Yihang Yang, ZhiXian Yang, Ziyan Yang, Songting Yao, Yifan Yao, Zilyu Ye, Bowen Yu, Jian Yu, Chujie Yuan, Linxiao Yuan, Sichun Zeng, Weihong Zeng, Xuejiao Zeng, Yan Zeng, Chuntao Zhang, Heng Zhang, Jingjie Zhang, Kuo Zhang, Liang Zhang, Liying Zhang, Manlin Zhang, Ting Zhang, Weida Zhang, Xiaohe Zhang, Xinyan Zhang, Yan Zhang, Yuan Zhang, Zixiang Zhang, Fengxuan Zhao, Huating Zhao, Yang Zhao, Hao Zheng, Jianbin Zheng, Xiaozheng Zheng, Yangyang Zheng, Yijie Zheng, Jiexin Zhou, Jiahui Zhu, Kuan Zhu, Shenhan Zhu, Wenjia Zhu, Benhui Zou, Feilong Zuo

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Seedance 1.5 pro是一款专为原生音频视频联合生成设计的基础模型,通过双分支扩散变压器架构实现高质量生成,支持多语言唇形同步和动态摄像机控制,提升专业内容创作效率。

Comments Seedance 1.5 pro Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17152 2025-12-22 cs.CV 57%

PhysFire-WM: A Physics-Informed World Model for Emulating Fire Spread Dynamics

PhysFire-WM: 一种融合物理信息的世界模型用于模拟火灾扩散动力学

Nan Zhou, Huandong Wang, Jiahao Li, Yang Li, Xiao-Ping Zhang, Yong Li, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 PhysFire-WM通过融合物理信息和跨任务协作训练策略,提升火灾扩散预测的物理真实性和几何准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16920 2025-12-19 cs.CV cs.AI 57%

EasyV2V: A High-quality Instruction-based Video Editing Framework

EasyV2V: 一种高质量的基于指令的视频编辑框架

Jinjie Mai, Chaoyang Wang, Guocheng Gordon Qian, Willi Menapace, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Ashkan Mirzaei

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 EasyV2V通过简化设计和灵活输入实现高质量视频编辑,超越现有系统。

Comments Project page: https://snap-research.github.io/easyv2v/

详情

展开后加载摘要…

URL PDF HTML 收藏