arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6771 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2606.24336 2026-07-01 cs.CV 新提交 57%

TIGER: Taming Identity, Geometry, and Generative Priors for High-Quality Face Video Restoration

TIGER:驯服身份、几何和生成先验以实现高质量人脸视频恢复

Yang Zhou, Wenxue Li, Peng Zhang, Yifei Chen, Fei Wang, Daiguo Zhou

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出TIGER框架,融合身份、几何和生成先验,通过解耦3D参数空间和一步整流流,解决人脸视频恢复中的身份偏移、视角纠缠和感知真实性问题,实现高保真、时间一致且高效的恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30045 2026-06-30 cs.CV 57%

Walking in the Implicit: Interactive World Exploration via Neural Scene Representation

行走于隐空间:通过神经场景表示进行交互式世界探索

Zhiqi Li, Chengrui Dong, Zhenhua Du, Hangning Zhou, Cong Qiu, Hailong Qin, Mu Yang, Dongxu Wei, Peidong Liu

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Afari Intelligent Drive(Afari智能驾驶)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出以场景为中心的交互式视频生成范式,将生成变量从帧隐变量改为可渲染的固定长度隐状态(神经隐式场景),通过紧凑场景状态随机转移和确定性姿态条件渲染实现长程一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28531 2026-06-30 cs.MM cs.CL 57%

A Good Talk Does not Look Like a Summary, It Teaches You! Measuring Takeaways from Paper-to-Video Talks

好的演讲不像摘要,它教你!衡量论文到视频演讲的收获

Ishani Mondal, Aparna Garimella, Ananya Sai, Pannaga Shivaswamy, Jordan Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 提出EffectivePresentationScorer框架,通过评估解释清晰度、背景概念引入和细节与贡献的关联,衡量论文讲解视频的教学质量,发现现有视频生成系统缺乏解释性。

Comments Under Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31603 2026-06-30 cs.CV cs.AI 57%

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models

Lumos-Nexus: 面向视频统一模型的高效频率桥接与同质潜在空间

Jiazheng Xing, Hangjie Yuan, Lingling Cai, Xinyu Liu, Yujie Wei, Fei Du, Tao Feng, Hai Ci, Jiasheng Tang, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Lumos-Nexus框架,通过两阶段训练和渐进频率桥接,在保持推理能力的同时显著提升视频生成保真度。

Comments ECCV 2026 Camera-Ready Version. Project page (https://jiazheng-xing.github.io/nexus-lumos-home/) and Code (https://github.com/alibaba-damo-academy/Lumos-Custom/) are available

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02918 2026-06-30 cs.CV 57%

Evaluating Newtonian Mechanics in Video Generative Models with Real Physical Systems

在视频生成模型中评估牛顿力学

Antonios Tragoudaras, Chenyu Zhang, Daniil Cherniavskii, Antonios Vozikis, Thijmen Nijdam, Derck W. E. Prinzhorn, Mark Bodracska, Nicu Sebe, Andrii Zadaianchuk, Efstratios Gavves

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Morpheus框架,通过真实物理系统评估视频生成模型对牛顿力学的理解能力,揭示当前模型在物理原理编码上的不足。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28026 2026-06-29 cs.CV 新提交 57%

EMOSH: Expressive Motion and Shape Disentanglement for Human Animation

EMOSH:用于人体动画的表现性运动与形状解耦

Dongbin Zhang, Hao Liu, Binquan Dai, Kangjie Chen, Chuming Wang, Chen Li, Jing Lyu, Haoqian Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出EMOSH框架,通过可表现人体模型解耦形状与姿态,结合粗细混合运动注入和空间对齐条件机制,实现高保真、可控的人体视频生成,解决运动-形状纠缠问题。

Comments Accepted to ECCV 2026, Project Page: https://eastbeanzhang.github.io/EMOSH/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26778 2026-06-26 cs.CV cs.LG 新提交 57%

LearniBridge: Learnable Calibration of Feature Caching for Diffusion Models Acceleration

LearniBridge: 用于扩散模型加速的特征缓存的可学习校准

Xuyue Huang, Zhe Chen, Wang Shen, Xiao-Ping Zhang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出LearniBridge,一种基于低秩共享子空间的可学习校准机制,通过轻量LoRA更新实现特征缓存的多时间步校准,仅需3-5个训练样本即可在图像和视频生成中实现高达5.87倍加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19193 2026-06-26 cs.CV 57%

How Far Are Video Models from True Multimodal Reasoning?

视频模型距离真正的多模态推理还有多远?

Xiaotian Zhang, Jianhui Wei, Yuan Wang, Jie Tan, Yichen Li, Yan Zhang, Ziyi Chen, Daoan Zhang, Dezhi YU, Wei Xu, Songtao Jiang, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出CLVG-Bench评估框架,通过上下文学习测试视频模型的零样本推理能力,揭示当前SOTA模型在逻辑推理和交互生成任务中表现不足,指出多模态推理和物理基础是关键瓶颈。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24799 2026-06-24 cs.CV cs.AI 新提交 57%

OrbitForge: Text-to-3D Scene Generation via Reconstruction-Anchored Video Synthesis

OrbitForge: 通过重建锚定的视频合成实现文本到3D场景生成

Chenrui Fan, Paolo Favaro

机构 * Computer Vision Group, Institute of Computer Science University of Bern(计算机视觉组,计算机科学研究所,伯恩大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出OrbitForge,利用冻结的视频先验和每提示高斯泼溅重建优化,将单个文本生成视频转换为规范闭轨3D场景,无需任务特定微调或分数蒸馏。

Comments 40 pages, 33 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05896 2026-06-24 cs.CV 版本更新 57%

Resonant Minds: Closed-Loop Social Avatars with Theory of Mind

共鸣心智:具备心智理论的闭环社交虚拟人

Jianxu Shangguan, Jing Xu, Hang Ye, Xiaoxuan Ma, Yizhou Wang, Jenq-Neng Hwang, Wentao Zhu

机构 * University of Washington(华盛顿大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Eastern Institute of Technology, Ningbo(宁波工程技术学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出一个闭环双智能体框架,通过整合感知、社会推理(基于心智理论)和多模态生成,实现具备社交智能的虚拟人,并在信息不对称数据集上取得优于全信息脚本模式的对话质量。

Comments Project page: https://resonantminds.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22835 2026-06-23 cs.CV cs.AI 新提交 57%

OrthoMotion:Disentangling Camera and Subject Motion via Geometry Semantics Orthogonal Attention

OrthoMotion:通过几何语义正交注意力解耦相机与主体运动

Zijie Meng

机构 * Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出OrthoMotion方法,通过将相机运动编码为几何通道(旋转位置嵌入相位旋转)和主体运动编码为语义通道(门控值注入交叉注意力),并利用正交正则化保证解耦,实现可控视频生成中相机与主体运动的独立控制,将串扰降低2.4倍以上。

Comments Accepted by SCA2026(poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22416 2026-06-23 cs.CV 新提交 57%

Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition

Gen2Balance:面向长尾视频动作识别的生成式平衡方法

Prajwal Gatti, Simon Jenni, Fabian Caba Heilbron, Dima Damen

机构 * University of Bristol(布里斯托大学) Adobe Research(Adobe 研究院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出Gen2Balance方法,利用文本到视频生成模型将长尾训练集平衡为真实与生成视频的混合,结合两阶段训练策略缓解域偏移,在长尾基准上显著提升动作识别准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15015 2026-06-19 cs.CV cs.AI 新提交 57%

NEXUS: Neural Energy Fields for Physically Consistent Contact-Rich 3D Object Dynamics

NEXUS: 用于物理一致的高接触3D物体动力学的神经能量场

Qizhen Ying, Guangming Wang, Yangchen Pan, Victor Adrian Prisacariu, Brian Sheil, Yixiong Jing

机构 * University of Oxford(牛津大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出神经能量场框架NEXUS,通过标量能量和耗散项建模保守与非保守动力学,提升高接触3D场景下的长时程轨迹精度并指导视频生成。

Comments 18 pages, 4 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10791 2026-06-19 eess.IV 版本更新 57%

Semantic Satellite Communications for Synchronized Audiovisual Reconstruction

面向同步视听重建的语义卫星通信

Fangyu Liu, Peiwen Jiang, Wenjin Wang, Xiao Li, Shi Jin

专题命中 视频生成 :video generation(abstract);分类 eess.IV

AI总结 提出自适应多模态语义传输系统,通过双流生成架构和动态关键帧更新机制,在带宽受限的卫星场景下实现高质量同步视听重建,显著降低带宽消耗并提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18943 2026-06-18 cs.CV 新提交 57%

Physics-IQ Verified

物理智力验证

Tim Rädsch, Yuki M Asano, Hilde Kuehne, Stefan Bauer, Priyank Jaini, Robert Geirhos, Carsten T. Lüth

机构 * Anates Labs(Anates实验室) Technical University of Munich(慕尼黑技术大学) University of Technology Nuremberg(纽伦堡技术大学) Tuebingen AI Center, University of Tuebingen(图宾根大学人工智能中心) Helmholtz AI, Munich(慕尼黑海德堡人工智能研究所) Google DeepMind research(谷歌DeepMind研究)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出Physics-IQ Verified基准,通过改进提示和地面真实质量及引入样本级评分系统,提升视频生成模型对物理现实的理解评估,验证结果表明基准提升了57.6%的样本和34.8%的提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16401 2026-06-16 cs.CV 新提交 57%

RGFVR: Reference-Guided Face Video Restoration with Flow Matching

RGFVR: 基于参考引导的流匹配人脸视频修复

Cem Eteke, Batuhan Tosun, Eckehard Steinbach

机构 * Chair of Media Technology, Munich Institute of Robotics and Machine Intelligence, School of Computation, Information, and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院慕尼黑机器人与机器智能研究所媒体技术教席)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出一种主体无关的参考引导框架,通过双模态感知-描述身份条件注入预训练流匹配文本到视频生成器,结合两阶段训练策略,在降采样、模糊、噪声和压缩伪影等退化下提升人脸视频修复的保真度、时间一致性和身份保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16317 2026-06-16 cs.CV 新提交 57%

Training-free sparse attention based on cumulative energy filtering

基于累积能量过滤的无训练稀疏注意力

Chunlu Li, Yixuan Pan, Bai Du, Zhenyuan Chen, Yanzhao Li, Hui Dong, Hui Wang, Zhiqiang Zou

机构 * Huawei Technologies(华为技术有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出动态阈值策略,在保持固定召回率的同时提高稀疏性,并与Flash Attention深度集成,无需额外掩码计算,在Wan 2.2上稀疏度从61.42%提升至82%,VBench指标下降小于5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15869 2026-06-16 cs.CV 新提交 57%

Metis: A Generalizable and Efficient World-Action Model for Autonomous Driving and Urban Navigation

Metis: 一种用于自动驾驶和城市导航的通用高效世界-动作模型

Jingyu Li, Zhe Liu, Dongnan Hu, Junjie Wu, Zipei Ma, Wenxiao Wu, Chao Han, Zhihui Hao, Zhikang Liu, Kun Zhan, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) The University of Hong Kong(香港大学) Tongji University(同济大学) Li Auto Inc.(理想汽车) Huazhong University of Science and Technology(华中科技大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Metis框架,通过解耦视频生成与动作预测,采用混合专家架构和不对称注意力掩码,实现高效推理与泛化,在多个导航基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13432 2026-06-12 cs.CV cs.AI 新提交 57%

OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data

OmniDirector: 无需配对数据的通用多镜头相机克隆

Jiwen Liu, Shujuan Li, Zhixue Fang, Xiaohan Li, Yan Zhou, Zijie Meng, Zhimin Zhang, Yawen Luo, Guoxin Zhang, Yu-Shen Liu, Pengfei Wan

机构 * Kuaishou Technology(快手科技) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出OmniDirector框架,通过将相机参数编码为网格运动视频,并利用百万级配对数据训练,实现无需交叉配对数据的多镜头相机运动克隆,具备卓越的控制性能。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 57%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11838 2026-06-11 cs.CV 新提交 57%

Plan-and-Verify Video Reward Reasoning with Spatio-Temporal Scene Graph Grounding

基于时空场景图基础的计划与验证视频奖励推理

Hyomin Kim, Junghye Kim, Joanie Hayoun Chung, Yoonjin Oh, Kyungjae Lee, Sungbin Lim, Sungwoong Kim

机构 * Korea University(高丽大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 提出SG-PVR视频奖励模型,通过计划-验证推理和时空场景图,系统验证提示中的每个条件,实现细粒度语义对齐,提升文本到视频生成的组合对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11187 2026-06-10 cs.CV 新提交 57%

Next Forcing: Causal World Modeling with Multi-Chunk Prediction

Next Forcing: 基于多块预测的因果世界建模

Gangwei Xu, Qihang Zhang, Jiaming Zhou, Xing Zhu, Yujun Shen, Xin Yang, Yinghao Xu

机构 * Robbyant HUST(华中科技大学) HKUST(香港科技大学) HKUST (GZ)(香港科技大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Next Forcing框架,通过多块预测训练目标加速视频生成模型收敛、提升精度并实现推理加速,在多个基准上取得最优结果。

Comments Project page: https://gangweix.github.io/next-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10988 2026-06-10 cs.CV cs.GR 新提交 57%

AnimaSpark: A Feed-Forward Method for Animating Arbitrary 3D Objects

AnimaSpark: 一种用于任意3D对象动画的前馈方法

Yiming Zhao, Haoyu Sun, Aoyu Wang

机构 * Bytedance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出AnimaSpark管道,通过将带骨骼的3D模型渲染为多层图像表示,输入视频生成模型,再提取2D关键点运动并提升至3D空间,实现类别无关的3D动画生成,在文本-运动对齐、运动质量和计算效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09828 2026-06-09 cs.CV 新提交 57%

Latent Spatial Memory for Video World Models

视频世界模型的潜在空间记忆

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。

Comments Project Page: https://aka.ms/latent-spatial-memory, Code: https://github.com/microsoft/LatentSpatialMemory

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08780 2026-06-09 cs.CV 新提交 57%

Beyond Consistency: Preserving Temporal Structure in Zero-Shot Video Editing

超越一致性:在零样本视频编辑中保留时间结构

Deyin Liu, Yisheng Ding, Zhe Jin, Xiatian Zhu, Anjan Dutta, Lin Wu

机构 * Anhui University(安徽大学) University of Surrey(萨里大学) University of Warwick(华威大学)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 提出一种零样本视频编辑方法,通过自适应分割视频片段、选取锚帧和令牌合并策略,首次显式保留源视频的时间结构,平衡编辑保真度与计算效率。

Journal ref Pattern Recognition, Vol. 180, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07967 2026-06-09 cs.CV 新提交 57%

DisCo: World Models with Discrete Camera Motion Control

DisCo: 具有离散相机运动控制的世界模型

Hongrui Huang, Junke Wang, Quanhao Li, Yu-Gang Jiang, Zuxuan Wu

机构 * Fudan University(复旦大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出DisCo,通过离散动作原语替代连续相机轨迹作为条件,解决可控视频生成中动作表示纠缠问题,提升动作跟随可靠性,并引入DisCoBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07345 2026-06-09 cs.CV cs.LG 版本更新 57%

Optimizing Few-Step Generation with Adaptive Matching Distillation

自适应匹配蒸馏优化少步生成

Lichen Bai, Zikai Zhou, Shitong Shao, Wenliang Zhong, Shuo Yang, Shuo Chen, Bojun Chen, Zeke Xie

机构 * xLeaF Lab, The Hong Kong University of Science(xLeaF实验室,香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学,深圳) School of Intelligence Science(智能科学学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出自适应匹配蒸馏(AMD),通过奖励代理检测并逃离禁止区域,结合结构信号分解和排斥景观锐化,提升少步生成模型的样本保真度和训练鲁棒性。

Comments 25 pages, 15 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05162 2026-06-04 cs.CV 57%

Controllable Dynamic 3D Shape Generation via 3D Trajectories and Text

基于3D轨迹和文本的可控动态3D形状生成

Jaeyeong Kim, Ines Kim, Jahyeok Koo, Seungryong Kim

机构 * KAIST AI Project(韩国科学技术院人工智能项目)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出T2Mo前馈框架,通过3D轨迹和文本条件生成可控动态3D形状,采用形状接地轨迹嵌入处理任意配置轨迹,实现空间精确跟随与全局语义一致。

Comments Project page: https://cvlab-kaist.github.io/T2Mo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19398 2026-06-04 cs.CV cs.AI 57%

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

重新平衡参考帧主导性以改善图像到视频模型中的运动

Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

机构 * Yonsei University(延世大学) GIST(韩国科学技术院) Adobe Research(Adobe研究)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 针对图像到视频模型生成视频过于静态的问题,提出无需训练且模型无关的DyMoS方法,通过重新平衡去噪初期生成帧对参考帧的注意力来增强运动,同时保持视觉质量和保真度。

Comments Preprint. Project page: https://sh0xed98b8.github.io/DyMoS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02575 2026-06-02 cs.CV 57%

From Zero to Hero: Training-Free Custom Concept Spawning in World Models

从零到英雄:世界模型中的免训练自定义概念生成

Kiymet Akdemir, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出SPAWN方法,利用图像到视频骨干网络的结构特性,通过交换参考帧锚点与外部概念潜变量,实现无需训练即可在世界模型中生成用户指定的视觉概念。

详情

展开后加载摘要…

URL PDF HTML 收藏