arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2608.15522 2026-08-18 cs.CV 新提交 70%

Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention

基于同步感知跨模态稀疏注意力的高效视听生成

Shengchuan Gao, Teng Hu, Bohao Feng, Luchen Li, Wenqiang Wang, Hongqian Deng, Ran Yi

机构 * Alibaba Group(阿里巴巴集团) Alibaba Cloud Computing(阿里巴巴云计算) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出同步感知加速框架,通过受保护的稀疏注意力策略在保留视听生成质量与同步性的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13391 2026-08-14 cs.CV 新提交 70%

Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation

上下文匹配蒸馏:用于自回归视频蒸馏的教师因果性

Hmrishav Bandyopadhyay, Xuanchi Ren, Zijian Huang, Jay Zhangjie Wu, Tianshi Cao, Ruilong Li, Bryan Chu, Sanja Fidler, Yi-Zhe Song, Zian Wang

机构 * NVIDIA(英伟达) University of Surrey(萨里大学)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出上下文匹配蒸馏(CMD)框架,解决现有视频蒸馏中教师监督与学生因果信息集不一致的问题,实现了自回归视频生成的最先进性能及对相机控制的更好依从性。

Comments Project Page: https://hmrishavbandy.github.io/cmd-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11013 2026-08-12 cs.CV 新提交 70%

Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning

观看合成视频:针对零样本视频字幕生成的视觉合成跨模态表征对齐

Liangyu Fu, Junbo Wang, Yuke Li, Ya Jing, Xuecheng Wu, Zhiyong Wang

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Information Science and Technology, Beijing University of Technology(北京工业大学信息科学与技术学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出WSV零样本视频字幕生成框架,通过文本到视频生成模型、抛光器、提示器弥合跨模态差距,在三个公开数据集上取得了B@4 52、CIDEr 95.7的成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10519 2026-08-12 cs.CV 新提交 70%

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

SparSTAR:用于时空自回归视频合成的稀疏注意力机制

Jongbeom Lee, Hyunwoo Yu, Jincheol Yang, Jaemin Choi, Suk-Ju Kang

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09449 2026-08-12 cs.CV 版本更新 70%

Sekai2: From World Exploration to Interactive World Modeling

Sekai2:从世界探索到交互式世界建模

Kang He, Wenshuo Peng, Zihui Gao, Jiaming Tan, Kaipeng Zhang, Yongtao Ge

机构 * Alaya Lab(Alaya实验室) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 研究人员推出多源真实世界视频数据集Sekai2,其具备丰富观测数据与标注,可用于长时程视频生成、相机可控合成及交互式世界模型预训练。

Comments Sekai2 dataset technical report. Developed at Alaya Lab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06770 2026-08-10 cs.AI cs.CV 新提交 70%

Surg-UniWorld: A Unified Surgical World Model with Multimodal Control Experts

Surg-UniWorld:具有多模态控制专家的统一外科世界模型

Rulin Zhou, Wanhao Liu, Guoheng Ma, Liangjin Shao, Qiujie Song, Yidu Wang, Guankun Wang, Tong Chen, Long Bai, Luping Zhou, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) the University of Sydney(悉尼大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本研究提出Surg-UniWorld统一外科世界模型,构建Chlec80-SurgWAM基准,经实验证实其在可控外科视频生成相关指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00079 2026-08-04 cs.CV cs.SD 新提交 70%

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation

LeapTalk:打破说话头生成中的延迟-质量权衡

Rongxiang Zhang, Songhua Liu

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 LeapTalk是一种新型说话头生成框架,通过单步前向传播结合数据到数据传输、异质蒸馏与音频驱动无分类器引导,实现了200 FPS的稳定实时生成,打破了延迟-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14686 2026-08-04 cs.CV cs.AI 版本更新 70%

MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model

MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现

Jinguang Tong, Jinbo Wu, Kaisiyuan Wang, Zhelun Shen, Xuan Huang, Mochu Xiang, Xuesong Li, Yingying Li, Haocheng Feng, Chen Zhao, Hang Zhou, Wei He, Chuong Nguyen, Jingdong Wang, Hongdong Li

专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。

Comments Project page: https://mvhoi.hirotong.fun

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05394 2026-07-27 cs.CV 版本更新 70%

Delving into Latent Spectral Biasing of Video VAEs for Superior Diffusability

深入探究视频VAE的潜在频谱偏置以实现更优的可扩散性

Shizhan Liu, Xinran Deng, Zhuoyi Yang, Jiayan Teng, Xiaotao Gu, Jie Tang

机构 * Zhipu AI, Beijing, China(智谱AI,北京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文通过统计分析发现视频VAE潜在空间的频谱特性对扩散训练至关重要,提出局部相关正则化和潜在掩码重建两种轻量级正则化器,实现3倍收敛加速和10%视频奖励提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12035 2026-07-22 cs.AR cs.CV 版本更新 70%

Timeripple: Accelerating vDiTs by Understanding the Spatio-Temporal Correlations in Latent Space

Timeripple:通过理解潜在空间中的时空相关性加速视频扩散变换器

Wenxuan Miao, Yulin Sun, Aiyue Chen, Jing Lin, Yiwu Yao, Yiming Gan, Jieru Zhao, Jingwen Leng, Minyi Guo, Yu Feng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Qizhi Institute(上海启智研究院) Huawei Technologies Co.,Ltd(华为技术有限公司) Institute of Computing Technology, Chinese Academy of Science(中国科学院计算技术研究所)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对视频生成中vDiT模型推理延迟问题,利用潜在空间时空相关性,提出轻量级自适应重用策略,通过重用相关令牌部分注意力分数近似计算,相比现有技术计算节省85%,且视频质量损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交 70%

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-07-16 cs.CV 新提交 70%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video understanding(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13336 2026-07-16 cs.CV cs.CR cs.LG 新提交 70%

Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization

深入探讨统一视频保护在图像到视频和基于微调的定制方面的时间挑战

Yuxin Huang, Ziming Hong, Mingming Gong, Wanyu Wang, Jing Zhang, Tongliang Liu

机构 * The University of Sydney(悉尼大学) University of Melbourne(墨尔本大学) City University of Hong Kong(香港城市大学) Wuhan University(武汉大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究针对基于扩散模型的视频定制引发的隐私等保护问题,提出TC-UAP方法,通过优化身份级多帧UAP并引入相关时间建模和损失,使其在时间上一致且鲁棒,在多种视频定制及攻击下实现强身份保护。

Comments This work provides a basis for the ECCV 2026 LifeGenIP Challenge on Unlearnable Videos against Diffusion-based Customization. Challenge page: https://lifegenip.cc/competition. Evaluation code: ECCV26_LifeGenIP_starting_kit" target="_blank" rel="noopener">https://github.com/tmllab/ECCV26_LifeGenIP_starting_kit. Project page: https://saythe17.github.io/TC-UAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08766 2026-07-10 cs.CV 新提交 70%

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators

OPSD-V:用于训练后少步自回归视频生成器的策略内自蒸馏

Hongyu Liu, Chun Wang, Feng Gao, Xuanhua He, Yue Ma, Ziyu Wan, Yong Zhang, Xiaoming Wei, Qifeng Chen

机构 * Meituan(美团) HKUST(香港科技大学) City University of Hong Kong(香港城市大学)

专题命中 视频生成 :video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对训练后少步自回归视频生成器存在的问题,提出OPSD-V策略内自蒸馏范式。通过引入真实长视频数据提供监督,学生和教师模型按特定方式运行,应用该范式于相关模型后,实验及用户研究表明其在多方面有改进且更受青睐。

Comments Project page: https://meigen-ai.github.io/OPSD-V ; Code: https://github.com/MeiGen-AI/OPSD-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13030 2026-07-08 cs.CV 版本更新 70%

Generative Refinement Networks for Visual Synthesis

生成细化网络用于视觉合成

Jian Han, Jinlai Liu, Jiahuan Wang, Bingyue Peng, Zehuan Yuan

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出生成细化网络(GRN),通过近无损分层二进制量化解决离散化瓶颈,结合全局细化机制和熵引导采样策略,提升图像生成质量与效率。

Comments code: https://github.com/bytedance/GRN

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05672 2026-07-07 cs.CV cs.AI cs.LG 版本更新 70%

InverseCrafter: Efficient Video ReCapture as a Latent Domain Inverse Problem

InverseCrafter:作为潜在域逆问题的高效视频重新捕捉

Yeobin Hong, Suhyeon Lee, Hyungjin Chung, Jong Chul Ye

机构 * Graduate School of AI, KAIST, South Korea(韩国釜山国立大学人工智能研究生院) EverEx, South Korea(韩国EverEx公司) Korea University, South Korea(韩国国立庆熙大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出InverseCrafter框架,将新视角视频生成转化为潜在空间基于图像修复的逆问题,通过轻量级潜在掩码编码器建立算子等价,无需标注4D训练数据,实现高效合成与编辑。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13546 2026-07-07 cs.CV 版本更新 70%

NABLA: Neighborhood Adaptive Block-Level Attention

$\nabla$NABLA:邻域自适应块级注意力

Dmitrii Mikhailov, Aleksey Letunovskiy, Maria Kovaleva, Vladimir Arkhipkin, Vladimir Korviakov, Vladimir Polovnikov, Viacheslav Vasilev, Evelina Sidorova, Denis Dimitrov

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出NABLA,一种邻域自适应块级注意力机制,通过自适应稀疏性驱动阈值减少计算开销,保持生成质量,无需定制低层运算符,可无缝集成PyTorch的Flex Attention。实验表明,NABLA在训练和推理速度上提升2.7倍,几乎不牺牲定量指标和视觉质量。

Journal ref IEEE Access, vol. 14, pp. 64655-64665, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28128 2026-06-29 cs.CV cs.AI cs.RO 新提交 70%

PhysisForcing: Physics Reinforced World Simulator for Robotic Manipulation

PhysisForcing:面向机器人操作的物理增强世界模拟器

Peiwen Zhang, Yufan Deng, Shangkun Sun, Juncheng Ma, Duomin Wang, Jonas Du, Zilin Pan, Ye Huang, Hao Liang, Songyan Huang, Ruihua Zhang, Enze Xie, Ming-Yu Liu, Daquan Zhou

机构 * Peking University(北京大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 针对视频生成模型在机器人操作模拟中物理不稳定的问题,提出PhysisForcing框架,通过像素级轨迹对齐和语义级关系对齐损失联合优化,显著提升物理一致性,在多个基准上改进基础模型,并提高下游策略成功率。

Comments Github: https://github.com/DAGroup-PKU/PhysisForcing Project website: https://dagroup-pku.github.io/PhysisForcing.github.io/#

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26668 2026-06-26 cs.CV cs.AI 新提交 70%

Disco-LoRA: Disentangled Composition of Content, Style, and Motion for Multi-concept Video Customization

Disco-LoRA:内容、风格和运动的解耦组合用于多概念视频定制

Xuancheng Xu, Gengyun Jia, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Hefei University of Technology(合肥工业大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出Disco-LoRA框架,通过两阶段解耦和重组内容、风格和运动概念,实现多概念视频定制,并采用Z-score正则化协调LoRA权重分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22347 2026-06-23 cs.CV 新提交 70%

Customizing Video Portraits via Identity-ActionDecoupling

通过身份-动作解耦定制视频肖像

Junxiong Lin, Haoran Wang, Xinji Mai, Zeng Tao, Xuan Tong, Ivy Pan, Wenqiang Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出身份-动作解耦框架,通过身份解耦损失和文本对齐损失,无需微调即可生成保持身份一致且表情丰富的视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20707 2026-06-23 cs.CV cs.AI 新提交 70%

GEOPHYS: The Geometry of Physical Plausibility

GEOPHYS: 物理合理性的几何学

Christian Internò, Alexander Pondaven, Habon Issa, Fabio Pizzati, Francesco Pinto, Markus Olhofer, Ivan Laptev, Philip Torr, Eero P. Simoncelli, Barbara Hammer, David Klindt

机构 * Bielefeld University(比勒费尔德大学) University of Oxford(牛津大学) Cold Spring Harbor Laboratory(冷泉港实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Independent(独立作者) Honda Research Institute EU(本田欧洲研究院) New York University(纽约大学) Flatiron Institute, Simons Foundation(西蒙斯基金会熨斗研究所)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出GEOPHYS方法,利用冻结图像编码器的每帧嵌入的五个几何特征检测视频中的物理不合理性,在物理违反检测上达到SOTA,并作为验证器提升视频生成模型的物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19958 2026-06-19 cs.CV 新提交 70%

SketchKeyAnime: Reference-anchored Sparse Key-Sketch Animation Synthesis

SketchKeyAnime:基于参考锚点的稀疏关键草图动画合成

Meixi Li, Xianlin Zhang, Yue Zhang, Xueming Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出SketchKeyAnime视频扩散框架,通过双分支条件机制和可学习门控的草图交叉注意力,从单张参考RGB图像和稀疏关键草图生成结构可控、外观一致且时间连贯的动画,在Sakuga-42M数据集上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19495 2026-06-19 cs.CV 新提交 70%

LooseControlVideo: Directorial Video Control using Spatial Blocking

LooseControlVideo: 使用空间分块进行导演式视频控制

Shariq Farooq Bhat, Niloy J. Mitra, Kalyan Sunkavalli

机构 * Adobe Research(Adobe研究院)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出LooseControlVideo框架,通过稀疏定向3D框作为“分块”代理,实现文本到视频生成中多对象场景的直观布局与轨迹控制,显著优于现有2D框和流方法。

Comments Project page at https://shariqfarooq123.github.io/LooseControlVideo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16742 2026-06-16 cs.CV cs.AI 新提交 70%

Revealing Artifacts via Noise Amplification: A Novel Perspective for AI-Generated Video Detection

通过噪声放大揭示伪影:AI生成视频检测的新视角

Renxi Cheng, Jie Gui, Hongsong Wang

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室) Engineering Research Center of Blockchain Application, Supervision And Management (Southeast University), Ministry of Education(教育部区块链应用监管工程研究中心(东南大学)) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对AI生成视频检测难题,提出基于位平面的噪声放大方法,通过像素级强度增强、区域级空间放大和帧级时间聚合,在GenVidBench和HardGVD基准上超越现有方法。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09156 2026-06-09 cs.CV 新提交 70%

OmniGen-AR: AutoRegressive Any-to-Image Generation

OmniGen-AR: 自回归任意到图像生成

Junke Wang, Xun Wang, Qiushan Guo, Peize Sun, Weilin Huang, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Bytedance Seed(字节跳动Seed) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出统一自回归框架OmniGen-AR,通过共享视觉分词器和解耦因果注意力,支持文本、空间信号和视觉上下文等多种条件输入,在多项基准上达到最优或竞争性能。

Comments Accepted by NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01620 2026-06-02 cs.CV 70%

Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs

基于参考引导深度压缩VAE的流式说话人肖像视频实时生成

Sicheng Xu, Yu Deng, Shoukang Hu, Yichuan Wang, Yizhong Zhang, Zhan Chen, Jiaolong Yang, Baining Guo

机构 * Microsoft Research(微软研究院) Microsoft AI(微软人工智能)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种结合因果视频VAE和自回归潜在去噪模型的流式说话人肖像视频生成框架,通过参考图像引导实现实时高质量生成。

Comments CVPR 2026 (Highlight) Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08555 2026-05-28 cs.CV 70%

VideoCanvas: Unified Video Completion from Arbitrary Spatiotemporal Patches via In-Context Conditioning

VideoCanvas: 通过上下文条件化从任意时空补丁进行统一视频补全

Minghong Cai, Qiulin Wang, Zongli Ye, Wenze Liu, Quande Liu, Weicai Ye, Xintao Wang, Pengfei Wan, Kun Gai, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手技术有限公司Kling团队)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出VideoCanvas框架,通过混合条件化策略(空间上使用零填充全帧画布编码,时间上使用Temporal RoPE插值)实现任意时空视频补全的统一任务,无需修改或重新训练VAE。

Comments Project page: https://onevfall.github.io/project_page/videocanvas

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24509 2026-05-26 cs.CV cs.AI cs.GR cs.LG 70%

Φ-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation

Φ-Noise:基于相位噪声操作的无训练时间视频条件生成

Ofir Abramovich, Nadav Z. Cohen, Adi Rosenthal, Ariel Shamir

机构 * Canvas-Lab

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练的方法,通过将参考视频的低频相位信息注入扩散噪声潜变量,实现运动条件视频生成,无需修改模型架构或推理流程。

Comments Under Review; 26 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20309 2026-05-21 cs.CV cs.AI 70%

Tiny-Engram: Trigger-Indexed Concept Tables for Generative Vision

Tiny-Engram: 生成视觉中的触发索引概念表

Runyuan Cai, Yiming Wang, Yu Lin, Xiaodong Zeng

机构 * AutoArk-AI

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Tiny-Engram,一种紧凑的触发索引概念表,通过显式地为视觉记忆分配词汇地址和激活边界,实现对冻结图像和视频生成器中的概念的控制。该方法通过注册的n-gram匹配索引参数化每个概念,仅在匹配触发区域调节文本编码器的隐藏状态,从而在保持周围提示的组合控制的同时,将罕见触发短语绑定到目标身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16503 2026-05-20 cs.CV cs.AI 70%

Motif-Video 2B: Technical Report

Motif-Video 2B:技术报告

Junghwan Lim, Wai Ting Cheung, Minsu Ha, Beomgyu Kim, Taewhan Kim, Haesol Lee, Dongpin Oh, Jeesoo Lee, Taehyun Kim, Minjae Kim, Sungmin Lee, Hyeyeon Cho, Dahye Choi, Jaeheui Her, Jaeyeon Huh, Hanbin Jung, Changjin Kang, Dongseok Kim, Jangwoong Kim, Youngrok Kim, Hyukjin Kweon, Hongjoo Lee, Jeongdoo Lee, Junhyeok Lee, Eunhwan Park, Yeongjae Park, Bokki Ryu, Dongjoo Weon

机构 * Motif Technologies(Motif技术公司)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 该研究探讨在有限预算下是否能够训练出高质量的文本到视频生成模型,提出通过架构设计而非单纯扩大模型规模来提升性能,结合共享交叉注意力和三部分主干网络,实现了在较少参数和数据下的高质量视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏