arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-26 至 2026-05-26 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 11 篇

2605.24962 2026-05-26 cs.CV 85%

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Tempered Self-Similarity Alignment for Physically Plausible Video Generation

Manjin Kim, Suha Kwak, Minsu Cho

机构 * Pohang University of Science and Technology (POSTECH)(浦项科学技术大学)

专题命中 视频生成 :video generation(title,title_cn);分类 cs.CV

AI总结 提出Tempered Self-Similarity Alignment (TSA)损失函数,通过将视觉基础模型中的时空自相似性关系知识迁移到视频生成模型中,以改善视频的物理合理性。

Comments Accepted to the CVPR 2026 Workshop on Video Generative Models: Benchmarks and Evaluation (VGBE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25266 2026-05-26 cs.CV 83%

DeltaCam: Differential Intrinsic Camera Modeling for Video Generation

DeltaCam: 用于视频生成的差分内参相机建模

Debabrata Mandal, Zhihan Peng, Yujie Wang, Praneeth Chakravarthula

机构 * UNC, Chapel Hill USA(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出DeltaCam视频扩散框架,通过差分参数化神经相机适配器学习相对变化,实现焦距、光圈、ISO等内参的平滑可控视频生成,并扩展到真实场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25801 2026-05-26 cs.CV 79%

PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution

PixelWizard: 迈向高效高保真超大规模空间分辨率视频生成

Wenxue Li, Jingjing Ren, Peng Zhang, Tian Ye, Daiguo Zhou, Jian Luan, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MiLM Plus, Xiaomi Inc(小米公司MiLM Plus部门) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出PixelWizard框架,通过分层解耦全局结构建模与细节合成,并引入噪声跨度对齐捷径训练,实现超大规模分辨率视频的高效高保真生成,加速超过10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25659 2026-05-26 cs.CV 79%

StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration

StreamChar: 基于解耦编排的长时程流式角色音频-视频生成

Linrui Tian, Qi Wang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出StreamChar流式框架,通过LLM编排器与联合音频-视频DiT解耦长时程编排与短窗去噪,实现实时、稳定、高质量的角色动画生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26105 2026-05-26 cs.CV 74%

On-Policy Adversarial Flow Distillation for Autoregressive Video Generation

自回归视频生成中的策略对抗流蒸馏

Yang Luo, Shengju Qian, Xiaohang Tang, Zirui Zhu, Yong Liu, Xin Wang, Yang You

机构 * LIGHTSPEED University College London(伦敦大学学院)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出策略对抗流蒸馏(AFD)框架,通过策略内对抗性反馈和正向过程流匹配,实现从异构黑盒教师模型向自回归学生模型的高效蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10543 2026-05-26 cs.CV 74%

TIE: Time Interval Encoding for Video Generation over Events

TIE:面向事件视频生成的时间区间编码

Zhilei Shu, Shangwen Zhu, Zihang Liang, Xiaofan Li, Qianyu Peng, Xinyu Cui, Bo Ye, Yiming Li, Fan Cheng, Jian Zhao, Yang Cao, Zheng-Jun Zha, Ruili Feng

机构 * University of Science and Technology of China(中国科学技术大学) Matrix Team(Matrix团队) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The Pennsylvania State University(宾夕法尼亚州立大学) Zhongguancun Academy(中关村学院) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 提出时间区间编码(TIE),将旋转位置嵌入推广为区间感知形式,解决扩散变换器(DiT)在重叠事件视频生成中时间区间无法表示的问题,显著提升时间可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24509 2026-05-26 cs.CV cs.AI cs.GR cs.LG 70%

Φ-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation

Φ-Noise:基于相位噪声操作的无训练时间视频条件生成

Ofir Abramovich, Nadav Z. Cohen, Adi Rosenthal, Ariel Shamir

机构 * Canvas-Lab

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种无需训练的方法,通过将参考视频的低频相位信息注入扩散噪声潜变量,实现运动条件视频生成,无需修改模型架构或推理流程。

Comments Under Review; 26 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26113 2026-05-26 cs.RO cs.CV 57%

AnyScene: Towards Highly Controllable Driving Scene Generation at Anywhere and Beyond

AnyScene: 迈向高度可控的任意位置驾驶场景生成及超越

Haiming Zhang, Junfei Zhou, Feng Jiang, Jingzhong Li, Zhenglong Guo, Penglin Dai, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto(利汽车) Southwest Jiaotong University(西南交通大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出AnyScene框架,通过时空占用扩散Transformer和几何引导视图扩展模块,实现从BEV布局生成语义占用序列和参考无关的多视角驾驶视频,支持精确可控和长时生成。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25343 2026-05-26 cs.CV 57%

Toward Native Multimodal Modeling: A Roadmap

迈向原生多模态建模:路线图

Siyu An, Junru Lu, Junnan Dong, Qiufeng Wang, Yinghui Li, Weizhi Fei, Zichao Yu, Zheng Yuan, Biao Liu, Haopeng Wang, Renzhao Liang, Yixuan Yang, Yunhang Shen, Bo Ke, Keyu Chen, Linhao Luo, Difan Zou, Xiao Huang, Di Yin, Ruizhi Qiao, Xing Sun

机构 * Tencent Youtu Lab(腾讯优图实验室) Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Warwick(沃林汉大学) Monash University(墨尔本大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出从非原生多模态范式向原生多模态建模(NMM)过渡的正式路线图,通过输入-输出二元性分类现有模型,并系统探讨架构协调、数据整理、训练推理及评估的全栈工业级方案。

Comments 52 pages, 5 figures, 3 tables, ~300 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16229 2026-05-26 cs.LG 50%

Factored Latent Action World Models

因子化潜在动作世界模型

Zizhao Wang, Chang Shi, Jiaheng Hu, Kevin Rohling, Roberto Martín-Martín, Amy Zhang, Peter Stone

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(abstract)

AI总结 提出因子化潜在动作模型(FLAM),通过将场景分解为独立因子并学习各自的潜在动作,提升了无动作视频中多实体动态建模的准确性和视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11815 2026-05-26 cs.CY 50%

Video Deepfake Abuse: How Company Choices Predictably Shape Misuse Patterns

视频深度伪造滥用:公司选择如何可预测地塑造滥用模式

Max Kamachee, Stephen Casper, Michelle L. Ding, Rui-Jie Yew, Anka Reuel, Stella Biderman, Dylan Hadfield-Menell

专题命中 视频生成 :video generation(abstract)

AI总结 本文通过分析2025年视频生成模型,指出少数开放权重的模型成为生成逼真AIG-NCII视频的主要工具,并论证开发者与分发平台的责任,强调风险管理可显著影响未来滥用难度。

详情

展开后加载摘要…

URL PDF HTML 收藏