arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 208 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 208 篇

2608.13037 2026-08-14 cs.CV 新提交 89%

Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization

基于推理时无梯度优化的空间接地文本到视频生成

Guillaume Jeanneret, Mathis Koroglu, Hugo Caselles-Dupré, Arnaud Dapogny, Matthieu Cord

机构 * ISIR - Sorbonne Université(ISIR - 索邦大学) Obvious Research

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 针对文本到视频生成的空间可控性挑战,提出无训练无梯度的GATO-Vid方法,通过解析求解交叉注意力分数实现精确空间引导,在提升定位精度的同时降低计算开销。

Comments Final Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05976 2026-08-07 cs.CV 新提交 89%

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model

Diff-VF:基于扩散模型的免训练高质量长视频生成

Haoning Yang, Xinyuan Chen, Yaohui Wang, Guo Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出免训练的Diff-VF框架,通过三种互补策略及跳跃残差引导,实现高质量长视频生成,在时间一致性与动作多样性上优于现有基线。

Comments Accepted for publication in ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26529 2026-07-30 cs.CV 新提交 89%

CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling

CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成

Yuyang Huang, Yabo Chen, Wenrui Dai, Ziyang Zheng, Haibin Huang, Chi Zhang, Junni Zou, Hongkai Xiong, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract);text-to-video(abstract)

AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18789 2026-07-22 cs.CV 新提交 89%

Moving Alphabet: A Controlled Study of Training Data for Text-to-Video Generation

移动字母表:文本到视频生成训练数据的对照研究

Amber Yijia Zheng, Lu Liu, Raymond A. Yeh, Xi Yin

机构 * Meta Superintelligence Labs(Meta超智能实验室) Purdue University(普渡大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 研究文本到视频生成中数据分布和字幕质量对模型的影响,通过移动字母表测试平台进行对照实验,发现视频内容分布、字幕质量很关键,无分类器引导等可部分恢复模型,为相关模型开发提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01942 2026-08-04 cs.CV cs.CL cs.MM 新提交 88%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV、cs.MM

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments Project page:https://hanxjing.github.io/CultureVidBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26694 2026-07-30 cs.CV 新提交 88%

Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation

Visko Orbis 1.0:用于实时交互式长视频生成的实时模型

Xiangbo Gao, Siyuan Yang, Ping He, Mingyang Wu, Yuheng Wu, Yushen Zuo, Jiongze Yu, Ryan Cui, Hongyuan Hua, Devin Ma, Xiao Jin, Yubo Yuan, Qing Yin, Jie Yang, Zhengzhong Tu

专题命中 视频生成 :video generation(title,abstract);long video(title);text-to-video(abstract);分类 cs.CV

AI总结 Visko Orbis 1.0是一款实时交互式长视频生成模型,支持多类型生成任务与实时提示词切换,靠有界多尺度记忆实现长视频生成无明显漂移,在对比测试中获最优偏好与稳定性评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21027 2026-07-24 cs.CV 新提交 88%

GroupVideo: Multi-Identity Customized Text-to-Video Generation

GroupVideo:多身份定制文本到视频生成

Xinyang Song, Libin Wang, Jianxin Sun, Qi Li, Dandan Zheng, JingDong Chen, Zhenan Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Ant Group(蚂蚁集团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);video diffusion(abstract);分类 cs.CV

AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17279 2026-07-21 cs.CR cs.AI cs.MM 新提交 88%

Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models

在安全边界之间:利用时间一致性破解文本到视频生成模型

Xingkai Peng, Jun Jiang, Jiayang Liu, Kejiang Chen, Weiming Zhang

机构 * University of Science and Technology of China(科学技术大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.MM

AI总结 研究针对文本到视频模型的越狱攻击,提出结构化查询高效的BSB框架,利用时间一致性,通过在文本代理空间进行蒙特卡洛树搜索并结合视频级评估来校准结果,实验表明该方法超越现有基线,有效发现模型漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22370 2026-06-23 cs.CV 新提交 88%

Towards Error-Free Long Video Generation

迈向无错误的长视频生成

Shuning Chang, Weihua Chen, Jiasheng Tang, Hao Xu, Zeyu Zhang, Hangjie Yuan, Yu Lu, Ruigang Niu, Fan Wang, Bohan Zhuang, Yi Yang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出一种基于扩散模型的长视频生成框架,通过因果注意力、KV缓存和截断修正流技术解决误差累积和属性漂移问题,实现高质量、身份一致的单镜头长视频合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11969 2026-06-11 cs.CV 新提交 88%

SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation

SpecLoR: 面向运动连贯文本到视频生成的频谱前瞻矫正

Xu Zhang, Yu Lu, Ruijie Quan, Zhaozheng Chen, Bohan Wang, Yi Yang

机构 * ReLER, College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院ReLER实验室) Huawei Central Research Institute(华为中央研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 提出SpecLoR,一种即插即用的推理方法,通过前瞻预测和频域矫正减少文本到视频生成中的时空不一致性,在Wan2.2上显著提升运动连贯性且仅增加4次NFE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08091 2026-06-09 cs.CV 新提交 88%

VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation

VideoWeaver: 评估与进化智能体长视频生成技能

Jianhui Wei, Jie Tan, Hengchuan Zhu, Xiaotian Zhang, Yan Zhang, Ziyi Chen, Daoan Zhang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出VideoWeaver框架,让智能体自主组合基础技能生成视频,并设计智能体裁判评估过程与结果,通过技能进化算法提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03046 2026-08-05 cs.CV 新提交 86%

CAPE-T2V: Captioner-Anchored Prompt Enhancement toward Two-Sided Conditioning Alignment in Text-to-Video Generation

CAPE-T2V:面向文本到视频生成中双侧条件对齐的以字幕生成器为锚点的提示增强方法

Yizhuo Jia, Jingyun Hua, Yuanxing Zhang

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 该研究针对文本到视频生成中存在的PE-字幕 gap,提出CAPE-T2V框架,通过两步微调PE与DiT,在多个基准数据集上实现了更高的生成综合得分,有效缩小了训练与推理间的条件不匹配。

Comments Includes appendix; 11 figures. Project page: https://github.com/yizzz927/CAPE-T2V

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16947 2026-07-21 cs.CV 新提交 86%

When Physical Preferences Meet Semantic Constraints: Physical and Semantic Direct Preference Optimization for Text-to-Video Generation

当物理偏好遇到语义约束:用于文本到视频生成的物理和语义直接偏好优化

Siwei Meng, Yawei Luo, Shu Zhang, Ping Liu

机构 * University of Nevada, Reno(内华达大学雷诺分校) Zhejiang University(浙江大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 文本到视频生成模型存在物理合理性与语义一致性的矛盾,提出物理和语义直接偏好优化方法(PSDPO),通过调节偏好对贡献,限制语义漂移,实现更可靠平衡,实验验证其在提高物理合理性和保持语义一致性上优于基线和现有方法。

Comments This work is accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26058 2026-06-25 cs.CV 新提交 86%

DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation

DomainShuttle: 自由形式开放域主题驱动文本到视频生成

Nan Chen, Yiyang Cai, Rongchang Xie, Junwen Pan, Cheng Chen, Weinan Jia, Zhuowei Chen, Wen Zhou, Zhenbang Sun, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(title);分类 cs.CV

AI总结 提出DomainShuttle方法,通过Domain-MoT解耦视频与参考特征、Video-Reference DualRoPE实现精确主体空间建模及Cross-Pair Consistent Loss提取本质特征,在开放域视频个性化中同时实现高保真与生成灵活性。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25306 2026-06-25 cs.CV cs.AI 新提交 86%

Physics Question Scene Graph: Fine-grained Evaluation of Physical Plausibility in Text-to-Video Generation

物理问题场景图:文本到视频生成中物理合理性的细粒度评估

Atin Pothiraj, Jaemin Cho, Yue Zhang, Elias Stengel-Eskin, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) AI2(艾伦人工智能研究所) Johns Hopkins University(约翰霍普金斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。

Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14667 2026-06-15 cs.CV 新提交 86%

Memento: Reconstruct to Remember for Consistent Long Video Generation

Memento: 通过重建来记忆以实现一致的长视频生成

Xuan Wei, Longbin Ji, Guan Wang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Qingqi Hong

机构 * Xiamen University(厦门大学) ERNIE Team, Baidu Inc.(百度公司ERNIE团队)

专题命中 视频生成 :video generation(title,abstract);long video(title);分类 cs.CV

AI总结 提出Memento框架,通过主体重建引导和双查询记忆机制,解决长视频生成中主体一致性丢失问题,实现跨镜头连贯生成。

Comments Project page: https://ernie-research.github.io/Memento/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26004 2026-07-29 cs.CV cs.LG 新提交 85%

Parallel Decoding Distillation for Fast Image and Video Generation

用于快速图像和视频生成的并行解码蒸馏

Neta Shaul, Chao Liu, Arash Vahdat, Julius Berner

机构 * NVIDIA(英伟达) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对视频扩散或流模型生成计算昂贵问题,提出并行解码蒸馏方法PDD,兼容预训练模型,通过预测多去噪步骤加速生成,在多个数据集上达SOTA性能,提升视频多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20940 2026-07-24 cs.CV 新提交 85%

Ms. Forcing: Efficient Streaming Video Generation with Multi-Scale Patchification and Attention

Ms. Forcing:通过多尺度分块和注意力实现高效流视频生成

Zekun Li, Xiaoyan Cong, Hongyu Li, Zhiyang Dou, Chuan Guo, Abhay Mittal, Sizhe An, Srinath Sridhar

机构 * Brown University(布朗大学) Massachusetts Institute of Technology(麻省理工学院) Meta

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对流视频生成中传统方法的不足,提出Ms. Forcing范式,通过多尺度分块和注意力调整空间粒度,引入均匀噪声水平DMD减少不匹配,该方法提升了效率,在单个H200 GPU上性能显著优于Rolling Forcing。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02798 2026-07-07 cs.CV cs.GR 新提交 85%

Track the Noise, Move the World:3D-Grounded Motion-Consistent Noise for Controllable Video Generation

追踪噪声,移动世界:用于可控视频生成的3D地面运动一致噪声

Long Vu, Tan Ngo, Animesh Karnewar, Amir Habibian, Binh-Son Hua, Hung Bui, Minh Hoai Nguyen, Phong Nguyen-Ha

机构 * Qualcomm AI Research(高通人工智能研究中心) Trinity College Dublin(都柏林三一学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究如何在视频生成中实现对物体和相机运动的精确统一控制。核心方法是构建统一框架UniCaMo,直接构造扩散模型输入噪声。主要贡献是在视频质量和运动可控性上取得先进成果,且无需对基础模型做大改动。

Comments Project Page: https://phongnhhn.info/Unicamo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18478 2026-06-24 cs.CV 新提交 85%

Data-Forcing Distillation: Restoring Diversity and Fidelity in Few-Step Video Generation

数据强制蒸馏:恢复少步视频生成中的多样性和保真度

Siyi Chen, Shaowei Liu, Yixuan Jia, Zian Wang, Huan Ling, Qing Qu, Jun Gao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对分布匹配蒸馏(DMD)在少步视频生成中出现的模式坍塌和过饱和问题,提出数据强制蒸馏(DFD)框架,通过教师评分差异引导学生接近真实数据分布,仅需一行代码修改即可恢复多样性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18702 2026-06-18 cs.CV 新提交 85%

UniTemp: Unlocking Video Generation in Any Temporal Order via Bidirectional Distillation

UniTemp: 通过双向蒸馏实现任意时间顺序的视频生成

Lin Zhang, Sicheng Mo, Zefan Cai, Jinhong Lin, Zihao Lin, Jiuxiang Gu, Krishna Kumar Singh, Yuheng Li, Yin Li

机构 * University of Wisconsin Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe 研究院) University of California Los Angeles(加利福尼亚大学洛杉矶分校) University of California Davis(加利福尼亚大学戴维斯分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 提出UniTemp框架,通过双向蒸馏训练单个自回归模型,支持任意时间方向(前向、后向、中间插值)的视频生成,解决因果3D VAE在后向生成中的不连续性,提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14162 2026-06-15 cs.CV 新提交 85%

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

VideoWeave: 通过联合几何-视频建模解锁视频生成中的几何一致性

Xunzhi Xiang, Zixuan Duan, Yabo Chen, Zhengxuan Wei, Guiyu Zhang, Zixiao Gu, Zhe Gao, Haibin Huang, Chi Zhang, Qi Fan, Xuelong Li

机构 * Nanjing University(南京大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出VideoWeave,一种在潜在空间后训练框架,利用隐式几何模型特征约束生成分布,缓解几何重建误差,提升视频几何一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13035 2026-06-12 cs.CV cs.AI 新提交 85%

TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment

TetherCache: 基于门控召回与可信对齐的自回归长视频生成稳定性方法

Yu Meng, Xiangyang Luo, Letian Li, Wenyuan Jiang, Chen Gao, Xinlei Chen, Yong Li, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) D-INFK, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 提出TetherCache,一种无需训练、即插即用的缓存管理策略,通过门控召回(GRAB)和可信对齐编辑(TAME)缓解自回归视频扩散模型中的上下文漂移,实现稳定长视频生成。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18436 2026-07-22 cs.CV 新提交 84%

Surprise Forcing: What to Remember, When to Skip in Long Video Generation

惊喜强制:长视频生成中该记住什么、何时跳过

Shuwei Shi, Zhen Li, Muyao Niu, Chuanhao Li, Bo Zheng, Kaipeng Zhang, Yinqiang Zheng

机构 * Alaya Lab(阿莱雅实验室) The University of Tokyo(东京大学)

专题命中 视频生成 :video generation(title);long video(title);分类 cs.CV

AI总结 研究长视频生成中资源分配问题,提出惊喜强制框架,含惊喜门控内存库、基于优先级的替换和相关性感知路由,以及惊喜感知去噪,实验证明该框架提高了长时一致性、视觉质量并保持实时流吞吐量。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17985 2026-07-21 cs.CV cs.MM 新提交 84%

Keyframe-Anchored Identity Preservation for Sequential-Action Video Generation

用于序列动作视频生成的关键帧锚定身份保留

Zhenjie Liu, Binyan Chen, Hao Chen, Tong Pan, Shangfei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 针对身份保留文本到视频生成任务中主体身份保持和动作执行的挑战,提出无训练三阶段管道框架,包括动作感知提示优化、身份保留生成和身份感知推理增强,该方法在官方排行榜上排名第三,性能和通用性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00712 2026-07-02 cs.CV cs.MM 新提交 84%

Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption

面向内存高效的自回归视频生成:基于实例特定参数吸收

Xiaomeng Fu, Jia Li, Yiming Hu, Yong Wang, Hayden Kwok-Hay So, Jiao Dai, Xiangxiang Chu, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) The University of Hong Kong(香港大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 提出ISPA框架,通过将历史上下文吸收到模型权重中,将部分注意力层从全局注意力转换为局部注意力,在保持视觉质量的同时减少50%的KV缓存。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10933 2026-08-12 cs.CV 新提交 83%

SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense

SafeCA:用于文本到视频越狱防御的安全交叉注意力定位与调控

Siyuan Liang, Yupeng Qiu, Junfeng Fang, Rong-Cheng Tu, Jiaxing Huang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 SafeCA是一种特征级T2V越狱防御机制,通过分析交叉注意力特征差异提出,可降低主流模型越狱成功率约20%,仅增0.1s推理开销且保持语义一致性,提供架构级可部署防护范式。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10439 2026-08-12 cs.CV 新提交 83%

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

流强制:构建用于鲁棒流视频生成的统一训练轨迹

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics(地平线机器人) Anyverse Dynamics

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。

Comments 15 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06231 2026-08-07 cs.CV 新提交 83%

EmoWorld: A Decoupled Affective Field for Controllable Emotional Video Generation

EmoWorld:用于可控情感视频生成的解耦情感场

Bingyuan Wang, Baistan Zhyldyzbekov, Kunyu Feng, Zeyu Wang

专题命中 视频生成 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 EmoWorld是一种解耦情感场框架,通过VAS、SAS、TAS三个引导模块优化可控情感视频生成,在Wan2.2等基准上实现情感对齐、线索检测及过渡单调性提升,具备多骨干网络可移植性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29545 2026-08-03 cs.CV 新提交 83%

MoRoute: Dynamic Routing for In-Context Multimodal Video Generation

MoRoute:面向上下文多模态视频生成的动态路由

Chong Gao, Jie Ma, Zhan Peng, Chongxiao Wang, Haoxue Wu, Jun Liang, Guanbin Li, Jing Li

机构 * Sun Yat-sen University(中山大学) HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。

Comments Project page: https://orange-3dv-team.github.io/MoRoute/

详情

展开后加载摘要…

URL PDF HTML 收藏