arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2604.25427 2026-04-29 cs.CV 79%

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23690 2026-04-29 cs.CV 79%

SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation

SynMotion: 语义-视觉适应用于运动定制视频生成

Shuai Tan, Biao Gong, Yujie Wei, Shiwei Zhang, Zhuoxin Liu, Ke Ma, Yan Wang, Kecheng Zheng, Xing Zhu, Yujun Shen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团) Tongyi(通义) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Huazhong University of Science and Technology(华中科技大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SynMotion通过联合语义指导和视觉适应,解决视频生成中语义与视觉信息的平衡问题,提出双嵌入语义理解机制和参数高效运动适配器,提升运动细节和时间一致性。

Comments Project page: https://lucaria-academy.github.io/SynMotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20597 2026-04-28 cs.CV 79%

StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval

StructAlign:结构化跨模态对齐用于连续文本到视频检索

Shaokun Wang, Weili Guan, Jizhou Han, Jianlong Wu, Yupeng Hu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Xi’an Jiaotong University(西安交通大学) Shandong University(山东大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出StructAlign,通过结构化跨模态对齐方法解决连续文本到视频检索中的模态错位和特征漂移问题,提升模型持续学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21291 2026-04-24 cs.CV cs.AI 79%

Exploring the Role of Synthetic Data Augmentation in Controllable Human-Centric Video Generation

探索合成数据增强在可控人类中心视频生成中的作用

Yuanchen Fei, Yude Zou, Zejian Kang, Ming Li, Jiaying Zhou, Xiangru Huang

机构 * Hunan University(湖南大学) Westlake University(西湖大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-Sen University(中山大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文研究合成数据对可控人类视频生成的影响,提出基于扩散的框架实现细粒度控制,并通过实验揭示合成与真实数据的互补作用,为高效选择合成样本提升视频真实感提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13669 2026-04-23 cs.CV 79%

EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation

EchoTorrent: 向快速、持续和流式多模态视频生成迈进

Rang Meng, Weipeng Wu, Yuming Li, Chenguang Ma

机构 * Ant Group(蚂蚁集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出EchoTorrent框架,通过四重设计提升多模态视频生成的效率与稳定性,实现快速、持续和流式生成,增强时空一致性与音频唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18215 2026-04-22 cs.CV 79%

Memorize When Needed: Decoupled Memory Control for Spatially Consistent Long-Horizon Video Generation

按需记忆:用于空间一致长时视频生成的解耦记忆控制

Yanjun Guo, Zhengqiang Zhang, Pengfei Wang, Xinyue Liang, Zhiyuan Ma, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出解耦框架,分离记忆条件与生成过程,提升空间一致性并保持生成能力。通过轻量记忆分支和跨帧注意力机制,实现高效且高质量的长时视频生成。

Comments 24 pages, with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18348 2026-04-21 cs.CV cs.AI 79%

AdaCluster: Adaptive Query-Key Clustering for Sparse Attention in Video Generation

AdaCluster:用于视频生成中稀疏注意力的自适应查询-键聚类

Haoyue Tan, Shengnan Wang, Yulin Qiao, Juncheng Zhang, Youhui Bai, Ping Gong, Zewen Jin, Cheng Li

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Independent Researcher(独立研究员) University of Macau(澳门大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 针对视频扩散变换器的高推理延迟问题,提出AdaCluster框架,通过自适应聚类方法提升生成速度并保持精度。

Comments CVPR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19979 2026-04-21 cs.CV 79%

CamPVG: Camera-Controlled Panoramic Video Generation with Epipolar-Aware Diffusion

CamPVG:基于视图控制的全景视频生成与视图感知扩散

Chenhao Ji, Chaohui Yu, Junyao Gao, Fan Wang, Cairong Zhao

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里达摩院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出CamPVG,首个基于视图控制的全景视频生成框架,通过全景Plücker嵌入和视图感知模块提升生成视频的质量与一致性。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11804 2026-04-20 cs.CV 79%

OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation

OmniShow:统一多模态条件以生成人-物体交互视频

Donghao Zhou, Guisheng Liu, Hao Yang, Jiatong Li, Jingyu Lin, Xiaohu Huang, Yichen Liu, Xin Gao, Cunjian Chen, Shilei Wen, Chi-Wing Fu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniShow框架,统一文本、图像、音频和姿态多模态条件,解决人-物体交互视频生成中的可控性与质量平衡问题,通过统一通道条件和门控局部上下文注意力实现高效生成,建立HOIVG-Bench基准测试平台,取得多模态条件下的最佳性能。

Comments Project page: https://correr-zhou.github.io/OmniShow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23421 2026-04-20 cs.CV 79%

DriveLaW:Unifying Planning and Video Generation in a Latent Driving World

DriveLaW:在潜在驾驶世界中统一规划与视频生成

Tianze Xia, Yongkang Li, Lijun Zhou, Jingfeng Yao, Kaixin Xiong, Haiyang Sun, Bing Wang, Kun Ma, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DriveLaW通过统一视频生成与运动规划,提升自动驾驶中的预测与规划性能,实现视频生成与轨迹规划的一致性,取得新的state-of-the-art结果。

Comments 18 pages, 6 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14148 2026-04-16 cs.CV 79%

Seedance 2.0: Advancing Video Generation for World Complexity

Seedance 2.0:提升世界复杂度的视频生成

Team Seedance, De Chen, Liyang Chen, Xin Chen, Ying Chen, Zhuo Chen, Zhuowei Chen, Feng Cheng, Tianheng Cheng, Yufeng Cheng, Mojie Chi, Xuyan Chi, Jian Cong, Qinpeng Cui, Fei Ding, Qide Dong, Yujiao Du, Haojie Duanmu, Junliang Fan, Jiarui Fang, Jing Fang, Zetao Fang, Chengjian Feng, Yu Gao, Diandian Gu, Dong Guo, Hanzhong Guo, Qiushan Guo, Boyang Hao, Hongxiang Hao, Haoxun He, Jiaao He, Qian He, Tuyen Hoang, Heng Hu, Ruoqing Hu, Yuxiang Hu, Jiancheng Huang, Weilin Huang, Zhaoyang Huang, Zhongyi Huang, Jishuo Jin, Ming Jing, Ashley Kim, Shanshan Lao, Yichong Leng, Bingchuan Li, Gen Li, Haifeng Li, Huixia Li, Jiashi Li, Ming Li, Xiaojie Li, Xingxing Li, Yameng Li, Yiying Li, Yu Li, Yueyan Li, Chao Liang, Han Liang, Jianzhong Liang, Ying Liang, Wang Liao, J. H. Lien, Shanchuan Lin, Xi Lin, Feng Ling, Yue Ling, Fangfang Liu, Jiawei Liu, Jihao Liu, Jingtuo Liu, Shu Liu, Sichao Liu, Wei Liu, Xue Liu, Zuxi Liu, Ruijie Lu, Lecheng Lyu, Jingting Ma, Tianxiang Ma, Xiaonan Nie, Jingzhe Ning, Junjie Pan, Xitong Pan, Ronggui Peng, Xueqiong Qu, Yuxi Ren, Yuchen Shen, Guang Shi, Lei Shi, Yinglong Song, Fan Sun, Li Sun, Renfei Sun, Wenjing Tang, Boyang Tao, Zirui Tao, Dongliang Wang, Feng Wang, Hulin Wang, Ke Wang, Qingyi Wang, Rui Wang, Shuai Wang, Shulei Wang, Weichen Wang, Xuanda Wang, Yanhui Wang, Yue Wang, Yuping Wang, Yuxuan Wang, Zijie Wang, Ziyu Wang, Guoqiang Wei, Meng Wei, Di Wu, Guohong Wu, Hanjie Wu, Huachao Wu, Jian Wu, Jie Wu, Ruolan Wu, Shaojin Wu, Xiaohu Wu, Xinglong Wu, Yonghui Wu, Ruiqi Xia, Xin Xia, Xuefeng Xiao, Shuang Xu, Bangbang Yang, Jiaqi Yang, Runkai Yang, Tao Yang, Yihang Yang, Zhixian Yang, Ziyan Yang, Fulong Ye, Bingqian Yi, Xing Yin, Yongbin You, Linxiao Yuan, Weihong Zeng, Xuejiao Zeng, Yan Zeng, Siyu Zhai, Zhonghua Zhai, Bowen Zhang, Chenlin Zhang, Heng Zhang, Jun Zhang, Manlin Zhang, Peiyuan Zhang, Shuo Zhang, Xiaohe Zhang, Xiaoying Zhang, Xinyan Zhang, Xinyi Zhang, Yichi Zhang, Zixiang Zhang, Haiyu Zhao, Huating Zhao, Liming Zhao, Yian Zhao, Guangcong Zheng, Jianbin Zheng, Xiaozheng Zheng, Zerong Zheng, Kuan Zhu, Feilong Zuo

机构 * ByteDance Seed(字节跳动Seed)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Seedance 2.0通过统一高效架构提升多模态音频视频生成能力,支持文本、图像、音频、视频四种输入模态,提供高质量生成体验。

Comments Seedance 2.0 Model Card

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06168 2026-04-16 cs.CV cs.RO 79%

Action Images: End-to-End Policy Learning via Multiview Video Generation

动作图像:通过多视图视频生成实现端到端策略学习

Haoyu Zhen, Zixian Gao, Qiao Sun, Yilin Zhao, Yuncong Yang, Yilun Du, Pengsheng Guo, Tsun-Hsuan Wang, Yi-Ling Qiao, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) NVIDIA(英伟达) Harvard University(哈佛大学) Genesis AI

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Action Images,通过多视图视频生成实现策略学习,利用像素化的动作表示,使视频模型本身成为零样本策略,提升视频-动作联合生成质量。

Comments Project Page: https://actionimages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12309 2026-04-15 cs.CV 79%

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

通过3D基础先验实现逼真且一致的轨道视频生成

Rong Wang, Ruyi Zha, Ziang Cheng, Jiayu Yang, Pulak Purkait, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) Amazon(亚马逊)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出利用3D基础生成模型的丰富形状先验作为辅助约束,以生成几何逼真且一致的轨道视频,通过多尺度latent特征提升生成效率和形状真实感。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12251 2026-04-15 cs.CV 79%

ArtifactWorld: Scaling 3D Gaussian Splatting Artifact Restoration via Video Generation Models

ArtifactWorld: 通过视频生成模型扩展3D高斯散射体修复

Xinliang Wang, Yifeng Shi, Zhenyu Wu

机构 * Ke Holdings Inc.(凯控股公司) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家研究院) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 本文提出ArtifactWorld框架,通过系统数据扩展和双模型范式解决3DGS修复问题,利用视频扩散骨干网络和Artifact-Aware Triplet Fusion机制提升稀疏视图合成和3D重建性能。

Comments The second author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11788 2026-04-14 cs.CV 79%

HDR Video Generation via Latent Alignment with Logarithmic Encoding

通过潜变量对齐与对数编码实现HDR视频生成

Naomi Ken Korem, Mohamed Oumoumad, Harel Cain, Matan Ben Yosef, Urska Jelercic, Ofir Bibi, Yaron Inger, Or Patashnik, Daniel Cohen-Or

机构 * Lightricks Gear Productions Tel Aviv University(特拉维夫大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出通过利用预训练生成模型的视觉先验,采用对数编码实现HDR视频生成,无需重新训练编码器,通过轻量微调即可实现高质量HDR视频生成。

Comments https://HDR-LumiVid.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06964 2026-04-14 cs.CV 79%

Adversarial Video Promotion Against Text-to-Video Retrieval

对抗性视频推广对抗文本到视频检索

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Qian Li, Shuai Liu, Chao Shen

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出首个对抗性视频推广攻击,通过改进的模态细化方法提升黑盒转移能力,实验显示在多种场景下攻击效果显著,揭示了文本到视频检索的潜在漏洞。

Comments This paper has been accepted by TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08121 2026-04-10 cs.CV cs.AI 79%

Uni-ViGU: Towards Unified Video Generation and Understanding via A Diffusion-Based Video Generator

Uni-ViGU:通过基于扩散的视频生成器实现视频生成与理解的统一

Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能实验室) Fudan University(复旦大学) Independent Researcher(独立研究者) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Uni-ViGU通过基于扩散的视频生成器统一视频生成与理解,引入统一流方法和模态驱动的MoE框架,实现多模态生成与理解的协同优化。

Comments Page and Code: https://fr0zencrane.github.io/uni-vigu-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06010 2026-04-08 cs.CV 79%

OmniCamera: A Unified Framework for Multi-task Video Generation with Arbitrary Camera Control

OmniCamera:一个统一的多任务视频生成框架,支持任意相机控制

Yukun Wang, Ruihuang Li, Jiale Tao, Shiyuan Yang, Liyi Chen, Zhantao Yang, Handz, Yulan Guo, Shuai Shao, Qinglin Lu

机构 * Sun Yat-sen University(中山大学) Hunyuan, Tencent(腾讯混元) CityU(香港城市大学) PolyU(香港理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 OmniCamera通过显式解耦场景内容与相机运动,实现灵活的视频生成,提出混合数据集和双阶段课程协同训练策略,提升多任务学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07310 2026-04-08 cs.CV 79%

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

MATRIX:用于交互感知视频生成的遮罩跟踪对齐

Siyoon Jin, Seongchan Kim, Dahyun Chung, Jaeho Lee, Hyunwook Choi, Jisu Nam, Jiyoung Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MATRIX通过引入遮罩跟踪对齐方法,提升视频生成中交互感知能力,增强语义对齐与传播,减少漂移和幻觉。

Comments Project Page is available at: https://cvlab-kaist.github.io/MATRIX/, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL 79%

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24702 2026-04-07 cs.CV 79%

Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility

通过推理不合理的部分来增强视频生成的物理合理性

Yutong Hao, Chen Chen, Ajmal Saeed Mian, Chang Xu, Daochang Liu

机构 * University of Western Australia(西澳大利亚大学) University of Sydney(悉尼大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的框架,在推理阶段通过显式推理不合理性来提升视频生成的物理合理性,通过同步解耦引导策略和物理感知推理流程,有效抑制不合理内容,提升物理真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03738 2026-04-07 cs.CV 79%

Rethinking Position Embedding as a Context Controller for Multi-Reference and Multi-Shot Video Generation

重新思考位置嵌入作为多参考和多镜头视频生成的上下文控制器

Binyuan Huang, Yuning Lu, Weinan Jia, Hualiang Wang, Mu Liu, Daiqing Yang

机构 * Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PoCo方法,通过引入位置嵌入作为额外的上下文控制,解决多参考和多镜头视频生成中参考混淆问题,提升跨镜头一致性和参考保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16933 2026-04-06 cs.CV cs.LG 79%

Reward-Forcing: Autoregressive Video Generation with Reward Feedback

基于奖励的强制:利用奖励反馈的自回归视频生成

Jingran Zhang, Ning Li, Yuanhao Ban, Andrew Bai, Justin Cui

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种利用奖励信号指导生成的自回归视频生成方法,提升了生成效率和可扩展性,实验表明其性能与现有自回归模型相当,甚至在某些情况下超越了双向模型。

Comments https://openreview.net/forum?id=K8Qjsxxl7y&noteId=K8Qjsxxl7y

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24458 2026-04-03 cs.CV 79%

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

OmniWeaving:迈向统一视频生成的自由组合与推理

Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, Yue Wu, Liefeng Bo, Siliang Tang, Zhao Zhong

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniWeaving模型,通过大规模预训练数据学习多模态组合与推理能力,引入IntelligentVBench基准测试,展示其在开放源码统一视频生成中的领先性能。

Comments 32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22193 2026-04-03 cs.CV 79%

PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎

Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao

机构 * Peking University(北京大学) Tsinghua University(清华大学) BAAI(北京智源人工智能研究院) SJTU(上海交通大学) Eastern Institute of Technology(东方理工高等研究院) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。

Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08210 2026-04-02 cs.CV 79%

Video2LoRA: Unified Semantic-Controlled Video Generation via Per-Reference-Video LoRA

Video2LoRA:通过每参考视频LoRA实现统一的语义控制视频生成

Zexi Wu, Baolu Li, Jing Dai, Yiming Zhang, Yue Ma, Qinghe Wang, Xu Jia, Hongming Xu

机构 * Dalian University of Technology(大连理工大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Video2LoRA框架,通过轻量级超网络预测个性化LoRA权重,实现灵活高效的语义控制视频生成,模型重量小于150MB,具备良好的零样本泛化能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29931 2026-04-01 cs.CV 79%

Gloria: Consistent Character Video Generation via Content Anchors

Gloria:通过内容锚点实现一致的字符视频生成

Yuhang Yang, Fan Zhang, Huaijin Pi, Shuai Guo, Guowei Xu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, USTC(教育部类脑智能感知与认知重点实验室,中国科学技术大学) UNSW(新南威尔士大学) HKU(香港大学) UESTC(电子科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究提出通过紧凑的锚帧集表示字符视觉属性,结合两种机制提升生成一致性,实现高质量多视角一致的字符视频生成。

Comments Accepted by CVPR2026 Main, project: https://yyvhang.github.io/Gloria_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06537 2026-04-01 cs.CV cs.AI 79%

ProFashion: Prototype-guided Fashion Video Generation with Multiple Reference Images

ProFashion: 基于多参考图像的原型引导时尚视频生成

Xianghao Kong, Qiaosong Qi, Yuanbin Wang, Biaolong Chen, Aixi Zhang, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Taobao & Tmall Group(淘宝天猫集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出ProFashion框架,利用多参考图像提升视图一致性和时间一致性,通过姿态感知原型聚合器和流增强原型生成器改进时尚视频生成。

Comments CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27915 2026-03-31 cs.CV 79%

FlashSign: Pose-Free Guidance for Efficient Sign Language Video Generation

FlashSign:无需姿态的高效手语视频生成

Liuzhou Zhang, Zeyu Zhang, Biao Wu, Luyao Tang, Zirui Song, Hongyang He, Renda Han, Guangzhen Yao, Huacan Wang, Ronghao Chen, Xiuying Chen, Guan Huang, Zheng Zhu

机构 * HUST(华中科技大学) GigaAI UTS(悉尼科技大学) HKU(香港大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Warwick(华威大学) TJU(天津大学) NNU(南京师范大学) UCAS(中国科学院大学) UTHealth Houston(德克萨斯大学休斯顿健康科学中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出无需姿态表示的高效手语视频生成框架,通过扩散模型直接映射自然语言文本到手语视频,引入可训练滑动瓷砖注意力机制提升推理效率,实现3.07倍的生成速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09104 2026-03-31 cs.CV 79%

Training-free Motion Factorization for Compositional Video Generation

无需训练的运动因子分解用于组合视频生成

Zixuan Wang, Ziqin Zhou, Feng Chen, Duo Peng, Yixin Hu, Changsheng Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Nanyang Technological University(南洋理工大学) Beijing Institute of Technology(北京理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出一种无需训练的运动因子分解框架,将复杂运动分解为静止、刚体和非刚体运动三类,通过规划先于生成的范式,提升视频生成中运动多样性的表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏