arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2606.07649 2026-07-22 cs.CV cs.AI 版本更新 79%

ViMax: Agentic Video Generation

ViMax: 智能体视频生成

Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16355 2026-07-21 cs.CV cs.AI 新提交 79%

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

机构 * Shanghai Jiao Tong University(上海交通大学) Cardiff University(卡迪夫大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。

Comments For project page, see https://iapple233.github.io/PhysAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22274 2026-07-20 cs.CV 版本更新 79%

GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure

GeCo:通过运动和结构评估视频生成的几何一致性

Leslie Gu, Junhwa Hur, Charles Herrmann, Fangneng Zhan, Todd Zickler, Deqing Sun, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeCo通过融合残差运动和深度先验,检测静态场景中的几何变形和遮挡不一致问题,并用于评估视频生成模型的性能与缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14202 2026-07-17 cs.CV 新提交 79%

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

关键帧指南针:迈向对关键帧条件视频生成的全面评估

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究关键帧条件视频生成,提出关键帧指南针综合基准及自动评估框架,将关键帧执行分解为六个指标评估,通过实验揭示当前模型在关键帧执行与自然视频合成间存在权衡等局限性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14194 2026-07-17 cs.CV cs.LG 新提交 79%

Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models

文本到视频模型的推理时概念抑制和以视频为中心的评估

Wenxuan Chen, Wenjie Feng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 研究文本到视频模型中可控去除目标概念的问题,提出无训练推理时框架SIRUS,通过定位目标相关提示证据抑制目标表达,引入视频导向评估框架,在多个概念上实验表现出色,能在不同骨干上泛化。

Comments 29 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13527 2026-07-16 cs.CV 新提交 79%

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation

VGIF分数:视频生成中时空指令跟随的可解释性和诊断性评估

Songyu Xu, Xin Wang, Qiang Chen, Xinran Wang, Muxi Diao, Yuxuan Zhang, Kongming Liang, Rui Lin, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Telecommunications Group Co., Ltd.(中国电信集团有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究视频生成模型遵循长指令能力评估不足问题,提出VGIF-Score框架,含客观完成和主观满意度分支,能生成统一分数,在VGIF-Bench基准实验中对视频生成指令跟随提供可靠、可解释及有诊断作用的评估。

Comments Accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 79%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31946 2026-07-15 cs.CV 版本更新 79%

World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration

世界叙事模型:从像素采样到物理世界编排的高度可控视频生成范式转变

Ye Chen, Xuanhong Chen, Yupeng Zhu, Liming Tan, Zhewen Wan, Yuxuan Xiong, Tielong Wang, Jinfan Liu, Wuze Zhang, Xiongzhen Zhang, Feifei Li, Xianglin Luo, Zhehan Zhao, Zhifan Zhang, Laisheng Kou, Zhujin Liang, Yugang Chen, Muchun Chen, Xu Miao, Yijing Zhang, Xiaojie Sheng, Qiang Hu, Jialiang Chen, Weimin Zhang, Wenjun Zhang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出世界叙事模型(WNM),将视频生成解耦为结构化物理叙事与像素渲染,通过协同代理将多模态输入转化为可编辑的4D世界表示,驱动基础模型生成符合创作者意图的视频,大幅提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10860 2026-07-14 cs.CV 新提交 79%

AU-Guided Synthetic Video Generation for Micro-Expression Recognition

用于微表情识别的基于动作单元引导的合成视频生成

Pei-Sze Tan, Sailaja Rajanala, Yee-Fan Tan, Raphael C. -W. Phan, Huey-Fang Ong

机构 * CyPhi AI Lab, Monash University Malaysia(马来西亚莫纳什大学CyPhi人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对现有微表情识别数据集的局限,提出基于动作单元引导生成合成微表情数据集EquiME的方法,经实验其在跨数据集微表情识别任务中性能有竞争力,且在不同架构中变化低,为微表情识别研究提供了新资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02584 2026-07-14 cs.CV 版本更新 79%

RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation

RotateAttention:用于视频生成中INT4量化注意力的RoPE感知旋转与范围校正

Yaofu Liu, Wanli Lan, Jinxi Li, Binhang Yuan, Harry Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究员)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对基于DiT的视频生成模型中注意力机制的计算瓶颈,提出RotateAttention框架,采用选择性FP16回退,引入RoPE感知旋转和范围优化P量化技术,提升速度并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05994 2026-07-08 cs.CV 新提交 79%

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。

Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 79%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05376 2026-07-07 cs.CV cs.GR 新提交 79%

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

MV-Forcing:基于4D锚定时空自强制的长时长多视角视频生成

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 针对动态场景长时多视角一致视频生成难题,提出MV-Forcing框架,融合时序与视角自回归,实现任意时长视角数的高一致性多视角视频生成。

Comments Accepted to ECCV 2026. Project webpage: https://galfiebelman.github.io/mv-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03803 2026-07-07 cs.CV cs.AI 新提交 79%

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

CineMobile:用于电影级相机运动生成的设备端图像到视频扩散

Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学) Transsion(传音)

专题命中 视频生成 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 针对移动设备图像到视频创作需求,提出CineMobile。采用蒸馏引导剪枝、扩散蒸馏与强化学习优化及混合后训练量化策略,在保持视觉质量的同时大幅加速生成,证明其在移动图像到视频创作中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03732 2026-07-07 cs.CV 新提交 79%

ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics

ProxyUp:用于可控动力学的免训练代理条件视频生成

Zanwei Zhou, Jiazhong Cen, Jiemin Fang, Yumeng He, Chen Yang, Sikuang Li, Fanpeng Meng, Zhikuan Bao, Wei Shen, Qi Tian

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc.(华为公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 现代视频生成模型精确控制复杂动力学具挑战性。提出代理条件视频生成,以代理视频控制前景物体运动。基于预训练模型构建免训练框架ProxyUp,用区域潜在噪声和随机流松弛,实验表明其在动态保真度和文本对齐方面优于基线。

Comments Project Page: $\href{https://zanue.github.io/proxyup}{\text{this https URL}}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22905 2026-07-01 cs.CV 新提交 79%

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar: 用于一致且意图感知的虚拟形象的实时流式视频生成

Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能科技(北京)有限公司) Wuhan University(武汉大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出InteractiveAvatar框架,通过自回归蒸馏实现实时无限流式生成,利用长短视觉记忆机制保持视觉一致性,并设计推理反应模块实现意图感知交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30557 2026-06-30 cs.CV 79%

EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics

EcoVideo: 云边动态中的熵编排视频生成范式

Jiayu Chen, Hengyi Zhang, Maoliang Li, Minyu Li, Zihao Zheng, Xuanzhe Liu, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University, China(北京大学计算机科学学院,中国) State Key Lab of Multimedia Information Processing, Peking University, China(北京大学多媒体信息处理国家重点实验室,中国) International School, Beijing University of Posts and Telecommunications, China(北京邮电大学国际学院,中国) School of Information Science and Technology, Beijing Forestry University, China(北京林业大学信息科学与技术学院,中国)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出EcoVideo框架,利用自注意力熵进行无训练帧选择,云大模型去噪关键帧,边轻量模型插值重建,自适应调整预算和深度,实现2.9倍端到端加速。

Comments EcoVideo is honored to be accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30019 2026-06-30 cs.CV 79%

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

OmniDance: 基于大规模互联网数据的多模态驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出CIPE-Dance大规模舞蹈视频数据集和OmniDance框架,通过深度感知架构、课程学习和条件引导策略,实现文本、音乐及多模态驱动的舞蹈视频生成,达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27964 2026-06-29 cs.CV 新提交 79%

Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control

Directing the World: 具有组合式人体-相机控制的快速自回归视频生成

Haoyuan Wang, Yabo Chen, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出一种快速自回归框架,通过解耦控制学习并保持统一视频先验,实现人体运动和相机轨迹的组合控制,支持稳定长程生成与高视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 79%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20562 2026-06-29 cs.CV 版本更新 79%

PhysChoreo: Physics-Controllable Video Generation with Part-Aware Semantic Grounding

PhysChoreo: 具有部分感知语义基础的物理可控视频生成

Haoze Zhang, Tianyu Huang, Zichen Wan, Xiaowei Jin, Hongzhi Zhang, Hui Li, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出PhysChoreo框架,通过两阶段方法(部分感知物理属性重建与时序指导的可编辑物理模拟)从单张图像生成物理可控且逼真的视频,在多个指标上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11755 2026-06-26 cs.CV 版本更新 79%

Controllable Egocentric Video Generation via Occlusion-Aware Sparse 3D Hand Joints

可控的第一人称视角视频生成:基于遮挡感知的稀疏3D手部关节点

Chenyangguang Zhang, Botao Ye, Boqi Chen, Alexandros Delitzas, Fangjinhua Wang, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Microsoft(微软)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出利用稀疏3D手部关节点作为显式控制信号,通过遮挡感知特征提取和3D加权机制,实现高保真、3D一致的第一人称手物交互视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25592 2026-06-25 cs.CV 新提交 79%

VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks

VPA-Guard:防御与基准测试图像到视频生成中的视觉提示攻击

Yining Sun, Haoyu Kang, Jiajun Wu, Heng Zhang, Danyang Zhang, Zhenjun Zhao, Haochen Han, Fangming Liu, Wai Kin Victor Chan, Alex Jinpeng Wang

机构 * Tsinghua University(清华大学) Central South University(中南大学) South China Normal University(华南师范大学) ByteDance Inc.(字节跳动公司) Pengcheng Laboratory(鹏城实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出首个针对图像到视频生成中视觉提示攻击的系统基准VVA-Bench,并设计检索增强自进化防御框架VPA-Guard,平均降低攻击成功率44.2%和危害评分73.4%。

Comments Dataset Page: https://huggingface.co/datasets/CSU-JPG/VVA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25040 2026-06-25 cs.CV 新提交 79%

Chorus II: Cross-Request Sparsity Reuse for Efficient Image-to-Video Generation

Chorus II: 跨请求稀疏性重用用于高效图像到视频生成

Hao Liu, Chenghuan Huang, Hao Liu, Xing Cai, Chen Li, Ziyang Ma, Jing Lyu, Nong Xiao, Jiangsu Du

机构 * Sun Yat-sen University(中山大学) WeChat HPC, Tencent Inc.(腾讯微信高性能计算) WeChat Vision, Tencent Inc.(腾讯微信视觉)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对图像到视频生成中计算昂贵的问题,提出跨请求稀疏性重用框架,通过共享稀疏掩码重用避免在线预测,实现2.16倍加速且保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08674 2026-06-25 cs.CV cs.AI 版本更新 79%

BioVid: Autoregressive Video Generation with Biological Behavior Semantic Comprehension

BioVid: 具有生物行为语义理解的自回归视频生成

Tsung-Wei Pan, Jung-Hua Wang

机构 * Department of Electrical Engineering, National Taiwan Ocean University(国立台湾海洋大学电子工程系) AI research center, National Taiwan Ocean University(国立台湾海洋大学人工智能研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出BioVid,一种数据驱动的自回归视频生成框架,通过FSQ-R3GAN分词器和因果Transformer学习生物行为的自然时长分布,无需预设长度约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20183 2026-06-25 cs.CV 版本更新 79%

MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation

MSAVBench:面向多镜头音频-视频生成的全面可靠评估

Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu, Quanhao Li, Zhiwu Qing, Xiang Wang, Zhen Xing, Ruihang Chu, Lingyi Hong, Yefei He, Junjie Zhou, Junqiu Yu, Yang Shi, Difan Zou, Kai Zhu, Shiwei Zhang, Yingya Zhang, Yu Liu, Xihui Liu, Hongming Shan

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出首个多镜头音频-视频生成基准MSAVBench,通过自适应混合评估框架在四个维度上系统评估19个模型,发现当前系统在导演级控制和细粒度音视频同步上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03723 2026-06-25 cs.CV 版本更新 79%

SymphoMotion: Joint Control of Camera Motion and Object Dynamics for Coherent Video Generation

SymphoMotion:相机运动与物体动态的联合控制以实现一致的视频生成

Guiyu Zhang, Yabo Chen, Xunzhi Xiang, Junchao Huang, Zhongyu Wang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shanghai Jiaotong University(上海交通大学) Nanjing University(南京大学) Beihang University(北京航空航天大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SymphoMotion通过联合控制相机运动和物体动态,提高视频生成的一致性和表达性,其核心方法结合了相机轨迹控制与物体动态控制机制,并引入了RealCOD-25K数据集进行大规模训练和评估,显著提升了视觉保真度和物体运动准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17773 2026-06-25 cs.CV 版本更新 79%

LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation

LoT-Pass: 面向图像到视频生成的长期鲁棒图像水印

Guanjie Wang, Zehua Ma, Han Fang, Weiming Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对图像引导视频生成中源图像追踪缺失的问题,提出跨模态水印框架I2VWM,通过视频模拟噪声层和光流对齐模块增强水印的时间鲁棒性,在开源和商业模型上验证了效果。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24829 2026-06-24 cs.CV 新提交 79%

GeoT2V-Bench: Benchmarking 3D Consistency in Text-to-Video Models via 3D Reconstruction

GeoT2V-Bench: 通过3D重建基准测试文本到视频模型中的3D一致性

Chenrui Fan, Paolo Favaro

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 提出GeoT2V-Bench,通过3D重建评估相机提示的文本到视频模型能否支持刚性3D场景重建,揭示不同指标下的互补失效模式。

Comments 36 pages, 17 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21661 2026-06-23 cs.CV 新提交 79%

UnityShots: Memory-Driven Multi-Shot Audio-Video Generation with Boundary-Aware Gating

UnityShots: 基于记忆的多镜头音视频生成与边界感知门控

Jiehui Huang, Yuechen Zhang, Bin Xia, Jiahao Wang, Xu He, Zhenchao Tang, Meng Chu, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Kling Team, Kuaishou Technology(Kling团队,快手科技) Tsinghua University(清华大学) Sun Yat-sen University(中山大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出UnityShots,一种基于记忆的多镜头音视频生成系统,通过固定大小的长期和短期记忆槽及边界条件门控实现跨镜头连贯性,在多种条件模式下超越开源基线。

Comments https://jackailab.github.io/Projects/UnityShots

详情

展开后加载摘要…

URL PDF HTML 收藏