arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6765 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2606.20233 2026-07-29 cs.CV 版本更新 79%

Cinematic Compositing Using Character-Environment-Harmonized Video Generation Models

使用角色-环境协调视频生成模型的电影级合成

Tianyi Xiang, Mingming He, Li Ma, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Independent Researcher(独立研究员)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。

Comments Project Page: https://cehcomposition.github.io/demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24027 2026-07-28 cs.CV 新提交 79%

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification

Sol-Attn:通过即时注意力稀疏化加速视频生成推理

Haopeng Li, Yitong Li, Junsong Chen, Tian Ye, Haozhe Liu, Jincheng Yu, Duomin Wang, Ruihua Zhang, Zeke Xie, Enze Xie, Song Han

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究针对扩散变压器视频生成中注意力推理瓶颈,提出无训练的Sol-Attn方法,通过即时块阈值处理和代理分数重用统一动态路由等,在图像和视频生成任务实验中实现质量-效率提升,加速视频生成和编辑。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23472 2026-07-28 cs.CV 新提交 79%

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER:用于物理上合理的视频生成的视觉上下文物理推理

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22959 2026-07-28 cs.CV cs.AI 新提交 79%

HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale

HALLELUAI:一个用于大规模超逼真图像到视频生成的幻觉感知人工智能系统

Aniket Sakpal, Yang Jiang, Rouzbeh Davoudi, Shayan Hassantabar, Mani Najmabadi

机构 * Expedia Group(亿客行集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对AI生成视频时质量控制难的问题,HALLELUAI系统集成视频调节与智能再生模块,能评估风险并迭代修复。经人工参与评估,该系统可输出超逼真视频,推动了可信AI视频内容发展,实现大规模图像到视频生成。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21580 2026-07-24 cs.CV cs.AI 新提交 79%

GraphVid: Interactive Graph-Controllable Video Generation

GraphVid:交互式图可控视频生成

Vedant Shah, Onkar Susladkar, Tushar Prakash, Kiet Nguyen, Tianjio Yu, Adheesh Juvekar, Muntasir Waheed, Ismini Lourentzou

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究如何实现可控视频生成,提出基于图条件的GraphVid模型及相关数据集,通过结构化交互图实现灵活精确控制,相比其他方法在减少训练数据和参数的情况下,提升了视频生成的可控性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20984 2026-07-24 cs.CV 新提交 79%

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

用于不确定性感知文本到视频检索的分布对齐桥

Kyeongmo Chae, Jihoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆北国立大学电子与电气工程学院)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 研究文本到视频检索问题,提出分布对齐桥(DAB)框架,将其视为分布对齐任务,通过高斯分布建模考虑不确定性,用受扩散启发的桥和分布感知对比损失优化,在多基准测试中显著优于现有基线并提供校准排名。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12304 2026-07-24 cs.SD cs.AI cs.MM eess.AS 版本更新 79%

OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model

OmniCustom: 通过联合音视频生成模型实现同步音视频定制

Maomao Li, Zhen Li, Kaipeng Zhang, Guosheng Yin, Zhifeng Li, Dong Xu

机构 * The University of Hong Kong(香港大学) Shanda AI Research Tokyo(Shanda AI东京研究所) XIntelligence Technology Co., Limited(XIntelligence技术有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 提出一种基于DiT的零样本音视频定制框架OmniCustom,通过参考图像和音频同步生成保持身份和音色一致性的视频,支持文本指定语音内容。

Comments code: https://github.com/OmniCustom-project/OmniCustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20174 2026-07-23 cs.CV cs.AI 新提交 79%

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

StreamHOI:用于流式HOI视频生成的交互感知时间记忆适应

Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee

机构 * Kling AI Research(克林人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) National Cheng Kung University(国立成功大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对现有HOI视频生成方法不适用于实时交互应用的问题,提出StreamHOI框架。通过分析Transformer块的历史记忆偏好,进行离线分析与偏差引导训练,并引入内存距离缩放模块,实现高效长时HOI视频生成,兼具多种优势且效率高。

Comments Code and models are available at https://github.com/KlingAIResearch/StreamHOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18664 2026-07-22 cs.CV 新提交 79%

DeforM: Reasoning-Guided Physics-Aware Video Generation via Spatial-Temporal Masking

DeforM:通过时空掩码实现推理引导的物理感知视频生成

Yunyi Li, Yu Qiao, Yaohui Wang, Xinyuan Chen

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究针对视频生成模型难以生成物理感知视频的问题,提出DeforM框架,引入VLM引导的物理推理模块及两种策略,经实验验证该框架能提高生成变形场景的真实感,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03118 2026-07-22 cs.CV cs.LG 版本更新 79%

Vidu S1: A Real-Time Interactive Video Generation Model

Vidu S1:一个实时交互式视频生成模型

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang Chen, Jungang Li, Chengyang Ye, Marco Chen, Hongzhou Zhu, Min Zhao, Yuxuan Jiang, Zhengkun Huang, Chendong Xiang, Kaiwen Zheng, Haoxu Wang, Xiaohang Wang, Qi Jia, Xin Chen, Yimin Chen, Youhe Jiang, Fangcheng Fu, Zhijie Deng, Fan Bao, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu Technology(生数科技)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 介绍实时交互式视频生成模型Vidu S1,支持数字角色语音控制,用户可随时通过语音指令控制视频内容,基于TurboDiffusion和TurboServe构建,能实时生成高质量视频,性能优且满足实时推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07649 2026-07-22 cs.CV cs.AI 版本更新 79%

ViMax: Agentic Video Generation

ViMax: 智能体视频生成

Lingxuan Huang, Sizhe He, Hengji Zhou, Liqiang Nie, Lianghao Xia, Chao Huang

机构 * The University of Hong Kong(香港大学) South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出ViMax框架,通过多智能体协作实现长视频生成,利用分层叙事引擎和视觉一致性机制,保证叙事连贯性和视觉一致性。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16355 2026-07-21 cs.CV cs.AI 新提交 79%

PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation

PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制

Qirui Li, Jinkun Hao, Yibo Li, Ran Yi, Paul L. Rosin, Yu-Kun Lai

机构 * Shanghai Jiao Tong University(上海交通大学) Cardiff University(卡迪夫大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。

Comments For project page, see https://iapple233.github.io/PhysAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22274 2026-07-20 cs.CV 版本更新 79%

GeCo: Evaluating Geometric Consistency for Video Generation via Motion and Structure

GeCo:通过运动和结构评估视频生成的几何一致性

Leslie Gu, Junhwa Hur, Charles Herrmann, Fangneng Zhan, Todd Zickler, Deqing Sun, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 GeCo通过融合残差运动和深度先验,检测静态场景中的几何变形和遮挡不一致问题,并用于评估视频生成模型的性能与缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14202 2026-07-17 cs.CV 新提交 79%

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

关键帧指南针:迈向对关键帧条件视频生成的全面评估

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究关键帧条件视频生成,提出关键帧指南针综合基准及自动评估框架,将关键帧执行分解为六个指标评估,通过实验揭示当前模型在关键帧执行与自然视频合成间存在权衡等局限性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14194 2026-07-17 cs.CV cs.LG 新提交 79%

Inference-Time Concept Suppression and Video-Centric Evaluation for Text-to-Video Models

文本到视频模型的推理时概念抑制和以视频为中心的评估

Wenxuan Chen, Wenjie Feng

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 研究文本到视频模型中可控去除目标概念的问题,提出无训练推理时框架SIRUS,通过定位目标相关提示证据抑制目标表达,引入视频导向评估框架,在多个概念上实验表现出色,能在不同骨干上泛化。

Comments 29 pages, 9 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13527 2026-07-16 cs.CV 新提交 79%

VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation

VGIF分数:视频生成中时空指令跟随的可解释性和诊断性评估

Songyu Xu, Xin Wang, Qiang Chen, Xinran Wang, Muxi Diao, Yuxuan Zhang, Kongming Liang, Rui Lin, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Telecommunications Group Co., Ltd.(中国电信集团有限公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究视频生成模型遵循长指令能力评估不足问题,提出VGIF-Score框架,含客观完成和主观满意度分支,能生成统一分数,在VGIF-Bench基准实验中对视频生成指令跟随提供可靠、可解释及有诊断作用的评估。

Comments Accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24152 2026-07-16 cs.CV cs.LG 版本更新 79%

Autonomous Video Generation with Counterfactual Controllability for Self-Evolving World Models

具有反事实可控性的自主视频生成用于自进化世界模型

Xin Wang, Wenxuan Liu, Tongtong Feng, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出反事实可控性是自进化世界模型的关键,通过自主视频生成实现可控性,使模型能测试动作后果并反馈改进生成。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31946 2026-07-15 cs.CV 版本更新 79%

World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration

世界叙事模型:从像素采样到物理世界编排的高度可控视频生成范式转变

Ye Chen, Xuanhong Chen, Yupeng Zhu, Liming Tan, Zhewen Wan, Yuxuan Xiong, Tielong Wang, Jinfan Liu, Wuze Zhang, Xiongzhen Zhang, Feifei Li, Xianglin Luo, Zhehan Zhao, Zhifan Zhang, Laisheng Kou, Zhujin Liang, Yugang Chen, Muchun Chen, Xu Miao, Yijing Zhang, Xiaojie Sheng, Qiang Hu, Jialiang Chen, Weimin Zhang, Wenjun Zhang, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出世界叙事模型(WNM),将视频生成解耦为结构化物理叙事与像素渲染,通过协同代理将多模态输入转化为可编辑的4D世界表示,驱动基础模型生成符合创作者意图的视频,大幅提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10860 2026-07-14 cs.CV 新提交 79%

AU-Guided Synthetic Video Generation for Micro-Expression Recognition

用于微表情识别的基于动作单元引导的合成视频生成

Pei-Sze Tan, Sailaja Rajanala, Yee-Fan Tan, Raphael C. -W. Phan, Huey-Fang Ong

机构 * CyPhi AI Lab, Monash University Malaysia(马来西亚莫纳什大学CyPhi人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对现有微表情识别数据集的局限,提出基于动作单元引导生成合成微表情数据集EquiME的方法,经实验其在跨数据集微表情识别任务中性能有竞争力,且在不同架构中变化低,为微表情识别研究提供了新资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02584 2026-07-14 cs.CV 版本更新 79%

RotateAttention: RoPE-Aware Rotation and Range Rectification for INT4 Quantized Attention in Video Generation

RotateAttention:用于视频生成中INT4量化注意力的RoPE感知旋转与范围校正

Yaofu Liu, Wanli Lan, Jinxi Li, Binhang Yuan, Harry Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究员)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对基于DiT的视频生成模型中注意力机制的计算瓶颈,提出RotateAttention框架,采用选择性FP16回退,引入RoPE感知旋转和范围优化P量化技术,提升速度并保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05994 2026-07-08 cs.CV 新提交 79%

SparseCtrl-HOI: Sparse Temporal Control for Human-Object Interaction Video Generation

SparseCtrl-HOI:用于人机交互视频生成的稀疏时间控制

Shenbo Xie, Mingrui Cai, Xu Yang, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 研究针对人机交互视频生成中建模物理动力学及时空协调复杂、现有方法依赖密集指导成本高且影响多样性的问题,提出SparseCtrl-HOI框架,用关键帧结合新机制和模块控制,构建数据集,降低标注开销,提升直播电商视频质量。

Comments ECCV 2026, Project Page: https://mpi-lab.github.io/SparseCtrl-HOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 79%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05376 2026-07-07 cs.CV cs.GR 新提交 79%

MV-Forcing: Long Multi-View Video Generation via 4D-Grounded Spatio-Temporal Self-Forcing

MV-Forcing:基于4D锚定时空自强制的长时长多视角视频生成

Gal Fiebelman, Hadar Averbuch-Elor, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 针对动态场景长时多视角一致视频生成难题,提出MV-Forcing框架,融合时序与视角自回归,实现任意时长视角数的高一致性多视角视频生成。

Comments Accepted to ECCV 2026. Project webpage: https://galfiebelman.github.io/mv-forcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03803 2026-07-07 cs.CV cs.AI 新提交 79%

CineMobile: On-Device Image-to-Video Diffusion for Cinematic Camera Motion Generation

CineMobile:用于电影级相机运动生成的设备端图像到视频扩散

Xuyao Huang, Zelai Deng, Xu Wang, Xizhong Xiao, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Nankai University(南开大学) Transsion(传音)

专题命中 视频生成 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 针对移动设备图像到视频创作需求,提出CineMobile。采用蒸馏引导剪枝、扩散蒸馏与强化学习优化及混合后训练量化策略,在保持视觉质量的同时大幅加速生成,证明其在移动图像到视频创作中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03732 2026-07-07 cs.CV 新提交 79%

ProxyUp: Training-Free Proxy-Conditioned Video Generation for Controllable Dynamics

ProxyUp:用于可控动力学的免训练代理条件视频生成

Zanwei Zhou, Jiazhong Cen, Jiemin Fang, Yumeng He, Chen Yang, Sikuang Li, Fanpeng Meng, Zhikuan Bao, Wei Shen, Qi Tian

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc.(华为公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 现代视频生成模型精确控制复杂动力学具挑战性。提出代理条件视频生成,以代理视频控制前景物体运动。基于预训练模型构建免训练框架ProxyUp,用区域潜在噪声和随机流松弛,实验表明其在动态保真度和文本对齐方面优于基线。

Comments Project Page: $\href{https://zanue.github.io/proxyup}{\text{this https URL}}$

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22905 2026-07-01 cs.CV 新提交 79%

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatar: 用于一致且意图感知的虚拟形象的实时流式视频生成

Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi'an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能国家重点实验室) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能科技(北京)有限公司) Wuhan University(武汉大学) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出InteractiveAvatar框架,通过自回归蒸馏实现实时无限流式生成,利用长短视觉记忆机制保持视觉一致性,并设计推理反应模块实现意图感知交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30557 2026-06-30 cs.CV 79%

EcoVideo: Entropy-Orchestrated Video Generation Paradigm in Cloud-Edge Dynamics

EcoVideo: 云边动态中的熵编排视频生成范式

Jiayu Chen, Hengyi Zhang, Maoliang Li, Minyu Li, Zihao Zheng, Xuanzhe Liu, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University, China(北京大学计算机科学学院,中国) State Key Lab of Multimedia Information Processing, Peking University, China(北京大学多媒体信息处理国家重点实验室,中国) International School, Beijing University of Posts and Telecommunications, China(北京邮电大学国际学院,中国) School of Information Science and Technology, Beijing Forestry University, China(北京林业大学信息科学与技术学院,中国)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出EcoVideo框架,利用自注意力熵进行无训练帧选择,云大模型去噪关键帧,边轻量模型插值重建,自适应调整预算和深度,实现2.9倍端到端加速。

Comments EcoVideo is honored to be accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30019 2026-06-30 cs.CV 79%

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

OmniDance: 基于大规模互联网数据的多模态驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出CIPE-Dance大规模舞蹈视频数据集和OmniDance框架,通过深度感知架构、课程学习和条件引导策略,实现文本、音乐及多模态驱动的舞蹈视频生成,达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27964 2026-06-29 cs.CV 新提交 79%

Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control

Directing the World: 具有组合式人体-相机控制的快速自回归视频生成

Haoyuan Wang, Yabo Chen, Haibin Huang, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI))

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出一种快速自回归框架,通过解耦控制学习并保持统一视频先验,实现人体运动和相机轨迹的组合控制,支持稳定长程生成与高视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交 79%

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏