Multi Modal Adaptive Normalization for Audio to Video Generation
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments ICPR 2020
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments Project page: https://ge.in.tum.de/publications/2019-tecogan-chu/, code link: https://github.com/thunil/TecoGAN
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments 12 pages, 9 figures
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments WACV 2020
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments Accepted in 2020 Winter Conference on Applications of Computer Vision (WACV '20)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments Computer Vision class project, 9 pages
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments To appear in ICCV 2019. The first two authors contributed equally to this work. 16 pages, 21 figures
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments Paper accepted at CVPR 2019. Source code and models available at https://github.com/junting/seg2vid/tree/master
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments Under review for CVPR 2018. Haoye and Chunyan have equal contribution
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments Master Thesis from ETH Zurich, May 22, 2018
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Comments Our supplemental material is available on http://www.mi.t.u-tokyo.ac.jp/assets/publication/hierarchical_video_generation_sup/ Accepted to AAAI2018
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
Journal ref Presented at ICCV 2017 (International Conference on Computer Vision)
构建具有人机监督的精确视频语言
专题命中 视频生成 :video generation(abstract);video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM
AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。
Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/
基于模拟数据集和双流光流监督的物理基础流体视频生成
机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)
专题命中 视频生成 :video generation(title);video diffusion(abstract)
AI总结 研究流体视频生成中模型违反物理原理的问题,构建含模拟与真实视频的数据集,引入双流图像到视频架构,通过光流监督增强模型,提升视频物理常识和质量得分,使模型内化连贯运动先验。
Arachne: 编排级联以实现高效文本到视频模型训练
专题命中 视频生成 :text-to-video(title,abstract)
AI总结 提出Arachne框架,通过将训练过程分解为细粒度计算单元(级联)并协调其分布式执行与同步,解决T2V模型训练中的负载不均和硬件利用率低问题,迭代时间最多减少65%。
DVG-WM:解耦视频生成实现高效机器人操作具身世界模型
机构 * Nanyang Technological University, Singapore(南洋理工大学(新加坡)) ; Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学(中国北京)) ; GigaAI
专题命中 视频生成 :video generation(title,abstract)
AI总结 提出解耦视频生成世界模型(DVG-WM),将世界模型分解为动力学学习和视觉合成,通过流匹配直接映射动力学到视频潜变量,并引入潜变量退化机制再生接触细节,在LIBERO和真实平台实现高达3.97倍加速。
推荐即生成:在工业规模上统一个性化视频生成与推荐
专题命中 视频生成 :video generation(title,abstract)
AI总结 提出推荐即生成(RaG)范式,通过共享语义ID统一生成式推荐与视频生成,实现个性化视频按需生成,并在工业平台部署,广告收入提升1.87%。
Comments Project page: https://recommendation-as-generation.github.io/
基于世界模型的视频生成中物理一致性的无参考评估
机构 * Hanyang University ERICA(汉阳大学ERICA校区)
专题命中 视频生成 :video generation(title,abstract)
AI总结 提出结合相对与绝对方法的无参考度量,用于评估生成视频的物理一致性,无需人工投票或真实参考,通过DROID-SLAM和SEA-RAFT量化不一致性,过滤后视频任务成功率提升超8%,并实现时空定位。
Comments Accepted to the 2nd 3D-LLM/VLA Workshop, CVPR 2026
TurboServe: 高效经济地服务流式视频生成
专题命中 视频生成 :video generation(title,abstract)
AI总结 针对流式视频生成的会话时长和用户需求异构性,提出TurboServe系统,通过在线调度联合优化会话放置与GPU配置,采用迁移感知放置和负载驱动自动缩放,降低延迟和成本。
自适应资源管理与质量控制用于流式视频生成
专题命中 视频生成 :video generation(title,abstract)
AI总结 针对自回归扩散Transformer在实时流式视频生成中的播放连续性SLO,提出基于播放余量的服务系统SlackServe,通过三级优先级队列、重新归位和弹性序列并行重新分配资源,并在质量下限下通过双模帕累托路由选择每块保真度配置,显著提升QoE并降低首块延迟。
帮助图表讲述它们的故事!基于论文的视频生成解释复杂科学图表
机构 * University of Maryland, College Park(马里兰大学学院市分校)
专题命中 视频生成 :video generation(title,abstract)
AI总结 提出MINARD流水线,从图表及其论文生成基于区域分解的叙述性视频,并发布FigTalk基准,在自动和人工评估中优于现有方法。
Comments Webpage: https://minard.vercel.app/
VICX: 通过视频生成和上下文操作网络实现可泛化的机器人操作
机构 * National University of Singapore(新加坡国立大学)
专题命中 视频生成 :video generation(title,abstract)
AI总结 提出VICX框架,利用冻结视频生成模型生成视觉计划,并通过视频到轨迹的上下文操作网络(V2T-ICON)将其映射为机器人可执行轨迹,实现跨任务、跨本体泛化。
Comments The first two authors contributed equally to this work
CamGeo: 基于稀疏相机条件的图像到视频生成与3D几何先验
专题命中 视频生成 :video generation(title,abstract)
AI总结 提出CamGeo框架,通过从预训练视频到3D模型蒸馏3D几何知识,结合关键帧轨迹蒸馏、跨帧一致性蒸馏和三阶段课程学习,解决稀疏相机条件下图像到视频生成中的姿态漂移和运动不连续问题。
Comments Accepted by ICML 2026
超越端到端视频模型:基于LLM的多智能体系统用于教育视频生成
机构 * Baidu Inc.(百度公司)
专题命中 视频生成 :video generation(title,abstract)
AI总结 提出LASEV,一种基于LLM的分层多智能体系统,通过将教育视频生成分解为多个专业智能体协作,解决端到端模型在逻辑严谨性和知识表示方面的不足,实现低成本、高吞吐量的自动化教学视频生产。
Comments Accepted at ACM SIGKDD 2026 (KDD '26), Applied Data Science Track. 10 pages, 2 figures, 5 tables. The project is available at \url{https://robitsg.github.io/LASEV}