Long-Term Human Video Generation of Multiple Futures Using Poses
专题命中 视频生成 :video generation(title);分类 cs.CV
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title);分类 cs.CV
专题命中 视频生成 :video generation(title);分类 cs.CV
Comments Appeared at NeurIPS 2020. Project page: http://pmh47.net/o3v/
专题命中 视频生成 :video generation(title);分类 cs.CV
Comments Video here: https://youtu.be/4ve1sGzWl2g
专题命中 视频生成 :video generation(title);分类 cs.CV
Comments ICLR 2020 Camera-Ready. Previous title: VideoFlow: A Flow-Based Generative Model for Video
专题命中 视频生成 :video generation(title);分类 cs.CV
Comments Accepted to BMVC 2019
专题命中 视频生成 :video generation(title);分类 cs.CV
专题命中 视频生成 :video generation(title);分类 cs.MM
专题命中 视频生成 :video generation(title);分类 cs.CV
专题命中 视频生成 :video generation(title);分类 cs.CV
Comments 11 pages, 12 figures. Technical report for a project in progress
专题命中 视频生成 :video generation(title);分类 cs.CV
专题命中 视频生成 :video generation(title);分类 cs.CV
Comments Accepted to ECCV 2018
专题命中 视频生成 :video generation(title);分类 cs.CV
Comments 17 pages, 8 figures, 4 tables, accepted by ECCV 2018
专题命中 视频生成 :video generation(title);分类 cs.MM
闭环三元组协同生成用于长视频
机构 * University of Science and Technology of China(中国科学技术大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV、cs.MM
AI总结 提出CoTriSyGen框架,通过闭环视觉-文本-记忆协同过程,结合分析器进行镜头内和镜头间修正,解决长视频生成中的身份漂移和不一致问题。
模型是否共享安全表示?面向安全视觉生成的跨模型引导
机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) ; University of Pisa(比萨大学) ; Amazon Prime Video(亚马逊prime视频)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 本文提出首个跨模型安全引导框架,通过源语言模型估计安全方向并迁移至目标生成器,无需目标侧不安全数据即可实现安全控制,且不牺牲生成质量。
Comments Project page: https://aimagelab.github.io/cross-model-safety-representations/
EAD-Net:具有空间细化和时间一致性的情感感知说话头生成
机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV、eess.IV
AI总结 EAD-Net通过引入同步网络监督和时空方向注意力机制,提升情感感知说话头生成的唇同步精度和时间一致性,同时利用大语言模型增强情感语义控制。
Comments Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments 30 pages, 14 figures
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments This paper was accepted by ICME 2025
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、eess.IV
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments Accepted for The 39th Annual AAAI Conference on Artificial Intelligence 2025 in Main Track, 19 pages, 24 figures
专题命中 视频生成 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM
Comments Video Editing
GenVid2Robot:通过刚性几何一致性从视频生成到机器人操作
机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) ; University of Liverpool(利物浦大学) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; State Key Laboratory of Submarine Geoscience, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学海洋地球科学国家重点实验室,自动化与智能感知学院)
专题命中 视频生成 :video generation(title)
AI总结 研究旨在将生成视频转换为机器人可执行操作轨迹。核心方法是GenVid2Robot框架,通过采样语义锚点、跟踪验证运动等步骤实现。主要贡献是提高了生成视频引导操作的可靠性,通过多种手段建立视觉运动先验。
Comments Preprint
PhyAVBench: 一个具有挑战性的音频物理敏感性基准,用于物理基础的文本到音频视频生成
机构 * HKUST(GZ)(香港科技大学(广州)) ; Tencent(腾讯)
专题命中 视频生成 :video generation(title)
AI总结 本文提出PhyAVBench,一个用于评估文本到音频视频生成、图像到音频视频生成和视频到音频生成模型中音频-物理基础能力的基准,通过引入新的数据集和评估方法,揭示了当前模型在物理合理音频生成方面的不足。
Comments 6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos
Camera Artist: 一种多智能体框架用于电影语言叙事视频生成
机构 * School of Information and Communication Engineering, Communication University of China(中国传媒大学信息与通信工程学院) ; State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)
专题命中 视频生成 :video generation(title)
AI总结 Camera Artist通过引入专门的 cinematography shot agent,增强了镜头间叙事连贯性和电影语言表达,提升了视频叙事的连贯性和表现力。
EmboAlign:通过组合约束对齐视频生成以实现零样本操控
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学)
专题命中 视频生成 :video generation(title)
AI总结 EmboAlign通过视觉语言模型生成组合约束,对齐视频生成模型输出,提升零样本机器人操控的成功率。
Bob的彩纸:音乐和视频生成中的语音记忆攻击
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of California San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视频生成 :video generation(title)
AI总结 研究揭示了生成音乐和视频AI系统中语音记忆攻击的漏洞,通过同音替代词绕过版权过滤,展示语音结构对跨模态检索的关键作用。
机构 * Nanyang Technological University(南洋理工大学) ; Beijing Jiaotong University(北京交通大学) ; National University of Singapore(国立新加坡大学) ; Beihang University(北航) ; Sun Yat-sen University(中山大学)
专题命中 视频生成 :text-to-video(title)
Comments 33 pages, 9 figures
专题命中 视频生成 :video generation(title)