Distilling Vision-Language Models on Millions of Videos
专题命中 视频生成 :text-to-video(abstract);video-language(abstract);分类 cs.CV
Comments CVPR 2024. Project page: https://zhaoyue-zephyrus.github.io/video-instruction-tuning
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :text-to-video(abstract);video-language(abstract);分类 cs.CV
Comments CVPR 2024. Project page: https://zhaoyue-zephyrus.github.io/video-instruction-tuning
专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV
Comments Project page: https://make-a-protagonist.github.io
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments 12 pages, System Demonstration/Industry paper. Preprint
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:2304.07410
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 eess.IV
Comments 16 pages, 4 tables, 4 figures
Journal ref Sensors. 2022; 22(11):4104
专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV
专题命中 视频生成 :text-to-video(abstract);video-language(abstract);分类 cs.CV
Comments NeurIPS 2021 (19 pages)
专题命中 视频生成 :video generation(abstract);video reasoning(abstract);分类 cs.CV
Comments Published in ICML 2021
专题命中 视频生成 :video generation(abstract);long video(abstract);分类 cs.CV
Tail-Aware HiFloat4: 面向Wan2.2的W4A4训练后量化
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract)
AI总结 提出Tail-Aware HiFloat4方法,通过感知激活尾部的百分位校准和紧凑PTQ状态恢复,在HiFloat4数值格式下对Wan2.2进行W4A4训练后量化,减少罕见校准异常值的影响。
人们如何观看物理场景的AI生成视频?
专题命中 视频生成 :video generation(abstract);video understanding(abstract)
AI总结 研究探讨了人们观看物理场景AI生成视频时的注视行为,发现高真实感视频的观看方式受观众感知真实性影响,而非视频实际真实性。
专题命中 视频生成 :video generation(abstract);text-to-video(abstract)
Comments 19 pages, 7 figures, 10 tables
专题命中 视频生成 :video generation(abstract);text-to-video(abstract)
Comments 18 pages, 12 figures
专题命中 视频生成 :video generation(abstract);text-to-video(abstract)
专题命中 视频生成 :video generation(abstract);text-to-video(abstract)
Comments 33 pages, 1 figure
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV、cs.MM
超越试错:面向图像到视频一致性的智能体优化
机构 * Google Cloud(谷歌云) ; Google DeepMind(谷歌DeepMind)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。
从廉价伪造到纯合成:应对文本生成视频(T2V)假新闻视频的新时代
机构 * Hong Kong Baptist University(香港浸会大学) ; Beijing Normal University(北京师范大学)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 该研究针对纯合成T2V假新闻视频带来的新威胁,构建了首个纯合成假新闻视频数据集,提出R-T2V框架,在10种主流基准上取得最优检测性能。
Comments Accepted at ACM Multimedia (ACM MM), 2026
Pistachio: 向合成、平衡和长形式视频异常基准迈进
机构 * Universiti Malaya(马来亚大学) ; Monash University(莫纳什大学) ; SenseTime Research(商汤科技研究院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 本文提出Pistachio基准,通过生成式流程构建,提供可控场景、异常类型和时间叙事,减少人工标注依赖,验证了现有方法的挑战并推动动态多事件异常理解研究。
Comments Accepted by ECCV 2026
AutoAWG:用于自动驾驶视频的自适应多控逆境天气生成
机构 * MiLM Plus, Xiaomi Inc.(小米 MiLM Plus) ; Xiaomi Inc.(小米公司)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 本文提出AutoAWG,通过自适应多控生成逆境天气视频,提升自动驾驶感知鲁棒性,实验表明其在FID和FVD指标上显著优于现有方法。
Comments Accepted by ICMR 2026
生成AI用于视频预告片合成:从提取启发式方法到自回归创造力
机构 * Google LLC(谷歌有限责任公司)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM
AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。
Comments 7 pages, 3 figures, accepted in WSDM 2026
UniTalking: 一种统一的音频-视频框架用于说话肖像生成
机构 * Central Media Technology Institute, Huawei(华为中央媒体技术研究所) ; School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 UniTalking提出了一种统一的端到端扩散框架,用于生成高质量的语音和唇同步视频,通过多模态Transformer块和个性化语音克隆技术,提升了视觉保真度和训练效率。
Comments Accepted at CVPR 2026 (Findings Track)
利用双摄像头系统捕捉稳定HDR视频
机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) ; Hangzhou Dianzi University(杭州电子科技大学) ; Lishui Institute of Hangzhou Dianzi University(杭州电子科技大学丽水学院) ; Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、eess.IV
AI总结 本文提出了一种双摄像头系统和曝光自适应融合网络,用于解决HDR视频中时间闪烁问题,提升视频重建质量。
面向常规和罕见OR事件可控视频合成
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Technical University Munich(慕尼黑技术大学) ; Johns Hopkins Medical Institutions(约翰霍普金斯医学机构)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV、eess.IV
AI总结 本文提出了一种可控视频合成框架,用于生成手术室中常规和罕见事件,以支持环境智能模型的发展。
Comments Accepted to IPCAI 2026 and submitted to IJCARs
区域约束的上下文生成用于教学视频编辑
机构 * University of Science and Technology of China(中国科学技术大学) ; HiDream.ai Inc.(HiDream.ai公司)
专题命中 视频生成 :video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 ReCo通过引入区域约束建模,提升基于指令的视频编辑中编辑区域的准确性和去噪效果,提出新的正则化方法和大规模数据集。
Comments Project page: https://zhw-zhang.github.io/ReCo-page/
RDTF:面向多帧动画贴纸生成的资源高效双掩码训练框架
机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能图案识别中心) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 RDTF通过三种核心设计,为多帧动画贴纸生成任务提供资源高效的解决方案,优于现有PEFT方法。
Comments Submitted to TMM
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
机构 * School of Computer Science and Technology(计算机科学与技术学院) ; School of Statistics and Mathematics(统计学与数学学院) ; Zhejiang Gongshang University(浙江工商大学) ; Zhejiang Key Laboratory of Big Data and Future E-Commerce Technology(大数据与未来电子商务技术重点实验室) ; Wangxuan Institute of Computer Technology(王萱计算机技术研究所) ; School of Information Science and Technology(信息科学与技术学院) ; University of Science and Technology of China(中国科学技术大学) ; School of Information(信息学院) ; Renmin University of China(中国人民大学) ; School of Computer Science and Information Engineering(计算机科学与信息工程学院)
专题命中 视频生成 :text-to-video(abstract);分类 cs.CV、cs.MM
Comments Accepted by TPAMI. The paper's homepage is https://github.com/HuiGuanLab/ms-sl-pp
机构 * eHealth Center, Faculty of Computer Science, Multimedia and Telecommunications, Universitat Oberta de Catalunya(eHealth中心,计算机科学、多媒体与电信学院,开放大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM
机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院) ; China Telecom(中国电信) ; Gaoling School of Artificial Intelligence(东城区人工智能学院) ; Renmin University of China(中国人民大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Tencent Data Platform(腾讯数据平台) ; Tsinghua University(清华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; The University of Hong Kong(香港大学)
专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM