Markov Decision Process for Video Generation
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV;video understanding(comments)
Comments To appear at 2019 ICCV Workshop on Large Scale Holistic Video Understanding
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV;video understanding(comments)
Comments To appear at 2019 ICCV Workshop on Large Scale Holistic Video Understanding
HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制
机构 * Tsinghua University(清华大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Chinese University of Hong Kong(香港中文大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。
Comments Project Page: this https URL (https://shad0wta9.github.io/handsonworld-page/)
H2R-Bench:面向世界模型的人到机器人操作视频生成基准测试
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 该研究推出H2R-Bench基准测试,评估视频世界模型跨实体将人类操作视频转为机器人操作视频的能力,发现现有模型在实体一致性等方面存在局限,为相关模型评估提供诊断框架。
用于改进人机物体交接预测的RGB-D视频生成
机构 * Nanyang Technological University(南洋理工大学) ; College of Computing and Data Science(计算与数据科学学院) ; Zhejiang University(浙江大学) ; College of Computer Science and Technology(计算机科学与技术学院) ; Alibaba Group(阿里巴巴集团)
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 针对人机物体交接数据集稀缺及现实-模拟差距问题,提出Hand2Bot数据集与PassGen生成流水线,实现高意图识别准确率与低误触发率,支持机器人稳健零样本迁移与早期意图预测。
GeoFlow:基于几何对齐先验的高效驾驶视频生成
机构 * Beihang University(北京航空航天大学) ; Macquarie University(麦考瑞大学) ; Tianyi Transportation Technology Co., Ltd(天宜交通科技有限公司) ; Jiangxi Research Institute, Beihang University(北京航空航天大学江西研究院)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 GeoFlow是一款新型驾驶视频生成框架,通过构建几何对齐先验分布替代标准高斯噪声初始化,可提升生成效率与少步生成质量,减少推理步骤。
Comments Accepted at ECCV 2026
EchoCache:面向高效音频驱动视频生成的能量引导跨模态缓存
机构 * Peking University(北京大学) ; Taiyuan University of Technology(太原理工大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 EchoCache是一种能量引导跨模态缓存框架,通过利用音频时频能量锚点与动态缓存机制,在保持音频驱动视频生成质量的同时,实现了2.46倍的推理加速,优化了延迟-质量权衡。
Comments EchoCache is honored to be accepted by ACM MM 2026
Sci-VBench:面向科学领域知识与推理密集型视频生成的评估
机构 * Zhejiang University(浙江大学) ; UCAS(中国科学院大学) ; Tongji University(同济大学) ; Yale University(耶鲁大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。
Comments COLM 2026
DUET:用于两步视频生成的蒸馏专家的多样性-质量二重奏
机构 * Alibaba Group(阿里巴巴集团)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 该研究提出DUET模型,通过噪声级专家二重奏协调两步视频生成中质量与多样性的权衡,经改进的DUET+进一步提升质量并保留多样性优势,效果显著。
LogiShot:逻辑连贯的跨镜头视频生成
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 针对跨镜头视频生成的内容脱节问题,提出LogiShot模型,通过联合编码与视觉记忆路径实现逻辑连贯,构建11万样本数据集及基准,性能优于现有方法。
身份作为存在:迈向基于外观和声音的联合音频视频生成
机构 * Tencent Inc.(腾讯公司) ; Peking University(北京大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出一个统一的框架,实现身份感知的音频视频生成,通过数据整理管道和灵活的身份注入机制,提升生成内容的高保真度和一致性。
VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架
机构 * University of Rochester(罗切斯特大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。
Comments Preprint
IP-Bench:图像到视频生成场景中的图像保护方法基准
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Wuhan University(武汉大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 针对图像到视频生成场景中图像保护方法缺乏统一评估框架的问题,IP-Bench提出首个系统性基准,评估6种保护方法和5种先进模型的鲁棒性及跨模型转移能力。
Comments 15 pages, 7 figures, 9 tables
SUV:将未来场景理解建模为视频生成的端到端驾驶
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 SUV是将未来场景理解建模为视频生成的端到端驾驶框架,其在NAVSIM-v2和WOD-E2E基准上优于近期SOTA方法,实现了更优的轨迹规划性能。
Comments 16 pages, 5 figures. Code: https://github.com/ASH-2046/SUV
ReCamDriving:无需LiDAR的相机控制新型轨迹视频生成
机构 * Sun Yat-sen University(中山大学) ; ZYT ; Shenzhen Polytechnic University(深圳职业技术大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 ReCamDriving通过基于3DGS的密集渲染和两阶段训练策略,实现了无需LiDAR的相机可控新型轨迹视频生成,构建了ParaDrive数据集并展示了卓越的生成效果。
Comments Project page: https://recamdriving.github.io/
用于高效视频生成的 Token 半径注意力机制
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 该研究针对视频扩散 Transformer 自注意力计算成本高的问题,提出 Token 半径注意力机制,在多种视频生成模型配置上实现了高效加速,同时保持了良好的生成质量。
UniMoCa:将运动与相机控制统一为忠实人类视频生成的视觉代理
机构 * SJTU(上海交通大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 UniMoCa是统一运动与相机控制的视觉代理框架,提出MCVP表征并构建MCVP-Video数据集,在Wan2.2 I2V上实现视频生成多方面性能提升且复杂度低
诊断视频生成中不可逆过程的欠发展问题
机构 * RIKEN iTHEMS(理化学研究所 iTHEMS) ; RIKEN AIP(理化学研究所 AIP) ; South China University of Technology(华南理工大学) ; Columbia University(哥伦比亚大学)
专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV
AI总结 本研究针对视频生成模型是否遵循物理不可逆性的问题,提出含进展与静态率的两部分协议,发现模型存在不可逆属性欠发展问题,并验证解耦属性潜空间的单调性构建可消除可操纵的读出引导。
Anti-Prompt: 针对文本引导的图像到视频生成的图像保护
机构 * GIST(光州科学技术院) ; POSTECH(浦项科技大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 提出Anti-Prompt方法,通过向图像注入不可察觉的扰动,在文本引导的图像到视频生成中引发视觉不一致和结构失败,从而保护版权和隐私。
Comments Accepted to ECCV 2026
通过后训练增强视频生成中的场景转换意识
机构 * Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV
AI总结 本文提出TAV数据集,通过后训练提升视频生成中场景转换的理解能力,改善多场景生成效果并保持图像质量。
Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics (2025) 706-721
Ripple:基于跨模态循环记忆的实时流音频-视频生成
机构 * China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(中国电信人工智能技术(北京)有限公司)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 本文提出Ripple系统,通过跨模态循环记忆机制及三阶段训练方案,实现480P下约28 FPS的实时流音频-视频生成,性能优于现有方法。
使用角色-环境协调视频生成模型的电影级合成
机构 * City University of Hong Kong(香港城市大学) ; Independent Researcher(独立研究员)
专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV
AI总结 提出端到端视频扩散框架,通过三掩码引导和RGB-D联合去噪建模角色与环境的双向物理与光照交互,实现高质量动态视频合成。
Comments Project Page: https://cehcomposition.github.io/demo/
Sol-Attn:通过即时注意力稀疏化加速视频生成推理
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 研究针对扩散变压器视频生成中注意力推理瓶颈,提出无训练的Sol-Attn方法,通过即时块阈值处理和代理分数重用统一动态路由等,在图像和视频生成任务实验中实现质量-效率提升,加速视频生成和编辑。
Comments technical report
VIPER:用于物理上合理的视频生成的视觉上下文物理推理
机构 * Zhejiang University(浙江大学) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。
Comments tech report
HALLELUAI:一个用于大规模超逼真图像到视频生成的幻觉感知人工智能系统
机构 * Expedia Group(亿客行集团)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 针对AI生成视频时质量控制难的问题,HALLELUAI系统集成视频调节与智能再生模块,能评估风险并迭代修复。经人工参与评估,该系统可输出超逼真视频,推动了可信AI视频内容发展,实现大规模图像到视频生成。
Comments 10 pages, 4 figures, 3 tables
GraphVid:交互式图可控视频生成
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 研究如何实现可控视频生成,提出基于图条件的GraphVid模型及相关数据集,通过结构化交互图实现灵活精确控制,相比其他方法在减少训练数据和参数的情况下,提升了视频生成的可控性与质量。
用于不确定性感知文本到视频检索的分布对齐桥
机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆北国立大学电子与电气工程学院)
专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV
AI总结 研究文本到视频检索问题,提出分布对齐桥(DAB)框架,将其视为分布对齐任务,通过高斯分布建模考虑不确定性,用受扩散启发的桥和分布感知对比损失优化,在多基准测试中显著优于现有基线并提供校准排名。
Comments ECCV 2026
OmniCustom: 通过联合音视频生成模型实现同步音视频定制
机构 * The University of Hong Kong(香港大学) ; Shanda AI Research Tokyo(Shanda AI东京研究所) ; XIntelligence Technology Co., Limited(XIntelligence技术有限公司)
专题命中 视频生成 :video generation(title,abstract);分类 cs.MM
AI总结 提出一种基于DiT的零样本音视频定制框架OmniCustom,通过参考图像和音频同步生成保持身份和音色一致性的视频,支持文本指定语音内容。
Comments code: https://github.com/OmniCustom-project/OmniCustom
StreamHOI:用于流式HOI视频生成的交互感知时间记忆适应
机构 * Kling AI Research(克林人工智能研究院) ; University of Chinese Academy of Sciences(中国科学院大学) ; National Cheng Kung University(国立成功大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 针对现有HOI视频生成方法不适用于实时交互应用的问题,提出StreamHOI框架。通过分析Transformer块的历史记忆偏好,进行离线分析与偏差引导训练,并引入内存距离缩放模块,实现高效长时HOI视频生成,兼具多种优势且效率高。
Comments Code and models are available at https://github.com/KlingAIResearch/StreamHOI
DeforM:通过时空掩码实现推理引导的物理感知视频生成
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 研究针对视频生成模型难以生成物理感知视频的问题,提出DeforM框架,引入VLM引导的物理推理模块及两种策略,经实验验证该框架能提高生成变形场景的真实感,优于基线模型。
Vidu S1:一个实时交互式视频生成模型
机构 * Tsinghua University(清华大学) ; Shengshu Technology(生数科技)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 介绍实时交互式视频生成模型Vidu S1,支持数字角色语音控制,用户可随时通过语音指令控制视频内容,基于TurboDiffusion和TurboServe构建,能实时生成高质量视频,性能优且满足实时推理需求。