Co-Speech Gesture Video Generation via Motion-Decoupled Diffusion Model
专题命中 动作与事件理解 :video generation(title);分类 cs.CV、cs.MM
Comments 22 pages, 8 figures, CVPR 2024
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 动作与事件理解 :video generation(title);分类 cs.CV、cs.MM
Comments 22 pages, 8 figures, CVPR 2024
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);text-to-video(abstract)
Comments Website: https://github.com/AgibotTech/EWMBench
OR-Action: 细粒度动作的多角色视频理解
机构 * Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Carl Zeiss AG(卡尔蔡司股份公司)
专题命中 动作与事件理解 :video understanding(title);分类 cs.CV
AI总结 针对手术室活动理解中场景图方法缺乏时间建模的问题,提出基于公开数据集的细粒度多角色动作基准,并引入纯视觉时序模型,显著优于图方法,同时提出多视角到单视角特征对齐策略提升单视角性能。
ProfVLM:一种轻量级视频-语言模型用于多视角技能评估
机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学) ; University of Trento(特伦托大学)
专题命中 动作与事件理解 :video-language(title);分类 cs.CV
AI总结 本文提出ProfVLM,一种轻量级视频-语言模型,通过生成式视觉-语言建模实现多视角技能评估,兼具生成自然语言反馈与定量评分,参数更少且训练更快。
Journal ref Computer Vision and Image Understanding, Volume 268, 2026
通过基于运动的图检索生成同步语音手势视频
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 动作与事件理解 :video generation(title);分类 cs.CV
AI总结 本文提出基于运动图检索和扩散模型生成同步语音手势视频,通过提取音频特征和运动分布提升生成质量。
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 动作与事件理解 :video generation(title);分类 cs.CV
机构 * National University of Singapore(新加坡国立大学) ; Sea AI Lab(Sea AI实验室)
专题命中 动作与事件理解 :video reasoning(title);分类 cs.CV
专题命中 动作与事件理解 :video-language(title);分类 cs.CV
Comments Accepted at WACV 2025
专题命中 动作与事件理解 :video generation(title);分类 cs.CV
Comments 5 pages, 5 figures, conference
专题命中 动作与事件理解 :video understanding(title);分类 cs.CV
Comments Accepted at the NeurIPS 2023 Workshop: Self-Supervised Learning - Theory and Practice
专题命中 动作与事件理解 :video understanding(title);分类 cs.CV
Comments 8 pages
专题命中 动作与事件理解 :video generation(title);分类 cs.CV
Comments Please visit https://wyhsirius.github.io/InMoDeGAN/ for introductions and more
专题命中 动作与事件理解 :video generation(title);分类 cs.CV
Comments 10 pages,
专题命中 动作与事件理解 :video generation(title);分类 cs.CV
Comments CVPR 2020, project link https://wyhsirius.github.io/G3AN/
专题命中 动作与事件理解 :video generation(title);分类 cs.CV
Comments Presented at the ICCV 2019 Workshop: The 5th International Workshop on Observing And Understanding Hands In Action
专题命中 动作与事件理解 :video understanding(title);分类 cs.CV
Comments Accepted by ICCV 2017
低频陷阱:视频语言模型在简单事件记录上的失败
专题命中 动作与事件理解 :video language model(title)
AI总结 该研究提出基于轨迹的参数化分析方法,发现视频语言模型Gemini 3.6 Flash在高数量、高频率事件计数上表现极差,额外帧和提示策略难以解决问题,推动视频评估转向时间推理故障诊断。
TC-IDM:为可执行零样本机器人运动实现视频生成
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) ; School of Computer Science, Peking University(北京大学计算机科学学院)
专题命中 动作与事件理解 :video generation(title)
AI总结 TC-IDM通过工具中心逆动力学模型实现视频生成,提升机器人零样本任务的执行能力与泛化性能。
专题命中 动作与事件理解 :video-language(title)
Comments Published as a conference paper at COLM 2024
专题命中 动作与事件理解 :video-language(title)
StreamSoccer:用于流式足球解说的事件驱动记忆
机构 * Migu Video Technology Co., Ltd.(咪咕视讯科技有限公司) ; South China University of Technology(华南理工大学) ; East China Normal University(华东师范大学)
专题命中 动作与事件理解 :video understanding(abstract);video-language(abstract);分类 cs.CV
AI总结 本研究提出StreamSoccer,一种用于流式足球解说的事件驱动系统,通过建模事件生命周期实现多时间范围解说,在数据集评估中取得优异性能且计算开销可控。
Robust-WAM:桥接生成式预训练与世界-动作模型中的语义前瞻
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Beihang University(北京航空航天大学) ; Huawei Foundation Model Department(华为基础模型部门)
专题命中 动作与事件理解 :video generation(abstract,abstract_cn);分类 cs.CV
AI总结 Robust-WAM是一种通用后训练方法,在保留VAE生成路径的同时添加语义前瞻对齐,可提升多个WAM基线在分布外条件下的动作预测成功率且不损失分布内性能。
MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) ; The University of Adelaide(阿德莱德大学) ; Wuhan University(武汉大学) ; Southeast University(东南大学) ; Beijing Jiaotong University(北京交通大学) ; Fudan University(复旦大学) ; Li Auto(理想汽车) ; School of Information, Renmin University of China(中国人民大学信息学院)
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。
Go-with-the-Track: 基于点追踪的视频合成与运动控制
机构 * Netflix USA(Netflix美国) ; Eyeline Labs USA(Eyeline Labs美国) ; University of Oxford(牛津大学) ; Eyeline Labs Los Angeles USA(Eyeline Labs洛杉矶美国) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Stony Brook University USA(石溪大学美国) ; Columbia University USA(哥伦比亚大学美国) ; Eyeline Labs United Kingdom(Eyeline Labs英国) ; Netflix Los Angeles USA(Netflix洛杉矶美国)
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出Go-with-the-Track,通过联合条件多参考图像和参考锚定点轨迹,统一视频合成与运动控制,实现精确合成与运动控制。
Comments SIGGRAPH 2026, Project page: https://eyeline-labs.github.io/Go-with-the-Track/
模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架
机构 * East China Normal University(华东师范大学) ; ByteDance(字节跳动)
专题命中 动作与事件理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV
AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。
Comments Accepted by CVPR 2026
使远见可操作:在世界动作模型中重新利用表示对齐
机构 * The University of Hong Kong(香港大学) ; XPENG Robotics(小鹏机器人)
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。
PointAction: 3D点作为机器人控制的通用动作表示
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出PointAction框架,通过微调视频生成模型联合预测未来RGB帧和动态3D点图,将点动力学作为与具体本体无关的动作接口,再由扩散动作解码器映射为可执行动作,以减少RGB动作歧义并跨任务/本体迁移。
Comments Project page: https://oriontmt.github.io/pointaction/
EA-WM:事件感知生成世界模型与结构运动-视觉动作场
机构 * Fudan University(复旦大学) ; Zhongguancun Academy(中关村学院) ; Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) ; University of Science and Technology of China(中国科学技术大学) ; DeepCybo(深瞳)
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 EA-WM通过结构化运动-视觉动作场闭环连接运动控制与视觉感知,提升机器人空间几何和细粒度交互动态的生成精度。
Comments Preprint. 22 pages, 10 figures
高效空间-时间聚焦适配器与SSM用于时间动作检测
机构 * Department of Informatics The University of Electro-Communications Chofu, Tokyo, Japan
专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 本文提出高效空间-时间聚焦适配器与SSM结合的方法,用于提升长视频中动作检测的定位精度与鲁棒性,通过综合时空特征建模与高效处理,验证了方法的有效性。
Comments ICME2026
超越黄金数据:通过时间步选择性训练解决运动-视觉质量困境
机构 * Tsinghua University(清华大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 本文提出TQD方法,通过时间步选择性训练解决视频生成中运动与视觉质量的矛盾,证明在不平衡数据上训练可超越传统高质量数据训练效果。
Comments Accepted to CVPR 2026