arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-16 至 2026-03-16 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 4 篇

2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV 84%

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

专题命中 动作与事件理解 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23120 2026-03-16 cs.CV 79%

MMGT: Motion Mask Guided Two-Stage Network for Co-Speech Gesture Video Generation

MMGT:基于运动遮罩的两阶段网络用于语音手势视频生成

Siyuan Wang, Jiawei Liu, Wei Wang, Yeying Jin, Jinsong Du, Zhi Han

专题命中 动作与事件理解 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出MMGT网络,通过结合音频、运动遮罩和姿态视频生成同步语音手势视频,解决单一音频控制导致的大动作缺失问题,提升视频质量与细节控制。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11975 2026-03-16 cs.CV cs.AI cs.CR 57%

HomeSafe-Bench: Evaluating Vision-Language Models on Unsafe Action Detection for Embodied Agents in Household Scenarios

HomeSafe-Bench:评估视觉-语言模型在家庭场景中对不安全行为检测的性能

Jiayue Pu, Zhongxiang Sun, Zilu Zhang, Xiao Zhang, Jun Xu

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出HomeSafe-Bench,用于评估视觉-语言模型在家庭场景中检测不安全行为的能力,同时引入HD-Guard架构提升实时安全监控效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01000 2026-03-16 cs.CV 57%

Let Your Image Move with Your Motion! -- Implicit Multi-Object Multi-Motion Transfer

让您的图像随您的动作移动!-- 隐式多对象多动作转移

Yuze Li, Dong Gong, Xiao Cao, Junchao Yuan, Dongsheng Li, Lei Zhou, Yun Sing Koh, Cheng Yan, Xinyu Zhang

机构 * Tianjin University(天津大学) University of New South Wales(新南威尔士大学) University of Electronic Science and Technology of China(电子科技大学) Hainan University(海南大学) University of Auckland(奥克兰大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出FlexiMMT框架,实现多对象多动作的隐式图像到视频转换,通过解耦注意力机制和改进的掩码传播机制,实现精确且高质量的多对象动作迁移。

Comments 15 pages, 11 figures, cvpr 2026, see https://ethan-li123.github.io/FlexiMMT_page/

详情

展开后加载摘要…

URL PDF HTML 收藏