Cambrian-P: Pose-Grounded Video Understanding
Cambrian-P: 基于姿态的视频理解
机构 * New York University(纽约大学) ; UC Berkeley(加州大学伯克利分校) ; Meta FAIR
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 该研究提出Cambrian-P,一种增强的视频多模态大语言模型,通过引入可学习的相机令牌和姿态回归头,利用姿态作为轻量级监督信号,显著提升了空间推理能力,并在多个视频问答基准上实现了SOTA表现。
Comments Project Page: https://cambrian-mllm.github.io/