P-JEPA: Procedural Video Representation Learning via Joint Embedding Predictive Architecture
P-JEPA: 通过联合嵌入预测架构进行程序性视频表示学习
机构 * Technical University of Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Carl Zeiss AG(卡尔蔡司股份公司)
专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI
AI总结 提出P-JEPA,一种与骨干网络无关的方法,通过将长视频映射到密集帧对齐动作空间并预测池化掩码潜在向量,实现对超过30分钟程序性视频的长时理解,在EgoExo4D等数据集上达到细粒度动作分类SOTA,参数比基于LLM的方法少一个数量级。