EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data
EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试
机构 * Meta Superintelligence Labs(Meta超智能实验室) ; Stanford University(斯坦福大学) ; Meta Reality Labs(Meta现实实验室) ; The University of Tokyo(东京大学)
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。