LongEgoRefer: A Benchmark for Long-Form Egocentric Video Referring Expression Comprehension
LongEgoRefer: 长形式自我中心视频指代表达理解基准
机构 * Woven by Toyota, Japan(丰田公司,日本) ; The University of Tokyo, Japan(东京大学,日本) ; National Institute of Informatics, Japan(日本信息机构国家研究所) ; Institute of Science Tokyo, Japan(东京科学研究所,日本) ; NII LLMC, Japan(日本信息机构LLMC) ; Kyoto University, Japan(京都大学,日本)
专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV
AI总结 提出LongEgoRefer基准,基于Ego4D长视频构建,解决现有基准仅关注短视频导致目标稀疏和活动复杂的问题,评估现有方法发现性能显著下降,凸显长形式自我中心时空定位的挑战。
Comments ECCV 2026. Dataset and code: https://github.com/shunya-kato/LongEgoRefer