Incentivizing Temporal-Awareness in Egocentric Video Understanding Models
激励时间感知的自体视频理解模型
机构 * Virginia Tech(弗吉尼亚理工大学) ; Apple(苹果公司) ; Harvard University(哈佛大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; UC Davis(加州大学戴维斯分校)
专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV
AI总结 本文提出TGPO算法,通过强化学习提升多模态大语言模型在自体视频理解中的时间感知能力,实验表明其在时间接地和因果连贯性方面优于现有方法。
Comments 11 pages, 4 figures