OmniPT: Unleashing the Potential of Large Vision Language Models for Pedestrian Tracking and Understanding
OmniPT:释放大型视觉语言模型在行人跟踪与理解中的潜力
专题命中 视觉定位与Grounding :vision language model(title);grounding(abstract);分类 cs.CV、cs.AI
AI总结 OmniPT 通过结合强化学习和微调方法,提升大型视觉语言模型在行人跟踪和语义理解中的性能。
Comments AAAI 2026