CrossView: Can Vision-Language Models Reason Across Cameras?
CrossView:视觉-语言模型能否跨相机进行推理?
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视频问答 :video understanding(abstract);分类 cs.CV
AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。
Comments ECCV 2026