Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?
视觉-语言模型能否从机器人的第一人称视角图像评估人际距离风险?
机构 * National University of Kyiv-Mohyla Academy(基辅莫希拉国立大学) ; University of Turin(都灵大学)
专题命中 VLM训练与架构 :InternVL(summary_cn,abstract);vision-language model(title,abstract);VLM(summary_cn,abstract_cn);grounding(abstract)
AI总结 该研究评估了InternVL、Qwen-VL、SmolVLM三种VLM在机器人第一人称视角图像人际距离危险分类中的表现,发现Qwen-VL经特定优化后高危险召回率更高,当前VLM在相关推理定位上仍有局限。
Comments Accepted at the EMR 2026 workshop at ECCV 2026 (non-archival)