PhysVLM-AVR: Active Visual Reasoning for Multimodal Large Language Models in Physical Environments
机构 * Beijing Jiaotong University(北京交通大学) ; Tencent Robotics X & Futian Laboratory, Shenzhen(腾讯机器人X及福田实验室,深圳) ; Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,中国科学院自动化研究所) ; ObjectEye Inc(ObjectEye公司)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
Comments 39th Conference on Neural Information Processing Systemss (NeurIPS 2025)