ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models
ViSRA:一种基于视频的空间推理代理用于多模态大语言模型
机构 * Fudan University(复旦大学) ; Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) ; Tongji University(同济大学)
专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 ViSRA从无训练视角出发,提出一种人类对齐的视频空间推理代理框架,通过显式空间信息探索多模态大语言模型的空间推理机制,实现模块化和可扩展的空间推理,提升3D理解能力并减少训练成本。