AgentGrounder: Zero-Shot 3D Visual Pointcloud Grounding using Multimodal Language Models
AgentGrounder:使用多模态语言模型的零样本3D视觉点云定位
机构 * Biomechatronics and Energy-Efficient Robotics (BE2R) Lab, ITMO University(生物机械与高效能机器人实验室,ITMO大学)
专题命中 其他机器人 :embodied AI(abstract);分类 cs.RO、cs.CV
AI总结 提出AgentGrounder框架,通过两阶段设计(离线构建对象查找表和在线工具驱动代理)实现零样本3D视觉定位,在ScanRefer和Nr3D上分别提升2.5%和6.3%的准确率。
Comments Code: https://github.com/be2rlab/AgentGrounder