Multimodal Behavior Tree Generation: A Small Vision-Language Model for Robot Task Planning
多模态行为树生成:一种小型视觉-语言模型用于机器人任务规划
机构 * Department of Electronics, Information, and Bioengineering, Politecnico di Milano(电子信息与生物工程系,米兰理工学院)
专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);visual question answering(abstract)
AI总结 本文提出一种小型视觉-语言模型,通过生成行为树提升机器人任务规划效率,实验证明其在性能和资源消耗上均优于现有闭源模型。