HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning
HALO:一种用于具身多模态推理的统一视觉-语言-动作模型
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 多模态Agent :multimodal(title,abstract)
AI总结 HALO提出了一种统一的视觉-语言-动作模型,通过结合文本推理、视觉子目标预测和增强的动作预测,实现具身多模态链式推理,提升了机器人在复杂环境中的表现和泛化能力。