Environmental Understanding Vision-Language Model for Embodied Agent
面向具身智能体的环境理解视觉-语言模型
机构 * UNIST(全南国立大学)
专题命中 模仿学习与强化学习 :embodied agent(title,abstract);分类 cs.AI、cs.CV
AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。
Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io