FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy
FabriMAE:我相信自己吗?基于马尔可夫注意力熵的视觉-语言-动作模型动作自评估
机构 * National University of Singapore(新加坡国立大学) ; Ludwig Maximilian University of Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Amazon(亚马逊) ; East China University of Science and Technology(华东理工大学) ; Mese Technology Limited Co., Ltd.(迈泽科技有限公司) ; FabriX team at Youibot Robotics Co., Ltd.(优必科技有限公司FabriX团队)
AI总结 本研究针对视觉-语言-动作模型的动作自评估难题,提出基于马尔可夫注意力熵(MAE)的自评估框架,构建LIBERO-Reflect基准,实验显示MAE性能优于现有方法,还提升了PI系列动作选择的鲁棒性。