MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings
MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型
机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Clemson University(克莱姆斯大学)
AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。
Comments 7 pages, 6 figures