Vector Symbolic Policy Gradient
向量符号策略梯度
机构 * University of California, Irvine(加州大学欧文分校) ; Intel Corporation(英特尔公司) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; Northeastern University(东北大学)
AI总结 该研究提出VSPG算法,以单位范数超向量表示离散动作,通过优势加权超向量捆绑更新动作,可实现样本高效学习且推理内存不增加,还证明其动作选择在随机比特翻转下稳定,连接了三类方法并提供鲁棒性保证。
Comments Code available in this https URL (https://github.com/BiasLabProjects/VSPG)