Cost of Structural Learning Under Censored Feedback: A Threshold-Bandit Approach
审查反馈下结构学习的代价:一种阈值-老虎机方法
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
AI总结 针对任务仅当联盟达到未知规模阈值时才产生奖励的审查反馈问题,提出阈值激活合作多臂老虎机模型,并通过集中式算法C-TAC实现O(log T)累积遗憾,以及去中心化事件触发协议D-TAC在保持可行性对齐的同时减少23倍通信。