Semi-Bandit Learning for Monotone Stochastic Optimization
单调随机优化的半强盗学习
机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Michigan(密歇根大学)
AI总结 针对未知分布下的单调随机优化问题,提出一种半强盗在线学习算法,在仅观测被探测变量样本的情况下,实现相对于最优近似算法的√(T log T)遗憾界,并扩展到删失和二元反馈场景。
Comments Full version (and extension) of FOCS 2024 paper. Fixes some missing assumptions in our results for continuous distributions. Also adds extensions to censored and binary feedback settings (along with applications) Revision: We improved the $k$ dependence