Continuous-time q-learning for mean-field control with common noise, part-II: q-learning algorithms
连续时间Q学习用于具有公共噪声的均场控制,第二部分:Q学习算法
Zhenjie Ren, Xiaoli Wei, Xiang Yu, Xun Yu Zhou
机构
*
LaMME, Université Évry Paris-Saclay(Évry巴黎萨克雷大学LaMME研究中心)
;
Department of Applied Mathematics, The Hong Kong Polytechnic University(香港理工大学应用数学系)
;
Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系)
Continuous-time q-learning for mean-field control with common noise, part-I: Theoretical foundations
连续时间q学习用于具有公共噪声的均场控制,第一部分:理论基础
Zhenjie Ren, Xiaoli Wei, Xiang Yu, Xun Yu Zhou
机构
*
LaMME, Université Évry Paris-Saclay(Évry巴黎萨克雷大学LaMME研究中心)
;
Department of Applied Mathematics, The Hong Kong Polytechnic University(香港理工大学应用数学系)
;
Department of Industrial Engineering and Operations Research, Columbia University(哥伦比亚大学工业工程与运筹学系)
AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving
AMMA: 一种面向低延迟1M上下文注意力服务的多芯片片内存架构
Zhongkai Yu, Haotian Ye, Chenyang Zhou, Ohm Rishabh Venkatachalam, Zaifeng Pan, Zhengding Hu, Junsung Kim, Won Woo Ro, Po-An Tsai, Shuyi Pei, Yangwook Kang, Yufei Ding
机构
*
University of California, San Diego(加州大学圣迭戈分校)
;
Columbia University(哥伦比亚大学)
;
Yonsei University(延世大学)
;
NVIDIA(NVIDIA公司)
;
Samsung Semiconductor, Inc.(三星半导体公司)
DDO-RM: Distribution-Level Policy Improvement after Reward Learning
DDO-RM:奖励学习后基于分布的策略改进
Tiantian Zhang, Jierui Zuo, Michael Chen, Wenping Wang
机构
*
Department of Computer Science(计算机科学系)
;
Columbia University(哥伦比亚大学)
;
Department of Management Science and Engineering(管理科学与工程系)
;
Tsinghua University(清华大学)
;
Carnegie Mellon University(卡内基梅隆大学)