Robust Parameter Learning for Uncertain MDPs
不确定马尔可夫决策过程的鲁棒参数学习
机构 * University of Oxford(牛津大学)
AI总结 本文提出通过参数马尔可夫决策过程(pMDPs)学习不确定MDPs,利用统计不确定性将经验转移频率投影到参数空间,生成更精确的PAC不确定性模型,通过多级多边形外近似解决算法挑战。
高校专区
不确定马尔可夫决策过程的鲁棒参数学习
机构 * University of Oxford(牛津大学)
AI总结 本文提出通过参数马尔可夫决策过程(pMDPs)学习不确定MDPs,利用统计不确定性将经验转移频率投影到参数空间,生成更精确的PAC不确定性模型,通过多级多边形外近似解决算法挑战。
Sonata:一种用于临床数据稀缺情况下的六轴躯干IMU表示学习的混合世界模型
机构 * TimeTrace Labs(TimeTrace实验室) ; NVIDIA ; University of Oxford(牛津大学)
AI总结 Sonata在临床数据稀缺情况下,通过混合世界模型实现了六轴躯干IMU的高效表示学习,具有更强的临床判别能力、前瞻性跌倒风险预测和跨群体迁移能力。
Comments 18 pages, 3 figures
基于连续思维的马尔可夫链深度思考
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) ; Department of Statistics, University of Oxford(牛津大学统计系) ; Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) ; Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学)
AI总结 本文提出MarCos模型,通过连续表示实现多步推理,提升数学任务处理速度,实现并行思维。