Meta Flow Maps enable scalable reward alignment
元流映射实现可扩展的奖励对齐
机构 * University of Oxford(牛津大学) ; Harvard University(哈佛大学) ; Kempner Institute(凯普纳研究所)
AI总结 提出元流映射(MFMs)框架,通过可微分的单步后验采样实现高效价值函数估计,从而无需轨迹模拟即可进行推理时引导和离策略微调,显著降低计算成本。
高校专区
元流映射实现可扩展的奖励对齐
机构 * University of Oxford(牛津大学) ; Harvard University(哈佛大学) ; Kempner Institute(凯普纳研究所)
AI总结 提出元流映射(MFMs)框架,通过可微分的单步后验采样实现高效价值函数估计,从而无需轨迹模拟即可进行推理时引导和离策略微调,显著降低计算成本。
深度Transformer动力学的统一视角
机构 * CNRS and Ecole Normale Supérieure PSL(CNRS和巴黎高等师范大学) ; Apple(苹果公司) ; Mathematical Institute, University of Oxford(牛津大学数学学院)
AI总结 提出Transformer PDE作为注意力层迭代的均场极限,证明其适定性并分析高斯初始数据下的各向异性演化与聚类现象。