RAMAC: Multimodal Risk-Aware Offline Reinforcement Learning and the Role of Behavior Regularization
RAMAC: 多模态风险感知离线强化学习及行为正则化的作用
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 提出RAMAC框架,结合分布性评论家与生成式演员(如扩散模型),通过条件风险价值与行为克隆的复合目标实现离线强化学习中的风险敏感学习,抑制分布外动作并提升CVaR。
Comments ICML 2026