Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation
用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习
机构 * Iowa State University(爱荷华州立大学) ; Cisco AI Research(思科人工智能研究院)
AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。