Optimizing CUDA like a Human: Micro-Profiling Tools as Expert Surrogates for LLM-Based GPU Kernel Optimization
像人类一样优化CUDA:微剖析工具作为基于LLM的GPU内核优化的专家替代品
机构 * Amazon(亚马逊) ; Siemens(西门子) ; University of Minnesota(明尼苏达大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出KernelPro闭环多智能体系统,通过LLM代码生成与硬件剖析反馈及可插拔瓶颈检测工具迭代优化GPU内核,在KernelBench上实现2.42x/4.69x/5.30x加速比,并首次兼顾能效优化。