HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks
HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试
机构 * Peking University(北京大学)
专题命中 程序修复 :repository(abstract);分类 cs.AI
AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。