arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-11 至 2026-05-11 共收录 2 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 2 篇

2605.07342 2026-05-11 cs.LG cs.AI cs.SE 67%

Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate

Mage:多轴评估LLM生成的可执行游戏场景超越编译通过率

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology and University of Gothenburg(楚尔姆斯理工大学和哥德堡大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出Mage多轴评估框架,通过编译通过率、运行通过率、结构保真度和机制符合度四个维度评估LLM生成的游戏场景,发现编译通过率与功能正确性反相关,证明多轴评估对检测领域差异的必要性。

Comments Main Content: 10 pages, 1 figure. In total 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15744 2026-05-11 cs.AR cs.PF 50%

Cleaning up the Mess: Re-Evaluating the Real-System Modeling Accuracy of Ramulator 2.0

清理混乱:重新评估Ramulator 2.0真实系统建模精度

F. Nisa Bostanci, Haocong Luo, Ataberk Olgun, Maria Makeenkova, Geraldo F. Oliveira, A. Giray Yaglikci, Onur Mutlu

专题命中 代码评测 :repository(abstract)

AI总结 本文指出Mess论文存在技术配置错误、方法论问题及不完整的工具包,导致Ramulator 2.0和DAMOV的模拟结果不可复现,纠正了其对真实系统性能的错误结论。

Comments Extended version of our publication at IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏