Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation
看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI
AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。