UIBenchKit: A unified toolkit for design-to-code model evaluation
UIBenchKit:一个统一的用于设计到代码模型评估的工具包
专题命中 代码评测 :code model(title);code generation(abstract);分类 cs.SE
AI总结 本文提出UIBenchKit,一个统一的工具包,用于评估设计到代码任务,提供一致的环境和分析接口,推动网页工程的基准测试和创新。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
UIBenchKit:一个统一的用于设计到代码模型评估的工具包
专题命中 代码评测 :code model(title);code generation(abstract);分类 cs.SE
AI总结 本文提出UIBenchKit,一个统一的工具包,用于评估设计到代码任务,提供一致的环境和分析接口,推动网页工程的基准测试和创新。
用可重用的跨领域管道评估AI会议摘要
机构 * Cisco Systems, Inc.(思科系统公司)
专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一个可重用的跨领域管道,用于评估AI会议摘要,通过结构化真实数据构建、固定候选生成、基于声明评分等方法,在114次会议上验证了不同模型的性能,发现gpt-5.1在保留性上表现更优。
Comments AI Application Feature Quality Evaluation (28 pages total)
MIDST挑战赛在SaTML 2025: 基于扩散模型的合成表格数据的成员推断
机构 * Vector Institute
专题命中 代码评测 :repository(abstract);分类 cs.LG
AI总结 本文探讨了基于扩散模型生成的合成表格数据在隐私保护方面的有效性,重点评估其对成员推断攻击的抗性,并开发了针对这些模型的新型攻击方法。
Comments 4 page, 1 table
形式猜想:一个开放且不断演进的数学验证发现基准
机构 * Google DeepMind(谷歌DeepMind) ; Imperial College London(帝国理工学院伦敦分校) ; Stockholms universitet(斯德哥尔摩大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 Formal Conjectures提供2615个形式化的数学问题,包含1029个开放猜想和836个已解决问题,用于评估自动化推理系统的能力,并通过协作项目确保正确性,推动数学证明发现的进展。
Comments 21 pages, 4 figures, 5 tables
CiteVQA:可信赖文档智能的证据归因基准测试
机构 * Peking University(北京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 代码评测 :repository(abstract);分类 cs.CL
AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。
安卓会为打破游戏而做梦吗?通过BenchJack系统性审计AI代理基准
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 代码评测 :coding agent(abstract);分类 cs.AI
AI总结 本文提出BenchJack系统,通过自动化红队系统审计AI代理基准,发现219种奖励黑客漏洞,提升基准鲁棒性。