arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-14 至 2026-05-14 共收录 6 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 6 篇

2605.13141 2026-05-14 cs.SE 79%

UIBenchKit: A unified toolkit for design-to-code model evaluation

UIBenchKit:一个统一的用于设计到代码模型评估的工具包

Chinh T. Le, Trevor Ong Yee Siang, Jingyu Xiao, Yuxuan Wan, Yintong Huo

专题命中 代码评测 :code model(title);code generation(abstract);分类 cs.SE

AI总结 本文提出UIBenchKit,一个统一的工具包,用于评估设计到代码任务,提供一致的环境和分析接口,推动网页工程的基准测试和创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21345 2026-05-14 cs.AI cs.CL 62%

Evaluating AI Meeting Summaries with a Reusable Cross-Domain Pipeline

用可重用的跨领域管道评估AI会议摘要

Philip Zhong, Don Wang, Jason Zhang

机构 * Cisco Systems, Inc.(思科系统公司)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个可重用的跨领域管道,用于评估AI会议摘要,通过结构化真实数据构建、固定候选生成、基于声明评分等方法,在114次会议上验证了不同模型的性能,发现gpt-5.1在保留性上表现更优。

Comments AI Application Feature Quality Evaluation (28 pages total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19185 2026-05-14 cs.LG 57%

MIDST Challenge at SaTML 2025: Membership Inference over Diffusion-models-based Synthetic Tabular data

MIDST挑战赛在SaTML 2025: 基于扩散模型的合成表格数据的成员推断

Masoumeh Shafieinejad, Xi He, Mahshid Alinoori, John Jewell, Sana Ayromlou, Wei Pang, Veronica Chatrath, Gauri Sharma, Deval Pandya

机构 * Vector Institute

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文探讨了基于扩散模型生成的合成表格数据在隐私保护方面的有效性,重点评估其对成员推断攻击的抗性,并开发了针对这些模型的新型攻击方法。

Comments 4 page, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13171 2026-05-14 cs.AI 57%

Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics

形式猜想:一个开放且不断演进的数学验证发现基准

Moritz Firsching, Paul Lezeau, Salvatore Mercuri, Miklós Z. Horváth, Yaël Dillies, Calle Sönne, Eric Wieser, Fred Zhang, Thomas Hubert, Blaise Agüera y Arcas, Pushmeet Kohli

机构 * Google DeepMind(谷歌DeepMind) Imperial College London(帝国理工学院伦敦分校) Stockholms universitet(斯德哥尔摩大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 Formal Conjectures提供2615个形式化的数学问题,包含1029个开放猜想和836个已解决问题,用于评估自动化推理系统的能力,并通过协作项目确保正确性,推动数学证明发现的进展。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12882 2026-05-14 cs.CL cs.CV 57%

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA:可信赖文档智能的证据归因基准测试

Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12673 2026-05-14 cs.AI cs.CR 57%

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

安卓会为打破游戏而做梦吗?通过BenchJack系统性审计AI代理基准

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出BenchJack系统,通过自动化红队系统审计AI代理基准,发现219种奖励黑客漏洞,提升基准鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏