arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-16 至 2026-07-16 共收录 8 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2603.12712 2026-07-16 cs.SE cs.LG 版本更新 84%

Design-Specification Tiling for ICL-based CAD Code Generation

基于ICL的CAD代码生成的Design-Specification Tiling设计

Yali Du, San-Zhuo Xi, Hui Sun, Ming Li

机构 * National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University(新型软件技术国家实验室,人工智能学院,南京大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.LG

AI总结 本文提出DST方法,通过量化知识充分性提升CAD代码生成质量,优于现有ICL示例选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 84%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 代码生成 :code generation(title,abstract);code model(abstract);分类 cs.SE、cs.CL

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18548 2026-07-16 cs.SE cs.AI 版本更新 81%

1D-Bench: A Benchmark for Iterative UI Code Generation with Visual Feedback in Real-World

1D-Bench: 一个用于具有实时反馈的现实世界迭代UI代码生成的基准

Qiao Xu, Yipeng Yu, Chengxiao Feng, Xu Liu

专题命中 代码生成 :code generation(title);repository(abstract);分类 cs.SE、cs.AI

AI总结 1D-Bench通过现实电商工作流提供迭代UI代码生成基准,测试模型在中间表示缺陷下的鲁棒性,实验表明迭代编辑能提升渲染成功率和视觉相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13820 2026-07-16 cs.SE 新提交 79%

PROBE: Benchmarking Code Generation in Large Language Models

PROBE:大语言模型中代码生成的基准测试

Rodrigo Pato Nogueira, Marco Vieira, João R. Campos

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 针对大语言模型代码生成评估不足,介绍PROBE基准框架,基于多维度评估代码,用于评估多种模型和语言,发现LLMs虽有成果,但处理难题及小模型在特定语言上有困难,且常因易避免错误失败。

Comments Accepted for publication in Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10057 2026-07-16 quant-ph cs.AI cs.CV cs.LG 交叉投稿 76%

Quantum Circuit Vision: Cost-Aware Evaluation of Visual AI Agents for Quantum Code Generation

量子电路视觉:用于量子代码生成的视觉人工智能代理的成本感知评估

Dongping Liu, Aoyu Zhang, Luyao Zhang

机构 * Amazon Web Services(亚马逊网络服务) Duke Kunshan University(杜克昆山大学)

专题命中 代码生成 :code generation(title);分类 cs.AI、cs.LG

AI总结 研究人工智能代理对量子电路图的理解及代码生成成本,提出量子电路视觉评估框架,构建基准并评估模型,发现中级模型在成本-准确性上平衡最佳,电路深度是失败主因,提出级联路由策略并开源数据集及代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02317 2026-07-16 cs.LG cs.AI cs.CY 62%

Defining and Evaluating Physical Safety for Large Language Models

定义和评估大语言模型的物理安全性

Yung-Chen Tang, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) IBM Research(IBM研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种无人机控制的全面基准,评估大语言模型在物理安全方面的风险与权衡,揭示了模型在安全性和实用性之间的不理想平衡。

Journal ref Communications of the ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14477 2026-07-16 cs.LG 版本更新 57%

Test-Time Learning with an Evolving Library

测试时学习与进化库

Weijia Xu, Alessandro Sordoni, Chandan Singh, Zelalem Gero, Michel Galley, Xingdi Yuan, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 EvoLib通过维护知识库实现大语言模型在不同实例间积累和进化知识,无需参数更新或外部监督,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13407 2026-07-16 cs.DB 新提交 50%

From Interpretation to Compilation: Compilation-Based Execution of Semantic Operators [Vision]

从解释到编译:基于编译的语义算子执行 [视觉]

Wenkai Dong, Yifan Wang

专题命中 代码生成 :program synthesis(abstract)

AI总结 研究语义算子系统执行效率问题,提出基于编译的执行方法,在编译时调用LLM将算子规范转为可执行代码,本地运行减少调用次数,应用于多种算子并集成到系统,初步结果显示减少了执行时间和调用次数,还拓展了LLM在该领域的角色认知。

详情

展开后加载摘要…

URL PDF HTML 收藏