arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-24 至 2026-07-24 共收录 18 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 9 篇

2607.20630 2026-07-24 cs.DB cs.AI cs.CL 新提交 81%

Demonstrating GenDB: Instance-Optimized and Customized Query Processing Code Generation via LLM Agents

展示GenDB:通过大语言模型代理实现实例优化和定制化查询处理代码生成

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对传统查询处理引擎扩展难题,提出GenDB生成式查询引擎,借助大语言模型代理生成代码。核心方法是通过LLM agents为特定场景生成优化代码,主要贡献是展示其工作流程、性能优势并提供用户探索平台。

Comments Accepted by VLDB 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20501 2026-07-24 cs.AI cs.MA 新提交 79%

MKEvolve: A Modular Multi-Agent Framework for Kernel Code Generation

MKEvolve:用于内核代码生成的模块化多智能体框架

Jason Yoo, Rajarshi Saha, Shaowei Zhu, Tao Yu, Wei Tang, Youngsuk Park

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 针对硬件加速器内核代码生成瓶颈,MKEvolve框架通过迭代共同进化PyTorch模块分解与子模块内核,经拆分融合优化分解并以束搜索改进子内核,实验证明其在正确性、加速及减少LLM令牌使用上有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20908 2026-07-24 cs.LG cs.AI 新提交 62%

Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习

Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Cisco AI Research(思科人工智能研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20638 2026-07-24 cs.AI cs.AR cs.CL 新提交 62%

WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

WaveformQA:对数字波形上的大语言模型时间推理进行基准测试

Yichuan Liu, Daniel Cummings, Nick Vadlamudi

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型对数字波形的时间推理能力,提出开源问答基准WaveformQA,含360个不同难度问题,波形由开源设计生成。评估发现模型在简单查询有准确率,但复杂问题上因窗口限制等性能下降,JSON表示可提高准确率,框架支持扩展实验。

Comments 10 pages; abridged version published in IEEE International Conference on LLM-Aided Design (ICLAD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20516 2026-07-24 cs.LG cs.AI 新提交 62%

Scaling Closed-Loop Feature Channel Configuration with LLMs

使用大语言模型扩展闭环特征通道配置

Tolgay Atinc Uzun, Radu Timofte, Dmitry Ignatov

机构 * University of Würzburg(维尔茨堡大学) Computer Vision Lab, CAIDAS & IFI(计算机视觉实验室,CAIDAS与IFI)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 研究用大语言模型扩展闭环特征通道配置,将搜索设置扩展到每个微调周期250个候选网络,分析大量候选网络,发现准确率呈正线性趋势,参数效率提高,还揭示了架构规律,表明通道搜索信号可转移。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20456 2026-07-24 cs.CL cs.AI 新提交 62%

Learn2Zinc: Fine-tuning Small Language Models for Text-to-Model Translation in MiniZinc

Learn2Zinc:微调小型语言模型以实现MiniZinc中的文本到模型翻译

Serdar Kadioglu, Karthik Uppuluri

机构 * AI Center of Excellence, Fidelity Investments(富达投资卓越人工智能中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 研究针对小型语言模型在MiniZinc文本到模型翻译的难题,提出跨模型错误引导方法,收集语法错误构建训练数据集微调模型,提升执行准确率至98%,虽语法可学但约束推理仍具挑战,且开源相关资源供后续研究。

Comments CP 2026 Workshop on LLMs meet Constraint Solving

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21292 2026-07-24 cs.AI cs.SY eess.SY 新提交 57%

An LLM-Driven Workflow for Automated Process Control Strategy Generation and Tuning from Dynamic Process Models

一种由大语言模型驱动的工作流程,用于从动态过程模型自动生成和调整过程控制策略

Ari Luna Rueda, Eike Cramer, Klaus Hellgardt, Mehmet Mercangöz

机构 * Imperial College London(帝国理工学院) University College London(伦敦大学学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究提出由大语言模型驱动的工作流程,用于从动态过程模型自动生成和调整控制策略,将设计任务分解为多步骤,经执行验证和修复,在气体预热器基准测试中生成控制结构与环境,贝叶斯优化降低闭环性能目标约26.5%,证明方法可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20806 2026-07-24 cs.AI 新提交 57%

Profiling Lightweight Large Language Models

轻量级大语言模型剖析

Tomohiro Harada, Enrique Alba, Gabriel Luque

机构 * Graduate School of Science and Engineering, Saitama University(埼玉大学理工学研究科) ITIS, University of Malaga(马拉加大学信息技术与系统研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究轻量级大语言模型在资源受限环境中的情况,提出基于PTME的实验框架,通过硬件级测量联合测量精度、时间、内存和能耗,对一组模型进行测试,发现代理描述符不足,揭示非主导配置,为不同资源下选模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20483 2026-07-24 cs.AI 新提交 57%

Tractable Hierarchical Control of Autoregressive Language Models

自回归语言模型的可处理分层控制

Max Scribner, Antonio Vergari, Vaishak Belle

机构 * University of Edinburgh(爱丁堡大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 研究如何约束自回归大语言模型生成,核心方法是将其提炼为可处理概率模型,利用有限时长$LR(k)$文法可多项式时间计算满足情况的特性,实现对LLM生成的有效约束与引导,确保输出满足形式句法约束。

Comments 21 pages, 4 figures, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2607.20972 2026-07-24 cs.AI cs.SE 新提交 81%

Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents

传递而非存储:线索锚定工作记忆作为编码代理的一种约束属性

Swapnanil Saha

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究编码代理记忆问题,提出基于认知文献的两层设计理论及线索锚定记忆模型,通过实际编码任务评估,表明传递而非存储是关键,可靠记忆通道应让代理无需思考,给出相关实验结果及贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20759 2026-07-24 cs.CR cs.AI cs.SE 新提交 81%

IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

IssueTrojanBench:针对恶意问题请求对人工智能编码代理进行基准测试

Ankur Singh, Jinqiu Yang, Tse-Hsun Chen

机构 * Concordia University(康科德大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对恶意问题请求对人工智能编码代理进行基准测试,通过构建包含多种攻击类别和交付向量的新型基准IssueTrojanBench,发现现代编码代理存在关键漏洞,强调需更强安全机制保护。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 4 篇

2607.20478 2026-07-24 cs.SE cs.AI 新提交 76%

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

用于基础设施即代码生成的智能语言模型的验证优先评估

Mohamed Jouini

专题命中 代码评测 :code generation(title);分类 cs.SE、cs.AI

AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。

Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20911 2026-07-24 cs.CL cs.SE 新提交 73%

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

腾讯工作伙伴基准测试:一个具有抗污染任务构建的多领域编码智能体基准测试

Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao, Zihan Xu, Zhiheng Lyu, Zhijian Shao, Yuchen Shi, Shuwen Zhang, Chaofan Qiu, Linjie Che, Xiaoxi Zhao, Feng Wu, Kai Zhang, Chaofan Zhu, Yubin Qi, Xiaoyun Liang, Peijie Dong, Yunhao Zhang, Yuanjie Zhu, Ling Jiang, Xianjun Zhang, Zhehang Chu, Anyuan Sang, Zhen Feng, Sen Nie, Shi Wu, Yuanzhen Xu, Xin Li, Ning Yang, Zhiqiang Dong, Hande Dong, Qiang Lin, Yi Liu, Yunsheng Wu, Ke Li, Xing Sun

机构 * Tencent(腾讯) Youtu Lab(腾讯优图实验室) Keen Security Lab(腾讯安全科恩实验室) Workbuddy(腾讯工作伙伴) Yunding Security Lab(腾讯云鼎实验室)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL

AI总结 介绍腾讯工作伙伴基准测试这一多领域编码智能体评估套件,核心是统一评估框架,任务经反向设计防污染,数据集公开,四个子集探测工作不同方面,以统一格式和协议运行,还给出跨模型排行榜。

Comments 30 pages, 9 figures. Project page: https://workbuddybench.com/ ; code: https://github.com/Tencent/workbuddy-bench ; dataset: https://huggingface.co/datasets/tencent/workbuddy-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21003 2026-07-24 cs.LG 新提交 57%

ADABORD: a novel AdaBoost approach for ordinal classification

ADABORD:一种用于有序分类的新型AdaBoost方法

Rafael Ayllón-Gavilán, Francisco José Martínez-Estudillo, David Guijo-Rubio, César Hervás-Martínez, Pedro A. Gutiérrez

机构 * IMIBIC(IMIBIC(初级保健临床流行病学研究部)) Universidad de Córdoba(科尔多瓦大学) Universidad Loyola Andalucía(安达卢西亚洛约拉大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 研究有序分类问题,提出ADABORD框架,将类别顺序特性融入AdaBoost算法关键组件,在TOC-UCO库与七种方法比较,实验表明其显著优于竞品,尤其在多类数据集上,且公开代码等方便后续研究。

Comments 42 pages, 6 figures, 7 tables. Submitted to CS top tier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20518 2026-07-24 cs.AI 新提交 57%

CANN Bench: Benchmarking Agent Generated Kernels against Real NPU and Algorithmic Limits

CANN基准测试:针对真实NPU和算法限制对代理生成的内核进行基准测试

Xue-Jian Gao, Deng Pan, Yueming Su, Jiasheng Li, Bin Du, Fengming Zhu, Chengdi Ma, Junyi Fan, Qichen Liao, Chengqiu Hu, Xinxian Chen, Lingchao Zheng, Jun Li, Jiwei Yang, Yuwei Fan

机构 * Huawei(华为)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究针对人工智能代理生成的算子内核在Ascend NPU上缺乏通用评估基线的问题,提出CANN Bench基准测试,涵盖多算子和测试用例,采用三维加权综合评分,为Ascend生态系统提供评估算子编写能力的标准。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 1 篇

2607.21217 2026-07-24 cs.AI 新提交 83%

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

ICAE-Bench:将编码智能体评估为交互式项目构建者

Zhongyuan Peng, Dan Huang, Chuyu Zhang, Caijun Xu, Changyi Xiao, Shibo Hong, David Lo, Lin Qiu, Xuezhi Cao, Jiyuan He, Yixin Cao

机构 * Meituan(美团)

专题命中 仓库级理解 :coding agent(title,abstract);repository(abstract);分类 cs.AI

AI总结 研究针对编码智能体在交互式项目构建中作用转变,现有基准未跟上的问题,提出ICAE-Bench基准。从模糊需求出发,经自动化用户智能体模拟动态范式,引入避免需求模糊性、确保用户模拟质量、公平评估开放式仓库的关键设计。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 程序分析与验证 1 篇

2607.21491 2026-07-24 cs.CL cs.LG 新提交 76%

What, Where, and How: Disentangling the Roles of Task, Language, and Model in Code Model Representations

是什么、在哪里以及如何:解开任务、语言和模型在代码模型表示中的作用

Piotr Wilam

机构 * University College London(伦敦大学学院)

专题命中 程序分析与验证 :code model(title);分类 cs.CL、cs.LG

AI总结 研究独立训练的语言模型在代码表示上的情况,通过2x2设计扩展概念电路提取方法,测量语法概念,发现任务决定概念获专用电路,模型决定电路位置及增长方式,还得出如Rust与Python电路差异等结论,为后续测试奠定基础。

Comments 16 pages, 11 figures, 6 tables. Code: https://github.com/piotrwilam/Atlas2x2 ; dataset: https://huggingface.co/datasets/piotrwilam/Atlas2x2

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他AI编程 1 篇

2607.20950 2026-07-24 cs.LG 新提交 57%

Best-of-Evidence: Best-of-N Selection under Partial Verification

最佳证据:部分验证下的最佳N选择

Cenwei Zhang, Teng Fang, Yuxia Wang, Derek Li, Bryan Dai, Lei You

机构 * IQuest Research(IQuest研究公司) INSAIT(INSAIT公司) Technical University of Denmark(丹麦技术大学)

专题命中 其他AI编程 :code model(abstract);分类 cs.LG

AI总结 研究视觉语言任务中部分验证问题,提出最佳证据(BoE)推理时选择框架,保持候选池固定,用图表示主张并分配预算,形式化部分验证选择,有实用控制器,实验表明其能改进选择并揭示相关限制。

Comments 3 figures, 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏