arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-17 至 2026-06-17 共收录 22 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2606.18023 2026-06-17 cs.LG cs.AI 新提交 62%

LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling

LoopCoder-v2: 仅循环一次以实现高效的测试时计算扩展

Jian Yang, Shawn Guo, Wei Zhang, Tianyu Zheng, Yaxin Du, Haau-Sing Li, Jiajun Wu, Yue Song, Yan Xing, Qingsong Cai, Zelong Huang, Chuan Hao, Ran Tao, Xianglong Liu, Wayne Xin Zhao, Mingjie Tang, Weifeng Lv, Ming Zhou, Bryan Dai

机构 * Beihang University(北京航空航天大学) IQuest Research Langboat(浪波) Renmin University of China(中国人民大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出并行循环Transformer(PLT)并研究循环次数选择,发现两循环变体在代码生成等任务上显著提升,而三循环以上性能下降,揭示了增益-成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17514 2026-06-17 cs.SE cs.AI 新提交 62%

Unlocking LLM Code Correction with Iterative Feedback Loops

解锁大语言模型代码修正的迭代反馈循环

Le Zhang, Suresh Kothari

机构 * Iowa State University(爱荷华州立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究通过执行反馈迭代修正代码的能力,提出评估指标并分析推理与非推理模型在利用反馈上的差异,发现推理模型显著优于非推理模型,且语法和运行时错误比逻辑错误更易修正。

Comments 22 pages, 14th Computing Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11715 2026-06-17 cs.LG cs.CL 版本更新 62%

DICE: Diffusion Large Language Models Excel at Generating CUDA Kernels

DICE:扩散大语言模型在生成CUDA内核方面表现出色

Haolei Bai, Lingcheng Kong, Xueyi Chen, Jianmian Wang, Zhiqiang Tao, Huan Wang

机构 * Westlake University(西湖大学) Hong Kong University of Science and Technology(香港科技大学) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出CuKe数据集和BiC-RL训练框架,构建DICE系列扩散大语言模型(1.7B/4B/8B),在KernelBench上显著优于同类自回归和扩散模型,实现CUDA内核生成新SOTA。

Comments v2: Expanded with dLLM vs. autoregressive LLM comparisons, ablation studies, and qualitative case studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17696 2026-06-17 cs.AI cs.GR 新提交 57%

FllumaOne: A Code-Native Multimodal CAD Dataset with Executable Programs and Kernel-Validated Feature Histories

FllumaOne:一个代码原生多模态CAD数据集,包含可执行程序与内核验证的特征历史

Jizong Zhan

机构 * Qt/C++ OpenCASCADE-based CAD system(基于Qt/C++ OpenCASCADE的CAD系统)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 提出FllumaOne数据集,通过可执行Python程序生成CAD模型,对齐程序、特征树、几何等模态,支持可编辑逆向工程等任务。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03045 2026-06-17 cs.LG 版本更新 57%

Clarify Before You Draw: Proactive Agents for Robust Text-to-CAD Generation

先澄清再绘制:面向鲁棒文本到CAD生成的主动式智能体

Bo Yuan, Zelin Zhao, Petr Molodyk, Bin Hu, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码生成 :coding agent(abstract);分类 cs.LG

AI总结 提出主动式智能体框架ProCAD,通过澄清代理在代码生成前解决用户提示中的歧义,再通过CAD编码代理生成可执行程序,显著提升鲁棒性,平均Chamfer距离降低79.9%。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16534 2026-06-17 cs.DC 新提交 50%

Generated, Parallel, Scalable? A Study of Agentic AI-Generated Julia Code on Supercomputers

生成、并行、可扩展?超级计算机上智能体AI生成的Julia代码研究

Linus Bantel, Anna-Lena Roth, Jonas Posner, Dirk Pflüger

专题命中 代码生成 :code generation(abstract)

AI总结 研究智能体AI生成并行Julia代码的能力,发现小规模输入可靠但大规模扩展时出现死锁等问题,商业模型优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2606.17058 2026-06-17 cs.DC 新提交 78%

Evaluating LLM Coding Agents on SZ-Family Lossy Compression Across Architectures

评估LLM编码代理在不同架构上的SZ系列有损压缩

Changqing Li, Shouwei Gao, Kai Zhao, Sheng Di, Wenqian Dong

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 评估LLM编码代理在SZ系列有损压缩内核上的表现,发现GPU上强模型性能高但对提示敏感,Cerebras上主要挑战是生成可运行程序,且代理在模块化内核上更有效。

Comments 5 pages, 4 figures. Accepted to IPDPS 2026 HPAI4S Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18168 2026-06-17 cs.SE cs.AI 新提交 73%

All Smoke, No Alarm: Oracle Signals in Agent-Authored Test Code

全是烟雾,没有警报:智能体编写的测试代码中的Oracle信号

Dipayan Banik, Kowshik Chowdhury, Shazibul Islam Shamim

机构 * Dipayan Banik(迪帕扬·班克) Kowshik Chowdhury(克什基·乔乌德里) Shazibul Islam Shamim(沙齐布·伊斯兰·沙米)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能体编写的测试代码中Oracle信号的存在情况,发现80.2%的测试补丁缺乏强Oracle信号,但强Oracle与合并可能性显著正相关(OR=1.28)。

Comments Accepted at the 8th IEEE International Conference on Artificial Intelligence Testing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17099 2026-06-17 cs.SE cs.AI 新提交 62%

Software Delegation Contracts: Measuring Reviewability in AI Coding-Agent Work

软件委托合约:衡量AI编码代理工作中的可审查性

Vincent Schmalbach

机构 * Independent Researcher(独立研究员)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究通过显式委托合约提升AI编码代理工作可审查性,实验发现合约虽不改善任务正确性,但显著提高证据充分性和降低审查歧义。

Comments 11 pages; empirical pilot study with 64 coding-agent runs and 192 blinded reviews

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10728 2026-06-17 cs.SE 新提交 57%

DeNovoSWE: Scaling Long-Horizon Environments for Generating Entire Repositories from Scratch

DeNovoSWE:扩展长时域环境以从零生成完整仓库

Jiale Zhao, Guoxin Chen, Fanzhe Meng, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 提出DeNovoSWE数据集,通过沙盒代理工作流自动构建4818个从文档生成完整仓库的实例,采用分治与批评修复策略及难度感知轨迹过滤,微调Qwen3-30B-A3B将BeyondSWE-Doc2Repo基准得分从5.8%提升至47.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2606.17612 2026-06-17 cs.SE 新提交 79%

PracRepair: LLM-Empowered Automated Program Repair Inspired by Human-Like Debugging Practices

PracRepair: 受人类调试实践启发的大语言模型赋能自动化程序修复

Yu Cheng, Zhongxin Liu, Zhenchang Xing, Chao Ni, Qing Huang, Xiaoxue Ren

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 提出PracRepair框架,通过构建按需静态-动态上下文、进行问题驱动的故障诊断并迭代细化补丁,利用动态信息提升LLM在程序修复中的效果,在Defects4J和真实世界漏洞上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2606.16072 2026-06-17 cs.CR cs.AI 新提交 57%

MASCOT-Android: A Curated Dataset and Automated Collection Pipeline for Android Malware Source Code Specimens

MASCOT-Android: 一个用于安卓恶意软件源代码样本的精选数据集与自动收集管道

Bojing Li, Duo Zhong, Prajna Bhandary, Raguvir S, Charles Maxa, Robert J Joyce, Charles Nicholas

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 测试生成 :repository(abstract);分类 cs.AI

AI总结 提出MASCOT-Android数据集和自动收集框架,利用仓库级文档(README)训练LinearSVC分类器,以96.28%准确率和1.06%假阳性率从GitHub发现恶意软件源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 2 篇

2603.03824 2026-06-17 cs.AI cs.CL cs.LG cs.MA 版本更新 67%

In-Context Environments Induce Evaluation-Awareness in Language Models

上下文环境诱导语言模型中的评估意识

Maheep Chaudhary

机构 * Independent(独立)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出黑盒对抗优化框架,通过优化上下文提示诱导语言模型产生评估意识并策略性低表现(沙袋效应),实验显示优化提示可使算术任务准确率下降高达94个百分点,且沙袋效应主要由评估意识推理驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17861 2026-06-17 cs.CL 新提交 57%

GameCraft-Bench: Can Agents Build Playable Games End-to-End in a Real Game Engine?

GameCraft-Bench:智能体能否在真实游戏引擎中端到端构建可玩游戏?

Tongxu Luo, Rongsheng Wang, Jiaxi Bi, Chenming Xu, Zhengyang Tang, Jianlong Chen, Juhao Liang, Ke Ji, Shuqi Guo, Yuhao Du, Fan Bu, Wenyu Du, Xiaotong Zhang, Kyle Li, Shaobo Wang, Linfeng Zhang, Yuxuan Liu, Xin Lai, Chenxin Li, Yiduo Guo, Zhexin Zhang, Xinyuan Wang, Tianyi Bai, Ziniu Li, Benyou Wang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Hunyuan Team, Tencent(腾讯混元团队) USTB(北京科技大学) DualverseAI SJTU(上海交通大学) NUS(新加坡国立大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL

AI总结 提出GameCraft-Bench基准,评估编码智能体在Godot引擎中端到端生成可玩游戏的能力,最强智能体仅达41.46%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 7 篇

2606.18237 2026-06-17 cs.CL cs.AI cs.LG 新提交 82%

ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计

Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Datadog

专题命中 仓库级理解 :repository(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17374 2026-06-17 cs.LO cs.PL cs.SE 新提交 62%

Verifying the Rust Standard Library

验证 Rust 标准库

Byron Cook, Remi Delmas, Zyad Hassan, Bart Jacobs, Ranjit Jhala, Rahul Kumar, Felipe R. Monteiro, Thanh Nguyen, Rebecca Rumbul, Michael Tautschnig, Celina Val, Carolyn Zech

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.PL

AI总结 通过众包方式集成多种验证工具,对 Rust 标准库中的不安全代码进行静态验证,发现并修复未定义行为,展示了大规模验证的可行性与挑战。

Comments Published at 18th NASA Formal Methods Symposium (NFM 2026)

Journal ref In: Deshmukh, J., Havelund, K., Pinto, A. (eds) NASA Formal Methods. NFM 2026. Lecture Notes in Computer Science, vol 16622. Springer, Cham, pp. 415-435

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07429 2026-06-17 cs.LG cs.AI 版本更新 62%

Brep2Shape: Boundary and Shape Representation Alignment via Self-Supervised Transformers

Brep2Shape:通过自监督变换器对齐边界与形状表示

Yuanxu Sun, Yuezhou Ma, Haixu Wu, Guanyang Zeng, Muye Chen, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(清华大学软件学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 提出Brep2Shape自监督预训练方法,利用双Transformer骨干和拓扑注意力对齐B-rep的抽象边界表示与直观形状表示,在多项下游任务中达到最优精度并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17858 2026-06-17 cs.LG 新提交 57%

Meta-classification of one-class classification models using ranking correlation and nearest neighbor

使用排序相关性和最近邻的一类分类模型的元分类

Toshitaka Hayashi, Hamido Fujita, Dalibor Cimr, Richard Cimler, Jitka Kühnová

机构 * Faculty of Science, University of Hradec Kralove(赫拉德茨-克拉洛韦大学理学院) Malaysia-Japan International Institute of Technology (MJIIT), Universiti Teknologi Malaysia(马来西亚-日本国际技术学院,马来西亚理工大学) Regional Research Center, Iwate Prefectural University(岩手县立大学区域研究中心)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 提出用排序相关性和最近邻对一类分类模型进行元分类,实验表明能高精度区分数据集、算法和超参数,本质是数据集分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17628 2026-06-17 cs.CL 新提交 57%

OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation

OPD-Evolver:通过在线策略蒸馏培养整体智能体进化器

Guibin Zhang, Xun Xu, Yanwei Yue, Zikun Su, Wangchunshu Zhou, Xiaobin Hu, Shuicheng Yan

机构 * LV-NUS Lab(林文实验室) FDU(福建大学) PKU(北京大学) Bytedance Inc.(字节跳动公司)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 提出OPD-Evolver框架,通过快慢双循环和在线策略自蒸馏,使智能体学会选择、使用、编写和维护经验,在多个基准上超越现有方法,并让小模型挑战大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18032 2026-06-17 math.NA cs.LG cs.NA physics.comp-ph 新提交 57%

INI-VPINN: A Variational Physics-Informed Neural Network with Implicit Neumann and Interface Handling for Multi-Material Domains with Geometric Singularities

INI-VPINN:一种隐式处理纽曼边界和界面的变分物理信息神经网络,适用于具有几何奇异性的多材料域

Shayan Dodge, Alessandro Formisano, Sami Barmada

机构 * DESTeC University of Pisa(DESTeC 帕尔米斯大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 提出一种新的弱形式物理信息神经网络INI-VPINN,通过隐式处理纽曼边界和界面条件,无需额外损失项或多子域网络,在多材料问题中实现更高精度和更快收敛。

Comments Preprint version. Under peer review. Code available at: https://github.com/ShayanDodge/INI-VPINN

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18210 2026-06-17 cs.SI 新提交 50%

Structural and Temporal Hallmarks of Genealogical Networks

家系网络的结构与时间标志

Japheth Carlson, Teayoun Kim, Matthew Lawyer, Wyatt Pochman, Emeline Thygerson, Benjamin Webb

专题命中 仓库级理解 :repository(abstract)

AI总结 通过结合网络理论与推断时间的方法,分析上百个家系数据集,发现人类亲缘网络具有无标度度分布、小世界等普适结构特征,并引入伪世代提取时间结构。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 程序分析与验证 1 篇

2603.16437 2026-06-17 cs.PL math.CT math.LO 57%

Dimensional Type Systems and Deterministic Memory Management: Design-Time Semantic Preservation in Native Compilation

维度类型系统与确定性内存管理:原生编译中的设计时语义保留

Houston Haynes

专题命中 程序分析与验证 :code generation(abstract);分类 cs.PL

AI总结 本文提出一种编译框架,通过多阶段MLIR降低保持维度类型注解,使编译器能联合解决数值表示选择和确定性内存管理作为程序语义图的共同效应。维度推断确定值范围,进而决定表示选择、字宽、内存占用、分配策略和跨目标传输保真度。

Comments 33 pages, 8 tables, 3 appendices with extended examples

详情

展开后加载摘要…

URL PDF HTML 收藏