arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-10 至 2026-06-10 共收录 14 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2606.09867 2026-06-10 cs.AR cs.AI 新提交 79%

EstRTL: Functional Estimation Guided RTL Code Generation

EstRTL:功能估计引导的RTL代码生成

Qi Xiong, Renzhi Chen, Bowei Wang, Yuqing Xiong, Libo Huang, Lei Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Defense Innovation Institute, Academy of Military Science (AMS)(军事科学院创新院) School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Key Laboratory of Advanced Microprocessor Chips and Systems, Changsha, China, and College of Computer Science and Technology, National University of Defense Technology, Changsha, China(先进微处理器芯片与系统重点实验室,长沙,中国,和国防科技大学计算机科学与技术学院,长沙,中国) Defense Innovation Institute, AMS, Beijing, China and Qiyuan Lab, Beijing, China(军事科学院创新院,北京,中国和启元实验室,北京,中国)

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 提出EstRTL框架,通过静态功能评分估计,结合生成、评估和修正三阶段范式,提升LLM生成RTL代码的功能正确性,在通用LLM上正确率提升3.2%-9.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10956 2026-06-10 cs.AI cs.CL 新提交 62%

Mind the Gap: Can Frontier LLMs Pass a Standardized Office Proficiency Exam?

注意差距:前沿大语言模型能否通过标准化办公能力考试?

Tengchao Lv, Dongdong Zhang, Jiayu Ding, Yilin Jia, Yuzhong Zhao, Yupan Huang, Wenshan Wu, Xiangyang Zhou, Shaohan Huang, Nan Yang, Li Dong, Lei Cui, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 基于中国计算机等级考试(NCRE)的200个综合操作任务,评估7个前沿LLM在Word、Excel和PowerPoint自动化中的表现,发现单轮模型最高得分率36.6%,带执行反馈的智能体系统达68.8%,仍低于95.5%的社区参考分,表明可靠细粒度办公自动化仍是重大挑战。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09956 2026-06-10 cs.SE cs.LG 新提交 62%

Multi-task LLMs for Bug Classification: Efficient Inference with Auxiliary Decoding Heads

多任务大语言模型用于缺陷分类:基于辅助解码头的高效推理

Nikolai Rozanov

机构 * Recurse Ltd. Department of Computing, Imperial College London(帝国理工学院计算机系)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 提出一种轻量级多任务大语言模型(MLC),通过令牌对齐算法和优化训练策略,实现全文件上下文下的行级缺陷定位,性能与代理方法相当但推理延迟降低数个数量级。

Comments 8 pages, 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10928 2026-06-10 cs.CE cs.AI cs.LG physics.comp-ph 新提交 62%

A Constrained Natural-Language Interface for Variational Multi-Physics Finite Element Simulations in FEniCS

FEniCS中变分多物理场有限元模拟的受约束自然语言接口

Nilay Upadhyay, Wesley F. Reinhart

机构 * Department of Engineering Science and Mechanics, The Pennsylvania State University(工程科学与力学系,宾夕法尼亚州立大学) Department of Materials Science and Engineering, The Pennsylvania State University(材料科学与工程系,宾夕法尼亚州立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出一种受约束的自然语言接口,将LLM限制在前端任务(解析提示、生成Gmsh代码),后端使用确定性模板求解器,在基准测试中实现100%解析率和90%几何生成成功率。

Comments 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10945 2026-06-10 cs.CR cs.SE 新提交 57%

Context-Based Adversarial Attacks on AI Code Generators: Vulnerability Analysis and Implications

基于上下文的AI代码生成器对抗攻击:漏洞分析与影响

Walther A. Del Orbe, John D. Hastings, Varghese Vaidyan

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究通过2800次实验,发现上下文对抗攻击使代码生成漏洞增加10.7倍,并提出双层防御框架实现89.1%检测率。

Comments 6 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10752 2026-06-10 cs.AI 新提交 57%

AutoPDE: Reliable Agentic PDE Solving via Explicitly Represented Solver Strategies

AutoPDE: 通过显式表示的求解器策略实现可靠的智能体PDE求解

Huanshuo Dong, Keyao Zhang, Hong Wang, Zhezheng Hao, Zhiwei Zhuang, Ziyan Liu, Jiacong Wang, Gengyuan Liu, Xin Jin

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) University of the Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 代码生成 :coding agent(abstract);分类 cs.AI

AI总结 提出AutoPDE,一种将求解器策略作为显式对象维护的代码智能体,通过PDE分析、数值方法选择和自适应调优三阶段构建策略,在PDE Agent Bench上达到54.5%的通过率,比最强基线提升14.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10285 2026-06-10 cs.CL 新提交 57%

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet: 基于大语言模型的Verilog模块设计的完全开源数据集

Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

机构 * UIUC-ChenLab(UIUC-陈实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出最大完全开源硬件设计数据集OpenRTLSet,包含13万+多样Verilog代码样本,结合GitHub代码、VHDL和C/C++翻译,利用DeepSeek-R1生成自然语言描述,支持多种语言模型微调,证明开源方法在硬件设计中的优越性。

Comments Accepted by ICLAD'25

Journal ref 2025 IEEE International Conference on LLM-Aided Design (ICLAD), Stanford, CA, USA, 2025, pp. 212-218

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09885 2026-06-10 cs.LG stat.ML 新提交 57%

TENP: Trapezoidal Expert Neuron Pruning For Mixture-of-Experts

TENP:用于混合专家的梯形专家神经元剪枝

Jiangyang He, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院 TJUNLP实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出TENP框架,通过识别重要专家并对其余专家进行神经元剪枝,保留梯形参数模式,在40%路由专家稀疏度和平均63.76%激活参数下,DeepSeek模型准确率仅下降1点,代码生成任务提升10%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2606.10933 2026-06-10 cs.AI 新提交 79%

Frontier Coding Agents Use Metaprogramming to Adapt to Unfamiliar Programming Languages

前沿编码代理使用元编程适应不熟悉的编程语言

Aman Sharma, Sushrut Thorat, Paras Chopra

机构 * Lossfunk

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究评估LLM编码代理在陌生语言上的表现,发现强代理通过元编程(如用Python生成目标语言代码)适应,禁止此策略性能大幅下降,而弱代理无法从中受益。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10106 2026-06-10 cs.SE cs.AI 新提交 73%

What makes a harness a harness: necessary and sufficient conditions for an agent harness

什么使一个工具成为工具:智能体工具的必要和充分条件

Sanderson Oliveira de Macedo

机构 * Federal Institute of Goiás(戈亚斯联邦理工学院)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文通过概念分析,定义了智能体工具的必要和充分条件,并提供了包含/排除测试,以区分智能体工具与智能体框架、SDK、IDE插件等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09935 2026-06-10 cs.CR cs.AI 新提交 57%

GitInject: Real-World Prompt Injection Attacks in AI-Powered CI/CD Pipelines

GitInject: AI驱动的CI/CD流水线中的真实提示注入攻击

Jafar Isbarov, Umid Suleymanov, Ilia Shumailov, Murat Kantarcioglu

机构 * Virginia Tech(弗吉尼亚理工学院) AI Sequrity Company(AI安全公司)

专题命中 软件智能体 :repository(abstract);分类 cs.AI

AI总结 提出GitInject框架,在真实GitHub工作流中评估AI代理的提示注入漏洞,发现所有测试提供商均存在结构性风险,并给出最低成本防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2606.10211 2026-06-10 cs.SE 新提交 57%

TestMap: Evidence Infrastructure for Foundation-Model-Assisted Test Generation

TestMap:基础模型辅助测试生成的证据基础设施

Hunter Leary, Luke Hanuska, Chris Brown

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 提出TestMap基础设施,自动化C#/.NET仓库的测试生成与验证,记录候选测试生命周期,支持多维度评估。

Comments 10 pages, 1 figure, 2 tables. Accepted to present at AIWare 2026 (arXiv Track)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 1 篇

2606.10255 2026-06-10 eess.IV cs.CV cs.DL cs.LG physics.bio-ph 新提交 57%

POPSICLE: Benchmark Datasets for Segmentation and Localization in CryoET

POPSICLE: 用于冷冻电镜断层扫描中分割和定位的基准数据集

Jonathan Schwartz, Utz Heinrich Ermel, C. Braxton Owens, Zhuowen Zhao, Ariana Peck, Gus L. W. Hart, Grant J. Jensen, Bridget Carragher, Dari Kimanius

机构 * Biohub Brigham Young University

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出POPSICLE基准套件,基于CryoET数据门户构建,涵盖真核和原核系统、纯化与原位样本,支持体素分割和稀疏定位任务,旨在解决冷冻电镜断层扫描中缺乏标准化基准的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 1 篇

2606.10666 2026-06-10 cs.CV cs.DB 新提交 50%

Analyzing Training-Free Corruption Detection for Object Detection Datasets

分析目标检测数据集的无训练腐败检测

Christian Sieberichs, Simon Geerkens, Thomas Waschulzik, Viswanathan Ramesh, Alexander Braun

机构 * University of Applied Sciences Düsseldorf(杜塞尔多夫应用科学大学) Siemens Mobility GmbH(西门子交通有限公司) Goethe University Frankfurt(法兰克福大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文研究无训练特征空间方法在目标检测数据集中检测标注错误的应用,发现该方法能可靠暴露语义错误,但位置错误难以检测。

Comments Accepted at DataCV Workshop, Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏