arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-01 至 2026-05-01 共收录 11 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 11 篇

2601.00376 2026-05-01 cs.SE cs.AI 88%

In Line with Context: Repository-Level Code Generation via Context Inlining

与上下文一致:通过上下文内联实现仓库级代码生成

Chao Hu, Wenhao Zeng, Yuling Shi, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 代码生成 :code generation(title,abstract);repository(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出InlineCoder框架,通过内联未完成函数到调用图中,将仓库理解转化为更易处理的函数级编码任务,提升仓库级代码生成能力。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27551 2026-05-01 cs.LG cs.AI cs.CL 82%

Beyond the Training Distribution: Mapping Generalization Boundaries in Neural Program Synthesis

超越训练分布:神经程序合成中的泛化边界映射

Henrik Voigt, Michael Habeck, Joachim Giesen

机构 * Friedrich Schiller University(弗里德里希-席勒大学)

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过构建领域特定算术语法规则的严格控制环境,系统评估了模型在程序合成中的泛化能力,发现优化密度泛化能提升鲁棒性,但transformers在语法扩展时表现下降30%以上,且计算规模提升与泛化能力呈对数线性关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27969 2026-05-01 cs.SE cs.AI 81%

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

从幻象到基础:迈向可靠的多模态电路到Verilog代码生成

Guang Yang, Xing Hu, Xiang Chen, Xin Xi

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区(滨江)区块链与数据安全研究院,杭州) School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出VeriGround模型,通过标识符匿名化、拒绝增强和D-ORPO对齐,解决了多模态模型在电路到Verilog代码生成中的可靠性问题,验证了真实视觉基础的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27238 2026-05-01 cs.CR cs.AR 78%

SafeTune: Mitigating Data Poisoning in LLM Fine-Tuning for RTL Code Generation

SafeTune: 缓解LLM微调中RTL代码生成的数据污染

Mahshid Rezakhani, Nowfel Mashnoor, Kimia Azar, Hadi Kamali

专题命中 代码生成 :code generation(title,abstract)

AI总结 SafeTune通过结合图神经网络和语义验证模块,有效过滤数据污染,提升LLM微调的鲁棒性和可靠性,不改变底层模型架构。

Comments This paper will be presented at IEEE VLSI Test Symposium (VTS) 2026. 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15564 2026-05-01 cs.SE cs.AI cs.LG 75%

OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research

OpenClassGen: 一个大规模的真实世界Python类语料库用于大语言模型研究

Musfiqur Rahman, SayedHassan Khatoonabadi, Emad Shihab

机构 * Concordia University(康科德大学)

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 OpenClassGen提供324,843个Python类的语料库,用于评估大语言模型的代码生成能力,通过类骨架和静态代码度量指标,支持多种应用场景。

Comments This paper has been accepted for publication at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026) AI models/data track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27296 2026-05-01 cs.SE cs.CL 62%

To Diff or Not to Diff? Structure-Aware and Adaptive Output Formats for Efficient LLM-based Code Editing

要进行差异生成还是不进行差异生成?面向高效LLM代码编辑的结构感知和自适应输出格式

Wei Cheng, Yongchang Cao, Chen Shen, Binhua Li, Jue Chen, Yongbin Li, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) Tongyi Lab, Alibaba Group, China(通义实验室,阿里巴巴集团,中国)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 本文提出BlockDiff和FuncDiff两种结构感知差异格式及AdaEdit策略,通过减少生成复杂度提升长代码编辑效率,准确度与全代码生成相当,降低30%以上延迟和成本。

Comments Accepted in the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27911 2026-05-01 cs.LG cs.ET cs.NE 57%

Physical Foundation Models: Fixed hardware implementations of large-scale neural networks

物理基础模型:大规模神经网络的固定硬件实现

Logan G Wright, Tianyu Wang, Tatsuhiro Onodera, Peter L. McMahon

机构 * Department of Applied Physics, Yale University, New Haven, CT 06520, USA(耶鲁大学应用物理系) School of Applied and Engineering Physics, Cornell University, Ithaca, NY 14853, USA(康奈尔大学应用与工程物理学院) Department of Electrical and Computer Engineering, Boston University, Boston, MA 02215, USA(波士顿大学电气与计算机工程系) NTT Physics and Informatics Laboratories, NTT Research, Inc., Sunnyvale, CA 94085, USA(NTT物理与信息学实验室,NTT研究公司) Kavli Institute at Cornell for Nanoscale Science, Cornell University, Ithaca, NY 14853, USA(康奈尔大学纳米科学研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文探讨了物理基础模型(PFMs)的概念,提出通过物理设计实现神经网络,以提升能效、速度和参数密度,适用于大规模模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27547 2026-05-01 cs.LG 57%

Diagnosing Capability Gaps in Fine-Tuning Data

诊断微调数据中的能力差距

Saeid Asgari Taghanaki, Rakshanda Agarwal, Bruce Sun, Rohan Jha, Elias Stengel-Eskin, Sara Malvar, Rui Ying, Yifei Xu, Guilherme Potje, Tusher Chakraborty, Leonardo de Oliveira Nunes, Ranveer Chandra, Emre Kiciman

机构 * Microsoft(微软)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出GoalCover框架,通过交互式目标分解和自动化覆盖评估,帮助检测微调数据集的能力缺口,通过实验验证其在不同领域和任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27115 2026-05-01 cs.CL 57%

Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models

探索剪枝的极限:任务特定神经元、模型崩溃与任务特定大语言模型中的恢复

M. K. Khalidi Siam, Md. Tausif-Ul-Islam, Md. Reshad Romim Khan, Mohammed Ali Hossain, Mushfiqul Amin, Labib Hasan Khan, Niloy Farhan, Farig Sadeque

机构 * BRAC University(布拉格大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 研究通过系统剪枝实验揭示任务特定语言模型中神经元的专有性,发现任务特定神经元对性能至关重要,剪枝策略影响模型鲁棒性和恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26990 2026-05-01 cs.SE 57%

UCSC-NLP at SemEval-2026 Task 13: Multi-View Generalization and Diagnostic Analysis of Machine-Generated Code Detection

UCSC-NLP在SemEval-2026任务13中的表现:机器生成代码检测的多视角泛化与诊断分析

Kargi Chauhan, Sadiba Nusrat Nur

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文提出多视角训练框架提升代码生成检测性能,针对多类别属性任务解决类别不平衡问题,通过加权训练策略提升F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00380 2026-05-01 cs.SE 57%

Knowledge-Graph-Driven Data Synthesis for Low-Resource Software Development: A HarmonyOS Case Study

基于知识图谱的数据合成用于低资源软件开发:一个HarmonyOS案例研究

Mingwei Liu, Zheng Pei, Yanlin Wang, Zihao Wang, Zikang Li, Enci Lin, Xin Peng, Zibin Zheng

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文提出APIKG4Syn框架,利用API知识图谱生成API导向的问题-代码对,提升低资源框架下的代码生成性能,通过HarmonyOS案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏