arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-06 至 2026-04-06 共收录 25 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 9 篇

2505.19353 2026-04-06 cs.AI cs.CL cs.CY cs.SE 82%

Architectures of Error: A Philosophical Inquiry into AI and Human Code Generation

错误的架构:对人工智能与人类代码生成的哲学探究

Camilo Chacón Sartori

机构 * Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究所(IIIA-CSIC))

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文探讨人类与机器代码生成的本质差异,通过分析错误的根源,揭示认知与随机性导致的因果区别,为AI与人类协作软件开发提供哲学框架。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02776 2026-04-06 cs.SE 79%

Evaluating the Environmental Impact of using SLMs and Prompt Engineering for Code Generation

评估使用SLMs和提示工程进行代码生成的环境影响

Md Afif Al Mamun, Sayan Nath, Gias Uddin, Novarun Deb

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文研究了基于SLMs的代码生成中不同提示策略对准确性和可持续性的影响,发现可持续性与准确性脱钩,提示工程可实现环保与性能的平衡。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02580 2026-04-06 cs.LG 79%

VoxelCodeBench: Benchmarking 3D World Modeling Through Code Generation

VoxelCodeBench:通过代码生成进行3D世界建模的基准测试

Yan Zheng, Florian Bordes

机构 * FAIR at Meta(Meta FAIR) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 本文提出VoxelCodeBench基准,通过代码生成评估3D空间推理能力,发现生成可执行代码易,但生成空间正确输出难,尤其在几何构造和多物体组合上挑战大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19108 2026-04-06 cs.SE 79%

A Multi-Language Perspective on the Robustness of LLM Code Generation

多语言视角下的大型语言模型代码生成鲁棒性研究

Fazle Rabbi, Zishuo Ding, Jinqiu Yang

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文从多语言角度评估了代码生成模型的鲁棒性,通过扰动文档字符串、函数名、语法和格式等关键提示部分,发现不同语言和扰动类型对模型性能影响不同,且增大模型规模并不能显著提升鲁棒性。

Comments 50 pages, 10 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02548 2026-04-06 cs.CR cs.AI 74%

From Theory to Practice: Code Generation Using LLMs for CAPEC and CWE Frameworks

从理论到实践:利用LLMs为CAPEC和CWE框架生成代码

Murtuza Shahzad, Joseph Wilson, Ibrahim Al Azher, Hamed Alhoori, Mona Rahimi

机构 * Northern Illinois University(北伊利诺伊大学)

专题命中 代码生成 :code generation(title);分类 cs.AI

AI总结 本文提出一个基于LLMs生成CAPEC和CWE漏洞代码的数据集,通过GPT-4o、Llama和Claude模型生成高准确性的代码示例,提升安全漏洞识别与修复的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02985 2026-04-06 cs.IR cs.AI cs.CL 62%

Prompt Compression in the Wild: Measuring Latency, Rate Adherence, and Quality for Faster LLM Inference

野火中的提示压缩:测量延迟、速率遵守和质量以加快大语言模型推理

Cornelius Kummer, Lena Jurkschat, Michael Färber, Sahar Vahdati

机构 * ScaDS.AI Dresden/Leipzig, CIDS, TU Dresden(ScaDS.AI 德累斯顿/莱比锡,CIDS,德累斯顿工业大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了提示压缩在实际应用中的延迟、速率遵守和质量影响,通过大规模实验发现,当提示长度、压缩比和硬件容量匹配时,LLMLingua可实现18%的端到端加速,但超出此范围压缩步骤会抵消收益。

Comments Accepted at ECIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29093 2026-04-06 cs.CL cs.AI cs.IR 62%

APEX-EM: Non-Parametric Online Learning for Autonomous Agents via Structured Procedural-Episodic Experience Replay

APEX-EM:通过结构化程序-经验经验回放实现自主代理的非参数在线学习

Pratyay Banerjee, Masud Moshtaghi, Ankit Chadha

机构 * Amazon, AGI / Sunnyvale, USA(亚马逊 AGI / 美国森尼韦尔)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出APEX-EM框架,通过结构化经验表示和PRGII工作流,实现自主代理的非参数在线学习,提升跨领域任务的性能。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02492 2026-04-06 cs.CV cs.AI 57%

Token-Efficient Multimodal Reasoning via Image Prompt Packaging

通过图像提示包装实现高效的多模态推理

Joong Ho Choi, Jiayang Zhao, Avani Appalla, Himansh Mukesh, Dhwanil Vasani, Boyi Qian

机构 * BNY Pittsburgh US(美国匹兹堡)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出图像提示包装方法,通过将结构化文本嵌入图像以减少文本令牌开销,并在多个数据集和模型上验证其效果,展示了在多模态系统设计中视觉编码的重要性。

Comments 9 pages including references

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10656 2026-04-06 cs.SE 57%

Precision or Peril: A PoC of Python Code Quality from Quantized Large Language Models

精度与危险:从量化大语言模型中Python代码质量的证明概念

Eric L. Melin, Adam J. Torek, Nasir U. Eisty, Casey Kennington

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究探讨了小型LLM的代码生成性能及量化影响,发现生成代码存在质量和可维护性问题,强调在软件项目中需谨慎验证LLM生成的代码。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2604.03035 2026-04-06 cs.SE cs.AI 84%

Beyond Isolated Tasks: A Framework for Evaluating Coding Agents on Sequential Software Evolution

超越孤立任务:一个评估编码代理在连续软件演进中的框架

KN Ajay Shastry, Ganesh Senrayan, Shrey Satapara, Pranoy Panda, Chaitanya Devaguptapu

机构 * Fujitsu Research(富士通研究所)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出一个框架,通过模拟真实开发者工作流程的两个现实场景,评估编码代理在连续任务中的表现,揭示孤立任务评估的局限性及多维评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03081 2026-04-06 cs.CR cs.AI cs.CL 81%

Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems

针对LLM编码代理技能生态系统的供应链污染攻击

Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma

机构 * Griffith University(格里菲斯大学) The State Information Center(国家信息中心) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Wake Forest University(维克森林大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM编码代理技能生态系统中供应链攻击对行动空间的影响,提出DDIPE方法通过嵌入恶意逻辑到技能文档中实现隐式payload执行,实验显示其在强防御下可绕过11.6%-33.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02547 2026-04-06 cs.SE 79%

Beyond Resolution Rates: Behavioral Drivers of Coding Agent Success and Failure

超越分辨率率:编码代理成功与失败的行为驱动因素

Tural Mehtiyev, Wesley Assunção

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文通过大规模实证研究分析了9374条轨迹,探讨了编码代理在特定任务中失败的原因,发现行为模式和LLM能力对成功与失败有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03196 2026-04-06 cs.SE 57%

From Industry Claims to Empirical Reality: An Empirical Study of Code Review Agents in Pull Requests

从行业声明到实证现实:代码审查代理在拉取请求中的实证研究

Kowshik Chowdhury, Dipayan Banik, K M Ferdous, Shazibul Islam Shamim

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文通过分析代码审查代理(CRAs)在拉取请求中的表现,探讨其对合并成功率的影响,发现CRAs生成的反馈质量与PR废弃率密切相关,需人类监督以提高代码审查效果。

Comments Accepted at 23rd International Conference on Mining Software Repositories (MSR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2604.03135 2026-04-06 cs.SE cs.AI 62%

AI-Assisted Unit Test Writing and Test-Driven Code Refactoring: A Case Study

AI辅助的单元测试编写与测试驱动的代码重构:一个案例研究

Ema Smolic, Mario Brcic, Luka Hobor, Mihael Kovac

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算学院)

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了利用AI生成单元测试并进行安全重构的方法,通过案例展示如何通过迭代测试捕获系统行为,减少重构风险,提升代码维护效率。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 6 篇

2604.02729 2026-04-06 cs.SE cs.AI cs.CL 82%

IndustryCode: A Benchmark for Industry Code Generation

IndustryCode: 一个用于行业代码生成的基准

Puyu Zeng, Zhaoxi Wang, Zhixu Duan, Liang Feng, Shaobo Wang, Cunxiang Wang, Jinghang Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出IndustryCode基准,涵盖125个工业挑战和579个子问题,支持多种编程语言,评估大模型在工业场景中的代码生成能力。

Comments 37 pages, 28 figures, 4 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02648 2026-04-06 cs.SE cs.AI 62%

GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers

GBQA:用于评估LLM作为质量保证工程师的博弈基准

Shufan Jiang, Chios Chen, Zhiyang Chen

机构 * The University of Hong Kong(香港大学) Independent Researcher(独立研究者) Westlake University(西湖大学) Datawhale Org(Datawhale组织)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出GBQA基准,通过30款游戏和124个经人类验证的bug测试LLM自主发现软件缺陷的能力,实验表明最佳模型仅能识别48.39%的bug。

Comments Accepted as a workshop paper at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02382 2026-04-06 cs.SE cs.AI 62%

Ambig-IaC: Multi-level Disambiguation for Interactive Cloud Infrastructure-as-Code Synthesis

Ambig-IaC:交互式云基础设施即代码合成的多级消歧

Zhenning Yang, Kaden Gruizenga, Tongyuan Miao, Patrick Tser Jern Kon, Hui Guan, Ang Chen

机构 * University of Michigan(密歇根大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Ambig-IaC框架,通过多级消歧方法提升IaC配置生成的准确性,针对IaC配置的不可逆性,设计了基于结构分歧的评估框架,在结构和属性评估上分别提升18.4%和25.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01021 2026-04-06 cs.LG cs.AI 62%

Transfer learning for nonparametric Bayesian networks

非参数贝叶斯网络的迁移学习

Rafael Sojo, Pedro Larrañaga, Concha Bielza

机构 * Aingura IIoT Universidad Politécnica de Madrid, Departamento de Inteligencia Artificial(马德里理工大学人工智能系)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出两种非参数贝叶斯网络迁移学习方法,PC-stable-transfer学习和hill climbing transfer学习,通过约束和评分方法提升模型性能,同时引入特定指标解决负迁移问题,最终通过统计检验证明方法有效性。

Comments An earlier version was previously posted on SSRN. This version includes improvements in experiments and evaluation metrics following reviewer comments. Revision submitted to Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02520 2026-04-06 physics.data-an cs.LG 57%

Neural posterior estimation for scalable and accurate inverse parameter inference in Li-ion batteries

用于锂离子电池可扩展和准确逆参数推断的神经后验估计

Malik Hassanaly, Corey R. Randall, Peter J. Weddle, Paul J. Gasper, Conlain Kelly, Tanvir R. Tanim, Kandler Smith

机构 * Computational Science Center, National Laboratory of the Rockies(落基山国家实验室计算科学中心) Energy Conversion and Storage Systems Center, National Laboratory of the Rockies(落基山国家实验室能量转换与存储系统中心) Energy Storage Research and Analysis Department, Idaho National Laboratory(爱达荷国家实验室储能研究与分析部)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出神经后验估计方法,用于高效估计锂离子电池参数,尽管在高维情况下计算成本较高,但能提供更准确的参数校准,并在电压预测中存在误差,同时具有更高的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07743 2026-04-06 eess.SY cs.SY 50%

The Reliability of Remotely Piloted Aircraft System Performance under Aeronautical Communication Uncertainties

远程飞行器系统性能在航空通信不确定性下的可靠性

Yutian Pang, Andrew Paul Kendall, John-Paul Clarke

专题命中 代码评测 :repository(abstract)

AI总结 研究在随机通信条件下,高机动远程飞行器系统任务完成性能的可靠性,通过蒙特卡洛模拟评估通信延迟和信号丢失对系统稳定性的影响,并提出新的可靠性指标communicability。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 5 篇

2604.03024 2026-04-06 cs.SE 79%

BugForge: Constructing and Utilizing DBMS Bug Repository to Enhance DBMS Testing

BugForge: 构建并利用DBMS bug仓库以增强DBMS测试

Dawei Li, Qifan Liu, Yuxiao Guo, Jie Liang, Zhiyong Wu, Chi Zhang, Jingzhou Fu, Haogang Mao, Zhenyu Guan, Yu Jiang

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 本文提出BugForge框架,通过构建标准化的DBMS bug仓库生成高质量测试用例,提升DBMS测试效果,已在PostgreSQL等数据库上实现,发现35个未知bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02942 2026-04-06 cs.LG 57%

Explainable Machine Learning Reveals 12-Fold Ucp1 Upregulation and Thermogenic Reprogramming in Female Mouse White Adipose Tissue After 37 Days of Microgravity: First AI/ML Analysis of NASA OSD-970

可解释机器学习揭示了37天微重力后雌性小鼠白色脂肪组织中Ucp1上调12倍及产热重编程:首次AI/ML分析NASA OSD-970

Md. Rashadul Islam

机构 * Daffodil International University(达芙妮国际大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本文首次利用机器学习分析NASA OSD-970数据集,发现微重力导致雌性小鼠白色脂肪组织中Ucp1上调12倍,揭示了产热重编程机制,对航天医学和地球肥胖研究有重要启示。

Comments 11 pages, 9 figures, 5 tables. First AI/ML analysis of NASA OSD-970 (GLDS-790). Code available at https://github.com/Rashadul22/NASA_OSD970_Complete_Output

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13122 2026-04-06 cs.CV cs.AI 57%

DePT3R: Joint Dense Point Tracking and 3D Reconstruction of Dynamic Scenes in a Single Forward Pass

DePT3R:在单次前向传递中联合密集点跟踪和动态场景的3D重建

Vivek Alumootil, Tuan-Anh Vu

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 DePT3R通过提取深度时空特征和密集预测头,实现动态场景的密集点跟踪与3D重建,无需相机姿态,提升适应性和效率。

Comments This is a work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03170 2026-04-06 math.PR 50%

The sharp one-dimensional convex sub-Gaussian comparison constant

一维凸子高斯比较常数的精确值

Damek Davis, Sam Power

专题命中 仓库级理解 :repository(abstract)

AI总结 本文确定了一维凸子高斯比较常数c*,证明其由一维方程组给出,并通过极值分布达到,数值约为2.30952。同时研究了子指数尾约束下的类似常数及高维后果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11111 2026-04-06 astro-ph.IM 50%

SpectralUnmix: A Torch-Based Regularized Non-negative Matrix Factorization

SpectralUnmix:基于Torch的正则化非负矩阵分解

Rafael S. de Souza, Paula Coelho, Niranjana P, Ana L. Chies-Santos, Rogério Riffel

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出SpectralUnmix包,利用Torch实现正则化非负矩阵分解,通过近端梯度更新估计低秩非负表示,并沿光谱轴引入平滑正则化。

Comments Accepted in Research Notes of AAS

Journal ref Res. Notes AAS 10 56 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏