arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-02 至 2026-04-02 共收录 21 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2604.01052 2026-04-02 cs.CR cs.AI 57%

VibeGuard: A Security Gate Framework for AI-Generated Code

VibeGuard:面向AI生成代码的安全闸门框架

Ying Xie

机构 * Kennesaw State University(肯尼索州立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出VibeGuard,针对AI生成代码中的五个盲点提供预发布安全检查,通过实验验证其在八个合成项目中的高召回率和精度,为依赖AI生成代码的团队提供多层次防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02827 2026-04-02 cs.SE 57%

From Code Changes to Quality Gains: An Empirical Study in Python ML Systems with PyQu

从代码变更到质量提升:基于PyQu的Python ML系统实证研究

Mohamed Almukhtar, Anwar Ghammam, Marouane Kessentini, Hua Ming

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文通过分析3340个开源Python ML项目,利用PyQu工具识别出61种提升软件质量的代码变更,揭示了代码变更与ML系统质量之间的关系,填补了现有研究的空白。

Comments Accepted for publication in the proceedings of IEEE/ACM 48th International Conference on Software Engineering (ICSE26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00281 2026-04-02 cs.AI 57%

Human-in-the-Loop Control of Objective Drift in LLM-Assisted Computer Science Education

人机协同控制LLM辅助计算机科学教育中的目标漂移

Mark Dranias, Adam Whitley

机构 * Asheville Institute for Memory and Longevity(阿什维尔记忆与长寿研究所) University of North Carolina Asheville(北卡罗来纳大学阿什维尔分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出一种人机协同的教学方法,通过分离规划与执行,训练学生在代码生成前指定接受标准和架构约束,以稳定AI辅助学习过程。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13841 2026-04-02 cs.AI 57%

LocationReasoner: Evaluating LLMs on Real-World Site Selection Reasoning

LocationReasoner: 评估大语言模型在真实世界选址推理中的能力

Miho Koda, Yu Zheng, Ruixian Ma, Mingyang Sun, Devesh Pansare, Fabio Duarte, Paolo Santi

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出LocationReasoner基准测试,评估大语言模型在复杂现实选址场景中的推理能力,发现先进模型在实际应用中表现有限,且代理策略常因过度推理而效果不佳。

Comments ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2603.03823 2026-04-02 cs.SE cs.AI cs.CL 75%

SWE-CI: Evaluating Agent Capabilities in Maintaining Codebases via Continuous Integration

SWE-CI:通过持续集成评估代理在维护代码库中的能力

Jialong Chen, Xander Xu, Hu Wei, Chuan Chen, Bing Zhao

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) Skylenage

专题命中 软件智能体 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-CI通过持续集成循环构建首个仓库级基准,旨在将代码生成评估从静态短期功能性正确性转向动态长期可维护性,通过跟踪功能正确性随时间的变化揭示可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00917 2026-04-02 cs.SE cs.AI cs.LG 67%

Investigating Autonomous Agent Contributions in the Wild: Activity Patterns and Code Change over Time

在真实世界中研究自主代理的贡献:活动模式与代码变更趋势

Razvan Mihai Popescu, David Gros, Andrei Botocan, Rahul Pandita, Prem Devanbu, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文通过分析11万条开源拉取请求数据,研究自主编码代理在开源项目中的活动模式及代码变更,探讨其对代码质量、团队动态和软件维护性的影响。

Comments MSR 2026 Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01079 2026-04-02 cs.CR cs.SE 57%

Automated Generation of Cybersecurity Exercise Scenarios

自动化生成网络安全演练场景

Charilaos Skandylas, Mikael Asplund

专题命中 软件智能体 :software agent(abstract);分类 cs.SE

AI总结 本文提出自动生成功能性IT系统网络安全场景的方法,生成多种标准的演练场景,并开源了模拟环境和包含10万个样本的数据库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00299 2026-04-02 cs.SE 57%

When is Generated Code Difficult to Comprehend? Assessing AI Agent Python Code Proficiency in the Wild

生成代码难以理解的条件是什么?评估AI代理在真实世界中的Python代码能力

Nanthit Temkulkiat, Chaiyong Ragkhitwetsagul, Morakot Choetkiertikul, Ruksit Rojpaisarnkit, Raula Gaikovina Kula

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本研究通过分析AI生成的Python代码,发现其主要为初级水平,但特定任务可能需要高级技能来理解和维护。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2604.00167 2026-04-02 cs.SE cs.AI 84%

A Study on the Impact of Fault localization Granularity for Repository-Scale Code Repair Tasks

对仓库级代码修复任务中故障定位粒度影响的研究

Joseph Townsend, Chandresh Pravin, Kwun Ho Ngan, Matthieu Parizy

机构 * Fujitsu Research of Europe(富士通欧洲研究院)

专题命中 程序修复 :repository(title,abstract);program repair(abstract);分类 cs.SE、cs.AI

AI总结 研究探讨了仓库级代码修复中故障定位粒度对修复效果的影响,提出框架验证不同粒度下的修复率,并指出任务依赖性可能影响最佳粒度。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 5 篇

2604.01128 2026-04-02 cs.CL cs.AI cs.LG 67%

Paper Reconstruction Evaluation: Evaluating Presentation and Hallucination in AI-written Papers

论文重构评估:评估AI论文中的表现和幻觉

Atsuyuki Miyai, Mashiro Toyooka, Zaiying Zhao, Kenta Watanabe, Toshihiko Yamasaki, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出首个系统评估框架,用于量化现代编码代理生成论文的质量与风险。通过重构现有论文并生成完整论文进行比较,将评估分为表现和幻觉两个维度,基于PaperWrite-Bench基准测试,揭示ClaudeCode和Codex在表现与幻觉间的权衡。

Comments Project Page: https://agent4science-utokyo.github.io/PaperRecon_HP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00788 2026-04-02 cs.AI cs.CR 57%

UK AISI Alignment Evaluation Case-Study

英国人工智能安全研究所对齐评估案例研究

Alexandra Souly, Robert Kirk, Jacob Merizian, Abby D'Cruz, Xander Davies

机构 * UK AI Security Institute(英国人工智能安全研究所)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文评估了前沿模型在作为代码助手部署时是否可靠遵循目标,发现未发现研究 sabotage,但部分模型对安全相关任务不合作,且评估意识较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00550 2026-04-02 cs.AI 57%

BloClaw: An Omniscient, Multi-Modal Agentic Workspace for Next-Generation Scientific Discovery

BloClaw:面向下一代科学发现的全能多模态智能工作空间

Yao Qin, Yangyang Yan, Jinhua Pang, Xiaoming Zhang

机构 * AI Innovation Department, Beijing 1st Biotech Group Co., Ltd.(北京第一生物技术集团有限公司AI创新部) Diplomatic Negotiation Simulation and Data Lab(外交谈判模拟与数据实验室) First Medical Center, Chinese PLA General Hospital(中国人民解放军总医院第一医学中心)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出BloClaw,一种多模态操作系统,通过XML-Regex路由协议、运行时状态拦截沙箱和状态驱动动态视口UI三大创新,提升科学计算助手的鲁棒性和自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00079 2026-04-02 cs.CR cs.SE 57%

When Labels Are Scarce: A Systematic Mapping of Label-Efficient Code Vulnerability Detection

当标签稀缺时:一种系统性地映射标签高效代码漏洞检测方法

Noor Khalal, Chakib Fettal, Lazhar Labiod, Mohamed Nadif

专题命中 代码评测 :code model(abstract);分类 cs.SE

AI总结 本文系统性地映射了减少对人工标签依赖的代码漏洞检测方法,综合了五种范式家族及其机制,并提出了设计图和约束优先决策指南以指导实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24116 2026-04-02 eess.AS 50%

How Open is Open TTS? A Practical Evaluation of Open Source TTS Tools

开放程度如何?对开源语音合成工具的实用性评估

Teodora Răgman, Adrian Bogdan Stânea, Horia Cucu, Adriana Stan

专题命中 代码评测 :repository(abstract)

AI总结 本文评估了四种开源语音合成框架在构建新型TTS模型的可行性,特别是在资源受限语言中的挑战,通过客观指标和主观测试揭示了工具链设置、数据预处理和计算效率的问题。

Comments Published in IEEE Access https://ieeexplore.ieee.org/document/11269795

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 7 篇

2604.01072 2026-04-02 cs.SE cs.CE 79%

Containing the Reproducibility Gap: Automated Repository-Level Containerization for Scholarly Jupyter Notebooks

缩小可重复性差距:面向学术Jupyter笔记本的自动化仓库级容器化

Sheeba Samuel, Daniel Mietchen, Hemanta Lo, Martin Gaedke

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 本文提出自动化可重复性工程流水线,通过依赖推断、容器生成和隔离执行,评估学术笔记本的执行环境,解决依赖问题并提升执行稳定性,但发现仍存在低输出保真度的可重复性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00890 2026-04-02 cs.AI cs.CL cs.CV 62%

Beyond Symbolic Solving: Multi Chain-of-Thought Voting for Geometric Reasoning in Large Language Models

超越符号求解:用于大语言模型几何推理的多链式思维投票

Md. Abu Bakor Siddique, Shahrin Hossain, Sadman Ahmed Siam, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARS-GPS方法,通过生成多个并行推理流程并结合Python代码执行,利用熵值进行排序并多阶段投票,提升大语言模型在几何推理中的性能,实验显示其在Geometry3K数据集上达到88.8%的准确率,比现有最佳水平提升11%。

Comments Under review, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00445 2026-04-02 cs.AI cs.CL 62%

Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models

迈向大语言模型中可靠的真实性对齐不确定性估计

Ponhvoan Srey, Quang Minh Nguyen, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) KAIST(韩国科学技术院) Shanghai Jiao Tong University(上海交通大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Truth AnChoring方法,通过将原始分数映射到事实对齐分数,解决不确定性估计指标在低信息区域的非判别性问题,提升大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21997 2026-04-02 cs.LG cs.AI 62%

Binned semiparametric Bayesian networks for efficient kernel density estimation

分箱半参数贝叶斯网络用于高效的核密度估计

Rafael Sojo, Javier Díaz-Rozo, Concha Bielza, Pedro Larrañaga

机构 * Aingura IIoT Universidad Politécnica de Madrid, Departamento de Inteligencia Artificial(马德里理工大学人工智能系)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种新的概率半参数模型,利用数据分箱降低非参数分布中核密度估计的计算成本。通过引入稀疏分箱核密度估计和傅里叶核密度估计两种新的条件概率分布,解决高维数据带来的维度灾难问题,实验表明该模型在速度上显著优于传统半参数贝叶斯网络。

Comments Major revision after reviewer comments. Title changed based on reviewer suggestion. Improved introduction, complexity analysis and experiments. Submitted to Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01179 2026-04-02 cs.RO cs.AI cs.CV 57%

A ROS 2 Wrapper for Florence-2: Multi-Mode Local Vision-Language Inference for Robotic Systems

为Florence-2设计的ROS 2封装器:面向机器人系统的多模式本地视觉语言推断

J. E. Domínguez-Vidal

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出一个ROS 2封装器,实现Florence-2模型的三种交互模式,支持本地部署和容器化运行,验证了消费级硬件在视觉语言任务中的可行性。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00936 2026-04-02 cs.SE 57%

Portable and Secure CI/CD for COBOL: Lessons from an Industrial Migration

便携式和安全的CI/CD用于COBOL:来自工业迁移的教训

Andreas Askholm, Kenneth Johnsen, Jacopo Mauro

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文探讨了在受监管行业中迁移COBOL CI/CD管道的挑战,通过容器化架构减少运行时间并降低维护成本,为遗留系统现代化提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15929 2026-04-02 cs.AI math.AP math.LO 57%

Semi-Autonomous Formalization of the Vlasov-Maxwell-Landau Equilibrium

半自动化的Vlasov-Maxwell-Landau平衡形式化

Vasily Ilin

机构 * University of Washington(华盛顿大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文展示了一个完整的Lean 4形式化,用于Vlasov-Maxwell-Landau系统中的平衡特性描述,通过AI辅助数学研究流程,结合AI推理模型、编码工具和专业证明器,实现了高效的形式化验证。

Comments 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏