arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-25 至 2026-03-25 共收录 10 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2603.22717 2026-03-25 cs.CR cs.SE 79%

Does Teaming-Up LLMs Improve Secure Code Generation? A Comprehensive Evaluation with Multi-LLMSecCodeEval

多模型协同是否能提升安全代码生成?基于多LLMSecCodeEval的全面评估

Bushra Sabir, Shigang Liu, Seung Ick Jang, Sharif Abuadbba, Yansong Gao, Kristen Moore, SangCheol Kim, Hyoungshick Kim, Surya Nepal

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文通过多LLMSecCodeEval框架评估多模型协同对安全代码生成的影响,发现混合策略在安全性能上表现最佳,而模型规模并非安全保障的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22577 2026-03-25 cs.CR cs.AI cs.MA 57%

STRIATUM-CTF: A Protocol-Driven Agentic Framework for General-Purpose CTF Solving

STRIATUM-CTF: 一种基于协议的代理框架用于通用CTF求解

James Hugglestone, Samuel Jacob Chacko, Dawson Stoller, Ryan Schmidt, Xiuwen Liu

机构 * Department of Computer Science, Florida State University, Tallahassee, USA(计算机科学系,佛罗里达州立大学,塔拉萨斯,美国)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出STRIATUM-CTF框架,通过Model Context Protocol标准化工具接口,提升CTF求解的自主性和适应性,在真实竞赛中取得第一名。

Comments 8 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08369 2026-03-25 cs.LG 57%

Guided Star-Shaped Masked Diffusion

引导式星形遮蔽扩散

Viacheslav Meshchaninov, Egor Shibaev, Artem Makoian, Ivan Klimov, Nikita Balagansky, Daniil Gavrilov, Aibek Alanov, Dmitry Vetrov

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出一种引导式星形遮蔽扩散算法,通过轻量级微调提升样本质量和效率,采用星形范式实现内在误差纠正,结合可学习重遮蔽调度器有效修正可能错误,在文本和代码生成中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2602.09892 2026-03-25 cs.SE 83%

Immersion in the GitHub Universe: Scaling Coding Agents to Mastery

在GitHub宇宙中的沉浸:将编码代理扩展至精通

Jiale Zhao, Guoxin Chen, Fanzhe Meng, Minghao Li, Jie Chen, Hui Xu, Yongshuai Sun, Wayne Xin Zhao, Ruihua Song, Yuan Zhang, Peng Wang, Cheng Chen, Jirong Wen, Kai Jia

专题命中 软件智能体 :coding agent(title);repository(abstract);unit test generation(abstract);分类 cs.SE

AI总结 本文提出ScaleSWE系统,通过自动化多代理工作流生成高质量SWE数据,产生10万验证实例,超越现有数据集的多样性和复杂性,训练出性能提升三倍的ScaleSWE代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22387 2026-03-25 cs.SE cs.AI cs.MA 81%

AI-Generated Code Is Not Reproducible (Yet): An Empirical Study of Dependency Gaps in LLM-Based Coding Agents

AI生成的代码不可重复(尚且):对基于LLM的编码代理依赖差距的实证研究

Bhanu Prakash Vangala, Ali Adibifar, Ashish Gehani, Tanu Malik

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文实证研究了基于LLM的编码代理生成代码的可重复性,发现仅68.3%的项目能在干净环境中成功执行,且不同语言存在显著差异,同时发现依赖项存在显著隐藏依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2603.23443 2026-03-25 cs.SE cs.AI 62%

Evaluating LLM-Based Test Generation Under Software Evolution

评估基于大语言模型的测试生成在软件演化中的表现

Sabaat Haroon, Mohammad Taha Khan, Muhammad Ali Gulzar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE、cs.AI

AI总结 研究评估了基于大语言模型的测试生成在软件演化中的性能,发现其在代码变化时表现下降,测试覆盖和回归检测能力不足。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 1 篇

2512.18474 2026-03-25 cs.RO cs.HC 50%

When Robots Say No: The Empathic Ethical Disobedience Benchmark

当机器人说不:共情伦理违抗基准

Dmytro Kuzmenko, Nadiya Shvai

机构 * National University of Kyiv-Mohyla Academy(基輔-莫海拉學院國家大學)

专题命中 代码评测 :repository(abstract)

AI总结 本文提出EED Gym基准,用于评估机器人在安全与社会接受性之间的平衡,探讨拒绝行为对信任的影响,发现解释性拒绝能维持信任,安全RL方法提升鲁棒性但易导致过度谨慎。

Comments Accepted at the ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026). This is a preprint of the author-accepted manuscript

Journal ref Proceedings of the ACM/IEEE International Conference on Human-Robot Interaction (HRI 2026), Edinburgh, UK, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 3 篇

2603.23441 2026-03-25 cs.SE 57%

MuSe: a Mutation Testing Plugin for the Remix IDE

MuSe:Remix IDE 的突变测试插件

Gerardo Iuliano, Daniele Carangelo, Carmine Calabrese, Dario Di Nucci

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文提出 MuSe,一个为 Remix-IDE 提供突变测试的插件,包含传统、Solidity 特定和安全导向的突变操作符,降低开发者的入门门槛,用于评估测试套件的有效性并发现智能合约潜在问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23070 2026-03-25 math.CO cs.DB cs.DM 50%

Knowledge management in House of Graphs

图之家中的知识管理

Gauvain Devillez, Sven D'hondt, Jan Goedgebeur

专题命中 仓库级理解 :repository(abstract)

AI总结 本文探讨图之家数据库中知识管理的实现,重点描述其数据存储机制及如何确保数据的一致性、质量和稳定性。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22488 2026-03-25 cs.NI cs.ET 50%

Architectural Enhancements for Efficient Sensing Data Utilization in 6G ISAC

6G ISAC中高效传感数据利用的架构增强

Muhammad Awais Jadoon, Sebastian Robitzsch

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出一种6G架构中的传感数据存储功能,通过融合历史与实时传感数据提升效率和准确性,验证了在交通交汇场景中减少误报率的效果。

Comments 6 pages, IEEE ICC 2026, 6G Architecture

详情

展开后加载摘要…

URL PDF HTML 收藏