arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-13 至 2026-03-13 共收录 12 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2603.11212 2026-03-13 cs.CR cs.LG 83%

Security-by-Design for LLM-Based Code Generation: Leveraging Internal Representations for Concept-Driven Steering Mechanisms

面向基于大语言模型的代码生成的Security-by-Design:利用内部表示进行概念驱动的引导机制

Maximilian Wendlinger, Daniel Kowatsch, Konstantin Böttinger, Philip Sperl

专题命中 代码生成 :code generation(title,abstract);code model(abstract);分类 cs.LG

AI总结 本文提出SCS-Code,通过引导大语言模型的内部表示生成安全且功能性的代码,解决现有方法在安全性和功能正确性上的不足。

Comments to be published in the IEEE European Symposium on Security and Privacy (EuroS&P)'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11226 2026-03-13 cs.SE 70%

ExecVerify: White-Box RL with Verifiable Stepwise Rewards for Code Execution Reasoning

ExecVerify: 带可验证逐步奖励的白盒强化学习用于代码执行推理

Lingxiao Tang, He Ye, Zhaoyang Chu, Muyang Ye, Zhongxin Liu, Xiaoxue Ren, Lingfeng Bao

专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.SE

AI总结 ExecVerify通过可验证的白盒奖励提升代码执行推理和生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06214 2026-03-13 cs.CL cs.AI math-ph math.MP quant-ph 62%

Can Theoretical Physics Research Benefit from Language Agents?

理论物理研究能否从语言代理中受益?

Sirui Lu, Zhijing Jin, Terry Jingchen Zhang, Pavel Kos, J. Ignacio Cirac, Bernhard Schölkopf

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了语言代理在理论物理研究中的潜力,指出需专门训练和工具支持,以实现多模态数据处理、物理假设提出和理论验证的AI代理。

Comments 8+2 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11489 2026-03-13 cs.PL cs.AR 57%

AutoVeriFix+: High-Correctness RTL Generation via Trace-Aware Causal Fix and Semantic Redundancy Pruning

AutoVeriFix+: 通过轨迹感知因果修复和语义冗余剪枝实现高正确性的RTL生成

Yan Tan, Xiangchen Meng, Zijun Jiang, Yangdi Lyu

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 AutoVeriFix+通过轨迹感知因果修复和语义冗余剪枝,提升Verilog代码生成的功能正确性与设计效率。

Comments arXiv admin note: text overlap with arXiv:2509.08416

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11073 2026-03-13 cs.SE 57%

Context Before Code: An Experience Report on Vibe Coding in Practice

上下文在代码之前:关于在实践中使用Vibe编码的经验报告

Md Nasir Uddin Shuvo, Md Aidul Islam, Md Mahade Hasan, Muhammad Waseem, Pekka Abrahamsson

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文报告了一个全栈团队在实践中应用Vibe编码构建多项目代理学习平台和学术检索增强生成系统,并探讨了生成代码在隔离约束和架构设计上的不足。

Comments 6 Pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22824 2026-03-13 cs.CL 57%

Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning

Critique-Coder: 通过批判强化学习增强Coder模型

Chi Ruan, Dongfu Jiang, Yubo Wang, Wenhu Chen

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 Critique-Coder通过批判强化学习提升Coder模型性能,优于传统强化学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2511.04583 2026-03-13 cs.AI cs.CL cs.CV cs.LG 67%

Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper

初级AI科学家及其风险报告:从基础论文出发的自主科学探索

Atsuyuki Miyai, Mashiro Toyooka, Takashi Otonari, Zaiying Zhao, Kiyoharu Aizawa

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京科学大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Jr. AI Scientist通过模仿初级研究人员的工作流程,自主生成科学论文,但存在潜在风险和局限性,需进一步研究。

Comments TMLR2026. Issues, comments, and questions are all welcome in https://github.com/Agent4Science-UTokyo/Jr.AI-Scientist

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2603.11262 2026-03-13 cs.SE 57%

Unveiling Practical Shortcomings of Patch Overfitting Detection Techniques

揭示修补过拟合检测技术的实用性缺陷

David Williams, Ioakim Avraam, Aldeida Aleti, Matias Martinez, Justyna Petke, Federica Sarro

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 研究发现简单随机选择在多数情况下优于现有修补过拟合检测技术,指出当前技术在实际应用中效果有限,需进一步改进。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2505.13903 2026-03-13 cs.CL cs.AI 62%

Let's Verify Math Questions Step by Step

逐步验证数学问题

Chengyu Shen, Zhen Hao Wong, Runming He, Hao Liang, Meiyi Qiang, Zimo Meng, Zhengyang Zhao, Bohan Zeng, Zhengzhou Zhu, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 ValiMath是一个包含2147个经过人类验证的数学问题的基准测试集,MathQ-Verify是用于验证数学问题正确性的流程,能有效提升数学数据集的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15112 2026-03-13 cs.AI 57%

ResearchGym: Evaluating Language Model Agents on Real-World AI Research

ResearchGym: 在真实世界人工智能研究中评估语言模型代理

Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。

Comments ICLR 2026 Agents in the Wild Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 2 篇

2603.11356 2026-03-13 cs.SE cs.AI cs.MA 76%

Resolving Java Code Repository Issues with iSWE Agent

用iSWE代理解决Java代码仓库问题

Jatin Ganhotra, Sami Serhan, Antonio Abu Nassar, Avraham Shinnar, Ziv Nevo, Martin Hirzel

机构 * IBM

专题命中 仓库级理解 :repository(title);分类 cs.SE、cs.AI

AI总结 本文提出iSWE代理,专注于Java问题解决,结合基于规则和模型的技术,提升企业软件开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03998 2026-03-13 cs.HC cs.AI cs.CY 57%

TRACE: AI-Assisted Assessment of Collaborative Projects in Computer Science Education

TRACE:计算机科学教育中协作项目的AI辅助评估

Songmei Yu, Andrew Zagula

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 TRACE通过AI辅助分析提升计算机科学教育中协作项目评估的透明度和可扩展性。

Comments 7 pages, 3 figures. Accepted at EISTA 2025; published in the Journal of Systemics, Cybernetics and Informatics (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏