arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-28 至 2026-04-28 共收录 43 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 程序修复 3 篇

2604.24212 2026-04-28 cs.SE 57%

Empowering Autonomous Debugging Agents with Efficient Dynamic Analysis

通过高效动态分析赋能自主调试代理

Jiahong Xiang, Xiaoyang Xu, Xiaopan Chu, Hongliang Tian, Yuqun Zhang

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 本文提出Agent-centric Debugging Interface,通过函数级交互和Frame Lifetime Trace提升自主调试代理效率,在SWE-bench验证集上实现63.8%的任务解决率,成本仅为1.28美元/任务。

Comments Accepted to the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17240 2026-04-28 cs.SE 57%

Ranking Plausible Patches by Historic Feature Frequencies

通过历史特征频率排名可能的补丁

Shifat Sahariar Bhuiyan, Abhishek Tiwari, Yu Pei, Carlo A. Furia

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 本文提出PrevaRank技术,通过历史程序员修复相似缺陷的补丁特征相似性,提升自动程序修复工具中正确补丁的排名效果,实验表明其显著提高了正确补丁的排名质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码评测 9 篇

2604.23088 2026-04-28 cs.SE cs.AI cs.CL cs.PL 70%

Code Broker: A Multi-Agent System for Automated Code Quality Assessment

Code Broker:一个用于自动化代码质量评估的多智能体系统

Samer Attrah

机构 * Independent researcher(独立研究者) California, USA(美国加州)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 Code Broker通过多智能体架构对Python代码进行分析并生成质量评估报告,结合LLM推理与静态分析工具,提升代码审查的效率与准确性。

Comments 8 pages, 1 figure, 2 tables, 28 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23361 2026-04-28 cs.SE cs.AI cs.LG 67%

An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code

对本地部署LLM在Python代码中检测bug的实证评估

Jelena Ilić Vulićević

机构 * Independent Researcher Master of Electrical(独立研究者 电气工程硕士)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文评估了本地部署的LLaMA 3.2和Mistral在Python bug检测中的性能,发现其准确率在43%-45%之间,但难以精确定位修复。

Comments 8 pages, 5 figures. Code available at https://github.com/insajder/llm-bug-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16419 2026-04-28 cs.SE cs.LG 62%

Can LLMs Find Bugs in Code? An Evaluation from Beginner Errors to Security Vulnerabilities in Python and C++

LLMs能否发现代码中的错误?对Python和C++中初级错误到安全漏洞的评估

Akshay Mhatre, Noujoud Nader, Patrick Diehl, Deepti Gupta

机构 * 1 Dept. of Computer Information Systems, Texas A\&M University - Central Texas, TX, 76549 USA. 2 LSU Center for Computation \& Technology, Louisiana State University, Baton Rouge, LA, 70803 USA. 3 Department of Physics Astronomy, Louisiana State University, Baton Rouge, LA, 70803 USA. 4 Applied Computer Science (CCS-7), Los Alamos National Laboratory, Los Alamos, NM 87545 USA.

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 本文评估了三个主流LLM在检测Python和C++中基础错误、经典安全漏洞及生产级bug的有效性,发现其在语法和语义问题上表现良好,但在复杂安全漏洞和大规模代码中性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05984 2026-04-28 cs.LG cs.AI cs.IR 62%

Explainable AI for Mental Disorder Detection via Social Media: A survey and outlook

通过社交媒体进行精神障碍检测的可解释AI:调查与展望

Yusif Ibrahimov, Tarique Anwar, Tommy Yuan

机构 * Department of Computer Science, University of York, Heslington, United Kingdom(英国约克大学计算机科学系) French-Azerbaijani University under Azerbaijan State Oil and Industry University(阿塞拜疆国家石油和工业大学下的法语-阿塞拜疆大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文调查了数据科学、人工智能与心理健康护理的交叉领域,探讨了通过在线社交媒体检测精神障碍的最新进展,并强调了可解释AI在医疗AI中的重要性。

Comments Accepted for publication in IEEE Transactions on Artificial Intelligence. \c{opyright} 2026 IEEE (To appear)

Journal ref IEEE Transactions on Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24621 2026-04-28 cs.SE 57%

Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions

评估基于大语言模型的软件工程工具:实践、挑战与未来方向

Utku Boran Torun, Veli Karakaya, Ali Babar, Eray Tüzün

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文探讨了基于大语言模型的软件工程工具的评估问题,分析了现有评估方法的局限性,并提出了未来研究方向以提升评估的可靠性与可扩展性。

Comments Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 57%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22840 2026-04-28 cs.CV cs.CL cs.MM 57%

AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards

AeSlides:通过可验证奖励激励基于大语言模型的幻灯片生成中的美观布局

Yiming Pan, Chengwei Hu, Xuancheng Huang, Can Huang, Mingming Zhao, Yuean Bi, Xiaohan Zhang, Aohan Zeng, Linmei Hu

机构 * Beijing Institute of Technology(北京理工大学) Zhipu AI (Z.ai)(智谱AI)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出AeSlides框架,通过可验证奖励优化幻灯片生成的美观布局,实验表明其在布局合规性、空格减少、元素碰撞和视觉平衡方面均优于现有方法。

Comments 21 pages, 25 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22834 2026-04-28 cs.CV cs.LG 57%

WebSerial Vision Training for Microcontrollers: A Browser-Based Companion to On-Device CNN Training

为微控制器的WebSerial视觉训练:一种浏览器基于的设备端CNN训练配套工具

Jeremy Ellis

机构 * High School Robotics Educator(高中机器人教育者)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出webmcu-vision-web,一种浏览器应用,用于在Seeed Studio XIAO ESP32-S3 Sense上端到端训练和部署TinyML视觉模型,提供本地机器学习流程,无需软件安装,支持实时激活可视化,实现快速训练部署。

Comments 29 pages, 16 figures, 5 tables. Paper 2 of the webmcu-ai series. All source code and supplemental results available at: https://github.com/webmcu-ai/webmcu-vision-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01251 2026-04-28 cs.CE physics.comp-ph physics.flu-dyn 50%

GPU-native Embedding of Complex Geometries in Adaptive Octree Grids Applied to the Lattice Boltzmann Method

在自适应八叉树网格中实现复杂几何的GPU原生嵌入应用于格子玻尔兹曼方法

Khodr Jaber, Ebenezer E. Essel, Pierre E. Sullivan

专题命中 代码评测 :repository(abstract)

AI总结 本文提出一种在GPU上原生嵌入静止三角网格的算法,用于自适应八叉树网格中的流体-固体边界条件处理,通过局部射线投射和高效网格块遍历实现稳定的近壁细化。

Comments 49 pages, 31 figures, 9 tables, 6 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 仓库级理解 1 篇

2604.24443 2026-04-28 cs.AI 57%

PhysNote: Self-Knowledge Notes for Evolvable Physical Reasoning in Vision-Language Model

PhysNote: 为视觉-语言模型中的可进化物理推理提供自我知识笔记

Sinin Zhang, Yunfei Xie, Yuxuan Cheng, Haoyu Zhang, Tong Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Rice University(里奇大学) City University of Hong Kong(香港城市大学) Fudan University(复旦大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出PhysNote框架,通过自我生成的知识笔记提升视觉-语言模型在动态物理推理中的表现,实验显示其在PhysBench上达到56.68%的准确率,优于多智能体基线。

Comments 11 pages. Accepted by ICLR 2026 Workshop ES-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 程序分析与验证 1 篇

2603.28592 2026-04-28 cs.SE 57%

Debt Behind the AI Boom: A Large-Scale Empirical Study of AI-Generated Code in the Wild

人工智能繁荣背后的债务:对真实世界中AI生成代码的大规模实证研究

Yue Liu, Ratnadira Widyasari, Yanjie Zhao, Ivana Clairine Irsan, Junkai Chen, David Lo

专题命中 程序分析与验证 :repository(abstract);分类 cs.SE

AI总结 本文研究了AI生成代码在真实软件项目中的技术债务影响,发现代码异味是最常见的问题,且部分问题长期存在,凸显了AI辅助开发中质量保障的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏