arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-08 至 2026-04-08 共收录 32 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2604.06079 2026-04-08 cs.CV cs.AI 79%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05839 2026-04-08 cs.AI 79%

Vision-Guided Iterative Refinement for Frontend Code Generation

基于视觉引导的前端代码生成迭代精修

Hannah Sansford, Derek H. C. Law, Wei Liu, Abhishek Tripathi, Niresh Agarwal, Gerrit J. J. van den Burg

机构 * School of Mathematics, University of Bristol, UK(英国布里斯托大学数学学院) Amazon AGI(亚马逊AGI)

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 本文提出一种全自动的批评者循环框架,利用视觉语言模型提供结构化反馈以指导代码生成的迭代优化,实验证明其在前端开发中能显著提升代码质量。

Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05514 2026-04-08 cs.AI 79%

OmniDiagram: Advancing Unified Diagram Code Generation via Visual Interrogation Reward

OmniDiagram:通过视觉 interrogation 奖励推进统一图代码生成

Haoyue Yang, Xuanle Zhao, Xuexin Liu, Feibang Jiang, Yao Zhu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 本文提出OmniDiagram统一框架,结合多种图代码语言和任务定义,引入视觉反馈策略Viva,通过生成方法奖励视觉结构,无需人工标注数据,实验表明其在图代码生成基准上达到新状态。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19894 2026-04-08 cs.SE cs.AI 73%

TransAgent: Enhancing LLM-Based Code Translation via Fine-Grained Execution Alignment

TransAgent:通过细粒度执行对齐增强基于LLM的代码翻译

Zhiqiang Yuan, Weitong Chen, Hanlin Wang, Xin Peng, Zhenpeng Chen, Yiling Lou

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 代码生成 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.AI

AI总结 TransAgent通过细粒度执行对齐本地化错误代码块,提升LLM代码翻译的准确性与修复性能,优于现有方法33.3%和56.7%。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09664 2026-04-08 cs.SE cs.AI cs.CL cs.PL 70%

CodeMind: Evaluating Large Language Models for Code Reasoning

CodeMind: 评估大型语言模型的代码推理能力

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出CodeMind框架,通过独立执行推理、规范推理和动态语义推理任务评估LLM的代码推理能力,发现LLM在处理复杂代码时性能下降,且bug修复性能与代码推理任务无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05854 2026-04-08 cs.AI 57%

Deep Researcher Agent: An Autonomous Framework for 24/7 Deep Learning Experimentation with Zero-Cost Monitoring

深度研究员代理:一个全天候深度学习实验的自主框架,零成本监控

Xiangyue Zhang

机构 * The University of Tokyo(东京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出深度研究员代理框架,实现24/7深度学习实验自动化,通过零成本监控、双层固定大小内存和最小工具集架构,提升实验效率与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05535 2026-04-08 cs.AI 57%

SignalClaw: LLM-Guided Evolutionary Synthesis of Interpretable Traffic Signal Control Skills

SignalClaw:基于大语言模型的进化合成可解释交通信号控制技能

Da Lei, Feng Xiao, Lu Li, Yuzhan Liu

机构 * Sichuan University(四川大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 SignalClaw通过大语言模型引导进化合成可解释的交通信号控制技能,结合模拟指标生成自然语言反馈,实现高效且可解释的交通信号控制策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14194 2026-04-08 cs.CV cs.AI 57%

ENTER: Event Based Interpretable Reasoning for VideoQA

基于事件的可解释推理用于视频问答

Hammad Ayyubi, Junzhang Liu, Ali Asgarov, Zaber Ibn Abdul Hakim, Najibul Haque Sarker, Zhecan Wang, Chia-Wei Tang, Hani Alomari, Md. Atabuzzaman, Xudong Lin, Naveen Reddy Dyava, Shih-Fu Chang, Chris Thomas

机构 * Columbia University(哥伦比亚大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出ENTER系统,通过事件图实现可解释的视频问答,利用事件图结构提升可解释性、上下文信息整合和鲁棒性,优于传统自上而下和自下而上方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2604.04979 2026-04-08 cs.SE cs.AI 84%

Squeez: Task-Conditioned Tool-Output Pruning for Coding Agents

Squeez:面向编码代理的任务条件工具输出剪枝

Ádám Kovács

机构 * KR Labs(KR实验室)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了编码代理的任务条件工具输出剪枝,通过构建11477个示例的基准测试集,利用Qwen 3.5 2B模型实现92%的输入token剪枝,达到0.86召回率和0.80 F1分数,优于零样本模型和启发式基线。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04990 2026-04-08 cs.SE cs.AI 81%

Architecture Without Architects: How AI Coding Agents Shape Software Architecture

无建筑师的架构:AI编码代理如何塑造软件架构

Phongsakon Mark Konrad, Tim Lukas Adam, Riccardo Terrenzi, Serkan Ayvaz

机构 * Centre for Industrial Software University of Southern Denmark Alsion 2, S nderborg, 6400, Denmark

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文研究AI编码代理如何通过隐式选择框架和基础设施影响软件架构,提出六种提示-架构耦合模式,探讨'vibe architecting'现象及治理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05278 2026-04-08 cs.SE cs.AI cs.MA 73%

Spec Kit Agents: Context-Grounded Agentic Workflows

Spec Kit Agents:基于上下文的代理工作流

Pardis Taghavi, Santosh Bhavani

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Spec Kit Agents,一种多代理的规范驱动开发流程,通过添加阶段级上下文绑定钩子,提升代码质量与测试兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06126 2026-04-08 cs.LG cs.AI 62%

Gym-Anything: Turn any Software into an Agent Environment

Gym-Anything: 将任意软件转化为智能体环境

Pranjal Aggarwal, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Gym-Anything框架,通过多智能体任务将任意软件转化为交互式计算机使用环境,生成涵盖医疗、天文、工程等领域的10K+长周期任务,提升现实场景下的智能体研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05955 2026-04-08 cs.SE cs.AI 62%

Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution

通过率能讲述全部故事吗?评估基于LLM的问题解决的设计约束合规性

Kai Yu, Zhenhao Zhou, Junhao Zeng, Ying Wang, Xueying Du, Zhiqiang Yuan, Junwei Liu, Ziyu Zhou, Yujia Wang, Chong Wang, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出设计感知问题解决方法,引入bench基准,通过挖掘和验证真实项目中的设计约束,评估LLM在问题解决中设计约束的合规性,发现测试通过率高并不代表设计合规性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06066 2026-04-08 cs.CL 57%

From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection

从幻觉到结构雪球效应:约束解码在LLM反思中的对齐税

Hongxu Zhou

机构 * Saarland University(萨尔大学)

专题命中 软件智能体 :repository(abstract);分类 cs.CL

AI总结 研究探讨了在开放式推理任务中,约束解码通过强制结构反思是否能避免错误传播,发现反而引发结构雪球效应,并揭示了约束解码的对齐税问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06085 2026-04-08 physics.plasm-ph physics.comp-ph 50%

gyaradax: Local Gyrokinetics JAX Code

gyaradax:局部回旋动力学JAX代码

Gianluca Galletti, Eric Volkmann, Johannes Brandstetter

专题命中 软件智能体 :coding agent(abstract)

AI总结 gyaradax是用于局部回旋动力学的JAX/CUDA求解器,结合GPU加速和自动微分,验证了与GKW的正式一致性和统计一致性,同时实现了显著加速,展示了编码代理在复杂Fortran代码转换中的高效性。

Comments Code: https://github.com/gerkone/gyaradax

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05203 2026-04-08 cs.HC 50%

Decision-Oriented Programming with Aporia

面向决策的编程:Aporia

Saketh Ram Kasibatla, Raven Rothkopf, Hila Peleg, Benjamin C. Pierce, Sorin Lerner, Harrison Goldstein, Nadia Polikarpova

专题命中 软件智能体 :coding agent(abstract)

AI总结 本文提出面向决策的编程范式,通过Aporia工具增强设计过程的参与度,提升代码实现的准确性。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 3 篇

2604.05481 2026-04-08 cs.SE cs.AI 81%

On the Role of Fault Localization Context for LLM-Based Program Repair

关于基于LLM的程序修复中故障定位上下文的作用

Melika Sepidband, Hung Viet Pham, Hadi Hemmati

机构 * York University(约克大学)

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI

AI总结 研究探讨了LLM基于程序修复中故障定位上下文的影响,发现文件级上下文对修复性能提升显著,而元素级和行级上下文效果不一,LLM检索优于传统方法。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05963 2026-04-08 cs.SE cs.LG 62%

QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization

QiMeng-PRepair: 通过编辑感知奖励优化实现精确代码修复

Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan Zhu, Xiong Peng, Di Huang, Zidong Du, Xing Hu, Qi Guo, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器芯片国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Microelectronics, CAS(中国科学院微电子研究所)

专题命中 程序修复 :program repair(abstract);分类 cs.SE、cs.LG

AI总结 本文提出PRepair框架,通过Self-Breaking和Self-Repairing组件减少过度编辑,提升代码修复精度,实验显示在fix_1@1指标下精度提升31.4%。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05753 2026-04-08 cs.SE 57%

An End-to-End Approach for Fixing Concurrency Bugs via SHB-Based Context Extractor

一种基于SHB上下文提取器的端到端并发bug修复方法

Zhuang Li, Qiuping Yi, Keyang Xiao, Zongcheng Ji, Hongliang Liang

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 本文提出ConFixAgent,一种基于LLM的端到端并发bug修复工具,通过静态发生前图识别相关代码段,提升修复准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 4 篇

2502.06556 2026-04-08 cs.SE cs.CL 81%

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms

MultiFileTest:一个多文件级LLM单元测试生成基准及错误修复机制的影响

Yibo Wang, Congying Xia, Wenting Zhao, Jiangshu Du, Chunyu Miao, Zhongfen Deng, Philip S. Yu, Chen Xing

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Salesforce Research(Salesforce研究院) Scale AI

专题命中 测试生成 :unit test generation(title,abstract);分类 cs.SE、cs.CL

AI总结 本文提出MultiFileTest基准,评估多文件级代码的单元测试生成性能,发现前沿LLM表现一般,且存在执行及级联错误,进一步评估了错误修复机制的效果。

Comments Published at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05159 2026-04-08 cs.SE cs.AI cs.CL 67%

Planning to Explore: Curiosity-Driven Planning for LLM Test Generation

规划以探索:基于好奇心的规划用于LLM测试生成

Alfonso Amayuelas, Firas Laakom, Piotr Piękos, Wenyi Wang, Yifan Xu, Yuhui Wang, Jürgen Schmidhuber, William Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学)

专题命中 测试生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出CovQValue方法,通过将覆盖地图反馈给LLM生成多样化计划,并利用LLM估计的Q值选择最信息量的计划,以平衡即时分支发现与未来可达性,优于贪心策略,在测试生成任务中取得更高覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05130 2026-04-08 cs.SE 57%

A Multi-Agent Framework for Automated Exploit Generation with Constraint-Guided Comprehension and Reflection

面向自动漏洞生成的多智能体框架:基于约束引导的推理与反思

Siyi Chen, Tianhan Luo, Shijian Wu, Xiangyu Liu, Yilin Zhou, Qi Li, Wenyuan Xu

专题命中 测试生成 :code generation(abstract);分类 cs.SE

AI总结 本文提出Vulnsage多智能体框架,通过分解复杂漏洞生成过程为多个专业化子智能体,结合LLM生成候选漏洞利用代码,并通过反馈驱动的自完善循环提升漏洞生成效率与准确性,实验证明其在生成漏洞利用代码和发现零日漏洞方面优于现有工具。

Journal ref 34th IEEE/ACM International Conference on Program Comprehension (ICPC '26), April 12--13, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24536 2026-04-08 cs.CL cs.HC 57%

Robust Multilingual Text-to-Pictogram Mapping for Scalable Reading Rehabilitation

鲁棒多语言文本到图示映射以实现可扩展的阅读康复

Soufiane Jhilal, Martina Galletti

机构 * Sony Computer Sciences Laboratories(索尼计算机科学实验室)

专题命中 测试生成 :repository(abstract);分类 cs.CL

AI总结 本文提出一种多语言AI界面,通过自动增强文本并映射相关图示,帮助特殊教育需求儿童提高阅读理解能力,经过五种语言评估显示系统在语义安全性和可用性方面具有技术可行性。

Comments Accepted at IEEE ICALT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 6 篇

2601.06565 2026-04-08 cs.CL 74%

EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation

EVM-QuestBench: 一个基于执行的自然语言交易代码生成基准测试

Pei Yang, Wanyi Chen, Ke Wang, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学)

专题命中 代码评测 :code generation(title);分类 cs.CL

AI总结 本文提出EVM-QuestBench,一个基于执行的自然语言交易脚本生成基准测试,包含107个任务,通过动态评估和模块化架构评估20个模型,发现单步精度与多步流程完成存在显著差异。

Comments 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04192 2026-04-08 cs.CV cs.AI cs.LG 62%

Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks

Graphic-Design-Bench:一个全面的评估AI在图形设计任务中的基准测试

Adrienne Deganutti, Elad Hirsch, Haonan Zhu, Jaejung Seol, Purvanshi Mehta

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphicDesignBench,首个针对专业图形设计任务的全面基准测试集,评估AI模型在布局、排版、信息图、模板设计和动画等任务中的表现,揭示当前模型在空间推理、矢量代码生成和动画分解等方面存在的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23448 2026-04-08 cs.SE cs.AI 62%

Code Review Agent Benchmark

代码审查代理基准

Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出c-CRAB基准,用于评估代码审查代理的能力,发现现有代理仅能解决40%的任务,揭示了未来研究的潜力及人机协作的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05168 2026-04-08 cs.AI 57%

Instruction-Tuned LLMs for Parsing and Mining Unstructured Logs on Leadership HPC Systems

指令调优的LLM用于领导型HPC系统上解析和挖掘无结构日志

Ahmad Maroof Karimi, Jong Youl Choi, Charles Qing Cao, Awais Khan

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) University of Tennessee(田纳西大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出一种基于指令调优的LLM框架,利用链式推理解析HPC日志,结合领域特定日志模板和示例对LLaMA模型进行微调,实现高精度的日志解析与挖掘,验证了其在大规模日志数据上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07388 2026-04-08 cs.CL 57%

Recent Advances in Multimodal Affective Computing: An NLP Perspective

多模态情感计算近期进展:自然语言处理视角

Guimin Hu, Weimin Lyu, Chang Sun, Zhihong Zhu, Lin Gui, Ruichu Cai, Erik Cambria, Hasti Seifi

机构 * Guangdong University of Technology(广东工业大学) Stony Brook University(石溪大学) University of Bologna(博洛尼亚大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Arizona State University(亚利桑那州立大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文从自然语言处理视角系统回顾了多模态情感计算的最新进展,聚焦于多模态情感分析、对话中多模态情绪识别、基于方面的多模态情感分析及多标签情绪识别等四个任务,提出统一视角并探讨相关方向与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05793 2026-04-08 cs.CR cs.CV 50%

BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents

BodhiPromptShield: 预推理提示调解用于抑制LLM/VLM代理中的隐私传播

Bo Ma, Jinsong Wu, Weiqi Yan

机构 * Auckland University of Technology(奥克兰理工大学) University of Chile(智利大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文提出BodhiPromptShield框架,通过检测敏感片段、路由和延迟恢复来抑制LLM/VLM代理中的跨阶段隐私传播,实验显示在控制提示隐私基准(CPPB)上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 2 篇

2604.05533 2026-04-08 cs.AI 57%

Experience Transfer for Multimodal LLM Agents in Minecraft Game

在Minecraft游戏中多模态大语言模型代理的经验迁移

Chenghao Li, Jun Liu, Songbo Zhang, Huadong Jian, Hao Ni, Lik-Hang Lee, Sung-Ho Bae, Guoqing Wang, Yang Yang, Chaoning Zhang

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出Echo框架,通过分解经验为五维,使代理能从历史交互中提取可操作知识,提升复杂环境下的任务解决效率。

详情

展开后加载摘要…

URL PDF HTML 收藏