arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-17 至 2026-03-17 共收录 31 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 12 篇

2507.14172 2026-03-17 cs.LG cs.AI cs.NE 81%

Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI

自改进语言模型用于进化编程合成:ARC-AGI的案例研究

Julien Pourcel, Cédric Colas, Pierre-Yves Oudeyer

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SOAR方法,通过将语言模型融入自改进进化循环中,提升编程合成性能,在ARC-AGI基准上实现显著改进。

Comments update related work

Journal ref Proceedings of the 42 nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18204 2026-03-17 cs.CR cs.LG cs.SE 81%

RESCUE: Retrieval Augmented Secure Code Generation

RESCUE:检索增强型安全代码生成

Jiahao Shi, Tianyi Zhang

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.LG

AI总结 RESCUE通过构建混合知识库和分层多维检索提升安全代码生成,实验显示其在SecurePass@1指标上平均提升4.8点,达到新水平。

Comments Accepted to ICLR'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13587 2026-03-17 cs.AI cs.CV 79%

Breaking the SFT Plateau: Multimodal Structured Reinforcement Learning for Chart-to-Code Generation

突破SFT平台:面向图表到代码生成的多模态结构强化学习

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Liming Zheng, Yufeng Zhong, Lin Ma

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 本文提出多模态结构强化学习(MSRL)以突破SFT平台,通过大规模实验构建最大训练语料库,并采用双阶段课程训练策略,提升图表到代码生成的高阶指标。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13201 2026-03-17 q-bio.GN cs.AI cs.MA 70%

Benchmarking LLM-based agents for single-cell omics analysis

对基于大语言模型的代理在单细胞组学分析中的性能评估

Yang Liu, Lu Zhou, Xiawei Du, Ruikun He, Xuguang Zhang, Rongbo Shen, Yixue Li

专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.AI

AI总结 本文提出一个评估系统,用于严格评估代理在单细胞组学分析中的能力,发现Grok3-beta在测试框架中表现最佳,多代理框架通过角色分工提升协作与执行效率。

Comments please see clear figures in this version. 6 main figures; 13 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13372 2026-03-17 cs.AI cs.LG 62%

The ARC of Progress towards AGI: A Living Survey of Abstraction and Reasoning

为AGI进步的ARC:抽象与推理的活体调查

Sahar Vahdati, Andrei Aioanei, Haridhra Suresh, Jens Lehmann

机构 * TIB - Leibniz Information Centre for Science and Technology(TIB - 科学技术信息研究中心) L3S Research Center, Leibniz University of Hannover(L3S研究所以汉诺威莱布尼茨大学) Dresden University of Technology, Amazon (work done outside of Amazon)(德累斯顿技术大学,亚马逊(非亚马逊工作))

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析三个版本的82种方法及ARC Prize竞赛,揭示了不同范式在版本间性能下降的规律,指出组合泛化能力的局限性,并强调测试时适应和精炼循环的重要性。

Comments Submitted to ACM Computing Surveys. Living survey website: https://nimi-ai.com/arc-survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13289 2026-03-17 cs.LG cs.AI 62%

RelayCaching: Accelerating LLM Collaboration via Decoding KV Cache Reuse

RelayCaching: 通过解码KV缓存重用加速LLM协作

Yingsheng Geng, Yuchong Gao, Weihong Wu, Guyue Liu, Jiang Liu

机构 * Beijing University of Posts(北京邮电大学) Tsinghua University, Beijing, China(清华大学) University of Electronic Science(电子科学大学) Peking University, Beijing, China(北京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RelayCaching方法,通过重用前序代理的解码阶段KV缓存,在多代理LLM系统中减少冗余预填充计算,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01842 2026-03-17 cs.LG 57%

Prism: Efficient Test-Time Scaling via Hierarchical Search and Self-Verification for Discrete Diffusion Language Models

Prism:通过分层搜索和自验证实现离散扩散语言模型的高效测试时扩展

Jinbin Bai, Yixuan Li, Yuchen Zhu, Yi Xin, Qingyu Shi, Aosong Feng, Xiaohong Liu, Molei Tao, Jianru Xue, Xiangtai Li, Ming-Hsuan Yang

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出Prism框架,通过分层轨迹搜索、局部分支和自验证反馈,提升离散扩散语言模型的测试时扩展效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14110 2026-03-17 cs.LG 57%

SVD Contextual Sparsity Predictors for Fast LLM Inference

基于SVD的上下文稀疏性预测器用于快速LLM推理

Georgii Serbin, Kirill Koshkin, Zhongao Sun, Anastasiya Bistrigova, C. C. Korikov

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出一种无需训练的快速稀疏模式预测方法,利用截断感知SVD和阈值校准算法,加速ReGLUFFN的LLM推理,实验显示在保持低精度损失下,解码时间减少1.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12165 2026-03-17 cs.CL 57%

QAQ: Bidirectional Semantic Coherence for Selecting High-Quality Synthetic Code Instructions

QAQ:双向语义一致性用于选择高质量的合成代码指令

Jiayin Lei, Ming Ma, Yunxi Duan, Chenxi Li, Tianming Yang

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出QAQ框架,通过双向语义一致性评估合成数据质量,利用反向互信息量化答案对查询的信息增益,实验表明选择25%数据可达到全数据训练效果,提升数据筛选效率。

Comments 14 pages, 5 figures. Under review at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08804 2026-03-17 cs.CL 57%

MOSAIC: Multi-agent Orchestration for Task-Intelligent Scientific Coding

MOSAIC:多智能体协作用于任务智能的科学编码

Siddeshwar Raghavan, Tanwi Mallick

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 MOSAIC通过多智能体协作解决复杂科学编码任务,采用自反思和学生-教师模式提升准确性和鲁棒性。

Comments The paper requires a great deal of restructuring to be beneficial to the research community. We also identified some issues with the current experiments and improvements in LLM models which we want our work to reflect

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13327 2026-03-17 cs.AI 57%

DOVA: Deliberation-First Multi-Agent Orchestration for Autonomous Research Automation

DOVA:基于协商的多智能体协作以实现自主研究自动化

Aaron Shen, Alfred Shen

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Amazon Web Services, USA(亚马逊网络服务)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 DOVA通过协商优先的协作机制、混合协同推理和自适应多层思考,提升多源信息整合与复杂任务处理能力,降低推理成本并提高回答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15538 2026-03-17 quant-ph 50%

QiboAgent: a practitioner's guideline to open source assistants for Quantum Computing code development

QiboAgent:量子计算代码开发开源助手的实践指南

Lorenzo Esposito, Andrea Papaluca, Stefano Carrazza

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出QiboAgent,通过轻量级开源大语言模型与定制工作流架构,提升量子计算中间件代码生成的准确性和自动化能力,实现90.2%的高精度代码生成。

Comments 13 pages, 9 figures, 1 table. Source code and deployment instructions are publicly available at https://github.com/qiboteam/qiboagent

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2603.15566 2026-03-17 cs.SE cs.AI cs.SY eess.SY 81%

Lore: Repurposing Git Commit Messages as a Structured Knowledge Protocol for AI Coding Agents

Lore:将Git提交信息重新利用为AI编码代理的结构化知识协议

Ivan Stetsenko

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出Lore协议,通过Git trailers重构提交信息,生成包含约束、拒绝替代方案、代理指令和验证元数据的自包含决策记录,以解决AI编码代理在代码生产与消费中机构知识流失的问题。

Comments 8 pages, 1 figure, 1 table. Preprint available at https://doi.org/10.5281/zenodo.19051840

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13023 2026-03-17 cs.SE cs.AI cs.CL 67%

daVinci-Env: Open SWE Environment Synthesis at Scale

daVinci-Env:大规模开放软件工程环境合成

Dayuan Fu, Shenyu Wu, Yunze Wu, Zerui Peng, Yaxing Huang, Jie Sun, Ji Zeng, Mohan Jiang, Lin Zhang, Yukun Li, Jiarui Hu, Liming Liu, Jinlong Hou, Pengfei Liu

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出OpenSWE,一个大规模透明的软件工程代理训练框架,包含45320个可执行Docker环境,通过多代理合成管道和质量过滤流程,实现高效学习和高质量训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23586 2026-03-17 cs.SE cs.AI 62%

Reducing Cost of LLM Agents with Trajectory Reduction

通过轨迹缩减降低LLM代理的成本

Yuan-An Xiao, Pengfei Gao, Chao Peng, Yingfei Xiong

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出AgentDiet方法,通过减少LLM代理轨迹中的冗余信息,降低计算成本,实验显示可减少输入token和总计算成本达39.9%-59.7%和21.1%-35.9%。

Comments 22 pages, 5 figures; accepted for FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13640 2026-03-17 cs.LG cs.SE 62%

SemRep: Generative Code Representation Learning with Code Transformations

SemRep:基于代码变换的生成式代码表示学习

Weichen Li, Jiamin Song, Bogdan Alexandru Stoica, Arav Dhoot, Gabriel Ryan, Shengyu Fu, Kexin Pei

机构 * The University of Chicago(芝加哥大学) Columbia University(哥伦比亚大学) Microsoft(微软公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.LG

AI总结 SemRep通过生成式代码表示学习提升代码变换效果,利用语义保持变换作为中间表示,实现更准确的语义推理和更高效的代码优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2603.14373 2026-03-17 cs.SE 57%

Trust Over Fear: How Motivation Framing in System Prompts Affects AI Agent Debugging Depth

信任胜过恐惧:系统提示中的动机框架如何影响AI代理调试深度

Wu Ji

专题命中 程序修复 :coding agent(abstract);分类 cs.SE

AI总结 研究探讨了信任与恐惧动机框架对AI代理调试深度的影响,发现信任框架能显著提升问题发现和调查步骤,而恐惧框架无明显效果,揭示了动机框架对AI行为的关键作用。

Comments 13 pages, 2 tables, 23 references. Code and data: https://github.com/wuji-labs/nopua

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 2 篇

2603.15611 2026-03-17 cs.CL 57%

Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning

Code-A1:通过强化学习进行代码LLM和测试LLM的对抗演化

Aozhe Wang, Yuchen Yan, Nan Zhou, Zhengxi Lu, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学)

专题命中 测试生成 :code generation(abstract);分类 cs.CL

AI总结 Code-A1通过对抗性共进化框架联合优化代码LLM和测试LLM,解决传统方法中白盒访问导致的自我 collusion 和黑盒限制下的测试泛化问题,提升测试生成能力。

Comments Project Page: https://zju-real.github.io/Code-A1 Code: https://github.com/ZJU-REAL/Code-A1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14191 2026-03-17 cs.SE cs.CR 57%

Mining the YARA Ecosystem: From Ad-Hoc Sharing to Data-Driven Threat Intelligence

挖掘YARA生态系统:从随意分享到数据驱动威胁情报

Dectot--Le Monnier de Gouville Esteban, Mohammad Hamdaqa, Moataz Chouchen

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 研究通过分析840万条规则揭示YARA生态系统高度集中且存在运营问题,提出需从随意收集转向严格规则工程。

Comments Accepted at the International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

Journal ref Proceedings of the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 5 篇

2506.06251 2026-03-17 cs.SE cs.AI 81%

DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation

DesignBench: 一个全面的基于MLLM的前端代码生成基准测试

Jingyu Xiao, Ming Wang, Man Ho Lam, Yuxuan Wan, Junliang Liu, Yintong Huo, Michael R. Lyu

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13251 2026-03-17 cs.AI 74%

ManiBench: A Benchmark for Testing Visual-Logic Drift and Syntactic Hallucinations in Manim Code Generation

ManiBench:一个用于测试Manim代码生成中视觉-逻辑漂移和语法幻觉的基准测试

Nabin Oli

机构 * Sunway College Kathmandu(加德满都阳光学院) Birmingham City University(伯明翰城市大学)

专题命中 代码评测 :code generation(title);分类 cs.AI

AI总结 ManiBench旨在评估LLM在生成Manim CE代码时的性能,针对语法幻觉和视觉-逻辑漂移两种关键失败模式,包含150-200个问题,涵盖微积分、线性代数、概率、拓扑和AI等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 73%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14870 2026-03-17 cs.LG cs.AI 62%

IgPose: A Generative Data-Augmented Pipeline for Robust Immunoglobulin-Antigen Binding Prediction

IgPose:一种生成式数据增强管道,用于鲁棒的免疫球蛋白-抗原结合预测

Tien-Cuong Bui, Injae Chung, Wonjun Lee, Junsu Ko, Juyong Lee

机构 * Arontier Co., Ltd.(阿罗尼尔公司) Department of Molecular Medicine and Biopharmaceutical Sciences(分子医学与生物制药科学系) Graduate School of Convergence Science and Technology(融合科学与技术研究生院) Seoul National University(首尔国立大学) Research Institute of Pharmaceutical Science, College of Pharmacy(药学研究 institute,药学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 IgPose通过生成式数据增强管道和结合等效图神经网络等方法,提升免疫球蛋白与抗原结合预测的鲁棒性,实现高通量抗体发现。

Comments 11 pages, 4 figures, Bioinformatics

Journal ref Bioinformatics 42 (2026) btag076

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13287 2026-03-17 cs.LG cs.AI 62%

From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code

从随机答案到可验证推理:利用LLM生成代码的可解释决策

Anirudh Jaidev Mahesh, Ben Griffin, Fuat Alican, Joseph Ternasky, Zakari Salifu, Kelvin Amoaba, Yagiz Ihlamur, Aaron Ontoyin Yin, Aikins Laryea, Afriyie Samuel, Yigit Ihlamur

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Oxford(牛津大学) Vela Research(Vela研究公司) Amazon(亚马逊)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将LLM视为代码生成器而非实例评估器,通过生成可执行决策逻辑提升决策可解释性与可重复性,在创业资本创始人筛选中实现更高精度与可验证性。

Comments 12 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 6 篇

2603.13258 2026-03-17 cs.LG cs.AI cs.SE 67%

Your Code Agent Can Grow Alongside You with Structured Memory

你的代码代理可以与你一同成长,借助结构化记忆

Yi-Xuan Deng, Xiaoqin Liu, Yi Zhang, Guo-Wei Yang, Shuojin Yang

机构 * Tsinghua University(清华大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出MemCoder框架,通过结构化记忆和实时反馈实现人类与AI的持续共进化,提升代码代理在复杂软件工程任务中的性能。

Comments Code Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10793 2026-03-17 cs.CL cs.AI 62%

LabelFusion: Fusing Large Language Models with Transformer Encoders for Robust Financial News Classification

LabelFusion:融合大型语言模型与Transformer编码器以实现稳健的金融新闻分类

Michael Schlee, Christoph Weisser, Timo Kivimäki, Melchizedek Mashiku, Benjamin Saefken

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LabelFusion架构,结合提示工程的LLM与微调的RoBERTa编码器,通过轻量MLP投票层提升金融新闻分类性能,在低数据环境下LLM单独使用表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01763 2026-03-17 cs.LG cs.CL 62%

FC-KAN: Function Combinations in Kolmogorov-Arnold Networks

FC-KAN:Kolmogorov-Arnold网络中的函数组合

Hoang-Thang Ta, Duy-Quy Thai, Abu Bakar Siddiqur Rahman, Grigori Sidorov, Alexander Gelbukh

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FC-KAN,通过元素级运算结合B-spline、小波和径向基函数等数学函数,改进KAN网络,实验表明其在MNIST和Fashion-MNIST数据集上优于其他模型。

Comments 17 pages

Journal ref Volume 736, 25 April 2026, 123103, Information Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13404 2026-03-17 cs.SE cs.AI 62%

Schema First Tool APIs for LLM Agents: A Controlled Study of Tool Misuse, Recovery, and Budgeted Performance

为LLM代理设计的基于模式的工具API:对工具误用、恢复和预算性能的受控研究

Akshey Sigdel, Rista Baral

机构 * Independent Researcher(独立研究者)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文通过受控实验探讨基于模式的工具合同和结构化验证诊断对LLM代理在严格交互预算下的可靠性影响,发现模式条件减少接口误用但未改善语义误用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15340 2026-03-17 cs.CL stat.ML 57%

DOS: Dependency-Oriented Sampler for Masked Diffusion Language Models

DOS:基于依赖关系的掩码扩散语言模型采样器

Xueyu Zhou, Yangrong Hu, Jian Huang

机构 * Department of Data Science and AI(数据科学与人工智能系)

专题命中 仓库级理解 :code generation(abstract);分类 cs.CL

AI总结 DOS是一种无需训练的解码策略,通过利用令牌间依赖关系提升生成质量,尤其在代码生成和数学推理任务中表现优异,且能与现有并行采样方法结合提升效率。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23021 2026-03-17 cs.RO cs.CV 50%

UniPrototype: Humn-Robot Skill Learning with Uniform Prototypes

UniPrototype:基于统一原型的人机技能学习

Xiao Hu, Qi Yin, Yangming Shi, Yang Ye

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出UniPrototype框架,通过共享运动原语实现人机知识迁移,解决机器人学习数据稀缺问题,提升学习效率和任务性能。

Comments This submission was uploaded in error and has been withdrawn. A substantial revision will need to be completed

详情

展开后加载摘要…

URL PDF HTML 收藏