arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-20 至 2026-05-20 共收录 29 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 13 篇

2605.19102 2026-05-20 cs.SE 79%

Prompt Optimization for LLM Code Generation via Reinforcement Learning

通过强化学习优化LLM代码生成的提示

Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. Ajila

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出了一种基于强化学习的框架,通过将提示优化视为序列决策问题,利用PPO代理结合直接生成、遗传词法突变和语义重写动作空间,指导由单元测试反馈获得的形状奖励,从而提升LLM代码生成的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18795 2026-05-20 cs.LG cs.AI 73%

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang

机构 * Department of Computer Science and Technlogy(计算机科学与技术系) Tsinghua University(清华大学) School of Computer Science and Technlogy(计算机科学与技术系) Xi’an Jiaotong University(西安交通大学) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)

专题命中 代码生成 :code generation(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出HELLoRA,一种针对混合专家模型的层级低秩适应方法,通过仅对最活跃的专家添加LoRA模块,减少可训练参数和计算量,同时提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12981 2026-05-20 cs.SE cs.AI cs.LG 67%

Protocol-Driven Development: Governing Generated Software Through Invariants and Continuous Evidence

基于协议的开发:通过不变式和连续证据治理生成的软件

Jun He, Deying Yu

专题命中 代码生成 :program synthesis(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出了一种基于协议的开发方法,通过定义协议的不变式和连续证据来治理生成的软件,其核心贡献是将协议作为主要软件 artifact,而非代码,从而实现对生成软件的持续验证和治理。

Comments 20 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04998 2026-05-20 cs.LG cs.AI cs.CL 67%

Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning

学习率至关重要:Vanilla LoRA可能足以用于LLM微调

Yu-Ang Lee, Ching-Yun Ko, Pin-Yu Chen, Mi-Yen Yeh

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院) Academia Sinica(台湾“学术院”)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过广泛的超参数搜索重新评估了九种代表性的LoRA变体和Vanilla LoRA,在数学推理、常识推理、代码生成和指令遵循等任务上,发现不同的LoRA方法偏好不同的学习率范围。当学习率正确调整时,所有方法都能达到相似的峰值性能,这表明Vanilla LoRA仍然是一个有竞争力的基线,而单一训练配置下的改进可能并不反映一致的方法优势。

Comments Project page: https://github.com/yuang-lee/lr-matters-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01031 2026-05-20 cs.AI cs.CL 62%

CADDesigner: Conceptual CAD Model Generation with a General-Purpose Agent

CADDesigner: 一种通用智能体的概念CAD模型生成

Fengxiao Fan, Jingzhe Ni, Xiaolong Yin, Sirui Wang, Xingyu Lu, Qiang Zou, Ruofeng Tong, Min Tang, Peng Du

机构 * Zhejiang University(浙江大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CADDesigner,一种基于LLM的智能体,通过文本描述和草图输入,结合交互对话进行需求分析,生成高质量CAD模型代码,并通过迭代视觉反馈提升模型质量,实验表明其在概念CAD模型生成任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22202 2026-05-20 cs.SE cs.CL 62%

Library Hallucinations in LLM-Generated Code: A Risk Analysis Grounded in Developer Queries

LLM生成代码中的库幻觉:基于开发者查询的风险分析

Lukas Twist, Jie M. Zhang, Mark Harman, Helen Yannakoudakis

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。

Comments 27 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19901 2026-05-20 cs.SE 57%

Can LLMs Produce Better Object-Oriented Designs than Human-Involved Development?

LLMs能否产生比人类参与开发更好的面向对象设计?

Zushuai Zhang, Elliott Wen, Ewan Tempero

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文研究了LLMs在生成面向对象设计(OOD)项目时的表现,通过比较预AI、后AI和纯AI三种作者条件下的项目质量,发现纯AI项目在代码异味密度和整体复杂度上较低,但存在过度简化的问题,结论指出在使用LLMs进行面向对象设计时,适当的人类指导仍很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01411 2026-05-20 cs.SE 57%

CodePori: Large-Scale System for Autonomous Software Development Using Multi-Agent Technology

CodePori:利用多智能体技术实现大规模自主软件开发的系统

Zeeshan Rasheed, Muhammad Waseem, Kai-Kristian Kemell, Aakash Ahmad, Malik Abdul Sami, Mika Saari, Jussi Rasku, Pekka Abrahamsson

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文研究了基于大语言模型的多智能体系统在自主软件开发中的潜力与局限,通过开发CodePori系统和参与式评估,揭示了LLM多智能体系统的优势、挑战及改进方向。

Comments 18 pages, 8 figures, and 4 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19028 2026-05-20 cs.LG 57%

Learning When to Adapt

学习何时适应

Ali Zindari, Xiaowen Jiang, Rotem Mulayoff, Sebastian U. Stich

机构 * Universität des Saarlandes(萨尔布吕肯大学) CISPA Helmholtz Center for Information Security(信息安全研究中心)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出DISeL,一种动态输入敏感的低秩适应方法,通过引入轻量级输入依赖门控机制,减少遗忘并保持微调准确性,同时提供可解释的诊断视图。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15113 2026-05-20 cs.LG 57%

Learning from Language Feedback via Variational Policy Distillation

通过变分策略蒸馏学习语言反馈

Yang Li, Erik Nijkamp, Semih Yavuz, Shafiq Joty

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出变分策略蒸馏(VPD),通过将学习语言反馈形式化为变分期望最大化问题,解决传统自蒸馏方法中教师策略能力停滞的问题,从而在科学推理和代码生成任务中优于标准RLVR和现有自蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18829 2026-05-20 cs.LG cs.CR 57%

Lossless Anti-Distillation Sampling

无损反蒸馏采样

Zibo Diao, Jingchu Gai, Xinyue Ai, Zhang Zhang, Zhenyu He, Di He

机构 * Peking University(北京大学) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出了一种无损反蒸馏采样方法,通过在保持良性用户体验的同时,有效对抗多账号蒸馏攻击,降低蒸馏模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18764 2026-05-20 cs.IR cs.AI 57%

From Intent to AI Pipelines: A Controlled Agentic Framework for Non-AI Expert Scientists

从意图到AI流水线:一种受领域驱动的可控代理框架,用于非AI专家科学家

Hyacinth Ali, Jessie Galasso-Carbonnel, Houari Sahraoui

机构 * University of Montreal(蒙特利尔大学) McGill University(麦吉尔大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出DDAP框架,通过分阶段交互帮助非AI专家科学家系统构建AI流水线及其实现代码,展示了可控代理框架在生成竞争性AI流水线方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19683 2026-05-20 cs.LO 50%

Completeness of Synthesis under Realizability Assumptions using Superposition

在可实现性假设下利用超位置的合成完备性

Márton Hajdu, Petra Hozzová, Laura Kovács, Eva Maria Wagner

专题命中 代码生成 :program synthesis(abstract)

AI总结 本文研究了在可实现性假设下利用超位置进行程序合成的完备性问题,通过改进超位置演算并证明其正确性和完备性,确保能够找到满足规范的可计算程序。

Comments to be published in IJCAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2605.20049 2026-05-20 cs.SE cs.AI 84%

Does Code Cleanliness Affect Coding Agents? A Controlled Minimal-Pair Study

代码整洁性影响编码代理吗?一项受控的最小对研究

Priyansh Trivedi, Olivier Schmitt

机构 * SonarSource

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究探讨了代码整洁性对编码代理性能的影响,通过构建结构和风格相似但整洁度不同的代码库对,发现整洁性不影响通过率,但显著降低计算成本和文件重复访问。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20086 2026-05-20 cs.NE cs.AI cs.LG 81%

What Do Evolutionary Coding Agents Evolve?

进化编码代理进化什么?

Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

机构 * Zuse Institute Berlin(柏林Zuse研究所) Technical University of Berlin(柏林技术大学) Hong Kong Baptist University(香港 Baptist大学) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了进化编码代理在数学发现和算法设计中通过任务特定反馈生成、修改和选择代码的过程,通过EvoTrace数据集和EvoReplay方法分析了进化过程中的机制,发现大部分得分提升来自少数几种编辑类型,并发现存在确定性的循环模式。

Comments 28 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18854 2026-05-20 cs.LG 79%

Evaluating Memory Condensation Strategies for Coding Agents in Data-Driven Scientific Discovery

评估用于数据驱动科学发现的编码代理的记忆压缩策略

Renuka Chintalapati, Sid Raskar, Anurag Acharya, Jared Willard, Patrick Emami, Sameera Horawalavithana

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) National Laboratory of the Rockies(落基山国家实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.LG

AI总结 本文评估了八种记忆压缩策略在数据驱动科学发现任务中的表现,发现没有压缩器显著提升假设质量,但基于LLM的压缩器会增加24-94%的token成本,而屏蔽工具调用输出可实现8.6%的净节省,且最佳压缩器因科学领域和任务长度而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19932 2026-05-20 cs.AI cs.CL cs.LG 67%

PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents

PEEK:上下文地图作为长上下文LLM代理的导向缓存

Zhuohan Gu, Qizheng Zhang, Omar Khattab, Samuel Madden

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PEEK系统,通过上下文地图缓存和维护导向知识,提升长上下文LLM代理在重复外部上下文中的交互准确性和效率,相比基线方法在推理和上下文学习任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15846 2026-05-20 cs.SE cs.AI 62%

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench: 评估跨版本升级的长期代理软件开发

Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI Peking University(北京大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出RoadmapBench,一个基于真实开源版本升级的115个长期编码任务的基准,旨在评估长期多目标软件开发,发现现有基准无法有效评估此类任务,表明长期软件开发仍是难题。

Comments 30 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2605.19369 2026-05-20 cs.SE 57%

When to Answer and When to Defer: A Decision Framework for Reliable Code Predictions

何时回答,何时延迟:一种可靠代码预测的决策框架

Ravishka Rathnasuriya, Wei Yang

专题命中 测试生成 :code model(abstract);分类 cs.SE

AI总结 本文提出了一种决策框架,用于在代码预测中可靠地判断何时回答何时延迟,通过整合不确定性估计、模型校准和工具基于的延迟处理,提高代码模型的可靠性。

Comments In Proceedings of the 48th IEEE/ACM International Conference on Software Engineering- New Idea and Emerging Results Track (ICSE-NIER 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 5 篇

2605.17046 2026-05-20 cs.LG cs.AI cs.CL 67%

1GC-7RC: One Graphic Card -- Seven Research Challenges! How Good Are AI Agents at Doing Your Job?

1GC-7RC:一张图形卡——七个研究挑战!AI代理在做你的工作方面有多好?

Robin-Nico Kampa, Fabian Deuser, Anna Bößendörfer, Konrad Habel, Norbert Oswald

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出1GC-7RC基准测试,通过七个跨领域机器学习任务评估AI代理在从头设计、实现和训练模型的能力,揭示了不同代理在隐式机器学习知识、规划能力和时间预算管理方面的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19382 2026-05-20 cs.AI 57%

PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning

PRISM:一个程序化空间-时间推理的基准测试

Qiran Zhang, Yuheng Wang, Runde Yang, Lin Wu, Jingru Fan, Shu Yao, Jie Zhang, Tianle Zhou, Huatao Li, Ruijie Shi, Yihan Li, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文提出PRISM基准测试,通过大规模人类校准的指令-代码对(共10,372个,比之前基准大20倍),评估语言模型生成空间正确动画输出的能力,并揭示执行成功率与空间正确率之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 57%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19399 2026-05-20 cs.AR 50%

HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip

HSCO-Bench: 一种由智能体驱动的端到端硬件软件协同设计基准,用于片上系统

Pei-Huan Tsai, Kuan-Lin Chiu, William Baisi, Pin-Yu Chen, Luca P. Carloni

专题命中 代码评测 :repository(abstract)

AI总结 本文提出HSCO-Bench,一个用于评估大型语言模型在端到端硬件软件协同设计能力的基准,通过评估LLM在资源约束下生成高效SoC原型的能力,揭示了当前模型在硬件加速方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19328 2026-05-20 cs.CR cs.RO 50%

RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents

RoboJailBench: 对具身体验机器人代理中对抗攻击和防御的基准测试

Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文提出RoboJailBench,通过建立安全分类学、引入意图对比数据集管道以及提供一个演进的存储库,为具身体验人工智能中的对抗攻击和防御提供了标准化评估框架,同时构建了一个新的分类平衡数据集并增强了五个现有数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 5 篇

2506.11590 2026-05-20 physics.chem-ph cond-mat.mtrl-sci cond-mat.str-el nucl-th physics.comp-ph 56%

The QUEST Database of Highly-Accurate Excitation Energies

高精度激发能数据库QUEST

Pierre-François Loos, Martial Boggio-Pasqua, Aymeric Blondel, Filippo Lipparini, Denis Jacquemin

专题命中 仓库级理解 :repository(abstract,comments)

AI总结 本文介绍了QUEST数据库,该数据库提供了大量激发态和分子的垂直跃迁能的理论最佳估计,包含多种参考基组的计算结果,并评估了各种单参考和多参考波函数方法的性能。

Comments 28 pages, 7 figures (Supporting Information available). For associated git repository, see https://github.com/pfloos/QUESTDB

Journal ref J. Chem. Theory Comput. 21, 8010 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20051 2026-05-20 cs.CR 50%

Hunting Vulnerability Variants in AI Infra: Measurement and Reference-Driven Detection

在AI基础设施中寻找漏洞变体:测量与参考驱动的检测

Tian Dong, Yanjun Chen, Shoufeng Zhang, Huaien Zhang, Yunlong Lyu, Keke Lian, Dong Zhang, Shaofeng Li, Hao Chen

专题命中 仓库级理解 :repository(abstract)

AI总结 本文研究了AI基础设施中漏洞变体的测量与参考驱动检测,通过分析688个GitHub仓库和251个公开披露的漏洞,发现AI基础设施项目经常共享重叠功能和重复的漏洞模式,提出了基于参考的多智能体框架INFRASCOPE,用于自动识别和验证新的漏洞变体。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05468 2026-05-20 quant-ph 50%

Cartan-Khaneja-Glaser decomposition of $SU(2^n)$ via involutive automorphisms

通过反交换自同构分解SU(2^n)

John A. Mora Rodríguez, Arthur C. R. Dutra, Henrique N. Sá Earp, Marcelo Terra Cunha

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出了一种新的算法,用于分解SU(2^n)中的酉矩阵,克服了原有方法中依赖于不明确的矩阵对数和截断BCH级数收敛问题的限制,利用反交换自同构的代数结构和对称李代数分解,实现了稳定且递归的因子分解过程。

Comments 17 pages, 7 figures To appear in Pure and Applied Mathematics Quarterly (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19058 2026-05-20 hep-ph nucl-th 50%

Looking at the Entropy in a Proton through a QGP Lens

通过QGP视角审视质子中的熵

Dmitri E. Kharzeev, Krishna Rajagopal

专题命中 仓库级理解 :repository(abstract)

AI总结 研究量子色液(QGP)热力学(Gibbs)熵与受限强子态量子纠缠熵在夸克-强子相变中的相互作用,揭示纠缠熵如何作为热力学熵的存储库,从而在热力学第二定律下解释宏观熵的减少。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29926 2026-05-20 hep-th 50%

Recursive-algebraic solution of the closed string tachyon vacuum equation

递归-代数解闭弦超光子真空方程

Manki Kim

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出了一种递归代数框架来求解闭弦超光子真空方程,通过限制零动量洛伦兹标量状态的领域,利用洛伦兹对称性确保该领域在运动方程下封闭,并引入缝级展开,证明在每级展开中方程完全代数化,仅需在系统长度上进行点评估,每级展开仅需矩阵求逆,无需弗雷德霍姆方程。

Comments v3: typos fixed, numerical errors fixed

详情

展开后加载摘要…

URL PDF HTML 收藏