arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-21 至 2026-07-21 共收录 16 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 16 篇

2607.17420 2026-07-21 cs.CL cs.SE 新提交 81%

The Librarian Who Refused to Code: Model-Dependent Identity Enactment in LLM Code Generation

拒绝编码的图书管理员:大语言模型代码生成中依赖模型的身份设定

Shayell Aharon Salomon, Noam Israel, Ido Safruti, Amir Shaked

机构 * Bluebear Security(蓝熊安全公司)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL

AI总结 研究在可控条件下评估不同人物角色对代码生成的影响,测试了四种提示条件、两个模型等,发现角色影响因模型而异,如Claude Opus上图书管理员角色降低正确性,结果表明角色是依赖模型的行为策略偏差,还发布了相关数据和文档。

Comments 17 pages, 3 tables, no figures. Ancillary files include raw completions, derived scores, analysis scripts, persona texts, and preregistration

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02138 2026-07-21 cs.SE cs.AI 版本更新 81%

CAM: A Causality-based Analysis Framework for Multi-Agent Code Generation Systems

CAM:基于因果分析的多智能体代码生成系统分析框架

Zongyi Lyu, Zhenlan Ji, Songqiang Chen, Liwen Wang, Yuheng Huang, Shuai Wang, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Tokyo(东京大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 CAM提出一种基于因果分析的框架,用于分析多智能体代码生成系统中中间特征对系统正确性的贡献,通过实证分析揭示了依赖上下文的特征和混合架构的优势。

Comments 20 pages, 12 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17540 2026-07-21 cs.LG stat.ML 新提交 79%

Program Synthesis for Simulation-Based Inference: Joint Model Selection and Parameter Estimation

基于仿真推理的程序合成:联合模型选择与参数估计

Siddharth Mishra-Sharma

机构 * Anthropic

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.LG

AI总结 研究提出结合大语言模型与神经仿真推理的框架,用于联合模型选择与参数估计。给定自然语言描述,大语言模型提出候选程序,经反馈驱动变异和神经密度估计评估,能在一组模型上推理,在多基准测试中可从提示识别合理模型族。

Comments 15+7 pages, 4+2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16632 2026-07-21 cs.SE cs.AI 新提交 79%

CLOSER-Bench: Evaluating Budgeted Cross-Stage Design Closure for Hardware Agents

CLOSER-Bench:评估硬件代理的预算跨阶段设计封闭性

Peilong Zhou, Zhirong Chen, Cangyuan Li, Haoyu Gao, Kaiyan Chang, Ziming Qu, Ying Wang

专题命中 代码生成 :code generation(abstract);repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究硬件代理跨阶段设计封闭性评估难题,提出CLOSER-Bench协议,通过配对任务记录调用,测量多方面指标。经试点和验证揭示差距,构建加速器,促使将硬件封闭视为预算顺序决策问题。

Comments 6 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17619 2026-07-21 cs.CR 新提交 78%

Insecure Coding Preferences in Long-Term Memory: Security Risks for LLM-based Code Generation

长期记忆中的不安全编码偏好:基于大语言模型的代码生成的安全风险

Yuchen Chen, Wei Cheng, Yuan Xiao, Zhou Yang, Weifeng Sun, Chunrong Fang, Xiang Chen, Baowen Xu, David Lo, Zhenyu Chen

专题命中 代码生成 :code generation(title,abstract)

AI总结 研究基于LLM的代码生成中,长期记忆里不安全编码偏好带来的安全风险,通过评估四种LLM在五种编程语言上的表现,发现其显著增加生成漏洞代码风险及存在警告差距,还评估了三种缓解策略并给出改进安全性的建议。

Comments Accepted to the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00594 2026-07-21 cs.AI 版本更新 70%

Agent psychometrics: Task-level performance prediction in agentic coding benchmarks

代理心理测量:在代理编码基准中的任务级性能预测

Chris Ge, Daria Kryvosheieva, Daniel Fried, Uzay Girit, Kaivalya Hariharan

机构 * Massachusetts Institute of Technology(麻省理工学院) Fulcrum Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI

AI总结 本文提出了一种基于任务级性能预测的代理编码基准评估框架,结合IRT理论与任务特征,区分LLM和支架能力,以更准确预测未见基准和组合的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17641 2026-07-21 cs.AI cs.SE 新提交 62%

Verify, Repair, Repeat, or Stop? Robust Stopping for Noisy Verify-Repair Loops in LLM Agents

验证、修复、重复还是停止?大语言模型代理中用于有噪声验证-修复循环的稳健停止方法

Yitao Wu, Si Shen, Rui Yang, Hong Peng, Bin Hu

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究大语言模型代理中验证-修复循环有噪声时缺乏停止原则的问题,提出VRR-Stop框架,通过四参数噪声模型和信念过滤估计有效性,依真实边际增益符号决策,配对VRR-Guard,提升了停止可靠性与真实有效性。

Comments 18 pages, 10 figures, 10 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11765 2026-07-21 cs.MA cs.AI cs.LG 版本更新 62%

OMAC: A Holistic Optimization Framework for LLM-Based Multi-Agent Collaboration

OMAC:一种面向基于大语言模型的多智能体协作的综合优化框架

Shijun Li, Hilaf Hasson, Joydeep Ghosh

机构 * Department of Electrical and Computer Engineering, The University of Texas at Austin, Austin, United States(得克萨斯大学奥斯汀分校电子与计算机工程系) Intuit AI Research, Mountain View, United States(Intuit AI研究)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OMAC框架,通过五个关键优化维度提升基于大语言模型的多智能体系统性能,采用语义初始化器和对比比较器算法实现单维和多维联合优化。

Comments Accepted as a Oral paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16580 2026-07-21 stat.AP cs.CE cs.SE 新提交 57%

Automating structural reliability analysis with a multi-agent large language model framework

使用多智能体大语言模型框架实现结构可靠性分析自动化

Jaehwan Jeon, Chang Hee Lee, Taeyong Kim

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究提出多智能体大语言模型框架,通过专门智能体处理结构可靠性分析流程,用QLoRA微调方法规划器,由确定性求解器计算结果,降低专业知识壁垒,保持计算可信度,实现结构可靠性分析自动化。

Comments 41 pages, 10 figures. Submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18026 2026-07-21 cs.AI 新提交 57%

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective

重新思考异构语言模型合并:加权模型平均视角

Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究异构语言模型合并问题,通过无训练的维度适配和比率控制插值,在联合式与交叉式合并中进行实验,结果表明简单参数平均结合轻量级适配和比率控制是强大基线,揭示直接加权融合的限制及对复杂方法的制约。

Comments 17 pages, 3 figures, 20 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17823 2026-07-21 cs.LG 新提交 57%

Theoretical Foundations of $\max$@$k$ Reinforcement Learning

$\max$@$k$强化学习的理论基础

Riccardo Poiani, Martino Bernasconi, Andrea Celli

机构 * Bocconi University(博科尼大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 研究有限 horizon 强化学习中$\max$@$k$学习问题,指出其与标准预期回报最大化不同,证明马尔可夫策略不足,识别状态增强,表征策略性能差距,表明学习更难,给出高效算法实现最优样本复杂度率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16850 2026-07-21 cs.CL 新提交 57%

Group Entropy-Controlled Policy Optimization

组熵控制策略优化

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 研究针对大语言模型强化学习中异构任务的探索利用问题,提出组熵控制策略优化(GEPO)方法,利用组熵进行优势塑造,通过实验验证该方法优于GRPO等,能实现跨任务平衡改进并保持任务探索水平。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16845 2026-07-21 cs.AI 新提交 57%

From Overload to Insights: How AI Agents Can Support Scientists in Analyzing Complex Data

从过载到洞察:人工智能代理如何支持科学家分析复杂数据

Tim Fuchs, Luca Gelisio, Steffen Hauf, Walid Maalej

机构 * European XFEL(欧洲X射线自由电子激光设施)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 针对欧洲XFEL科学家分析复杂数据面临的挑战,设计并评估智能AI系统。采用设计科学研究方法,经多项研究开发并评估两原型,确定关键挑战,得出对AI代理的要求及设计建议,为开发可维护的AI支持提供指导。

Comments Accepted for publication at the 42nd IEEE International Conference on Software Maintenance and Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16727 2026-07-21 cs.AI cs.CV 新提交 57%

Constraint-Anchored Reasoning Traces

约束锚定推理轨迹

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI

AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。

Comments 15 pages, ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16708 2026-07-21 cs.SE 新提交 57%

Model-Driven Discipline for Multi-Agent LLMs: Requirement-to-Verification Generation of Traceable System Models

多智能体大语言模型的模型驱动规范:可追溯系统模型的需求到验证生成

Ran Wei, Le Zhu, Haochi Wang, Ruizhe Yang, Jiapeng Guan, Siyuan Ji, Yuchen Hu, Zhe Jiang, Xiangyang Ji

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 针对软件复杂性问题,提出RADIANT方法,结合MDE与多智能体LLMs用于系统开发。能从需求模型自动生成异构模型及可追溯链接,进行变更影响分析和形式验证。评估显示可提高语法有效性和可执行性,减少开发时间并可跨领域应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16206 2026-07-21 cs.AI 新提交 57%

PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization

PPO-HSC:基于广域策略覆盖优化的探索性强化学习框架

Yujie Shen, Haowen Chen

机构 * School of Mathematics, Hunan University(湖南大学数学学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 PPO-HSC是用于解决大语言模型微调中模式崩溃问题的探索性强化学习框架,通过纳入高阶采样覆盖奖励及维护动态轨迹库,提高解决方案多样性与状态空间覆盖,在数学推理和代码生成任务中表现出色。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏