arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-19 至 2026-08-19 共收录 23 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2608.16934 2026-08-19 cs.AR cs.CL 新提交 79%

SeqFeed: Improving Agentic RTL Code Generation with Sequential Behavior Feedback

SeqFeed:通过顺序行为反馈改进智能体RTL代码生成

Yuxin Du, Juxin Niu, Tao Hu, Xi Wang, Zhe Jiang, Nan Guan

专题命中 代码生成 :code generation(title,abstract);分类 cs.CL

AI总结 针对智能体RTL代码生成的时序信息传递难题,本研究提出含SeQuery和SeGraph机制的SeqFeed,通过满足三项反馈要求提升LLM的RTL代码生成通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24126 2026-08-19 cs.LG cs.PL 版本更新 76%

Likelihood Hacking in Probabilistic Program Synthesis

概率程序合成中的似然黑客行为

Jacek Karwowski, Younesse Kaddar, Zihuiwen Ye, Esmeralda S. Whitammer, Sam Staton

机构 * University of Oxford, Department of Computer Science(牛津大学计算机科学系) University of Edinburgh, School of Informatics(爱丁堡大学信息学院) CIFAR Fellow, Learning in Machines and Brains(CIFAR Fellow, 机器与大脑学习)

专题命中 代码生成 :program synthesis(title);分类 cs.LG、cs.PL

AI总结 研究概率程序合成中语言模型通过强化学习生成程序时可能人为夸大边际似然奖励的问题,提出安全语言片段SafeStan以防止似然黑客行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16970 2026-08-19 cs.CR cs.AI cs.LG 新提交 62%

Probing the Prefill: Detecting Code Vulnerabilities via Latent Activations

探测预填充:通过潜在激活检测代码漏洞

Alizishaan Khatri

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 该研究从四个LLM提取预填充标记激活训练MLP探测器,在四个代码漏洞基准上实现平均F1值41.7%,证明LLM自身代码表示含漏洞信息,为轻量原生筛查提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16890 2026-08-19 cs.AI 新提交 57%

GxP-Agent: Process-DAG Topology for Reliable Clinical Trial Programming with LLM Agents

GxP-Agent:基于流程有向无环图拓扑结构的可靠临床试验编程大模型智能体

Jaime Yan

机构 * Harrisburg University of Science and Technology(哈里斯堡科技大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 该研究提出基于流程DAG拓扑的多智能体系统GxP-Agent,在临床试验编程任务上显著优于现有方法,实现了高结构匹配率,验证了编码领域流程知识为图拓扑的有效性。

Comments Preprint. 9 pages main text, 3 figures, plus references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17504 2026-08-19 physics.comp-ph cs.SE 新提交 57%

Agentic Porting, Construction and Initial Verification and Validation of Libraries within the Open Source Unified TRAnsient Multi-Phase Advanced Reactor simulation Kit (Outram Park) Part I: Thermal Hydraulics

开源统一瞬态多相先进反应堆模拟工具包(Outram Park)中库的智能体迁移、构建及初步验证与确认 第一部分:热工水力

Theodore Kay Chen Ong, Ethan Yew Hoe Wong, Sicong Xiao

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究将OpenFOAM库智能体迁移至Rust语言的Outram-Foam库,开发了两相HEM壅塞流求解器,验证显示其吻合度良好,智能体编码可提升开源库开发效率,人类专业知识仍为关键。

Comments 78 pages, 21 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09932 2026-08-19 cs.PL cs.AR 版本更新 57%

Automatically Generating ML Compiler Backends from Tensor Accelerator ISA Descriptions

从张量加速器ISA描述自动生成ML编译器后端

Devansh Jain, Akash Pardeshi, Marco Frigo, Kaustubh Khulbe, Krut Patel, Saatvik Lochan, Jai Arora, Charith Mendis

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 本文提出ACT工具,可基于ISA描述自动生成张量加速器的XLA编译器后端,其生成的后端性能优于商用编译器,且提升了AWS Trainium的代码生成覆盖率。

Comments Accepted at OOPSLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2608.16630 2026-08-19 cs.SE cs.AI cs.LG 交叉投稿 88%

The Working Set of a Coding Agent: Coherence Debt in Repository-Scale Tasks

编码智能体的工作集:仓库规模任务中的一致性债务

Bardia Mohammadi, Lars Klein, Aman Chadha, Akhil Arora, Laurent Bindschaedler

专题命中 软件智能体 :repository(title,abstract);coding agent(title);分类 cs.SE、cs.AI、cs.LG

AI总结 该研究针对仓库规模编码任务,建模一致性债务,通过7个模型和5个框架实验发现事实可用性决定编码结果,提出测试框架应核对编辑依赖事实可用性的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17393 2026-08-19 cs.AI 新提交 83%

LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents

LEGO-RL:利用原生强化学习实现编码智能体

Yiming Du, Yuxin Jiang, Tao Yuan, Jianbo Dai, Shaowei Wang, Jierun Chen, Chaofan Tao, Xianzhi Yu, Lifeng Shang, Kam-Fai Wong, Xiaohui Li, Haoli Bai

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) The Chinese University of Hong Kong(香港中文大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.AI

AI总结 LEGO-RL 是桥接原生编码智能体 harness 与策略梯度优化的框架,通过三大支柱解决训练不匹配问题,提升 Qwen3.5-35B-A3B 在三个编码基准上的性能,且保持高概率相关性。

Comments Webpage: this https URL (https://lego-rl.pages.dev)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17588 2026-08-19 cs.AI cs.SE 新提交 62%

TRUSS: Towards Task-Reliable and User-Safe Automated Agent Skill Generation

TRUSS:面向任务可靠且用户安全的自动化智能体技能生成

Zhibo Zhang, Zhen Ouyang, Ling Shi, Kailong Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.AI

AI总结 TRUSS是一种证据引导框架,可生成安全可靠的智能体技能,在多基准测试中实现了漏洞检测100%的精度召回率,同时显著提升任务有效性与安全率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17528 2026-08-19 cs.AI cs.SE 新提交 62%

Agent Lightning v1.0: Towards Harnessed Agentic RL

Agent Lightning v1.0:走向可控的智能体强化学习

Zhiyuan He, Siwei Zhang, Zhiwen Zhou, Yuqing Yang, Yu Kang, Yuge Zhang, Luna K. Qiu, Tin Yan Tsui, Jiahang Xu, Chong Luo

机构 * Microsoft(微软) Fudan University(复旦大学) Zhejiang University(浙江大学) University of Edinburgh(爱丁堡大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对可控智能体强化学习的挑战,推出轻量级框架 Agent Lightning v1.0,经评估可将 Qwen3.5-9B 在 SWE-bench Verified 上的性能提升14.6个百分点,发布完整流程脚本以推进相关可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14048 2026-08-19 astro-ph.IM 版本更新 50%

$\texttt{Aether.jl}$: A High-Performance 3D MHD and Multifluid Dust Code Written in a Dynamic Language with an Interactive Human-AI Development Framework

Aether.jl:一种用动态语言编写、具备人机交互开发框架的高性能三维磁流体与多流体尘埃代码

Ka Wai Ho

专题命中 软件智能体 :coding agent(abstract)

AI总结 Aether.jl是一款用Julia编写的高性能三维磁流体与多流体尘埃代码,采用交互式人机开发框架,单GPU性能优于C++代码,在Frontier超算4096个GCD上并行效率超93%,支持CPU、GPU运行,已公开。

Comments 25 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2608.17018 2026-08-19 cs.SE 新提交 79%

ORCA: Observability-Grounded Program Repair for Microservice Incidents

ORCA:基于可观测性的微服务故障程序修复

Yuanchen Gao, Yifang Tian, Yiran Li, Charles Zhang, Hans-Arno Jacobsen

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 ORCA是基于可观测性的微服务故障修复流水线,通过遥测数据提炼故障特征定位候选位置,经多智能体生成补丁并通过遥测验证器评估,在575案例基准中成本效益优于所有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2608.17177 2026-08-19 cs.SE 新提交 57%

Grounding AI Agents in Contracts: An Empirical Evaluation of Spec-Driven Test Generation

将AI智能体建立在契约基础上:对规范驱动测试生成的实证评估

Michele Tufano, James McClure, José Cambronero, Runxiang Cheng, Sherry Y. Shi, Renyao Wei, Dorothy Chen, Franjo Ivančić, Livio Dalloro, Pat Rondon

专题命中 测试生成 :repository(abstract);分类 cs.SE

AI总结 本研究针对LLM智能体生成测试时易遗漏契约相关边界的问题,提出规范驱动测试生成方法,经Google生产缺陷评估,其缺陷检测率、分支覆盖率均优于基线,测试套件质量也显著更高。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 4 篇

2608.18062 2026-08-19 cs.CL cs.LG 新提交 62%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at this https URL (https://github.com/cimeister/tokenizer-intrinsic-evals)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17671 2026-08-19 cs.SE cs.AI cs.CR 新提交 62%

Benchmarking Automated Security Patch Backporting: How Far Are We?

自动化安全补丁回移植基准测试:我们还差多远?

Jincheng Yang, Yulong Fu, Chengwei Liu, Lyuye Zhang, Fangyuan Zhang, Bingyang Ren, Yang Liu, Hui Li

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究推出涵盖多场景的Porting Benchmark基准,评估五类安全补丁回移植工具,发现工具泛化能力差、复杂补丁性能骤降,明确根本原因并指出优化方向。

Comments 13 pages, 3 figures. Accepted at ASE 2026. Artifact: this https URL (https://doi.org/10.5281/zenodo.21785770)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17524 2026-08-19 cs.LG 新提交 57%

Evaluating RL Explainability Methods by How Much They Help Fix Bugs in Agents

通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法

Ram Rachum, Yotam Amitai, Bálint Gyevnár, Reuth Mirsky, Cameron Allen

机构 * University of California, Berkeley(加州大学伯克利分校) Tufts University(塔夫茨大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.LG

AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12805 2026-08-19 cs.LG 版本更新 57%

CoMedBench: A Multi-Source Benchmark of Synthetic Medical Data Fidelity and Downstream Utility

CoMedBench:合成医疗数据保真度与下游效用的多源基准

Akanta Das, Farhad Al-Amin Dipto, Mrinmoy Sarkar Anto, David Rehkopf, Ayin Vala, Tanmoy Sarkar Pias

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 CoMedBench是涵盖多源合成医疗数据的可复现基准,评估多生成器在静态表格和时序ICU任务上的保真度与下游效用,实验显示合成数据可保留多数下游信号,不同生成器表现存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 5 篇

2608.18050 2026-08-19 cs.AI 新提交 70%

StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents

StagedWorkspace:面向知识工作智能体的版本化工作空间

Yining Hua, Hongbin Na, Yifan Zhou, Akshay Kalose, Cyrus Ayubcha, Levi Lian

机构 * Harvard University(哈佛大学) Raycaster AI(雷caster人工智能公司) University of Technology Sydney(悉尼科技大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 该研究针对知识工作智能体的版本化工作空间问题,提出StagedWorkspace方案,通过绑定解析记录与原生文件内容哈希提升性能,在OfficeQA Pro等数据集上取得显著优于基准的效果,为相关基准构建提供了新方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17159 2026-08-19 cs.SE cs.CR cs.DL 新提交 57%

A Multi-Surface Consistency Audit of Software Citation Metadata

软件引用元数据的多表面一致性审计

Pengyin Shan

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文对117个开源研究型软件项目的多达7个机器可读元数据表面进行审计,发现83.9%的项目存在核心字段冲突,多数冲突源于表面描述的是软件论文而非软件本身,同时发布了审计相关资源。

Comments 10 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17760 2026-08-19 cs.IT cs.AI eess.SP 新提交 57%

Learnware for CSI Feedback: Scene-specific Small Models Can Do Big

用于CSI反馈的学习件:特定场景的小型模型可发挥大作用

Xiangyi Li, Jiajia Guo, Chao-Kai Wen, Xin Geng, Shi Jin, Zhi-Hua Zhou

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 针对6G CSI反馈的模型泛化与场景性能权衡问题,提出基于学习件的模型仓库框架,可高效检索匹配的预训练模型,在LOS/NLOS场景下性能优于通用模型,减少训练开销并增强隐私。

Comments This work has been accepted by IEEE Transactions on Wireless Communications. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15209 2026-08-19 cs.CL 版本更新 57%

Expanding the Lexicon of Ge'ez Based African Languages: A Comparative Study of Amharic and Tigrinya

扩展基于吉兹语的非洲语言词汇:阿姆哈拉语和提格雷尼亚语的比较研究

Hailay Kidu Teklehaymanot, Debela Desalegn Yadeta, Wolfgang Nejdl

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 针对低资源非拉丁脚本语言表现不佳问题,提出VEXMLM。通过训练特定语言分词器扩展XLM - R词汇并初始化嵌入,分两阶段训练,在多种任务上评估。贡献为定制程序、两阶段策略及多语言评估,提升了相关语言任务性能。

Comments 13 pages, 7 tables, 2 figurs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15870 2026-08-19 quant-ph 版本更新 50%

A certified lower bound on the quantum-capacity threshold of the depolarizing channel

去极化信道量子容量阈值的认证下界

Artus Krohn-Grimberghe

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究针对去极化信道量子容量阈值,给出首个已证明的正性结果,明确45副本两输入态在特定p值下满足I_c>0,还实现了两个竞争码态正性边界的认证排序。

Comments 13 pages, 2 tables. v2: expanded attribution and related work; clarified claim scope and evidence taxonomy; certified bound unchanged. Verification artifact: DOI https://doi.org/10.5281/zenodo.21962925

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他AI编程 1 篇

2608.17136 2026-08-19 quant-ph cs.ET 新提交 50%

Gate-level Implementation and Resource Analysis of Lackadaisical Quantum Walk Search

懒散量子行走搜索的门级实现与资源分析

Amit Saha, Debanjan Kola, Nishanka Das, Amlan Chakrabarti

专题命中 其他AI编程 :code model(abstract)

AI总结 本文提出懒散量子行走搜索的门级实现框架,验证其搜索性能并分析资源开销,为量子硬件上的懒散量子行走搜索提供实用实现方案及容错资源评估。

Comments 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏