arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-28 至 2026-07-28 共收录 27 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 9 篇

2607.22898 2026-07-28 cs.SE cs.CL 新提交 81%

AssumptionMiner: Extracting, Tracing, and Revising Implicit Assumptions in LLM Code Generation

假设挖掘器:在大语言模型代码生成中提取、追踪和修正隐式假设

Jie "JW" Wu

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL

AI总结 研究LLMs代码生成中隐式假设问题,提出AssumptionMiner框架,能生成显式假设层并实现针对性代码再生。通过新基准测试评估,结果显示该框架提升了代码生成的透明度与可控性。

Comments 20 pages, 6 figures, 9 tables. Submitted to IEEE Transactions on Software Engineering. Replication package: https://doi.org/10.5281/zenodo.21535058

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23088 2026-07-28 cs.CR cs.AI 新提交 79%

Poster: Rethinking Security in LLM Code Generation through Real-World Risk Scenarios

海报:通过现实世界风险场景重新思考大语言模型代码生成中的安全性

Lixun Ma, Ruolong Ma, Bei Wang, Feng Wei, Zhenguang Liu, Lorenzo Cavallaro, Wentao Chen

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 研究LLM代码生成的安全行为,识别出三种风险场景,构建含2700个测试用例的基准评估安全性,发现先进LLMs平均漏洞率超56%,证明安全感知提示可大幅降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23286 2026-07-28 cs.AI cs.LG 新提交 62%

TopoFE: topology-aware LLM-guided Automated Feature Engineering

TopoFE:拓扑感知的大语言模型引导的自动特征工程

Sha Li, Naren Ramakrishnan

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG

AI总结 研究表格学习中自动特征工程问题,提出拓扑感知多岛进化框架TOPOFE,结合特定族探索、自适应提示记忆和拓扑引导知识转移,在多个公共数据集实验中,相比现有方法有改进,能发现更多样可转移特征程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24259 2026-07-28 cs.AI 新提交 57%

Generative Artificial Intelligence (GenAI) to convert images of queuing networks into verifiable simulation models: an open-weight LLM workflow approach

生成式人工智能(GenAI)将排队网络图像转换为可验证的仿真模型:一种开放权重的大语言模型工作流方法

Thomas Monks, Alison Harper, Amy Heather, Navonil Mustafee

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究提出Sketch2DES工作流,利用开放权重LLMs将排队网络图像转换为可验证仿真模型,经多阶段处理,在多图表评估中各阶段可靠性高,相比直接代码生成提升多项性能,证明结构化工作流模型生成对LLM辅助仿真建模的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22759 2026-07-28 cs.AR cs.LG 新提交 57%

Benchmarking LLMs for Verilog Design Flows

对用于Verilog设计流程的大语言模型进行基准测试

Angshuman Chakravertty, Rahul Koshti, Buddhi Prakash Sharma, Vinay Chamola

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 研究针对大语言模型生成Verilog RTL代码能力的基准测试问题,提出含特定流程的可重复平台,经测试提升了开源模型的语法有效性和模拟通过率,且平台与数据集开源,利于生成式人工智能在硬件设计工作流的评估。

Comments 7 pages, 3 figures, 3 tables. Manuscript prepared for submission to IEEE Design & Test

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22652 2026-07-28 cs.AI 新提交 57%

KG2Code: Bridging Knowledge Graphs and Large Language Models via Executable Code for Question Answering

KG2Code:通过可执行代码连接知识图谱与大语言模型以进行问答

Yike Wu, Nan Hu, Guilin Qi, Guohui Xiao, Chen Jiang, Xinchun Zou, Yuchen Lu, Songlin Zhai, Yongrui Chen, Yuyang Zhang, Xiaoguang Li, Lifeng Shang, Jiaoyan Chen, Jeff Z. Pan

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其交叉应用重点实验室(东南大学)) Huawei Technologies(华为技术有限公司) University of Manchester(曼彻斯特大学) University of Edinburgh(爱丁堡大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究针对知识图谱问答中现有方法的局限,提出KG2Code方法,将知识图谱转换为代码表示,在此基础上构建KG2Code-QA框架,把KGQA作为代码生成任务,还构建代码语料库,训练后的模型在KGQA任务中表现优异且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24051 2026-07-28 astro-ph.IM cs.AI cs.RO 新提交 57%

HELIOS: An LLM-Driven Autonomous Indirect Trajectory Optimization Agent

HELIOS:一个由大语言模型驱动的自主间接轨迹优化智能体

An-yi Huang

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究低推力轨迹优化面临的问题,提出基于大语言模型的HELIOS智能体,能自主进行PMP符号推导等。其创新包括约束自适应推导框架等,实验表明可解决多种轨迹优化问题,验证了模型无关架构及模型规模与推导能力的正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24475 2026-07-28 cs.IR cs.DL 新提交 50%

Robust Interpretation of Historical Documents in Knowledge Graphs Through Query Inference and Execution

通过查询推理和执行对知识图谱中的历史文档进行鲁棒解释

Sebastià Nicolau, Adrià Molina, Oriol Ramos Terrades, Josep Lladós

专题命中 代码生成 :code generation(abstract)

AI总结 研究如何在利用大语言模型泛化能力时保证可靠性,提出智能检索系统,比较传统RAG与智能GraphRAG架构,引入半符号框架,通过单词识别与代码生成协作构建鲁棒检索查询,提升历史文档分析准确性与可验证性。

Comments Accepted at ICDAR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23523 2026-07-28 cs.AR 新提交 50%

CircuitWeave: Topology-Behavior Alignment for Executable Multimodal RTL Generation

CircuitWeave:用于可执行多模态RTL生成的拓扑-行为对齐

Jiahao Feng, Haiyan Qin, Zhiwei Xie, Wang Kang

专题命中 代码生成 :code generation(abstract)

AI总结 研究如何从自然语言规范生成RTL,提出CircuitWeave合同介导多模态框架,从原理图和文本提取合同并融合,通过联合目标监督相关过程,在生成可执行RTL上取得较好效果,部分指标高于无原理图的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 6 篇

2607.22711 2026-07-28 cs.LG cs.AI cs.SE 新提交 82%

CORVUS: Context Optimization and Reduction Via Underlying Synchronization for LLM Coding Agents

CORVUS:通过底层同步实现大语言模型编码代理的上下文优化与缩减

Mingwei Zheng, David OBrien, Siwei Cui, Pardis Pashakhanloo, Rajdeep Mukherjee, Myeongsoo Kim, Sachit Kuhar

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究针对大语言模型编码代理传统轨迹架构问题,提出CORVUS架构解耦文件读取与观察,通过维护同步注册表注入当前内容,经实验评估,该架构能减少输入令牌、缩短提示并减少推理周期,保持通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22807 2026-07-28 cs.SE cs.CL 新提交 81%

The Best Programming Language for Tokenmaxxing: An Investigation of Coding Agent Behavior Across Programming Languages

用于Tokenmaxxing的最佳编程语言:跨编程语言的编码代理行为研究

Zixuan Wu, Carolyn Jane Anderson, Arjun Guha

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL

AI总结 研究跨Python、Java、Rust和OCaml的编码代理行为,通过评估五个模型发现不同语言的令牌消耗有显著差异。分析代理轨迹结构与内容,揭示其在不熟悉语言中的行为特点,指出按语言的令牌效率对多语言代理基准测试和开发有指导意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22569 2026-07-28 cs.AI cs.SE 新提交 81%

Execution-Grounded Security Testing for Coding Agents in Software Engineering Pipelines

软件工程流水线中编码代理的基于执行的安全测试

Yifei Ge, Weisong Sun, Jinkun Xiao, Yuchen Chen, Yebo Feng, Peizhuo Lv, Xia Feng, Chunrong Fang, Zhihong Zhao, Zhenyu Chen, Yang Liu

机构 * Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Hainan University(海南大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对软件工程流水线中编码代理的安全问题,提出基于执行的红队测试框架,利用沙盒证据探测安全边界,将不安全操作嵌入工作负载并借助执行预言机优化,通过实验大幅增加不安全执行验证率,凸显编码代理需更强安全测试。

Comments Preprint. 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22585 2026-07-28 cs.AI 新提交 79%

The Scaffold Effect in Coding Agents: Harness Choice as a Hidden Variable in Coding-Agent Evaluation

编码智能体中的支架效应:在编码智能体评估中利用选择作为隐藏变量

Naman Vats, Oleg Golev

机构 * Alibaba(阿里巴巴) Agentic AI Foundation(Agentic人工智能基金会) OpenCode Contributors(OpenCode贡献者团队) Harbor Framework Team(Harbor框架团队)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 研究编码智能体评估中工具选择对结果的影响,通过在三个开源工具上评估两个模型,发现工具选择会使解决任务的令牌数有40倍差异,失败指纹有工具级偏差,建议按通过率选工具-模型对并报告相关指标,还发布了相关数据和脚本。

Comments 7 pages, 2 figures, 6 tables. Preliminary work; under review at the 5th DL4C Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24604 2026-07-28 cs.CL cs.AI 新提交 73%

Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair

循环并非可靠性保障:智能代码修复的状态约束证据与类型化修订契约

Xueping Gao, Jianwei Yang, Qiang Yang

机构 * Alibaba Cloud(阿里云)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.CL、cs.AI

AI总结 研究编码智能体中生成-测试-修订循环的可靠性问题,通过实验揭示相关差距及问题,提出证据约束的类型化循环契约并实例化其可机械执行子集,实现规范与工件,非证明修复能力提升等。

Comments 11 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22677 2026-07-28 cs.DL cs.AI 新提交 70%

SetGo: Metadata Readiness for Scientific AI Datasets

SetGo:科学人工智能数据集的元数据就绪性

Sean R. Wilkinson, Polina Shpilker, Wesley Brewer

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 研究针对科学AI数据集元数据就绪性评估工具缺失的问题,提出开源工具SetGo,能从六个维度评估修复元数据,揭示通用工具未发现的缺陷,提升公平性分数,还可集成大语言模型支持自动化工作流程。

Comments 6 pages; accepted at SSDBM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2607.22883 2026-07-28 cs.SE cs.AI cs.LG 新提交 67%

Evaluating and Mitigating the Misguidance Effect of Buggy Code in LLM-Generated Unit Tests

评估和减轻大语言模型生成单元测试中错误代码的误导效应

Junda Zhao, Shurui Zhou, Eldan Cohen

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究大语言模型生成单元测试时错误代码的误导效应,提出新指标衡量,分析其双重影响,引入基于规范的单元测试生成范式,有效减少误导性测试,增加有效测试,改善测试生成管道,适用于各类代码。

Comments 24 pages, 7 figures, 12 tables. Accepted at ISSTA 2026; to appear in Proceedings of the ACM on Software Engineering (PACMSE), Vol. 3, No. ISSTA, Article ISSTA113

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 6 篇

2607.23784 2026-07-28 cs.RO cs.AI 新提交 70%

A Few Words Go a Long Way: Language Guided Robot Policy Synthesis

寥寥数语,成效显著:语言引导的机器人策略合成

Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码评测 :coding agent(abstract);program synthesis(abstract);分类 cs.AI

AI总结 研究针对视觉-语言-动作模型难以解释等问题,提出ARCHITECT框架,利用大语言模型编码代理合成模块化机器人程序,通过人类自然语言修正引导策略并积累技能库,在机器人基准评估中表现出色,提供了新的机器人学习方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22642 2026-07-28 cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 70%

CRAFT: Learn the Schema, Execute the Plan

CRAFT:学习模式,执行计划

Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

机构 * Amazon Advertising Foundations(亚马逊广告基金会) Amazon Web Services Agentic AI(亚马逊网络服务代理人工智能)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 研究企业编码代理将自然语言分析请求转换为可执行代码时的问题,提出两阶段训练后方法 CRAFT,先进行模式剥离的 PLAN 监督微调,再用执行形状的强化学习,评估显示其在多方面有提升并减少负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23225 2026-07-28 cs.LG 新提交 57%

ParasGB: A Graph Benchmark Suite for Parasitic Estimation on AMS Circuits

ParasGB:用于 AMS 电路寄生估计的图形基准套件

Jiajun Zou, Jiawei Liu, Ao Liu, Junnong Tian, Yibin Zhang, Chengjie Liu, Yuxi Wang, Shan Shen, Wenhua Gu, Jun Yang, Wenjian Yu

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 研究针对 AMS 电路寄生估计问题,引入 ParasGB 开源基准套件,提供大规模异构 RC 网络与统一评估协议,用标准化流程对 GNN 架构基准测试,揭示相关挑战,为电路图学习和寄生感知模型开发提供可重复研究平台。

Comments Published at ICCAD2026. Full appendix version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22654 2026-07-28 cs.AI 新提交 57%

MINT-V2X: A Mobility-Integrated Network Trajectory Dataset for Predictive Resource Management

MINT-V2X:用于预测资源管理的移动集成网络轨迹数据集

Abdullah Anjum, Abdolazim Rezaei, Mehdi Sookhak

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文介绍用于预测资源管理的移动集成网络轨迹数据集MINT-V2X,它通过耦合SUMO与OMNeT++/Simu5G生成,经多项测试验证,包含大量同步数据点,通过案例研究证明其在RSU负载预测上比仅用网络历史基线性能更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22588 2026-07-28 cs.AI cs.DC 新提交 57%

ParBench: A Benchmark for Reliable Evaluation of LLM Parallel Code Translation

ParBench:用于可靠评估大语言模型并行代码翻译的基准测试

Samyak Jhaveri, Erel Kaplan, Tom Yotam, Le Chen, Tomer Bitan, Niranjan Hasabnis, Gal Oren

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 研究针对大语言模型并行代码翻译缺乏可靠评估方法的问题,提出ParBench基准框架,通过声明性规范评估,涵盖多开源套件与跨API翻译方向,经源增强测试,揭示了当前并行代码翻译存在的如方向不对称等障碍。

Comments 57 pages, 22 figures, 11 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22573 2026-07-28 cs.AI cond-mat.mtrl-sci physics.comp-ph 新提交 57%

PhononBench-MP40: a spectrum-resolved benchmark dataset for phonon stability

PhononBench-MP40:用于声子稳定性的光谱分辨基准数据集

Wen-Kao Li, Ze-Feng Gao, Zhong-Yi Lu

机构 * School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China(中国人民大学物理学院及量子态构建与调控教育部重点实验室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究针对计算材料筛选中虚声子模式瓶颈,提出PhononBench-MP40数据集,源于47969个MP40任务,含4类记录。通过科学数据银行公开,配套GitHub仓库提供代码等,为相关研究提供可审计参考。

Comments 18 pages, 3 figures, includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 4 篇

2607.24512 2026-07-28 cs.AI cs.DL 新提交 57%

Making Mathematical Knowledge Explainable, Accessible and Interoperable Through Large Language Model Integration

通过大语言模型集成使数学知识可解释、可访问和可互操作

Jan Range, Björn Schembera, Dominik Göddeke

机构 * Stuttgart Center for Simulation Science (SC SimTech), University of Stuttgart(斯图加特大学斯图加特模拟科学中心 (SC SimTech)) Institute of Applied Analysis and Numerical Simulation, University of Stuttgart(斯图加特大学应用分析与数值模拟研究所)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 研究旨在解决数学模型文档不符合FAIR原则及访问难等问题,通过模型上下文协议(MCP)服务器将大语言模型与MathModDB集成,实现基于认知的LLM使用,提高可解释性、可访问性并简化互操作性,通过用例展示了集成优势。

Comments Preprint submitted to 6th Wikidata Workshop@ISWC

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23806 2026-07-28 cs.CL cs.AI cs.IR cs.LG cs.PF 新提交 56%

A Frozen 12B Beats Frontier Models on Verified Work: 100% Accuracy, 0 Tokens, Bit-Exact, Forever

一个冻结的12B模型在经过验证的任务上超越前沿模型:100%准确率、零token、位精确、永远如此

Sietse Schelpe

专题命中 仓库级理解 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 研究提出一种让模型冻结,通过增长持久内存来解决问题的方法。在多个问题族实例上,四种架构得分优异,执行与参数扩展解耦。该方法在开放式推理中也有效,内存选择快,存储规模大,在已验证任务上超越前沿模型。

Comments Industry experience report. 14 pages, 8 figures. Public testbench: https://corbenic-galahad-bench.hf.space; companion repository with SHA-256 provenance manifest: https://github.com/corbenicai/galahad-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23309 2026-07-28 cs.HC cs.SD 新提交 50%

Explainable AI through the Lens of Material Agency: Enabling Musical Interface Design with Neural Audio Models

通过物质能动性视角实现可解释人工智能:利用神经音频模型实现音乐界面设计

Shuoyang Jasper Zheng, Anna Xambó Sedó, Nick Bryan-Kinns

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究从物质能动性视角探讨可解释人工智能,提出物质可解释性,通过构建资源库案例研究,在音乐界面设计中探索神经音频模型,还给出在艺术实践中探索人工智能为材料的建议,以启发未来面向艺术家的可解释人工智能设计。

Comments Under review for "Explainable AI for the Arts" (N. Bryan-Kinns, Ed.), Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23911 2026-07-28 physics.ins-det eess.SP 新提交 50%

Leveraging Inexpensive Lab Tools for Hands-on RF Systems Course

利用廉价实验室工具开展射频系统实践课程

B. Joel Gonzalez, Tom J. Zajdel, L. Richard Carley

专题命中 仓库级理解 :repository(abstract)

AI总结 卡内基梅隆大学为电气与计算机工程专业学生开设新课程,利用廉价硬件通过六个实验室练习教授射频系统设计核心概念,最终现场演示波束控制技术,课程成本低且受学生欢迎,资源开源。

Comments 5 pages, 9 figures, to be submitted to the IEEE International Symposium on Circuits and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他AI编程 1 篇

2607.23528 2026-07-28 physics.plasm-ph 新提交 50%

Implementation and first application of EMC3-EIRENE on DTT for assessing the heat load on the ICRH antenna

EMC3-EIRENE在DTT上的实现及首次应用:评估ICRH天线的热负荷

H. S. Wu, Y. Feng, F. Subba, S. Ceccuzzi, P. Innocente, M. M. Robaldo, A. A. Tuccillo, R. Zanino

专题命中 其他AI编程 :code model(abstract)

AI总结 介绍EMC3-EIRENE在DTT上的实现及应用,通过轴对称几何和SOLPS-ITER结果评估其性能,纳入ICRH天线结构进行模拟,得出热负荷分布预测值,还评估了三维气体喷射对天线热负荷的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏