arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-17 至 2026-07-17 共收录 17 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 7 篇

2607.14181 2026-07-17 cs.SE cs.LG cs.PL 新提交 82%

Quantize with Confidence? An Empirical Study of Quantization for Code Generation

有信心量化?代码生成量化的实证研究

Saima Afrin, Md. Zahidul Haque, Antonio Mastropaolo

机构 * AURA Lab Department of Computer Science William \& Mary Williamsburg, VA, USA

专题命中 代码生成 :code generation(title);code model(abstract);分类 cs.SE、cs.LG、cs.PL

AI总结 研究在资源受限硬件上运行大型代码模型时,六种量化方法对代码质量的影响,用多基准评估功能正确性等指标,引入提示复杂性分析,揭示不同量化技术在正确性、代码质量及鲁棒性上的差异,为选择量化策略提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14816 2026-07-17 cs.SE cs.AI 新提交 81%

Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

用于从多语言提示生成代码的大语言模型:一个精心策划的基准测试和对代码质量的研究

Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo

机构 * University of Catania(卡塔尼亚大学) North Carolina State University(北卡罗来纳州立大学) University of Sannio(萨尼奥大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 研究多语言提示对代码生成的影响,通过460个Python和Java编码任务,将英文提示翻译成多种语言并评估生成代码,发现英文提示非最佳,提示语言影响因编程语言和大语言模型而异,提供多语言基准测试及见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14165 2026-07-17 cs.SE cs.AI cs.AR cs.LG 新提交 67%

Towards Reliable AI-Assisted Analog Design: Template-Constrained LLM Agents for SAR ADC Generation

迈向可靠的人工智能辅助模拟设计:用于逐次逼近寄存器型模数转换器生成的模板约束大语言模型智能体

Dimple Vijay Kochar, Hae-Seung Lee, Anantha P. Chandrakasan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究针对大语言模型在模拟电子设计自动化应用的瓶颈,提出端到端多步骤的ATLAS框架,利用专家知识结合模板约束生成,能生成成功通过仿真验证的SAR ADC,为集成LLMs到可靠模拟设计方法奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15099 2026-07-17 cs.SE 新提交 57%

Capturing and Exploiting Design Pattern Variability in Mobile Application Generation

在移动应用生成中捕获和利用设计模式的可变性

Ramón Peralta, Jose-Miguel Horcas

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 研究如何解决移动应用开发中自动代码生成忽视设计原则和架构质量的问题,核心方法是用UVL建模设计模式可变性并结合Jinja模板实现Swift代码生成,利用SPL工程原则,促进了可维护等移动应用的生产。

Comments Research paper presented as a Master's Thesis for the MSc in Advanced Software Technologies for Mobile Devices, Universidad San Jorge (Spain), September 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14709 2026-07-17 cs.CL 新提交 57%

Gold-Guided Programmatic Distillation for Financial Reasoning over Hybrid Tables and Text

用于混合表格和文本的金融推理的黄金引导式程序蒸馏

Yun Dong, Erica Zhao, Elana Chen

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL

AI总结 研究针对混合表格和文本数据的金融推理问题,基于程序蒸馏开发方法,利用黄金推导指导程序合成,经执行验证转移可靠数值推理,引入迭代恢复阶段,实验表明该框架能有效训练小模型进行可靠数值推理。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15001 2026-07-17 hep-lat cs.AI hep-ph 新提交 57%

LQCDMaster: Agentic Scientific Computing for Lattice Quantum Chromodynamics Research

LQCDMaster:用于格点量子色动力学研究的智能科学计算

Haofei Gao, Tingjia Miao, Wenkai Jin, Muhua Zhang, Hanzhang Wang, Jie Ran, Jinxin Tan, Zhentao Zhang, Bo Tang, Leiyi Li, Jun Hua, Xiangyu Jiang, Qi-An Zhang, Siheng Chen, Wei Wang

机构 * School of Physics and Astronomy(物理与天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics(物理学院) SciLand Institute of Quantum Matter(量子物质研究所) Department of Physics(物理系)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 研究针对格点量子色动力学研究实际应用受限问题,提出LQCDMaster智能体,结合智能规划等技术将自然语言任务转化为计算工作流程。经实验评估,其能精确再现多数任务,大幅缩短实现时间,开创智能科学计算范式,促进相关研究。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15068 2026-07-17 cs.AR 新提交 50%

Pattern-Guided Design Space Exploration for FPGA Accelerator Design

用于FPGA加速器设计的模式引导设计空间探索

Jialiang Zhang, Weiman Yan, Yuelin Zou

专题命中 代码生成 :code generation(abstract)

AI总结 研究针对FPGA加速器设计中因调度决策产生的组合设计空间问题,提出PATTERNDSE框架,将重复计算模式映射到调度空间,经多步骤评估候选调度,在六个内核上验证其能大幅减少候选者数量且保持最佳延迟,提升设计效率。

Comments 6 pages, 4 figures, IEEE ICECCME conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2607.15205 2026-07-17 cs.SE cs.AI 新提交 81%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14340 2026-07-17 cs.SE cs.AI cs.CR 新提交 81%

The Prover Is the Judge: Verified Security Software from AI Coding Agents in Ada/SPARK

验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件

Tobias Philipp

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15143 2026-07-17 cs.CR cs.HC cs.SE 新提交 79%

Setup Complete, Now You Are Compromised: Weaponizing Setup Instructions Against AI Coding Agents

设置完成,现在你已被攻破:利用设置指令攻击人工智能编码代理

Aadesh Bagmar, Pushkar Saraf

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究人工智能编码代理在安装包时因不验证依赖项而面临的供应链攻击,通过编辑项目设置文档即可发动攻击。对前沿模型在多场景下测试,发现安装安全性取决于工具与模型组合,还存在多种检测问题,提出预安装检查可弥补大部分安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14390 2026-07-17 cs.SE cs.AI cs.IR 新提交 73%

Why Git Is the Memory Solution for the Agentic Development Lifecycle

为什么Git是智能开发生命周期的记忆解决方案

Frank Guo

机构 * MIT(麻省理工学院)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能开发生命周期中代码变更推理过程的记忆问题,提出将记忆与Git绑定的方法,通过解决种子供应和答案组装问题,实现低令牌数回答且结果可复制。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14890 2026-07-17 cs.AI cs.SE 新提交 62%

Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control

证明或停止:不要信任代理,信任证据——用于可验证证据门控生命周期控制的循环工程

Jek Huang, Jeffery Hsia, Jiayi Sun, Freddie Shi, Wei Huang, Ian H. White

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究自主编码代理多步骤软件工作中生命周期状态缺乏证据支持的问题,提出证明或停止生命周期控制方法,经实验评估,该方法能有效控制生命周期转换,支持其作为与模型无关、主机中立的控制层。

Comments 48 pages, 10 figures, 29 numbered tables. Preprint v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14570 2026-07-17 cs.AI cs.CR 新提交 57%

Democratizing Agent Deployment Safety: A Structural Monitoring Approach

使智能体部署安全民主化:一种结构监测方法

Preeti Ravindra, Rahul Tiwari, Vincent Wolowski

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究人工智能智能体部署安全问题,引入信息流图(IFG)监测器,通过控制流、数据流图及原始代码差异分析结构安全回归。实验表明,IFG监测器能降低攻击错过率,还可同步作为部署前保障,为组织实现部署安全民主化提供实用途径。

Comments Accepted in ICML 2026 Workshops: AI4GOOD and AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14919 2026-07-17 cs.RO 新提交 50%

Human-Robot Interaction in GenAI Architectures via the Agent-Client Protocol

通过代理-客户端协议实现生成式人工智能架构中的人机交互

Jesus Moncada-Ramirez, Jose-Raul Ruiz-Sarmiento, Javier Gonzalez-Jimenez

机构 * Machine Perception and Intelligent Robotics Group (MAPIR-UMA), Malaga Institute for Mechatronics Engineering and Cyber-Physical Systems (IMECH.UMA), University of Malaga(机器感知与智能机器人组(MAPIR-UMA),马拉加机电一体化工程与网络物理系统研究所(IMECH.UMA),马拉加大学)

专题命中 软件智能体 :coding agent(abstract)

AI总结 研究针对GenAI推动下机器人架构中HRI层碎片化问题,提出采用代理-客户端协议(ACP),结合MCP构建三层解耦架构,消除架构依赖,支持异构界面,提供协作HRI能力,经实验验证了架构的互操作性和实时人在回路工作流程。

Comments 8 pages, 5 figures, 1 table. Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 1 篇

2607.14541 2026-07-17 cs.AI 新提交 57%

Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent

大语言模型生成的GPU内核能否用于生产?基于追踪的基准测试与优化代理

Lingyun Yang, Yuxiao Wang, Shenghao Liang, Linfeng Yang, Daocheng Ying, Chunbo You, Rui Zhang, Luping Wang, Yinghao Yu, Guodong Yang, Liping Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 研究大语言模型生成GPU内核用于生产的可行性,提出Atrex-Bench基准测试,发现现有模型表现不佳。为此发布Atrex-Kernel-Agent优化代理,结合多种技术,经案例研究能将回退转换为匹配或超越生产基线的内核。

Comments Both artifacts are released as open source: Atrex-Bench (https://github.com/alibaba/atrex-bench) and Atrex-Kernel-Agent (https://github.com/alibaba/atrex-kernel-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 2 篇

2607.14474 2026-07-17 cs.SD cs.AI cs.LG 新提交 62%

Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026

令牌能竞争吗?针对BirdCLEF+ 2026的与监督式CNN主干竞争的令牌表示

Anthony Miyaguchi, Murilo Gustineli, Adrian Cheung

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 针对BirdCLEF+ 2026中动物发声多标签检测任务,先构建监督基线,后对比神经音频编解码器的编解码表示与基础嵌入的语义表示,比较两个生物声学专家模型和四个基于令牌的编码器,探究基于令牌的表示能否竞争。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14397 2026-07-17 cs.CE 新提交 56%

Model-Informed Joint Material-Structural Optimization of Hard-Magnetic Soft Materials

硬磁软材料的模型驱动联合材料-结构优化

Ian Galloway, Prashant K. Jha

专题命中 仓库级理解 :repository(abstract,comments)

AI总结 针对硬磁软材料,开发模型驱动框架,将多种关系纳入统一剪切模量框架获多个本构模型,经实验选代表性关系,再用所选模型开发联合材料-结构优化框架,可处理不同设计情况,产生规定变形响应设计并开源实现。

Comments 53 pages, 20 figures, 8 tables; Repository: https://github.com/CEADpx/top_optim

详情

展开后加载摘要…

URL PDF HTML 收藏