arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-06 至 2026-03-06 共收录 11 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 7 篇

2603.05278 2026-03-06 cs.SE 79%

A framework for assessing the capabilities of code generation of constraint domain-specific languages with large language models

一种评估大语言模型生成约束领域特定语言代码能力的框架

David Delgado, Lola Burgueño, Robert Clarisó

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出一种评估框架,用于评估大语言模型生成约束领域特定语言代码的能力,发现LLMs在Python上的表现优于OCL和Alloy,并探讨了改进代码生成的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04646 2026-03-06 cs.AR 71%

HDLFORGE: A Two-Stage Multi-Agent Framework for Efficient Verilog Code Generation with Adaptive Model Escalation

HDLFORGE:一种用于高效Verilog代码生成的两阶段多智能体框架

Armin Abdollahi, Saeid Shokoufa, Negin Ashrafi, Mehdi Kamal, Massoud Pedram

专题命中 代码生成 :code generation(title)

AI总结 HDLFORGE通过两阶段多智能体框架实现高效Verilog代码生成,通过自适应模型升级提升生成准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04372 2026-03-06 cs.SE cs.AI cs.LG 67%

Assessing the Impact of Code Changes on the Fault Localizability of Large Language Models

评估代码更改对大型语言模型故障定位性的影响

Sabaat Haroon, Ahmad Faraz Khan, Ahmad Humayun, Waris Gill, Abdul Haddi Amjad, Ali R. Butt, Mohammad Taha Khan, Muhammad Ali Gulzar

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文通过端到端评估框架评估LLM在故障定位中的鲁棒性,发现SPMs导致78%的LLM失败于之前定位的故障,表明LLM推理依赖于语法而非语义。

Comments This paper is currently Under Review. It consists of 12 pages, 11 Figures, and 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03540 2026-03-06 cs.LG cs.AI 62%

Path Planning for Masked Diffusion Model Sampling

基于掩码扩散模型采样的路径规划

Fred Zhangzhi Peng, Zachary Bezemek, Sawan Patel, Jarrid Rector-Brooks, Sherwood Yao, Avishek Joey Bose, Alexander Tong, Pranam Chatterjee

机构 * Duke University(杜克大学) Atom Bioworks(Atom生物工坊) Mila – Québec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) The University of Oxford(牛津大学) Aithyra(Aithyra公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出路径规划策略,通过规划和去噪两个阶段提升掩码扩散模型的生成质量,实验表明在多个领域均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04893 2026-03-06 cs.CL cs.AI 62%

Free Lunch for Pass@$k$? Low Cost Diverse Sampling for Diffusion Language Models

免费午餐吗?低成本的多样化采样用于扩散语言模型

Sean Lamont, Christian Walder, Paul Montague, Amir Dezfouli, Michael Norrish

机构 * Australian National University(澳大利亚国立大学) Defence Science and Technology Group(国防科学与技术集团) Google DeepMind(谷歌DeepMind) BIMLOGIQ

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种低成本方法,通过修改中间样本以增强扩散语言模型的生成多样性,从而提升Pass@$k$任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04743 2026-03-06 cs.IR cs.AI cs.CL 62%

DARE: Aligning LLM Agents with the R Statistical Ecosystem via Distribution-Aware Retrieval

DARE: 通过分布感知检索对齐LLM代理与R统计生态系统

Maojun Sun, Yue Wu, Yifei Xie, Ruijian Han, Binyan Jiang, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University, Hong Kong SAR, China(数据科学与人工智能系,香港理工大学,香港特别行政区,中国) Department of Applied Mathematics, The Hong Kong Polytechnic University, Hong Kong SAR, China(应用数学系,香港理工大学,香港特别行政区,中国)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 DARE通过整合数据分布信息提升R包检索效果,构建了面向R的LLM代理以实现更高效的统计分析任务。

Comments 24 pages,7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05454 2026-03-06 cs.CV 50%

Beyond Scattered Acceptance: Fast and Coherent Inference for DLMs via Longest Stable Prefixes

超越零散接受:通过最长稳定前缀实现DLMs的快速且一致推理

Pengxiang Li, Joey Tsai, Hongwei Xue, Kunyu Shi, Shilin Yan

机构 * Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 代码生成 :code generation(abstract)

AI总结 通过最长稳定前缀调度器,提升DLMs推理速度3.4倍,同时保持输出质量。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2603.04466 2026-03-06 cs.RO cs.LG 79%

Act-Observe-Rewrite: Multimodal Coding Agents as In-Context Policy Learners for Robot Manipulation

动作-观察-重写:多模态编码代理作为机器人操作的上下文政策学习者

Vaishak Kumar

机构 * General Bionix, Inc.(通用生物交叉公司)

专题命中 软件智能体 :coding agent(title);code generation(abstract);分类 cs.LG

AI总结 AOR框架通过生成可执行代码使机器人操作策略学习无需演示或奖励工程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04857 2026-03-06 cs.CL cs.SE 62%

FireBench: Evaluating Instruction Following in Enterprise and API-Driven LLM Applications

FireBench: 评估企业及 API 驱动的 LLM 应用中的指令遵循

Yunfan Zhang, Yijie Bei, Jetashree Ravi, Pawel Garbacki

机构 * Columbia University(哥伦比亚大学) Fireworks AI

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 FireBench 是一个评估企业及 API 驱动 LLM 应用中指令遵循能力的基准测试,通过 2400 个样本评估六个核心能力维度,评估 11 个 LLM 的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04582 2026-03-06 cs.AI cs.LG 62%

Self-Attribution Bias: When AI Monitors Go Easy on Themselves

自我归因偏差:当AI监控对自己宽容时

Dipika Khullar, Jack Hopkins, Rowan Wang, Fabien Roger

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究发现AI监控在自我归因偏差下可能低估风险,导致部署不充分的监控系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 1 篇

2512.15163 2026-03-06 cs.CL cs.AI 62%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏