arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-23 至 2026-06-23 共收录 9 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2601.13864 2026-06-23 cs.CR cs.AI 版本更新 79%

HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation

HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试

Qirui Chen, Jingxian Shuai, Shuangwu Chen, Shenghao Ye, Zijian Wen, Xufei Su, Jie Jin, Jiangming Li, Jun Chen, Xiaobin Tan, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) ZTE Corporation(中兴通讯)

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22461 2026-06-23 cs.NI cs.LG 版本更新 74%

Toward Non-Expert Customized Congestion Control: Large Language Model-Assisted CCA Code Generation with eBPF Deployment

面向非专家用户的定制化拥塞控制:基于大语言模型的CCA代码生成与eBPF部署

Mingrui Zhang, Hamid Bagheri, Lisong Xu

机构 * School of Computing, University of Nebraska-Lincoln(内布拉斯加大学林肯分校计算机学院)

专题命中 代码生成 :code generation(title);分类 cs.LG

AI总结 提出NECC框架,利用大语言模型和eBPF接口,使非专家用户能轻松建模、实现和部署定制化拥塞控制算法,首次解决定制化CCA实现问题。

Comments Accepted manuscript (AAM) of IEEE ICC 2025 paper. DOI: 10.1109/ICC52391.2025.11160790

Journal ref Proc. IEEE International Conference on Communications (ICC), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00012 2026-06-23 cs.LG cs.AI cs.CY cs.IR 版本更新 62%

OGD4All: A Framework for Accessible Interaction with Geospatial Open Government Data Based on Large Language Models

OGD4All: 基于大语言模型的可访问地理空间开放政府数据交互框架

Michael Siebenmann, Javier Argota Sánchez-Vaquerizo, Stefan Arisona, Krystian Samp, Luis Gisler, Dirk Helbing

机构 * Professorship of Computational Social Science, ETH Zurich(计算社会科学教授职位,苏黎世联邦理工学院) Esri R&D Center Zurich(埃斯里苏黎世研发中心) Complexity Science Hub(复杂性科学中心)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出OGD4All框架,结合语义检索、智能体推理和沙盒执行,实现基于大语言模型的地理空间开放政府数据交互,在430个数据集上达到98%分析正确率和94%召回率,有效减少幻觉风险。

Comments Author Accepted Manuscript (AAM). Proceedings of 2026 IEEE CAI (Granada, Spain). Update manuscript with final DOI. Code & data available at: https://github.com/ethz-coss/ogd4all

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), pp. 882-888

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10757 2026-06-23 cs.CV 版本更新 50%

CodePercept: Code-Grounded Visual STEM Perception for MLLMs

CodePercept: 基于代码的MLLM视觉STEM感知

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian Hu, Ruilin Luo, Ruize Chen, Songtao Jiang, Peng Wang, Wei Shen, Junyang Lin, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学) Qwen Team(通义实验室) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 代码生成 :code generation(abstract)

AI总结 本文发现多模态大模型在STEM视觉推理中感知能力是瓶颈,提出通过代码作为感知媒介,构建ICC-1M数据集和STEM2Code-Eval基准来增强和评估感知能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2603.25764 2026-06-23 cs.SE cs.AI 版本更新 81%

Confident and Wrong: Silent Semantic Failures in Coding Agents

自信且错误:编码智能体中的无声语义失败

Aman Mehta

机构 * Snowflake AI Research(Snowflake AI研究院)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文揭示编码智能体在任务完成率与可信度之间存在系统性偏差,提出“无声语义失败”这一危险模式,并建议通过多次运行的测试验证正确率来评估智能体。

Comments 8 pages, 8 figures. Request: please change the primary category to cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00528 2026-06-23 cs.DC cs.AI cs.LG cs.OS 版本更新 62%

SAGA: Workflow-Atomic Scheduling for AI Agent Inference on GPU Clusters

SAGA:面向GPU集群的AI代理推理工作流原子调度

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Brain Investing Limited(脑投有限公司) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 SAGA通过工作流级调度减少任务完成时间1.64倍,提升GPU内存利用率1.22倍,同时在多租户环境下达成99.2%的服务水平目标,但牺牲了30%的峰值吞吐量。

Comments 15 pages, 3 figures, 11 tables. Accepted to HPDC '26 (35th International Symposium on High-Performance Parallel and Distributed Computing), July 13-16, 2026, Cleveland, OH, USA

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 2 篇

2510.09898 2026-06-23 cs.LG cs.AI 版本更新 62%

Learning Bug Context for PyTorch-to-JAX Translation with LLMs

学习 PyTorch 到 JAX 翻译中的 Bug 上下文

Hung Phan, Son Vu, Tuan Dinh, Nesreen Ahmed, Ali Payani, Ali Jannesari

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State大学计算机科学系) Department of Human Science, Iowa State University, Ames, IA, USA(Iowa State大学人类科学系) Cisco AI Research, Outshift, San Jose, CA, USA(Cisco AI研究,Outshift,San Jose,加利福尼亚州,美国)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 针对 LLM 在 PyTorch 到 JAX 代码翻译中易出错的问题,构建 T2J 基准(含 bug 及修复),通过上下文学习使弱 LLM 翻译质量提升达 20%。

Comments ICML Deep Learning for Code (DL4C) workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 57%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 1 篇

2602.17431 2026-06-23 cs.CL cs.AI cs.LG 版本更新 56%

Fine-Grained Uncertainty Quantification for Long-Form Language Model Outputs: A Comparative Study

长文本语言模型输出的细粒度不确定性量化:一项比较研究

Dylan Bouchard, Mohit Singh Chauhan, Viren Bajaj, David Skarbrevik

机构 * CVS Health(CVS健康公司) Wellesley, MA(马萨诸塞州韦尔士利)

专题命中 仓库级理解 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 针对长文本生成,提出细粒度不确定性量化分类法,通过响应分解、单元级评分和响应级聚合三阶段区分方法,引入FactScore-STEM-Geo数据集,实验发现声明-响应蕴含评分优于复杂方法,声明级评分优于句子级,不确定性感知解码有效提升事实性。

Comments Accepted by TMLR; UQLM repository: https://github.com/cvs-health/uqlm

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏