arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-23 至 2026-06-23 共收录 10 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 10 篇

2606.22248 2026-06-23 cs.LG cs.CL 新提交 76%

SamatNext v0.2-B: An Exploratory Study of RMS-Normalized Hybrid Decoders for Curriculum Retention in Small Code Models

SamatNext v0.2-B: 针对小型代码模型中课程保留的RMS归一化混合解码器的探索性研究

Samat Zharassov

专题命中 代码评测 :code model(title);分类 cs.CL、cs.LG

AI总结 提出SamatNext v0.2-B混合解码器,在课程微调中通过RMS归一化和输出缩放校准交替使用差分注意力层与简化线性状态混合器,在Python代码课程上相比Transformer基线显著提升保留率,但长期早期阶段保留仍较弱。

Comments 12 pages, 3 tables. Technical report. Code and reproducibility artifacts: https://github.com/samat2003/samatnext-v0.1/tree/samatnext-v02-lsm-rmsnorm. v2 adds an AI-assisted software development disclosure; no changes to main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22906 2026-06-23 cs.SE cs.AI 新提交 62%

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

从片段到路径:大型工业代码库的任务级上下文恢复

Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

机构 * AMAP, Alibaba Group(阿里集团AMAP) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) University of Cambridge(剑桥大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出DeepDiscovery方法,通过两阶段定位-推理框架在预算约束下恢复任务级上下文,显著提升大型工业代码库的文件检索和下游软件工程任务性能。

Comments 12 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21627 2026-06-23 cs.AI cs.LG 新提交 62%

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Counsel: 面向智能体任务的元评估数据集

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

机构 * Atla AI Cohere AI Mistral AI Google DeepMind(谷歌DeepMind)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09898 2026-06-23 cs.LG cs.AI 版本更新 62%

Learning Bug Context for PyTorch-to-JAX Translation with LLMs

学习 PyTorch 到 JAX 翻译中的 Bug 上下文

Hung Phan, Son Vu, Tuan Dinh, Nesreen Ahmed, Ali Payani, Ali Jannesari

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State大学计算机科学系) Department of Human Science, Iowa State University, Ames, IA, USA(Iowa State大学人类科学系) Cisco AI Research, Outshift, San Jose, CA, USA(Cisco AI研究,Outshift,San Jose,加利福尼亚州,美国)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 针对 LLM 在 PyTorch 到 JAX 代码翻译中易出错的问题,构建 T2J 基准(含 bug 及修复),通过上下文学习使弱 LLM 翻译质量提升达 20%。

Comments ICML Deep Learning for Code (DL4C) workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22167 2026-06-23 cs.LG 新提交 57%

Early-Exit Graph Neural Networks for Link Prediction

用于链接预测的早期退出图神经网络

Roman Knyazhitskiy, Andrea Giuseppe Di Francesco

机构 * University of Cambridge(剑桥大学) Sapienza University of Rome(罗马大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出一种无需辅助损失的早期退出策略,在GCN和SAS-GNN骨干网络上实现链接预测的加速,同时保持或提升预测质量。

Comments Accepted at LoG@Pisa 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21113 2026-06-23 cs.CV cs.LG 新提交 57%

Object-Centric Dataset Resources for Constrained-Data Image Generation and Augmentation

面向受限数据图像生成与增强的以对象为中心的数据集资源

Vasile Marian, Yong-Bin Kang, Alexander Buddery

机构 * The University of Queensland(昆士兰大学) Swinburne University of Technology(斯威本科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 针对少样本场景下的对象中心图像生成,提出三个标准化数据集资源(Cityscapes-Pedestrian、TrafficSigns、COCO PottedPlant),提供256×256裁剪、边界框标注及重建脚本,支持受控比较与评估。

Comments 5 pages including references, 2 figures, 2 tables. Dataset and related files at https://github.com/Latzi/object-centric-low-data-datasets and https://doi.org/10.5281/zenodo.20573001

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21071 2026-06-23 cs.CR cs.AI 新提交 57%

Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer

本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计

Zhengsong Zhang, Zongze Li, Jiawei Guo, Haipeng Cai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, SUNY(布法罗大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 57%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01241 2026-06-23 cs.CR cs.SE 57%

MCP-SandboxScan: WASM-based Secure Execution and Runtime Analysis for MCP Tools

MCP-SandboxScan:基于WASM的MCP工具安全执行与运行时分析

Zhuoran Tan, Run Hao, Jeremy Singer, Yutian Tang, Christos Anagnostopoulos

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出MCP-SandboxScan框架,通过WASM环境执行工具并提取运行时证据,结合语义分析识别MCP工具的风险,验证其在跨语言项目、 evasion基准和100个仓库中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22868 2026-06-23 eess.AS 新提交 50%

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

MSU-Bench:面向对话多说话人场景中以说话人为中心的理解

Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao, Yuang Cao, Chunjiang He, Pan Zhou, Lei Xie

专题命中 代码评测 :repository(abstract)

AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。

Comments 4 pages, accepted by interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏