arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-15 至 2026-06-15 共收录 21 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2606.03108 2026-06-15 cs.AI 版本更新 70%

EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

EvoTrainer: 协同进化LLM策略与训练框架以实现自主智能体强化学习

Guhong Chen, Yingcheng Shi, Yongbin Li, Binhua Li, Xander Xu, Hu Wei, Shiwen Ni, Min Yang, Jieping Ye

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团) Alibaba Group(阿里巴巴集团) SUAT(深圳大学)

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI

AI总结 提出EvoTrainer框架,通过协同进化LLM策略和训练端框架,基于经验反馈自动诊断、修正并积累可复用技能,在数学推理、编程竞赛和仓库级软件工程任务上匹配或超越人工设计的RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05106 2026-06-15 cs.AI cs.CL cs.LG 版本更新 67%

Token-Level LLM Collaboration via FusionRoute

通过融合路由实现令牌级LLM协作

Nuoya Xiong, Yuhang Zhou, Hanqing Zeng, Zhaorun Chen, Furong Huang, Shuchao Bi, Lizhu Zhang, Zhuokai Zhao

机构 * [cs.AI](计算机科学与人工智能)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FusionRoute框架,通过轻量级路由器在解码步骤中选择最合适的专家并补充对数几率以优化下一个令牌分布,解决了单个通用模型在多个领域表现不佳的问题,同时在多个基准测试中优于其他方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14672 2026-06-15 cs.AI cs.CL 新提交 62%

Towards Direct Latent-Space Synthesis for Parallel Branches in LLM-Agent Workflows

面向LLM-Agent工作流中并行分支的直接潜在空间合成

Shikun Liu, Mufei Li, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出Parallel-Synthesis框架,通过直接利用并行工作代理的KV缓存进行合成,避免文本拼接冗余,在9个数据集上匹配或超越文本合成,并将首令牌延迟降低2.5-11倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13982 2026-06-15 stat.ML cs.LG 新提交 57%

Adaptive Nucleus Truncation for Long-Form Reasoning

自适应核截断用于长形式推理

Ousmane Amadou Dia

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 提出自适应核截断采样(ANTS),通过熵条件控制器动态调整截断宽度,在长文本生成中提升推理性能,在33B参数稀疏MoE模型上平均提升1.9-5.2分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01455 2026-06-15 cs.CL 版本更新 57%

Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal

大型语言模型中的可信不确定性:置信度校准与风险控制拒绝的统一框架

Markus Oehri, Giulia Conti, Kaviraj Pather, Alexandre Rossi, Laia Serra, Adrian Parody, Rogvi Johannesen, Aviaja Petersen, Arben Krasniqi

机构 * University of Liechtenstein(列支敦士登大学) University of the Republic of San Marino(圣马尔科共和国大学) University of Mauritius(毛里求斯大学) International University of Monaco(摩纳哥国际大学) University of Andorra(安道尔大学) University of Gibraltar(直布罗陀大学) University of the Faroe Islands(法罗群岛大学) Ilisimatusarfik (University of Greenland)(格陵兰岛研究所(格陵兰大学)) University of Prizren(普里兹伦大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出UniCR框架,融合多种不确定性证据为校准的正确概率,并通过原则性拒绝满足用户指定的错误预算,无需微调基础模型,在短问答、代码生成和检索增强长问答中提升校准指标并降低风险-覆盖曲线下面积。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2606.13763 2026-06-15 cs.SE 新提交 79%

Do programming languages still matter to your AI coding agent teammate? Evidence at scale from chess engines

编程语言对你的AI编码队友还重要吗?来自国际象棋引擎的大规模证据

Mathieu Acher, Jean-Marc Jézéquel

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 通过让前沿AI代理用17种编程语言开发国际象棋引擎,发现AI能生成任何语言的可用系统,但语言选择仍影响性能、成本和功能,主流编译语言才能达到强棋力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14357 2026-06-15 cs.SE cs.AI 新提交 76%

No Accidental Software Agent First Canonical Code for Human Code Entropy Reduction and 30 to 500 times Lower Frontier Model Requirements

无意外软件智能体:首个用于人类代码熵降低的正则代码,以及30到500倍的前沿模型需求降低

Jepson Taylor

专题命中 软件智能体 :software agent(title);分类 cs.SE、cs.AI

AI总结 提出智能体优先的正则代码方法,通过行为等价商化人类代码中的意外熵,实现30-500倍的前沿模型需求降低,核心是行为等价商化和证明携带变更。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14000 2026-06-15 cs.AI 新提交 57%

Formalizing Numerical Analysis: An Agent Pipeline and Quality Audit Beyond Kernel Acceptance

数值分析的形式化:超越内核接受的智能体流水线与质量审计

Theodore Meek, Siyuan Ge, Di Qiu Xiang, Simon Chess, Vasily Ilin

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种编码智能体流水线,将数值分析教材形式化为Lean 4代码,并引入三维质量评估框架(语义正确性、Mathlib复用、跨文件复用),发现编译通过掩盖了不忠实的形式化模式。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 4 篇

2606.14516 2026-06-15 cs.AI cs.CL cs.CY 新提交 81%

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

Every Eval Ever:AI评估结果的统一模式与社区仓库

Jan Batzner, Sree Harsha Nelaturu, Damian Stachura, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra, Brian H. Hu, Eliya Habba, Andrew M. Bean, Chang Liu, Sander Land, Steven Dillmann, Aniketh Garikaparthi, Elron Bandel, Saki Imai, James Edgell, Wm. Matthew Kennedy, Jenny Chim, Patrick Meusling, Asteria Kaeberlein, Venkata Ramachandra Karthik Chundi, Manasi Patwardhan, Martin Ku, Austin Meek, Leon Knauer, Brian Wingenroth, Srishti Yadav, Usman Gohar, Felix Friedrich, Michelle Lin, Jennifer Mickel, Arman Cohan, Stella Biderman, Irene Solaiman, Zeerak Talat, Anka Reuel, Mubashara Akhtar, Gjergji Kasneci, Avijit Ghosh, Leshem Choshen

机构 * Technical University Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Weizenbaum Institute(魏岑鲍姆研究所) Zuse Institute Berlin(柏林祖泽研究所) Evidence Prime Trustible Kitware ETH Zurich(苏黎世联邦理工学院) StickFlux Labs Stanford University(斯坦福大学) Northeastern University(东北大学) IBM Research(IBM研究院) Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学) Cisco(思科) University of Notre Dame(圣母大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of Oxford(牛津大学) Ohio University(俄亥俄大学) Writer TCS Research(塔塔咨询服务研究院) Oxford University Press(牛津大学出版社) Queen Mary University of London(伦敦玛丽女王大学) Technical University Berlin(柏林工业大学) University of Delaware(特拉华大学) Cinemo Johns Hopkins University(约翰霍普金斯大学) University of Copenhagen(哥本哈根大学) ELLIS(欧洲学习与智能系统实验室) Iowa State University(爱荷华州立大学) Meta FAIR University of Montreal(蒙特利尔大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所) EleutherAI Yale University(耶鲁大学) Hugging Face University of Edinburgh(爱丁堡大学) Harvard University(哈佛大学) ETH AI Center(ETH人工智能中心) MIT(麻省理工学院) MIT-IBM Watson Lab(MIT-IBM沃森实验室)

专题命中 代码评测 :repository(title,abstract);分类 cs.CL、cs.AI

AI总结 针对AI评估结果格式不统一、难以比较的问题,提出首个共享模式与社区众包仓库,通过标准化表示、自动转换器和社区数据库实现跨评估框架的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13995 2026-06-15 cs.CL 新提交 79%

Dialogue SWE-Bench: A Benchmark for Dialogue-Driven Coding Agents

Dialogue SWE-Bench: 对话驱动的编码智能体基准

Brendan King, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 代码评测 :coding agent(title,abstract);分类 cs.CL

AI总结 提出Dialogue SWE-Bench基准,通过用户模拟器评估编码智能体在对话中解决软件工程问题的能力,并引入模式引导智能体提升对话性能3-14%。

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13735 2026-06-15 cs.AR cs.AI cs.LG cs.PL 新提交 67%

VHDLSuite: Unified Pipeline for LLM VHDL Generation with Data Synthesis and Evaluation

VHDLSuite:面向LLM VHDL生成的统一流水线,包含数据合成与评估

Yijun Shen, Minghao Shao, Yichen Zhao, Zhuoyan Yu, Boyuan Chen, Yik-Cheung Tam, Muhammad Shafique

机构 * Center for Data Science, NYU Shanghai, China(纽约市立大学上海分校数据科学中心) NYU Tandon School of Engineering, USA(纽约大学Tandon工程学院) NYU Abu Dhabi, UAE(纽约大学阿布扎比分校)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG、cs.PL

AI总结 提出VHDLSuite基础设施,通过自动基准合成、可执行验证和多模型诊断分析,解决LLM在VHDL生成评估中的不足,并构建含200+问题的VHDLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20462 2026-06-15 cs.SE cs.CL cs.IR 版本更新 62%

Deja Vu at Scale: Paraphrase-Robust Detection of Duplicate Gherkin Steps in Behaviour-Driven Software Testing with Sentence-Transformer Embeddings and a 1.1M-Step Open Benchmark

大规模既视感:基于Sentence-Transformer嵌入和行为驱动软件测试中重复Gherkin步骤的释义鲁棒检测与110万步骤开放基准

Ali Hassaan Mughal, Noor Fatima, Muhammad Bilal

机构 * work(工作) seecs.edu.pk(SEECs大学) tum.de(图腾大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL

AI总结 针对BDD测试中Gherkin步骤重复问题,提出结合精确哈希、归一化Levenshtein、句子Transformer余弦和Levenshtein带混合的四种策略检测器,并构建跨组织语料库和标注基准,F1达0.906。

Comments 28 pages, 2 figures, 4 tables. Submitted to Information and Software Technology (Elsevier). Tool, corpus, labelled benchmark, and rubric released at https://github.com/amughalbscs16/cukereuse-release under Apache-2.0

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 7 篇

2606.14445 2026-06-15 cs.SE cs.AI cs.HC 新提交 62%

tap: A File-Based Protocol for Heterogeneous LLM Agent Collaboration

tap:一种用于异构LLM智能体协作的基于文件的协议

Minseo Kim

机构 * HUA Labs(HUA实验室)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出tap协议,通过文件优先设计实现不同厂商LLM智能体(如Claude和Codex)在共享代码库上的协作,无需共享内存或相同运行时,实验表明异构模型对审查缺陷发现率更高。

Comments Accepted to KCC 2026. English archival translation. 3 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14327 2026-06-15 cs.SE cs.AI cs.ET 新提交 62%

I'm Sorry Driver, I'm Afraid I Can't Do That: Appraising the Safety of LLMs within Automotive Contexts

抱歉,司机,恐怕我不能这么做:评估LLMs在汽车环境中的安全性

Shaun Feakins, Ibrahim Habli, Kim Littler, Robert Palin

机构 * UKRI AI Centre for Doctoral Training in Safe Artificial Intelligence Systems (SAINTS)(英国研究理事会安全人工智能系统博士培训中心(SAINTS)) University of York(约克大学) Jaguar Land Rover(捷克·陆罗恩)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文从安全保证角度评估了将LLMs集成到汽车控制任务中的现有框架,指出其面临概念和具体挑战,并通过案例研究提出未来保障机制。

Comments Accepted at the Dependable AI in Embedded Systems (DAIES) Workshop at SAFECOMP 2026; 15 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14616 2026-06-15 cs.SE 新提交 57%

GitHub Template Repositories: Served Domains, Maintenance, and Practitioner Guidelines

GitHub 模板仓库:服务领域、维护与从业者指南

Leuson Da Silva, Altaf Allah Abbassi, Imen Trabelsi, Paulo Borba, Foutse Khomh

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 通过对五种主流编程语言的 GitHub 模板仓库进行大规模实证研究,分析了模板的服务领域、维护特征及质量问题,并提出了设计和管理模板的实用指南。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13392 2026-06-15 cs.AI 新提交 57%

MiniMax Sparse Attention

MiniMax 稀疏注意力

Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, Jinkai Hu, Jiayao Li, Rui Gao, Zekun Li, Songquan Zhu, Jingkai Zhou, Pengyu Zhao

机构 * MiniMax Peking University(北京大学) NVIDIA(英伟达) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15196 2026-06-15 stat.ML cs.LG 57%

A Review on Self-Supervised Learning for Time Series Anomaly Detection: Recent Advances and Open Challenges

时间序列异常检测中自监督学习的综述:最新进展与开放挑战

Aitor Sánchez-Ferrera, Borja Calvo, Jose A. Lozano

机构 * University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU) Basque Center for Applied Mathematics (BCAM)(巴斯克应用数学中心)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本文综述了时间序列异常检测中自监督学习的最新方法,提出分类体系以理解其多样性,并提供GitHub仓库供后续更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14425 2026-06-15 cond-mat.str-el cond-mat.supr-con 新提交 50%

SmoQyElPhQMC.jl: An open-source Julia package for efficient and scalable quantum Monte Carlo simulations of electron-phonon coupled models

SmoQyElPhQMC.jl: 一个用于高效可扩展电子-声子耦合模型量子蒙特卡洛模拟的开源Julia包

Benjamin Cohen-Stead, James Neuhaus, Kipton Barros, Thomas A. Maier, Steven Johnston

专题命中 仓库级理解 :repository(abstract)

AI总结 介绍SmoQyElPhQMC.jl v1.0,一个基于SmoQyDQMC的开源Julia包,通过改进算法实现系统尺寸和逆温度线性标度的电子-声子模型量子蒙特卡洛模拟,并提供灵活脚本接口以适配不同工作流。

Comments Planned submission to SciPost Codebases, comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12193 2026-06-15 cs.CV 版本更新 50%

MMRINet: Efficient Mamba-Based Segmentation with Dual-Path Refinement for Low-Resource MRI Analysis

MMRINet: 基于Mamba的高效双路径细化分割网络用于低资源MRI分析

Abdelrahman Elsayed, Ahmed Jaheen, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University(纽约大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 提出MMRINet,一种基于Mamba的轻量级分割网络,通过双路径特征细化和渐进特征聚合,在低资源MRI分析中以2.5M参数实现高效分割,在SSA数据集上优于UNETR等基线。

Comments Accepted at The Medical Image Understanding and Analysis Conference (MIUA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他AI编程 2 篇

2606.13918 2026-06-15 cs.SE cs.CR 新提交 57%

Bayesian-Calibrated Detection of Hallucinated Package Imports in AI-Assisted Code

AI辅助代码中幻觉包导入的贝叶斯校准检测

Lom M. Hillah, Jean-Marc Richard, Ryan Hasnaoui

专题命中 其他AI编程 :code model(abstract);分类 cs.SE

AI总结 提出贝叶斯校准层,基于三元认知分类法输出Beta后验概率,并利用PyPI元数据检测注册但可疑的包,优于二元基线。

Comments 23 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06442 2026-06-15 quant-ph 版本更新 50%

Nanostructure modelling with early fault tolerant quantum computers

早期容错量子计算机的纳米结构建模

Zhu Sun, Christian Binder, Balint Koczor, Simon Benjamin

专题命中 其他AI编程 :code model(abstract)

AI总结 本文提出一个量子模拟框架,采用一阶量化表示和Trotterization与qubitisation算法,结合经典模拟资源估计,在早期容错量子计算机上高效模拟多电子双量子点,实现基态能量计算。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏