arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-15 至 2026-06-15 共收录 6 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2606.03108 2026-06-15 cs.AI 版本更新 70%

EvoTrainer: Co-Evolving LLM Policies and Training Harnesses for Autonomous Agentic Reinforcement Learning

EvoTrainer: 协同进化LLM策略与训练框架以实现自主智能体强化学习

Guhong Chen, Yingcheng Shi, Yongbin Li, Binhua Li, Xander Xu, Hu Wei, Shiwen Ni, Min Yang, Jieping Ye

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团) Alibaba Group(阿里巴巴集团) SUAT(深圳大学)

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.AI

AI总结 提出EvoTrainer框架,通过协同进化LLM策略和训练端框架,基于经验反馈自动诊断、修正并积累可复用技能,在数学推理、编程竞赛和仓库级软件工程任务上匹配或超越人工设计的RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05106 2026-06-15 cs.AI cs.CL cs.LG 版本更新 67%

Token-Level LLM Collaboration via FusionRoute

通过融合路由实现令牌级LLM协作

Nuoya Xiong, Yuhang Zhou, Hanqing Zeng, Zhaorun Chen, Furong Huang, Shuchao Bi, Lizhu Zhang, Zhuokai Zhao

机构 * [cs.AI](计算机科学与人工智能)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FusionRoute框架,通过轻量级路由器在解码步骤中选择最合适的专家并补充对数几率以优化下一个令牌分布,解决了单个通用模型在多个领域表现不佳的问题,同时在多个基准测试中优于其他方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01455 2026-06-15 cs.CL 版本更新 57%

Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal

大型语言模型中的可信不确定性:置信度校准与风险控制拒绝的统一框架

Markus Oehri, Giulia Conti, Kaviraj Pather, Alexandre Rossi, Laia Serra, Adrian Parody, Rogvi Johannesen, Aviaja Petersen, Arben Krasniqi

机构 * University of Liechtenstein(列支敦士登大学) University of the Republic of San Marino(圣马尔科共和国大学) University of Mauritius(毛里求斯大学) International University of Monaco(摩纳哥国际大学) University of Andorra(安道尔大学) University of Gibraltar(直布罗陀大学) University of the Faroe Islands(法罗群岛大学) Ilisimatusarfik (University of Greenland)(格陵兰岛研究所(格陵兰大学)) University of Prizren(普里兹伦大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出UniCR框架,融合多种不确定性证据为校准的正确概率,并通过原则性拒绝满足用户指定的错误预算,无需微调基础模型,在短问答、代码生成和检索增强长问答中提升校准指标并降低风险-覆盖曲线下面积。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码评测 1 篇

2604.20462 2026-06-15 cs.SE cs.CL cs.IR 版本更新 62%

Deja Vu at Scale: Paraphrase-Robust Detection of Duplicate Gherkin Steps in Behaviour-Driven Software Testing with Sentence-Transformer Embeddings and a 1.1M-Step Open Benchmark

大规模既视感:基于Sentence-Transformer嵌入和行为驱动软件测试中重复Gherkin步骤的释义鲁棒检测与110万步骤开放基准

Ali Hassaan Mughal, Noor Fatima, Muhammad Bilal

机构 * work(工作) seecs.edu.pk(SEECs大学) tum.de(图腾大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL

AI总结 针对BDD测试中Gherkin步骤重复问题,提出结合精确哈希、归一化Levenshtein、句子Transformer余弦和Levenshtein带混合的四种策略检测器,并构建跨组织语料库和标注基准,F1达0.906。

Comments 28 pages, 2 figures, 4 tables. Submitted to Information and Software Technology (Elsevier). Tool, corpus, labelled benchmark, and rubric released at https://github.com/amughalbscs16/cukereuse-release under Apache-2.0

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 仓库级理解 1 篇

2511.12193 2026-06-15 cs.CV 版本更新 50%

MMRINet: Efficient Mamba-Based Segmentation with Dual-Path Refinement for Low-Resource MRI Analysis

MMRINet: 基于Mamba的高效双路径细化分割网络用于低资源MRI分析

Abdelrahman Elsayed, Ahmed Jaheen, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University(纽约大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 提出MMRINet,一种基于Mamba的轻量级分割网络,通过双路径特征细化和渐进特征聚合,在低资源MRI分析中以2.5M参数实现高效分割,在SSA数据集上优于UNETR等基线。

Comments Accepted at The Medical Image Understanding and Analysis Conference (MIUA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他AI编程 1 篇

2606.06442 2026-06-15 quant-ph 版本更新 50%

Nanostructure modelling with early fault tolerant quantum computers

早期容错量子计算机的纳米结构建模

Zhu Sun, Christian Binder, Balint Koczor, Simon Benjamin

专题命中 其他AI编程 :code model(abstract)

AI总结 本文提出一个量子模拟框架,采用一阶量化表示和Trotterization与qubitisation算法,结合经典模拟资源估计,在早期容错量子计算机上高效模拟多电子双量子点,实现基态能量计算。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏