arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-14 至 2026-07-14 共收录 14 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2604.03922 2026-07-14 cs.LG 版本更新 79%

ACES: Who Tests the Tests? Leave-One-Out AUC Consistency for Code Generation

ACES: 谁测试测试?留一法AUC一致性用于代码生成

Hui Sun, Yun-Ji Zhang, Zheng Xie, Ren-Biao Liu, Yali Du, Xin-Ye Li, Ming Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 本文提出ACES方法,通过留一法AUC评估测试区分正确与错误代码的能力,解决测试正确性判断的循环依赖问题,实现代码生成的高精度筛选。

Comments 32 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25917 2026-07-14 cs.AI cs.CL cs.LG 版本更新 67%

Recursive Multi-Agent Systems

递归多智能体系统

Jiaru Zou, Rui Pan, Ruizhong Qiu, Pan Lu, Shizhe Diao, Jindong Jiang, Hanghang Tong, Tong Zhang, Markus J. Buehler, Jingrui He, James Zou

机构 * UIUC(伊利诺伊大学香槟分校) Stanford University(斯坦福大学) NVIDIA(英伟达) MIT(麻省理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出递归多智能体框架RecursiveMAS,通过递归计算提升多智能体协作效率,实验证明其在多个基准测试中准确率提升8.3%,推理速度提升1.2-2.4倍,token使用减少34.6%-75.6%。

Comments Project Website: https://recursivemas.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01331 2026-07-14 cs.CL cs.AI cs.LG 版本更新 67%

MetaState: Persistent Working Memory Enhances Reasoning in Discrete Diffusion Language Models

MetaState: 持久工作记忆增强离散扩散语言模型的推理能力

Kejing Xia, Mingzhe Li, Lixuan Wei, Zhenbang Du, Xiangchi Yuan, Dachuan Shi, Qirui Jin, Wenke Lee

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Harvard University(哈佛大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MetaState通过引入轻量级循环增强模块,为冻结的离散扩散语言模型提供持久固定大小的工作记忆,提升推理性能,平均提升4.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04089 2026-07-14 physics.comp-ph cond-mat.str-el cs.AI cs.HC 版本更新 57%

From Paper to Program: Knowledge Externalization and Bottleneck Diagnosis in AI-Assisted Quantum Many-Body Programming

从论文到程序:AI辅助量子多体代码生成中的知识外化

Yi Zhou

机构 * Institute of Physics, Chinese Academy of Sciences, Beijing 100190, China(中国科学院物理研究所,北京100190,中国)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 针对AI直接翻译论文为代码时因隐含约定导致失败的问题,提出知识外化方法,通过多阶段人机协作流程将隐式假设显式化,在DMRG和Pfaffian-MPS任务上验证了有效性。

Comments 20 pages, 4 figures. Substantially revised presentation, related-work context, reproducibility documentation, validation-gate wording, limitations, and generative-AI disclosure; numerical results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2507.11059 2026-07-14 cs.SE cs.AI cs.CL 版本更新 67%

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

机构 * GigaCode ITMO University(ITMO大学) MWS AI(MWS人工智能) IITU university(IITU大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09361 2026-07-14 cs.DB 版本更新 50%

Bespoke-Card: Why Tune When You Can Generate? Synthesizing Workload-Specific Cardinality Estimators

Bespoke-Card:为何调优而非生成?合成工作负载特定的基数估计器

Johannes Wehrstein, Anton Winter, Timo Eckmann, Carsten Binnig

专题命中 软件智能体 :coding agent(abstract)

AI总结 提出Bespoke-Card系统,通过智能体驱动合成工作负载特定的基数估计器,利用结构化q-error反馈和课程学习等策略,在JOB上降低33%总运行时间和41%中位数q-error。

Comments Accepted for AIDB@VLDB'26 (Boston)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 3 篇

2606.11864 2026-07-14 cs.IR 版本更新 67%

CORE-Bench: A Comprehensive Benchmark for Code Retrieval in the Era of Agentic Coding

CORE-Bench:智能体编程时代代码检索的综合基准

Fuwei Zhang, Yanzhao Zhang, Mingxin Li, Dingkun Long, Lexiang Hu, Pengjun Xie, Zhao Zhang, Fuzhen Zhuang

专题命中 代码评测 :repository(abstract);coding agent(abstract)

AI总结 针对智能体编程中需求驱动的仓库级代码检索问题,构建了包含18万查询和10.6万上下文相关性标签的三级基准CORE-Bench,实验表明现有嵌入模型性能显著下降,微调可提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07204 2026-07-14 math.OC cs.LG 版本更新 57%

Restricted Dynamic Geometric Complexity: Path-Space Reduction and Möbius--Jacobi Response

受限动态几何复杂度:结构化预处理的证书

Zavier Li

机构 * Xidian University(西安电子科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 研究优化几何动力学中受限动态几何复杂度,通过发展相关理论,如单调性和子流形距离原理等,将结构化预处理器问题转化为几何问题,还给出低秩谱模型等诊断接口及相关工作流程。

Comments 32 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08164 2026-07-14 cs.CV 版本更新 50%

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 4 篇

2607.02772 2026-07-14 cs.SE 版本更新 70%

From Codebases to LLMs: Non-Inclusive Naming in Linux Foundation Repositories

从代码库到语言模型:Linux 基金会存储库中的非包容性命名

Honghao Tan, Md Nafiu Rahman, Shin Hwei Tan

专题命中 仓库级理解 :code generation(abstract);repository(abstract);分类 cs.SE

AI总结 研究利用 NISCAN 框架检测 Linux 基金会存储库中代码及相关工件的非包容性术语,对 461 个存储库进行生态系统规模研究,分析术语变化及影响因素,还通过案例研究评估大语言模型处理情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29550 2026-07-14 cs.SE 版本更新 57%

Deforking the World of Code: A Project-Provenance Map that Recovers Cross-Forge Fork Families that Platform Graphs Cannot See

去分叉代码世界:一个恢复跨平台分叉家族的项目来源图谱,平台图无法识别

Audris Mockus

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 针对Git分叉导致代码度量膨胀的问题,提出基于全局共享提交关系的去分叉映射p2PFull,通过集线节点星编码和并行Louvain聚类构建项目来源图,并验证了跨平台分叉家族的发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22636 2026-07-14 math.PR cs.DS math.CO stat.CO 版本更新 50%

Spectral Gap for the Binary Fixed-Margin Swap Chain

二元固定边缘交换链的谱间隙

Weibo Fu, Qian Qin, Guanyang Wang

专题命中 仓库级理解 :repository(abstract)

AI总结 证明了具有指定行和与列和的二元矩阵上的惰性交换链具有逆多项式谱间隙,下界为组合数乘积的倒数,并给出了紧例。

Comments add acorollary and additional references

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10991 2026-07-14 cs.CC cs.FL 版本更新 50%

Implementation of Polynomial NP-Complete Algorithms Based on the NP Verifier Simulation Framework

基于NP验证器模拟框架的多项式NP完全算法实现

Changryeol Lee

专题命中 仓库级理解 :repository(abstract)

AI总结 本文基于改进的NP验证器模拟框架,构建了SAT和子集和问题的确定性图灵机,实现了理论证明与可执行软件之间的桥梁,并展示了多项式时间内的有效执行。

Comments A reference implementation is available at https://github.com/changryeol-hub/poly-np-sim. The verifier Turing machines have been updated to certificate-oblivious Turing machines, following the update to the original framework

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他AI编程 1 篇

2201.08986 2026-07-14 quant-ph 版本更新 71%

Information causality beyond the random access code model

超越随机访问码模型的信息因果性

Baichu Yu, Valerio Scarani

专题命中 其他AI编程 :code model(title)

AI总结 本文提出基于冗余信息的新量化器,用于缩小信息因果性原则在量子相关性中的理论间隙。

Comments 6 pages, 3 figures, 1 table

Journal ref Phys. Rev. A 114, 012202 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏