arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-30 至 2026-07-30 共收录 16 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2607.24884 2026-07-30 cs.SE cs.AI cs.CL cs.LG 版本更新 85%

Beyond "What to Retrieve": Uncertainty in Retrieval-Augmented Code Generation

超越“检索什么”:检索增强代码生成中的不确定性

Chandan Kumar Sah, Li Zhang, Xiaoli Lian

专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 研究存储库级代码生成中异构证据不确定性问题,提出不确定性感知框架OpenCoder,通过估计特定源不确定性来过滤和排序证据以指导相关操作,实验表明其能提高输出正确性,支持将不确定性作为可操作控制信号。

Comments 9 pages, 4 figures. Source code and supporting materials are available at https://github.com/Rocky5502/OpenCoder_V1

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23254 2026-07-30 cs.SE 版本更新 79%

Better Call Grep: Evaluating and Improving Grep-Like Lexical Retrieval for Repository-Level Code Completion

更好地调用Grep:评估和改进用于仓库级代码补全的类Grep词汇检索方法

Baoyi Wang, Xingliang Wang, Guochang Li, Chen Zhi, Junxiao Han, Xinkui Zhao, Nan Wang, Shuiguang Deng, Jianwei Yin

专题命中 代码生成 :repository(title,abstract);分类 cs.SE

AI总结 本文评估改进类Grep词汇检索,提出Naive GrepRAG基线,又结合后处理流水线的GrepRAG在代码补全任务上优于SOTA,为轻量检索支撑仓库级代码补全提供方案。

Comments ISSTA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19450 2026-07-30 cs.LG cs.AI 版本更新 62%

REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

REGEN:用于从专家到通用模型蒸馏的离线强化学习的重放回收

Yunjie Chen, Xiaoxin Chen, Fang Wang

机构 * vivo AI Lab(vivo人工智能实验室) Department of Computer Science, Sun Yat-Sen University(中山大学计算机科学系)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型强化学习扩展的挑战,提出REGEN方法,通过回收重放记忆并运用离线强化学习算法训练通用模型,解耦训练过程,降低成本,在多任务上以低成本达类似准确率,还可能变革在线强化学习及扩展训练阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00192 2026-07-30 cs.LG cs.AI 版本更新 62%

Train Large, Deploy Compact: Structured Compression for Compact Low-Rank Adaptation

大模型训练,紧凑部署:用于紧凑低秩适配的结构化压缩

Xin Yu, Cong Xie, Xunmei Liu, Tiantian Fan, Lingzhou Xue, Zhi Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LoRA表征能力不足的问题,提出PrunedLoRA框架,通过动态结构化剪枝实现自适应秩分配,在多项微调任务中性能优于LoRA及其变体和现有结构化剪枝方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19652 2026-07-30 cs.SE 版本更新 57%

Characterizing Real-World Bugs in Tile Programs for Automated Bug Detection

刻画用于自动化Bug检测的Tile程序中的现实世界Bug

Ravishka Rathnasuriya, Zihe Song, Nidhi Majoju, Aaryaa Moharir, Tingxi Li, Wei Yang, Tao Xie

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文首次系统研究了Tile程序代码生成中的Bug,通过收集401个GitHubbug报告,识别出301个Tile程序代码生成Bug,分析其根本原因、症状、输入模式、触发测试或acles以及修复策略,为构建针对Tile编译器基础设施的调试、测试和修复工具提供基础见解。

Comments In Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2604.01527 2026-07-30 cs.SE cs.AI cs.LG 版本更新 82%

REAP: Automatic Curation of Coding Agent Benchmarks from Interactive Production Usage

REAP:从交互生产使用自动整理编码代理基准

Smriti Jha, Matteo Paltenghi, Chandra Maddila, Vijayaraghavan Murali, Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。

Comments Accepted at ASE 2026 Industry Showcase

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23624 2026-07-30 cs.SE cs.AI cs.CL 版本更新 75%

Where Is the Cost of Third-Party API Routers in Agentic Software Development?

代理软件开发中第三方 API 路由器的成本在哪里?

Donghao Fu, Jingxin Li, Xue Jiang, Yihong Dong

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 研究第三方 API 路由器在代理软件开发中的影响,通过实证研究编码代理中路由器端注入的四个干预级别,开发 SIDEL 框架评估代理,发现路由器端干预难测,客户端缓解措施未完全恢复控制,强调需提供商端输出完整性保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18699 2026-07-30 cs.DS cs.SC 版本更新 50%

A more accurate rational non-commutative algorithm for multiplying 4x4 matrices using 48 multiplications

一种更精确的有理非交换算法用于使用48次乘法的4x4矩阵乘法

Jean-Guillaume Dumas, Clément Pernet, Alexandre Sedoglavic

专题命中 软件智能体 :coding agent(abstract)

AI总结 本文提出一种更精确的4x4矩阵乘法算法,使用48次非交换乘法,改进了误差界指数并提升了实际精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2510.20521 2026-07-30 cs.SE 版本更新 57%

Large Language Models for Fault Localization: An Empirical Study

用于故障定位的大语言模型:一项实证研究

Yingjian Xiao, Weiwei Gong, Jianjun Huang, Rongqun Hu, Hongwei Li, Anquan Jie, Boyang Yang

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 本文通过在HumanEval-Java、Defects4J数据集上评估四款LLMs,对比非LLM基线,分析不同提示策略,明确其在语句级故障定位的优缺与实际权衡,为软件工程应用提供实证支持。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2601.09695 2026-07-30 cs.SE 版本更新 57%

How well LLM-based test generation techniques perform with newer LLM versions?

基于新版本LLM的测试生成技术表现如何?

Michael Konstantinou, Renzo Degiovanni, Mike Papadakis

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 本文研究了基于新版本LLM的测试生成技术表现,发现纯LLM方法在覆盖率和变异评分上优于现有方法,且成本相当。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 3 篇

2509.22768 2026-07-30 cs.CL 版本更新 70%

ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation

ML2B:评估大语言模型跨语言ML流水线生成能力的基准

Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

机构 * HSE University(俄罗斯伏尔加格勒国立大学) Constructor University(Constructor大学) National University of Singapore(新加坡国立大学)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.CL

AI总结 ML2B是首个评估大语言模型跨语言ML流水线生成能力的基准,含多领域多语言任务,实验发现跨语言性能退化高度依赖任务,挑战了传统多语言模型能力假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01153 2026-07-30 cs.CL cs.AI cs.SE 版本更新 56%

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准

Brett Reynolds

机构 * Humber Polytechnic(汉博理工学院) University of Toronto(多伦多大学)

专题命中 代码评测 :分类 cs.SE、cs.CL、cs.AI;repository(comments)

AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。

Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08729 2026-07-30 cs.CV 版本更新 50%

WaspMOT: A Benchmark for Long-Term Multi-Object Tracking of Trichogramma Wasps

WaspMOT:赤眼蜂长期多目标跟踪基准

Tomasz Stanczyk, Yuan Gao, Hardik Agarwal, Seongro Yoon, Tiantao Zhang, Vincent Calcagno, Francois Bremond

机构 * Inria(法国国家信息与自动化技术研究院) INRAE Institut Sophia Agrobiotech(法国国家农业生物技术研究院) Université Côte d'Azur(蔚蓝海岸大学) Indian Institute of Technology Delhi(德里印度理工学院) Institute of Plant Protection, Chinese Academy of Agricultural Sciences(中国农业科学院植物保护研究所)

专题命中 代码评测 :repository(abstract)

AI总结 研究针对多目标跟踪在长期身份保持评估不足的问题,引入WaspMOT基准,通过对赤眼蜂长时间跟踪构建数据集,评估五种检测跟踪方法,发现都有轨迹碎片化问题,简单拼接基线可提升性能,揭示了现有方法局限。

Journal ref AVSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 3 篇

2607.23597 2026-07-30 cs.CR cs.CL 版本更新 57%

HiTMS: A High-Throughput Multi-Stream Linguistic Steganography Framework

HiTMS:一个高通量多流语言隐写框架

Ruiyi Yan, Zhongliang Yang, Yugo Murawaki

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 HiTMS针对现有语言隐写术单流方案的局限,提出在多轮交互响应中分配秘密,通过批处理调用提高吞吐量,用自描述框架和密钥派生调度保证可恢复性,实验显示其速度提升且降低隐写分析器AUROC,并发增加时吞吐量持续提高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02184 2026-07-30 cs.DL cs.LG 版本更新 57%

The Ghost Couple: Correlated LLM Name Priors and Their Haunting of the Web and Academic Publishing

幽灵搭档:相关的大语言模型姓名先验及其对网络和学术出版的困扰

Michał Brzozowski, Neo Christopher Chung

机构 * Samsung AI Center(三星人工智能中心) University of Warsaw(华沙大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 研究发现大语言模型生成虚构专家姓名时会产生相关性强的角色组合,这些组合具有模型家族特异性,并在Zenodo等平台造成大量幽灵作者记录,影响学术出版。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07851 2026-07-30 cs.SE 版本更新 57%

Uncovering Scientific Software Sustainability through Community Engagement and Software Quality Metrics

通过社区参与和软件质量指标揭示科学软件的可持续性

Sharif Ahmed, Addi Malviya Thakur, Gregory R. Watson, Nasir U. Eisty

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 该研究针对科学开源软件长期维持的挑战,以GitHub上的十个知名Sci-OSS项目为对象,结合社区参与与软件质量指标,提出新颖可视化技术及相关分析方法,为相关人员提供了软件可持续性的关键见解。

Comments Accepted for publication in IEEE Computing in Science & Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏