arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-09 至 2026-06-09 共收录 25 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 10 篇

2606.08135 2026-06-09 cs.SE 新提交 88%

TICoder: A Repository-Level Code Generation Framework with Test-Driven Planning and Implementation-Aware Reuse

TICoder: 一种具有测试驱动规划和实现感知复用的仓库级代码生成框架

Siyu Nan, Yaling Luo, Jian Wang, Neng Zhang, Bing Li

专题命中 代码生成 :code generation(title,abstract);repository(title,abstract);分类 cs.SE

AI总结 提出TICoder框架,通过测试驱动迭代规划机制和实现感知代码复用策略,解决仓库级代码生成中的依赖和上下文限制问题,在多个基准上平均提升11.52%。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09577 2026-06-09 cs.CL cs.LG cs.SE 新提交 78%

Code Is More Than Text: Uncertainty Estimation for Code Generation

代码不仅仅是文本:代码生成的不确定性估计

Yuling Shi, Caiqi Zhang, Yuexian Li, Haopeng Wang, Yeheng Chen, Nigel Collier, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.CL、cs.LG

AI总结 针对代码生成中错误程序的可靠性问题,提出基于词法、算法和功能三个正交轴的不确定性估计方法,在五个代码LLM上将AUROC提升8.1个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09145 2026-06-09 cs.CR 新提交 78%

PrivCode++: Latent-Conditioned Differentially Private Code Generation for Comprehensive Guarantees

PrivCode++: 潜在条件差分隐私代码生成以实现全面保障

Zheng Liu, Chen Gong, Terry Yue Zhuo, Zhou Yang, Kecen Li, Wenlong Meng, Xinwen Hou, Yu Liu, Xiaochen Li

专题命中 代码生成 :code generation(title,abstract)

AI总结 针对指令-代码对微调的大语言模型可能泄露敏感数据的问题,提出PrivCode-Plus,首个在微调中同时保护提示和代码的差分隐私代码生成方法,通过两阶段DP框架和无隐私潜在条件模块实现高效合成。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08676 2026-06-09 cs.SE cs.AI cs.CL 新提交 67%

Lost in the Flow with Code Talkers: Unveiling the Instruction-Tuning Tax of Large Language Models in Code Tasks

迷失在代码对话者的流程中:揭示代码任务中大语言模型的指令微调税

Shi Ying Chang, Chiok Yew Ho, Yichen Li, Yintong Huo

机构 * Singapore Management University(新加坡国立管理学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本研究首次实证发现指令微调在代码任务中导致权衡:增强指令遵循能力却削弱代码填充性能,称之为“指令微调税”,并通过定性和定量分析总结出七项发现和四项启示。

Comments 25 pages, 6 figures. Evaluation toolkit and dataset: https://github.com/arkosioscambions/CodeTalkers

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09396 2026-06-09 cs.CL cs.LG 新提交 62%

PriFT: Prior-Support Guided Supervised Fine-Tuning

PriFT: 先验支持引导的监督微调

Ke Wang, Shuangqi Li, Mathieu Salzmann, Pascal Frossard

机构 * EPFL(瑞士联邦理工学院洛桑分校)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出PriFT方法,利用冻结的预训练模型计算token权重,避免在线模型导致的自我强化动态,在数学推理、代码生成和医疗问答任务中取得SFT最优结果,并为后续RL提供更好初始化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07547 2026-06-09 cs.CL cs.AI cs.SD 新提交 62%

Liberating LLM Capabilities in Full-Duplex Speech Models

在全双工语音模型中释放LLM能力

Luoyuan Zhang, Bokai Xu, Junbo Cui, Weiyue Sun, Yingjing Xu, Hanyu Liu, Yuan Yao

机构 * Royal Zhang(皇家张)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出Listen-Write-Speak (LWS)三通道范式,使LLM在共享因果注意力上下文中同时监听、书写可见文本并实时口语回应,无需架构修改,实现全双工交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08411 2026-06-09 cs.CL 新提交 57%

AsyncLane: Decoupling Refinement from Advancement in Diffusion Language Model Decoding

AsyncLane: 扩散语言模型解码中精炼与推进的解耦

Yingxuan Ren, Yuxuan Lou, Yong Liu, Pengcheng Fang, Ziming Wang, Pengfei Zhou, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Southampton(南安普顿大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出AsyncLane,一种无需训练的解码调度器,通过将生成过程分叉为精炼和推进两个通道,解耦块间依赖,在保持质量的同时显著提升扩散语言模型的解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-06-09 cs.AI physics.flu-dyn 新提交 57%

Self-Evolving Scientific Agent Discovers Generalizable Physically-Reasoned Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07968 2026-06-09 cs.CR cs.AI 新提交 57%

RecurGuard: Runtime Monitoring for Reasoning-Token Consumption Attacks

RecurGuard: 推理令牌消耗攻击的运行时监控

Abid Aziz, Hafsa Binte Kibria

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Rajshahi University of Engineering & Technology(拉贾克西希大学工程与技术学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 RecurGuard通过监控推理轨迹的重复率、体积增长和查询进展三个信号,实时检测并阻止推理令牌消耗攻击,在DS-R1-Qwen-7B上对OverThink和ExtendAttack的检测率分别达99%和92%,且误报率接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09180 2026-06-09 cs.CV 新提交 50%

Claude Code-Driving Scenario Mining for the Argoverse 2 Challenge

Claude Code驱动的Argoverse 2挑战赛场景挖掘

Wei Deng, Caoshengzhe Xue, Shuaikun Liu, Zhaohong Liu, Mengshi Qi, Huadong Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 代码生成 :code generation(abstract)

AI总结 提出四阶段管道:Claude Code自主生成代码、迭代训练集筛选、语义代码审查和场景级验证,用于Argoverse 2场景挖掘挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2606.07889 2026-06-09 cs.LG cs.AI cs.CL 新提交 82%

Strained Coherence: A Pre-Failure Signal in Coding Agent Execution Trajectories

应变连贯性:编码代理执行轨迹中的故障前信号

Marut Pandya, Kasey Zhang, Baiqing Lyu

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08500 2026-06-09 cs.SE cs.AI 新提交 62%

Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey

通过发起野生的代码理解之旅来投射SWE代理新兴思维模式

Zhengyi Zhuo, Yan Liu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07682 2026-06-09 cs.SE cs.AI 新提交 62%

SWE-Marathon: Can Agents Autonomously Complete Ultra-Long-Horizon Software Work?

SWE-Marathon: 智能体能否自主完成超长时程软件工作?

Rishi Desai, Jesse Hu, Joan Cabezas, Neel Harsola, Pratyush Shukla, Roey Ben Chaim, Adnan El Assadi, Omkaar Mukund Kamath, Fenil Faldu, Prannay Hebbar, Jiankai Sun, Yiyuan Li, Pramod Srinivasan, Ishan Gupta, Christopher Settles, Daniel Wang, Derek Chen, Pranav Raja, Albert Liu, Marek Šuppa, Nevasini Sasikumar, Luyang Kong, Erik Quintanilla, Xiangyi Li, Ivan Bercovich, Steven Dillmann

机构 * Abundant Zenity Harvard University(哈佛大学) University of Waterloo(滑铁卢大学) Gujarat Technological University(古吉拉特技术大学) Warping Stanford University(斯坦福大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Independent(独立) Refresh Soleda AI Near AI Georgia Tech(佐治亚理工学院) Comenius University in Bratislava(布拉迪斯拉发Comenius大学) UC San Diego(圣地亚哥大学) BenchFlow UC Santa Barbara(圣巴巴拉大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 提出SWE-Marathon基准,包含20个超长时程任务,平均消耗2720万token,评估智能体在规划、长上下文理解和记忆方面的能力,当前前沿编码智能体解决率低于30%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 3 篇

2606.08433 2026-06-09 cs.CR cs.AI 新提交 61%

AI Code Sandboxes: A Comparative Security Study. Part 1 of 2 -- Engine-Level Properties (Attack Surface, Leakage, Stackability, CVE History, Patch Cadence, Fuzzing)

AI 代码沙箱:比较安全研究。第 1 部分(共 2 部分)——引擎级属性(攻击面、泄露、可堆叠性、CVE 历史、补丁节奏、模糊测试)

George Andronchik, Pavel Lokhmakov

机构 * orbitalab.dev(orbitalab实验室) fellows.tech(fellows技术)

专题命中 程序修复 :repository(abstract,comments);分类 cs.AI

AI总结 本文通过六项引擎级测量,比较五种 AI 沙箱产品隔离访客代码与主机内核的能力,发现引擎类在架构轴上清晰分离,但产品内无差异;补丁策略是主要操作变量;模糊测试投资分为三层,最强组合(微VM × 持续公共模糊测试)空缺。

Comments 61 pages, 7 figures, 33 tables; Part 1 of 2; companion code repository (Apache-2.0): https://github.com/orbitalab/RnD-ai-sandboxes-sec-study-part-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09738 2026-06-09 cs.CV 新提交 50%

HDSL: A Hierarchical Domain-Specific Language for Structured 3D Indoor Scene Generation and Localized Editing with LLM Agents

HDSL:一种用于结构化3D室内场景生成和基于LLM智能体局部编辑的层次化领域特定语言

Letian Li, Chao Shen, Shuzhao Xie, Chenghao Gu, ZhengXiao He, Yu Meng, Xin Yang, Wenyuan Jiang, Zhi Wang

机构 * SIGS, Tsinghua University(清华大学深圳国际研究生院) Nankai University(南开大学) University of Arizona(亚利桑那大学) Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 程序修复 :program repair(abstract)

AI总结 提出HDSL语言,以树结构表示室内场景,结合LLM智能体生成、多模态检索和力导向布局优化,实现结构化场景生成与局部编辑,显著提升对象覆盖率和编辑效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08760 2026-06-09 quant-ph physics.comp-ph 新提交 50%

Visual-to-Code Authoring, Tensor-Network Debugging, and Quantum-Circuit Inspection Tools in Python

Python中的可视化到代码创作、张量网络调试和量子电路检查工具

Alejandro Mata Ali

专题命中 程序修复 :code generation(abstract)

AI总结 提出三个互补包:张量网络可视化、张量网络编辑器和量子电路绘制器,分别用于视觉调试、可视化到代码创作和电路检查,以增强张量网络和量子电路的结构可见性和可编辑性。

Comments 15 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2606.08588 2026-06-09 cs.SE 新提交 57%

LLM vs. Human Unit Tests: Fault Detection on Real Python Bugs

LLM vs. 人类单元测试:对真实 Python 错误的故障检测

Phouvadeth Vathana, Prapti Bhatt, Rishi Patel, Nasir U. Eisty

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 通过对比 LLM 生成与人工编写的单元测试在真实 Python 错误上的故障检测能力,发现 LLM 结合检索增强上下文可检测 69% 的故障,远超人工测试的 17.2%,且代码覆盖率相近,表明覆盖率不足以衡量故障检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 4 篇

2606.09800 2026-06-09 cs.SE cs.AI cs.MA 新提交 62%

FASE: Fast Adaptive Semantic Entropy for Code Quality

FASE: 用于代码质量的快速自适应语义熵

Shizhe Lin, Ladan Tahvildari

机构 * University of Waterloo(滑铁卢大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08840 2026-06-09 cs.AI cs.SE 新提交 62%

Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

超越通过率:开放代码大语言模型的多语言、执行基础评估

Sayed Erfan Arefin

机构 * Sayed Erfan Arefin

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 针对12种编程语言的2707道LeetCode问题,评估9个开放代码LLM,发现最佳模型Yi-Coder-9B-Chat的正确率仅23.64%,远低于人类57.2%的基准,且排名因问题难度和语言而异,编译错误占失败原因的63.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08976 2026-06-09 cs.AI 新提交 57%

RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

RTL-BenchLS:面向大语言模型的RTL推理与生成的大规模基准

Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出大规模基准RTL-BenchLS,包含超1万个形式验证的Verilog设计,并引入三项自监督推理任务,解决现有基准规模小、任务单一的问题,评估显示当前最佳模型性能较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07851 2026-06-09 physics.med-ph 新提交 50%

ULMShare: A Large-Scale In Vivo Ultrasound Localization Microscopy Dataset for Microvascular Imaging

ULMShare:用于微血管成像的大规模体内超声定位显微镜数据集

Brice Rauby, Nin Ghigo, Gerardo Ramos-Palacios, Alexis Leconte, Stephen A. Lee, Alice Wu, Paul Xing, Oleksandra Gulenko, Louis Caron, Antoine Malescot, Eric Martineau, Jonathan Porée, Maxime Gasse, Ravi L. Rungta, Abbas F. Sadikot, Jean Provost

专题命中 代码评测 :repository(abstract)

AI总结 本文介绍ULMShare,一个包含99次全脑经颅超声定位显微镜采集的开放数据集,旨在为微血管成像方法开发、验证和基准测试提供标准化资源。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 4 篇

2606.07611 2026-06-09 cs.IR cs.AI cs.LG cs.SE 新提交 82%

MIRAGE: Metadata-Integrated Repository Analysis and Guided Enhancement for MSR Datasets

MIRAGE:面向MSR数据集的元数据集成仓库分析与引导增强

Aabia Ather, Muhammad Usayd Ather, Qurat-Ul-Ain Somroo, Muhammad Khuram Shahzad

机构 * SEECS, NUST(软件工程系,努斯兰大学)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 提出通过元数据丰富化、FAIR评估和主题驱动分析改进MSR数据集分析的方法,扩展了数据集目录并揭示了仓库站点和格式对引用与可用性的影响。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08970 2026-06-09 cs.AI 新提交 57%

An Effective Router for Vision-Language Model Selection

一种有效的视觉-语言模型选择路由器

Can Wang, Shengwei Wang, Bolin Zhang, Zhiying Tu, Dianhui Chu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 针对视觉-语言模型(VLM)选择中数据缺乏、特征表示无效和模型空间僵化的问题,提出ARMS路由器,通过增强输入信号和扩展训练策略,在分布内和分布外测试集上表现优异,仅800M参数即可超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08944 2026-06-09 cs.AR cs.PL 新提交 57%

LongRTL: Graph-Similarity-Guided LLM-driven Long Context RTL Optimization

LongRTL:基于图相似性的LLM驱动的长上下文RTL优化

Yuyang Ye, Che-Kuan Shen, Xiangfei Hu, Yuchen Liu, Shuo Yin, Xufeng Yao, Bei Yu, Tsung-Yi Ho

专题命中 仓库级理解 :code generation(abstract);分类 cs.PL

AI总结 提出一种基于图相似性的LLM驱动RTL优化框架,通过分区、优化和重构三个智能体解决长上下文RTL代码的优化问题。

Comments 7 pages, 6 figures, 5 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08860 2026-06-09 cs.CV 新提交 50%

Vision-Language Work Zone Intelligence for Safety-Critical Speed Regulation of Mixed-Autonomy Vehicles in Dynamic Environments

面向动态环境中混合自主车辆安全关键速度调节的视觉语言工作区智能

Angel Martinez-Sanchez, Kianna Ng, Wesley Maia, Laura Fleig, Maitrayee Keskar, Erika Maquiling, Yash Tandon, Parthib Roy, Mohan Trivedi, Ross Greer

机构 * UC Merced(加州大学默塞德分校) Johns Hopkins(约翰霍普金斯大学) UC San Diego(加州大学圣地亚哥分校)

专题命中 仓库级理解 :repository(abstract)

AI总结 提出一种实时车载感知管线,通过目标检测与语义验证融合及滞后状态转换,从视觉标志中识别临时工作区限速,在低成本硬件上实现96.5%召回率和68.7%精确率。

详情

展开后加载摘要…

URL PDF HTML 收藏