arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-06 至 2026-08-06 共收录 15 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2510.00501 2026-08-06 cs.SE 版本更新 79%

CodeChemist: Test-Time Scaling for Low-Resource Code Generation via Functional Knowledge Transfer

CodeChemist:通过测试时扩展实现低资源代码生成的功能知识迁移

Kaixin Wang, Tianlin Li, Xiaoyu Zhang, Aishan Liu, Xianglong Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou, and Bin Shi

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 提出CodeChemist框架,通过合成测试用例将模型功能知识从高资源语言迁移到低资源语言,无需训练,显著提升低资源语言代码生成性能。

Comments This paper is accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20690 2026-08-06 cs.CL 版本更新 70%

Learning to Detect UI Principle Violations via Reinforcement Learning

通过强化学习学习检测用户界面原则违规

Nishi Mehta, Swathi Alse, Himani Kumawat, Yue Yu, Pratik Jayarao

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.CL

AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02323 2026-08-06 cs.SE 版本更新 57%

ECLAIR: A Causally-Grounded AI Framework for Scientific Discovery in Empirical Software Engineering

ECLAIR:一种用于实证软件工程科学发现的因果基础AI框架

Alejandro Velasco, Daniel Rodriguez-Cardenas, Dipin Khati, David N. Palacio, Denys Poshyvanyk

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 该研究提出因果基础AI框架ECLAIR,将LLMs整合到软件工程科学过程各阶段,通过案例研究揭示提示设计对LLMs代码生成准确率的影响,为AI辅助软件工程实证研究提供方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03808 2026-08-06 cs.CV cs.LG 版本更新 57%

From Brute Force to Semantic Insight: Performance-Guided Data Transformation Design with LLMs

从暴力到语义洞察:基于LLM的性能引导数据转换设计

Usha Shrestha, Dmitry Ignatov, Radu Timofte

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg(计算机视觉实验室、CAIDAS与IFI、乌尔姆大学)

专题命中 代码生成 :repository(abstract);分类 cs.LG

AI总结 本文提出了一种基于LLM的性能引导数据转换设计方法,通过经验反馈实现闭环优化,减少穷举搜索需求,提升代码生成的准确性与任务对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2604.00073 2026-08-06 cs.SE cs.AI cs.CL 版本更新 67%

Terminal Agents Suffice for Enterprise Automation

终端代理足以实现企业自动化

Patrice Bechard, Orlando Marquez Ayala, Emily Chen, Jordan Skelton, Sagar Davasam, Srinivas Sunkara, Vikas Yadav, Sai Rajeswar

机构 * Mila -- Quebec AI Institute(Mila — 魁北克人工智能研究所)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文探讨终端代理通过直接调用平台API在企业自动化中表现优异,证明简单接口结合强大基础模型足以替代复杂代理架构。

Comments Pre-print. Under review. 51 pages, 6 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2605.13138 2026-08-06 cs.SE cs.CR cs.LG 版本更新 62%

A Comprehensive Evaluation of Code Language Models for Security Patch Detection

以代码为中心的漏洞修复提交检测:一个统一的基准和实证研究

Nils Loose, Joseph Bienhüls, Kristoffer Hempel, Felix Mächtle, Thomas Eisenbarth

机构 * University of Lübeck(吕贝克大学) University of Lübeck Institute for IT Security(吕贝克大学信息安全部)

专题命中 程序修复 :repository(abstract);分类 cs.SE、cs.LG

AI总结 本文通过统一框架评估了基于代码语言模型的漏洞修复提交检测,发现仅依赖代码变更无法让模型获得可转移的安全相关代码理解,且在去除提交信息后,增加内过程语义上下文也无法使模型关注代码变更,性能受数据分布和时间分割影响显著。

Comments Accepted at ASE26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25465 2026-08-06 cs.SE 版本更新 57%

BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions

BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力

Yinghang Ma, Jiho Shin, Leuson Da Silva, Zhen Ming, Jiang, Song Wang, Foutse Khomh, Shin Hwei Tan

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。

Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 3 篇

2607.28545 2026-08-06 cs.CL cs.AI cs.SE 版本更新 67%

ORCA-bench: How Ready Are Language Model Agents for Oncall?

ORCA-bench:语言模型智能体的值班待命准备程度如何?

Albert Gong, Kyuseong Choi, Abhineet Agarwal, Jason Schechner, Ryan Huang, Raj Agrawal, Anish Agarwal, Raaz Dwivedi

机构 * Cornell Tech(康奈尔科技学院) Traversal Columbia University(哥伦比亚大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 该研究推出ORCA-bench基准,评估编码智能体在生产级值班待命场景下的根本原因分析能力,发现现有前沿智能体表现不佳,凸显其距离安全胜任生产可靠性工作仍有较大差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29677 2026-08-06 cs.AI 版本更新 57%

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

ExtractBench:模式引导的企业文档抽取基准

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 研究针对企业文档模式引导抽取的评估需求,构建首个同时评估值准确率等多指标的基准ExtractBench,发现LlamaExtract Agentic Plus在成本远低于编码智能体的情况下,准确率可与之媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17529 2026-08-06 cs.SE 版本更新 57%

Automated Logging Is Language-Sensitive: A Multilingual Benchmark and Empirical Study of LLMs

单语言证据不足以支持自动化日志记录:一个多语言基准和基于LLM的实证研究

Renyi Zhong, Yichen Li, Yulun Wu, Jinxi Kuang, Yintong Huo, Michael R. Lyu

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文通过多语言基准MultiLogBench研究自动化日志记录的跨语言有效性,发现框架锚点匹配是最敏感的组件,模型排名在顶级稳定,但需多语言验证以确保鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 5 篇

2605.12153 2026-08-06 cs.SE cs.AI 版本更新 73%

CIDR: A Large-Scale Industrial Source Code Dataset for Software Engineering Research

CIDR:一个大规模工业源代码数据集用于软件工程研究

Vladislav Savenkov

机构 * Fermatix AI

专题命中 仓库级理解 :repository(abstract,abstract_cn);分类 cs.SE、cs.AI

AI总结 CIDR是首个基于工业合作的大型源代码数据集,包含2440个仓库、138种语言和3.73亿行代码,支持代码智能、软件质量分析和语言模型预训练等研究。

Comments 60 pages, 13 figures, 8 appendices. Dataset access: https://fermatix.ai/#Contact. Anonymization tool: https://github.com/Fermatix/repo-sanitizer. Metadata utility: https://github.com/Fermatix/repo_metadata_cli

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12503 2026-08-06 cs.CL cs.AI 版本更新 62%

Topology-Aware Reasoning over Incomplete Knowledge Graph with Graph-Based Soft Prompting

基于拓扑的不完整知识图谱推理与图基软提示

Shuai Wang, Xixi Wang, Yinan Yu

机构 * Chalmers University of Technology and University of Gothenburg, Sweden(楚姆勒大学技术学院和哥德堡大学,瑞典) Technical University of Denmark, Kgs. Lyngby, Denmark(丹麦技术大学,基斯勒吕辛,丹麦)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于图的软提示框架,通过图神经网络编码子图生成软提示,使LLM在更丰富的结构上下文中推理,减少缺失边的影响,提升多跳KBQA性能。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00195 2026-08-06 cs.CR cs.AI cs.SE 版本更新 62%

Formal Analysis and Supply Chain Security for Agentic AI Skills

代理AI技能的正式分析与供应链安全

Varun Pratap Bhardwaj

机构 * Independent Research(独立研究)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SkillFortify是首个用于代理技能供应链的形式化分析框架,通过六大贡献提升安全性和检测效率。

Comments 32 pages, 5 theorems with full proofs, 68 references, open-source tool: https://github.com/qualixar/skillfortify

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10252 2026-08-06 cs.CR 版本更新 50%

Bridging Source Code and Bytecode for Smart Contract Vulnerability Detection via Dual-Perspective Cross-Modal Distillation

ExDoS:专家引导的双焦点跨模态蒸馏用于智能合约漏洞检测

Ye Tian, Yifan Jia, Yanbin Wang, Jianguo Sun, Haitao Xu, Xin Wang, Zhihua Fu

专题命中 仓库级理解 :code model(abstract)

AI总结 本文提出ExDoS方法,通过双焦点蒸馏框架,从源代码到字节码转移语义知识,提升智能合约漏洞检测的细粒度对齐与识别能力。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07358 2026-08-06 q-fin.PM math.OC q-fin.PR 版本更新 50%

Variable annuities: A closer look at ratchet guarantees, hybrid contract designs, and taxation

可变年金:深入审视棘轮担保、混合合约设计与税收

Jennifer Alonso-Garcia, Len Patrick Dominic M. Garces, Jonathan Ziveyi

专题命中 仓库级理解 :repository(abstract)

AI总结 本文研究含最低提款保障、棘轮机制与现金基金的可变年金合约,通过反向动态规划分析投保人最优策略,揭示税收、现金基金与棘轮机制的相互作用,发现二者均提升合约估值、抑制提前退保与主动提款,高税率时需同时包含以刺激需求。

Comments 36 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏