arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-04 至 2026-08-04 共收录 26 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 12 篇

2604.23488 2026-08-04 cs.LG 版本更新 79%

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation

合成轨迹反映真实的奖励黑客行为吗?对监控真实世界代码生成中黑客行为的系统研究

Lichen Li, Hengguang Zhou, Yijun Liang, Tianyi Zhou, Cho-Jui Hsieh

机构 * Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) Arena University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(莫莫迪 bin Zayed 人工智能大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 本文研究合成轨迹与真实世界中代码生成奖励黑客行为的差异,通过对比监控器在合成与真实数据上的表现,发现合成数据训练的监控器无法泛化到真实黑客行为,而真实数据训练的监控器对未见过的黑客类型更具泛化能力。

Comments Corrected a typo in the title; no other changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10880 2026-08-04 cs.CV 版本更新 78%

Chart Specification: Structural Representations for Incentivizing VLM Reasoning in Chart-to-Code Generation

图表规范:用于促进VLM在图表到代码生成中推理的结构表示

Minggui He, Mingchen Dai, Jian Zhang, Yilun Liu, Shimin Tao, Pufan Zeng, Osamu Yoshie, Yuya Ieiri

机构 * Waseda University(早稻田大学) University of Science and Technology of China(中国科学技术大学) NanKai University(南开大学)

专题命中 代码生成 :code generation(title,abstract)

AI总结 本文提出图表规范,通过结构化中间表示提升VLM在图表到代码生成中的结构保真度,实验显示其在数据效率和性能上优于现有方法。

Comments Accepted by Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27964 2026-08-04 cs.SE cs.AI 版本更新 73%

Specification-Guided Synthesis of Deadlock-Free Communication Protocol Refinements with Large Language Models

基于大语言模型的、由规范引导的无死锁通信协议精化合成

Yang Li, Ping Hou, Nobuko Yoshida

专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出Syntropy框架,结合多方会话类型规范与大语言模型合成无死锁通信协议精化,经评估其有效性达95.6%-99.5%,可生成多样且语法正确的协议精化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07086 2026-08-04 cs.SE cs.AI cs.CL 版本更新 67%

RAG Strategies for Natural Language-Based SQL Query and REST API Call Generation

评估用于基于自然语言的SQL和API调用生成的检索增强生成变体

Tim Schlippe, Simon Martin, Michael Marketsmüller

机构 * IU International University of Applied Sciences(国际应用科学大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文评估了三种RAG变体在生成SQL和API调用任务中的性能,发现CoRAG在混合文档环境下表现最佳,检索策略设计对自然语言接口至关重要。

Comments preprint of conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20639 2026-08-04 cs.CL cs.AI cs.LG 版本更新 67%

Latent Collaboration in Multi-Agent Systems

多智能体系统中的潜在协作

Jiaru Zou, Ruizhong Qiu, Gaotang Li, Xiyuan Yang, Katherine Tieu, Pan Lu, Ke Shen, Hanghang Tong, Yejin Choi, Jingrui He, James Zou, Mengdi Wang, Ling Yang

机构 * University of Washington(华盛顿大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。

Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25333 2026-08-04 cs.SE cs.AI cs.DC cs.OS 版本更新 62%

Specula: Scaling formal specifications for autonomous model checking of system code

Specula:扩展用于系统代码自主模型检查的形式规范

Qian Cheng, Saad Mohammad Rafid Pial, Ruize Tang, Yiming Su, Emilie Ma, Finn Hackett, Ivan Beschastnikh, Yu Huang, Tianyin Xu

专题命中 代码生成 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 Specula利用大语言模型编码代理为系统代码生成形式规范,通过自我进化循环解决LLM技术局限,实现自主模型检查,应用于48个开源项目发现众多错误,消除形式方法应用障碍,助力系统代码验证。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31650 2026-08-04 cs.LG cs.AI 版本更新 62%

ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL

ECHO: 在智能体强化学习中通过选择性回合记忆进行剪枝行动与追踪学习

Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Baidu Inc.(百度公司) University of Science and Technology of China(中国科学技术大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出ECHO框架,通过选择性回合记忆和源索引重建解决长程智能体强化学习中的历史崩溃与可追踪学习问题,在BrowseComp-Plus上达到43.4%准确率,优于GRPO和SUPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14581 2026-08-04 cs.LG cs.AI 版本更新 62%

CARE: Context-Aware Ranking Evolution with Executable Scoring Programs for Budgeted Reaction Optimization

CARE:通过科学实验中的可审计证据审查控制LLM生成的策略

Guanyu Liu, Weiyi Kong, Chao Tang, Zeyu Wang, Boer Zhang, Baiqing Li, Peiyu Zhang, Tianyu Shi

机构 * University of Macau(澳门大学) University of Toronto(多伦多大学) UCLA(加州大学洛杉矶分校) Harvard University(哈佛大学) XtalPi(晶泰科技) McGill University(麦吉尔大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG

AI总结 提出CARE框架,通过可审计的干预门控机制,在保留非LLM优化器作为默认路径的同时,利用LLM修正挑战者排序策略,显著提升高通量实验优化性能。

Comments 27 pages, 5 figures. Code: https://github.com/SHITIANYU-hue/care

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30359 2026-08-04 cs.NE cs.DC cs.LG cs.PF cs.SE cs.SY eess.SY 版本更新 62%

Kernel Foundry: A Diagnosis-driven Evolutionary Kernel Optimizer with Multi-Experts

Kernel Foundry:一种基于诊断的多专家进化内核优化器

Zixuan Huang, Da Chen, Kecheng Huang, Lihao Yin, Xing Li, Huiling Zhen, Mingxuan Yuan, Zili Shao

机构 * The Chinese University of Hong Kong(香港中文大学) Noah’s Ark Lab, Huawei Hong Kong(华为香港诺亚实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 提出Kernel Foundry,一种结合专家引导初始化、多岛进化搜索和结构化诊断反馈的自动GPU内核优化框架,显著提升正确性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15607 2026-08-04 cs.CL cs.LG 版本更新 62%

Syntax Without Semantics: Teaching Large Language Models to Code in an Unseen Language

无语义的语法:教大语言模型在未见过的语言中编程

Vinayshekhar Bannihatti Kumar, Disha Makhija, Manoj Ghuhan Arivazhagan, Rashmi Gangadharaiah

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨大语言模型在未见过的语言中生成代码的能力,发现微调仅能教授语法而无法转移语义能力,揭示了推理与语言实现之间的鸿沟。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20402 2026-08-04 cs.SE 版本更新 57%

CIgrate: Automating CI Service Migration with Large Language Models

CIgrate:利用大语言模型自动化持续集成服务迁移

Md Nazmul Hossain, Taher A. Ghaleb

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文提出基于大语言模型(LLM)的CI配置迁移框架CIgrate,经对比实验,其性能显著优于现有基于规则的方法CIMig,为CI配置迁移提供了更实用准确的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29239 2026-08-04 cs.CR 版本更新 50%

Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors

打破舍入陷阱:保护LLM免受量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

专题命中 代码生成 :code generation(abstract)

AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2607.15854 2026-08-04 cs.SE cs.AI 版本更新 73%

Agentic Synthesis against Counterexample-Supplemented Sketches

针对反例补充草图的智能合成

Muness Castle, Eric Rubeck

机构 * Independent(独立研究者)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对编码智能体修复失败示例易留隐患的问题,提出针对反例补充草图的智能合成方法,通过人类给出草图、智能体生成实现,依据反例修正并保留代码,经实验验证该方法能减少返工,承载审查策略。

Comments 32 pages, 5 displayed figures (4 distinct screenshots). Includes the CatSynth artifact supplement. Code and captured experiment artifacts: https://github.com/open-horizon-labs/counterexample-supplemented-sketches Clarifies the two-check CESS method and Developer change authority; adds the protocol-correct CatSynth rerun and replaces the prior withheld-case headline

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14061 2026-08-04 cs.SE 版本更新 70%

LLM Agents Can See Code Repositories

LLM智能体能够查看代码仓库

Dongjian Ma, Silin Chen, Yufei Yang, Yuling Shi, Yanfu Yan, Xiaodong Gu

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。

Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03618 2026-08-04 cs.AI 版本更新 57%

Cross-Lingual Token Arbitrage: Optimizing Code Agent Context Windows via Local LLM Preprocessing

跨语言令牌套利:通过本地LLM预处理优化代码智能体上下文窗口

Mehmet Utku Colak

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种预处理的边缘端提示重写中间件,利用本地Llama 3.2模型进行跨语言翻译和结构重写,在保持或提升任务准确率的同时减少34-47%的提示令牌和最高18.8%的总令牌消耗。

Comments Updated References

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24600 2026-08-04 cs.AI 版本更新 57%

Agent-as-Peer-Debriefer: A Multi-Agent Framework with Perspective-Based Refinement for Qualitative Analysis

Agent-as-Peer-Debriefer: 一种基于视角精炼的多智能体定性分析框架

Zhimin Lin, Kun Cheng, Zhiyao Shu, Junhua Fang, Juntao Li, Fan Bai, Jie Gao

机构 * Soochow University(苏州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出一种多智能体框架,通过模拟同行汇报(peer debriefing)并引入理论驱动、数据驱动和应用三种分析视角,提升大语言模型在定性数据分析中的编码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29007 2026-08-04 q-bio.QM 版本更新 50%

EasyBCI Agent: Towards Universal Neural Data Preprocessing for Brain-Computer Interfaces

EasyBCI Agent:面向脑机接口的通用神经数据预处理

Yu Zhu, Runkai Zhao, Zhimin Zhou, Jinyu Cai, Zhouheng Yao, Chutian Zhang, Peiyuan Li, Xiaoxing Zhang, Qihao Zheng, Jiamin Wu, Mianxin Liu, Chi Zhang, Bin Min, Lei Bai, Chengyu Li, Jingpeng Wu, Chunfeng Song

专题命中 软件智能体 :coding agent(abstract)

AI总结 EasyBCI是两阶段大语言模型智能体,可针对六种信号类型规划执行脑机接口预处理,经评估其在EEG任务中表现优于人工流程及通用编码智能体,可扩展至多模态并提升可复现性。

Comments 15 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2602.06090 2026-08-04 cs.SE cs.AI cs.CV 版本更新 86%

SVRepair: Structured Visual Reasoning for Automated Program Repair

SVRepair: 结构化视觉推理用于自动化程序修复

Jincheng Wang, Liwei Luo, Xiaoxuan Tang, Jingxuan Xu, Sheng Zhou, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团) Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems(浙江可感知智能系统重点实验室)

专题命中 程序修复 :program repair(title,abstract);repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 SVRepair 通过结构化视觉表示框架,结合多模态信息提升程序修复的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21930 2026-08-04 cs.SE 版本更新 57%

PITMuS: A Tool for Automated Bug Dataset Generation via Source-Level Mutant Reconstruction

PITMuS: 通过源级变异体重建实现自动化bug数据集生成工具

Tasfia Tasnim, Soneya Binta Hossain

专题命中 程序修复 :program repair(abstract);分类 cs.SE

AI总结 本文提出PITMuS工具,通过源级变异体重建生成自动化bug数据集,解决现有工具生成的变异体难以复现和利用的问题,为bug定位和修复技术提供结构化数据支持。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 2 篇

2604.23509 2026-08-04 cs.SE 版本更新 79%

Uncovering Business Logic Bugs via Semantics-Driven Unit Test Generation

通过语义驱动的单元测试生成揭示业务逻辑错误

Chen Yang, Junjie Chen

专题命中 测试生成 :unit test generation(title,abstract);分类 cs.SE

AI总结 本文提出SeGa方法,通过语义知识库生成单元测试以发现业务逻辑错误,实验显示其在检测错误数量和精度提升方面优于现有技术。

Comments Accepted in the Research Track of ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10628 2026-08-04 cs.SE 版本更新 57%

On the Diffusion of Test Smells in LLM-Generated Unit Tests

论LLM生成的单元测试中测试异味的扩散

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Xunzhu Tang, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 测试生成 :unit test generation(abstract);分类 cs.SE

AI总结 本研究通过多基准大规模分析,对比LLM生成、人类编写及EvoSuite生成的单元测试,发现LLM生成测试存在特定测试异味,受提示策略等影响,凸显基于LLM的测试生成的潜力与风险,呼吁开发相关优化方案。

Comments Accepted at Transactions on Software Engineering and Methodology (TOSEM) journal on 31 July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 4 篇

2509.23422 2026-08-04 astro-ph.IM physics.ins-det 版本更新 82%

Cryogenic Materials Repository: A Public Resource and New Measurements for Cryogenic Research Applications

低温材料库:用于低温研究应用的公共资源及新测量数据

Henry E. Nachman, Oorie Desai, Nicholas Galitzki, Daniel Lee, JB Lloyd, Tannishtha Nandi, Ani Pagni, Ray Radebaugh, Elle C. Shaw

专题命中 仓库级理解 :repository(title,abstract)

AI总结 该研究开发了公共GitHub低温材料库(CMR),提供亚开尔文热导率测量数据,支持各学科研究人员设计评估低温系统,服务于宇宙学、天体物理望远镜等低温研究应用。

Journal ref IEEE Transactions on Applied Superconductivity, Volume 36 , Issue 6, September 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08645 2026-08-04 cs.CL 版本更新 57%

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22935 2026-08-04 cs.CR cs.SE 版本更新 57%

SPFinder: Improving the Context Length and Scalability for Tracing Known Vulnerability Patches

SPFinder:提升已知漏洞补丁追踪的上下文长度与可扩展性

Jiangrui Zheng, Xueqing Liu, Guanqun Yang, Siyan Wen, Qiushi Liu, Xiaoyin Wang

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 SPFinder是一种用于追踪已知漏洞补丁的可扩展检索框架,通过分层嵌入和三阶段检索解决长上下文与可扩展性问题,在多数据集评估中优于现有方法,可实用关联CVE补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18062 2026-08-04 cs.SE 版本更新 57%

An Empirical Study of Complexity, Heterogeneity, and Compliance of GitHub Actions Workflows

GitHub Actions工作流的复杂性、异质性与合规性的实证研究

Edward Abrokwah, Taher A. Ghaleb

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究分析Java、Python、C++仓库的GitHub Actions工作流,量化其复杂性、异质性与合规性,发现工作流设计依赖生态惯例,为该领域提供了可复现的实证基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 程序分析与验证 1 篇

2605.03822 2026-08-04 cs.SE cs.CR 版本更新 57%

KVerus: Scalable and Resilient Formal Verification Proof Generation for Rust Code

KVerus:面向Rust代码的可扩展且高鲁棒性的形式化验证证明生成工具

Yuwei Liu, Xinyi Wan, Yanhao Wang, Minghua Wang, Lin Huang, Tao Wei

专题命中 程序分析与验证 :repository(abstract);分类 cs.SE

AI总结 KVerus是适配Rust代码的形式化验证工具,通过自适应范式与动态知识库,在单文件、仓库级基准及Rust内核验证中均优于现有方案,为形式化验证的规模化应用提供了关键进展。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏