arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-07 至 2026-07-07 共收录 12 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 1 篇

2606.28998 2026-07-07 cs.SE cs.AI 版本更新 76%

Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation

从预训练或微调的大语言模型进行无奖励代码对齐:揭示代码生成中的权衡

Sanjeepan Sivapiran, Gias Uddin

机构 * York University Canada(加拿大约克大学)

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI

AI总结 本研究通过实证分析,探讨了在代码生成任务中,对预训练或微调后的大语言模型进行无奖励对齐(DPO和BoNBoN)的效果,发现预训练到对齐的路径提升更大,但微调版本基线更高。

Journal ref The ACM International Conference on the Foundations of Software Engineering (FSE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2603.02510 2026-07-07 cs.LG cs.DC cs.NE cs.PF 版本更新 57%

ParEVO: Synthesizing Code for Irregular Data: High-Performance Parallelism through Agentic Evolution

ParEVO:为不规则数据合成代码:通过智能进化实现高性能并行

Liu Yang, Zeyu Nie, Andrew Liu, Felix Zou, Deniz Altinbüken, Amir Yazdanbakhsh, Quanquan C. Liu

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) Google DeepMind(谷歌DeepMind)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 针对不规则数据并行计算难题,ParEVO框架通过构建数据集、微调模型及进化编码代理,合成高性能并行算法,在基准测试中加速显著,优于商业模型及专家基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22956 2026-07-07 cs.SE 版本更新 57%

SWE-Manager: Selecting and Synthesizing Golden Proposals Before Coding

SWE-Manager:编码前选择并合成黄金方案

Boyin Tan, Haoning Deng, Junyuan Zhang, Junjielong Xu, Pinjia He, Youcheng Sun

专题命中 软件智能体 :code generation(abstract);分类 cs.SE

AI总结 研究软件工程中提案选择问题,引入SWE-Manager方法,通过强化学习训练8B模型进行提案比较、选择及合成黄金方案,在基准测试中表现优异,并设计框架评估其在实际问题解决中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 3 篇

2605.03117 2026-07-07 cs.SE cs.AI 版本更新 88%

ARISE: A Repository-level Graph Representation and Toolset for Agentic Program Repair and Fault Localization

ARISE:面向智能体程序修复与故障定位的仓库级图表示及工具集

Shahd Seddik, Fahd Seddik, Amirrezza Esmaeili, Mahdieh Sadatbenis, Fatemeh Fard

专题命中 程序修复 :program repair(title,abstract);repository(title,abstract);分类 cs.SE、cs.AI

AI总结 针对现有图智能体缺乏过程内数据流建模的问题,提出多粒度程序图工具集ARISE,支持语句级数据流切片查询,大幅提升智能体故障定位与程序修复性能。

Comments v2: extended analysis, more experiments, additional authors added

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01827 2026-07-07 cs.SE 版本更新 79%

PSearch: Search-based Patch Generation in the Era of LLM-based Automated Program Repair

PSearch:基于大语言模型的自动程序修复时代中基于搜索的补丁生成

Haichuan Hu, Ye Shang, Weifeng Sun, Quanjun Zhang

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 针对现有基于大语言模型的自动程序修复方法靠试错生成补丁、难以有效评估搜索方向潜力和分配预算的问题,提出Psearch框架,以迭代补丁评估和优化为核心,能集成不同搜索算法,实验证明其有效性。

Comments accepted to ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20412 2026-07-07 cs.SE cs.AI cs.OS 版本更新 62%

kAgent: An execution-guided crash resolution agent for the Linux kernel

kAgent:一种用于Linux内核的执行引导式崩溃修复代理

Alex Mathai, Chenxi Huang, Suwei Ma, Jihwan Kim, Hailie Mitchell, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Junfeng Yang, Baishakhi Ray

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Google Inc.(谷歌公司) Google DeepMind(谷歌DeepMind)

专题命中 程序修复 :program repair(abstract);分类 cs.SE、cs.AI

AI总结 研究针对Linux内核崩溃修复难题,以内核开发者修复方式为灵感构建kAgent及支持工具栈,通过检查日志等步骤修复崩溃,消融特性定量分析,评估显示其能有效修复多种崩溃。

Comments Accepted to ICML, 2026; in the Deep Learning for Code Workshop. This paper was previously circulated as "CrashFixer"

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 2 篇

2501.11086 2026-07-07 cs.SE cs.AI 版本更新 62%

Evaluating LLM-Based Regression Test Generation

基于大语言模型的回归测试生成评估

Jing Liu, Seongmin Lee, Eleonora Losiouk, Marcel Böhme

机构 * MPI-SP(Max Planck Institute for Software Process Engineering) University of California at Los Angeles(加州大学洛杉矶分校) University of Padua(帕多瓦大学)

专题命中 测试生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究利用大语言模型为特定程序即时生成回归测试,将其作为机器翻译任务,通过对多个项目测试,反馈导向的零样本原型Cleverest表现良好,还探讨了提交消息对其效果的影响。

Comments 23 pages. Published in PACMSE Volume 3, Issue FSE. Artifact of Paper "Evaluating LLM-based Regression Test Generation": https://dl.acm.org/do/10.5281/zenodo.19616584

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15620 2026-07-07 cs.CY 版本更新 50%

Lost in Vagueness: Towards Context-Sensitive Standards for Robustness Assessment under the EU AI Act

迷失在模糊性中:迈向欧盟人工智能法案下稳健性评估的上下文敏感标准

Roberta Tamponi, Carina Prunkl, Thomas Bäck, Anna V. Kononova

专题命中 测试生成 :repository(abstract)

AI总结 研究欧盟人工智能法案下稳健性定义及评估方法不明问题,指出其依赖于多种因素,提出上下文敏感的多层标准化框架,减少解释负担等。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 2 篇

2606.07591 2026-07-07 cs.LG cs.AI cs.CL 版本更新 67%

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench: 端到端自主科学研究基准

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04136 2026-07-07 cs.AI 版本更新 57%

A Technical Survey of Reinforcement Learning Techniques for Large Language Models

大语言模型强化学习技术的技术综述

Saksham Sahai Srivastava, Vaneet Aggarwal

机构 * University of Georgia(佐治亚大学) Purdue University(普渡大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 2 篇

2602.16086 2026-07-07 cs.CV cs.LG 版本更新 57%

LGQ: Learnable Geometric Quantization for Image Tokenization

LGQ:用于图像令牌化的可学习几何量化

Idil Bilge Altun, Mert Onur Cakiroglu, Elham Buxton, Mehmet Dalkilic, Hasan Kurban

机构 * Luddy School of Informatics, Computing and Engineering, Indiana University Bloomington(印第安纳大学布卢明顿分校信息学、计算与工程学院) Department of Computer Science, University of Illinois Springfield(伊利诺伊大学斯普林菲尔德分校计算机科学系) College of Science and Engineering, Hamad Bin Khalifa University, Doha, Qatar(哈马德·本·卡伊夫大学多哈校区科学与工程学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 研究提出可学习几何量化(LGQ),保留可学习码本,通过温度退火进行软到硬分配,用两个低成本项正则化,无需EMA等防止码本崩溃,在图像任务中表现优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28489 2026-07-07 eess.IV cs.CV 版本更新 50%

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms

视频生成模型作为世界模型:高效的范式、架构和算法

Muyang He, Hanzhong Guo, Junxiong Lin, Yizhou Yu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。

详情

展开后加载摘要…

URL PDF HTML 收藏