arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-21 至 2026-08-21 共收录 20 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 9 篇

2608.19854 2026-08-21 cs.SE cs.AI 新提交 84%

Repo0: Design-Driven Zero-to-All Code Generation

Repo0:面向从零到全代码生成的设计驱动框架

Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan

专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 Repo0是面向从零到全代码生成的连续结构演化框架,通过Dual-DAG架构等技术,在RepoCraft数据集上相较RPG大幅提升了代码生成的功能覆盖率与通过率。

Comments Our code and data are available at this https URL (https://github.com/cslsolow/Repo0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19784 2026-08-21 cs.SE 新提交 79%

PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation

PRAXIS:面向领域代码生成的基于图的默会知识

Xue Jiang, Tianyu Zhang, Lingwei Wu, Ziyu Wang, Ge Li, Yuan Sui, Hao Zhu, Wenpin Jiao, Zhi Jin, Yihong Dong

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 PRAXIS框架通过模拟人类开发工作流提取代码依赖图上的默会知识,提升智能体领域代码生成性能,优于现有方法且可适配多种智能体框架与大语言模型

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14398 2026-08-21 cs.AI 版本更新 79%

ChronoAgentic: A Code-based Multi-Agent World Simulator for Physically Grounded Simulation Construction

编码智能体作为世界模拟器

Hongyu Wang, Jingquan Wang, Ashvin Anilkumar, Bocheng Zou, Radu Serban, Dan Negrut

机构 * Department of Mechanical & Aerospace Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校机械与航空航天工程系) School of Computer, Data, and Information Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机、数据与信息科学学院)

专题命中 代码生成 :coding agent(title);code generation(abstract);分类 cs.AI

AI总结 提出一个通过可执行模拟代码构建基于物理的世界模型的智能体框架,协调规划、代码生成、视觉审查和物理分析智能体,迭代修正代码以满足物理约束,在物理准确性、指令忠实度和视觉质量上超越视频模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08866 2026-08-21 cs.SE 版本更新 77%

ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS

ArkEval: 对ArkTS自动代码修复的基准测试与评估

Bang Xie, Senjian Zhang, Zhiyuan Peng, Wei Chen, Chenhao Ying, Yuan Luo

专题命中 代码生成 :code generation(abstract);program repair(abstract);repository(abstract);分类 cs.SE

AI总结 ArkEval为ArkTS自动代码修复提供首个全面基准,通过挖掘官方仓库问题并采用LLM测试机制,评估了四种先进模型的修复能力,揭示了LLM在该领域的现状与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19882 2026-08-21 cs.AI 新提交 57%

TESTNAV: Pareto-Guided Search for Compositional Robustness Testing

TESTNAV:面向组合鲁棒性测试的帕累托引导搜索

Arooj Arif, Tobias Hartung, Elena Botoeva, Alexandros Koliousis

机构 * Northeastern University London(伦敦东北大学) University of Kent(肯特大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 TESTNAV是帕累托引导的鲁棒性测试框架,采用NSGA-II近似双目标帕累托前沿,在四类跨模态基准上,以35.8%-89.3%的扰动空间实现比基线快2.15倍的帕累托前沿恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19752 2026-08-21 cs.SE 新提交 57%

A Fully Automated, Deployment-Aware Testing Pipeline for IoT-Based Automotive Applications

面向物联网汽车应用的全自动、感知部署的测试流水线

Denesa Zyberaj, Roman Vintonyak, Pascal Hirmer, Marco Aiello

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 针对物联网汽车应用的测试难题,提出结合LLM、VLM及人在回路机制的感知部署测试流水线,经CPDS案例验证可实现全需求覆盖与高准确率,适配OEM-供应商测试工作流。

Comments Submitted, accepted and presented at IoTBDS26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19463 2026-08-21 cs.LG 新提交 57%

LLM as Detector: An In-context Learning Approach for Tabular Anomaly Detection

作为检测器的大语言模型:一种用于表格异常检测的上下文学习方法

Tu Anh Hoang Nguyen, Dang Nguyen, Thuc Duy Le, Trung Le, Sunil Gupta

机构 * Applied Artificial Intelligence Initiative (A2I2), Deakin University(应用人工智能计划(A2I2),迪肯大学) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本研究提出LLM-Detector框架,利用LLM的上下文学习能力进行表格异常检测,在24个数据集上对比15个SOTA基线均获提升,且无需微调或神经网络训练,降低了计算成本。

Comments Accepted at International Conference on Neural Information Processing (ICONIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19009 2026-08-21 cs.CL 版本更新 57%

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

评估评估者:面向大语言模型推理的验证自主等级(L0-L5)

Yajie Yin

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 该研究提出验证自主等级(VAL)元标准,解决验证领域的等级概念混淆,明确不同验证方案的完备性边界,相关代码与评估材料已公开。

Comments v2: reproducibility study (kappa~0.8), agent-security case (PPMF), anchor semantics, 15+ fixes. Code and data: this https URL (https://github.com/1549080929-debug/math_agent) Keywords: LLM verification; verification autonomy; completeness; ground truth; trustworthy AI Writing and implementation assisted by an AI language model; all experiments, data, and research decisions are the author's own

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02710 2026-08-21 cs.LG 版本更新 57%

Maximum Likelihood Reinforcement Learning

最大似然强化学习

Fahim Tajwar, Guanning Zeng, Yueer Zhou, Yuda Song, Daman Arora, Yiding Jiang, Jeff Schneider, Ruslan Salakhutdinov, Haiwen Feng, Andrea Zanette

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 MaxRL是一种基于采样的强化学习框架,通过最大似然估计提升模型训练效率,实验显示其在多个任务中表现优于现有方法。

Comments ICML 2026. Project website: this https URL (https://zanette-labs.github.io/MaxRL/)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2608.19799 2026-08-21 cs.CL cs.SE 新提交 84%

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?

SWE-bench Science:编码智能体能解决科学领域的工程任务吗?

Zhipeng Xu, Jiahao Lu, Yining Zheng, Yuxin Wang, Xipeng Qiu

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.CL

AI总结 本研究推出SWE-bench Science基准,含20个领域98个仓库的119项任务,评估发现最优智能体pass@1低于50%,揭示科学软件工程的挑战,分析四类失败机制并经消融实验明确科学知识的作用,为编码智能体研究提供测试平台。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-21 cs.SE 版本更新 83%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20195 2026-08-21 cs.SE cs.AI cs.HC 新提交 81%

From Agent Behaviour to Agent-Friendly Documentation: An Empirical Study of How Coding Agents Discover, Read, and Write Technical Documentation

从智能体行为到智能体友好型文档:关于编码智能体如何发现、阅读和编写技术文档的实证研究

Zhijun Gao, Jing Chen

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本研究通过SWE-chat和AIDev两个数据集,揭示编码智能体的文档交互规律,发现面向智能体的制品占主导,文档与代码编辑关联弱,验证序列缺失,文档滞后代码,且"智能体友好型"文档的可操作性、可验证性缺乏行为支持。

Comments 14 pages, 1 figure, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19816 2026-08-21 cs.CY 新提交 50%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 软件智能体 :coding agent(abstract)

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2608.19347 2026-08-21 cs.SE 新提交 79%

Hype Meets Reality: Large Language Models as Mutators in Search-based Automated Program Repair of Simulink-Stateflow Models

炒作与现实的碰撞:大型语言模型作为基于搜索的Simulink-Stateflow模型自动化程序修复中的变异器

Ayesha Irshad, Pablo Valle, Jon Ayerdi, Aitor Arrieta

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 本文以Simulink/Stateflow建模的CPS为研究对象,扩展FlowRepair方法用LLM生成的变异替换部分算子,受控实验发现该方法大幅降低修复性能,分析指出盲目集成LLM到基于搜索的APR存在根本局限,需发展混合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2608.19626 2026-08-21 cs.SE 新提交 57%

Auditing and Decomposing Feedback-Driven Evolution in LLM Test Generation under the Oracle Problem

在神谕问题下对LLM测试生成中反馈驱动演化的审计与分解

Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni

专题命中 测试生成 :code model(abstract);分类 cs.SE

AI总结 该研究针对LLM测试生成中反馈驱动演化的神谕问题,通过多任务实验发现单一神谕会膨胀演化增益,提出审计-安慰剂协议以分离验证器人工制品等,为相关评估提供改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 4 篇

2608.20318 2026-08-21 cs.AI cs.CL cs.LG 新提交 67%

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement

AI4AI-Bench:用于递归自我改进算法设计中大语言模型智能体的基准测试

Yizhe Chi, Wenyi Li, Deyao Hong, Xiaoqiu Wang, Mingju Gao, Kaisen Yang, Bingxiang He, Youjie Zheng, Calvin Xiao, Qinhuai Na

机构 * Navers Lab(Navers实验室) Tsinghua University(清华大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AI4AI-Bench基准测试,测试大语言模型智能体设计训练算法的能力,实验显示现有智能体仅缩小了已有算法与最优值间不到五分之一的差距,发布相关资源供重复测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19380 2026-08-21 cs.CV 新提交 67%

CAViAR: A Causal Video Dataset for Fine-Grained Accident Reasoning in Real-World Scenarios

CAViAR:用于真实场景细粒度事故推理的因果视频数据集

Sparsh Garg, Yi-Wen Chen, Vijay Kumar B G, Abhishek Aich

机构 * NEC Laboratories, America(美国NEC实验室)

专题命中 代码评测 :repository(abstract,abstract_cn)

AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。

Comments Accepted to ECCV 2026 Workshop DriveX

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19625 2026-08-21 cs.AI 新提交 57%

Scientific Data Skills: Enabling Agent-Ready Scientific Data Services at Scale

科学数据技能:实现规模化的智能体就绪型科学数据服务

Xiaohan Huang, Qingqing Long, Xiaolei Du, Siyu Pu, Jiawen Xu, Haotian Chen, Chenyang Zhao, Jinbiao Liu, Xuezhi Wang, Hao Wang, Hengshu Zhu, Yuanchun Zhou

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 针对现有数据集表示难以满足AI智能体需求的问题,提出SciDSK智能体就绪型表示并构建相关平台,可提升智能体的数据集发现与解释能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17787 2026-08-21 cs.IR 版本更新 50%

Beyond Uniform Token Training: A Multi-Target Framework for Learning Token-Weighted Objectives in Generative Recommenders

基于课程学习的生成推荐系统中的标记加权多目标学习

Wei-Ning Chiu, Song-Duo Ma, Han-Jay Shu, Chuan-Ju Wang, Pu-Jen Cheng

专题命中 代码评测 :repository(abstract)

AI总结 本文提出基于课程学习的生成推荐系统中的标记加权多目标学习方法,通过两种信息增益策略提升推荐性能,实验表明其在不同语义ID构造下表现优异。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 1 篇

2608.19703 2026-08-21 cs.SE cs.AI 新提交 81%

Loreley: Repository-Scale Program Evolution with Quality-Diversity Search

Loreley:基于质量多样性搜索的仓库级程序演化

Mohan Chen

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 该研究提出名为 Loreley 的 QD 方法,将完整仓库状态存入存档采样,在 Zstandard 实验中对比三种策略,发现 48 作业时 QD 未显优势但垫脚石机制生效,早期活动已产出多文件改进。

Comments 15 pages, 3 figures, 8 tables. Code and evidence: this https URL (https://github.com/NeapolitanIcecream/loreley)

详情

展开后加载摘要…

URL PDF HTML 收藏