arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-27 至 2026-07-27 共收录 17 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2607.22471 2026-07-27 cs.SE cs.AI 新提交 81%

MineValiCoder: Reliable Code Generation with Test Case Quality Mining and Bipartite Graph-Based Mutual Validation

MineValiCoder:通过测试用例质量挖掘和基于二分图的相互验证实现可靠的代码生成

Zhen Zhao, Qihang Yang, Feifei Dai, Xiangfang Li, Bo Li

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对基于大语言模型的测试驱动开发中现有方法的不足,提出MineValiCoder框架,通过测试用例质量挖掘、并行TDD优化和二分图代码-测试相互验证三个模块,有效减轻LLM随机性,提升自动代码生成可靠性,在多基准测试中表现优异。

Comments 12 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11136 2026-07-27 cs.LO 版本更新 78%

Automating the Derivation of Unification Algorithms: A Case Study in Deductive Program Synthesis

自动推导合一算法:演绎程序合成的一个案例研究

Richard Waldinger

专题命中 代码生成 :program synthesis(title,abstract)

AI总结 该研究聚焦于合一算法的自动推导,以演绎程序合成方式,将编程视为定理证明任务。通过推广和自动化手动证明,新程序能依给定环境替换合一符号表达式,确定输出替换,还能处理不可合一情况,且怀疑带环境的算法更易自动合成。

Comments 92 pages

Journal ref Journal of Symbolic Computation, January-February 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21677 2026-07-27 cs.SE cs.AI 新提交 62%

Enhancing SLMs for Sustainable Code Optimization in Radio-Astronomy

增强小型语言模型以实现射电天文学中的可持续代码优化

Elisa Chiarotto, Jingbo Li, P. Chris Broekema, Rob V. van Nieuwpoort

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究利用小型语言模型(SLMs)优化射电天文学代码,通过多采样生成策略和纳入编译器反馈两种方式增强SLMs,提高代码生成质量和性能,用更少计算资源匹配或超越大型单生成模型,且使所有测试模型持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21609 2026-07-27 cs.AI 新提交 57%

Coupled Hierarchical Search over Topology and Execution for Agentic Workflow Synthesis

用于智能工作流合成的拓扑与执行耦合分层搜索

Dong Li, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Xintao Wu, Zhong Chen, Chen Zhao, Haifeng Chen

机构 * Baylor University(贝勒大学) NEC Laboratories America(美国NEC实验室) University of Arkansas(阿肯色大学) Southern Illinois University(南伊利诺伊大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 针对大语言模型结构化工作流创建自动化难题,提出拓扑与执行耦合的搜索范式,引入HierFlow架构,通过反馈引导拓扑调整与树搜索优化子工作流,经多基准测试验证其性能优于基线,平衡了质量与效率且无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08379 2026-07-27 cs.AI 版本更新 57%

DeepFeature: LLM-Empowered Context-aware Feature Generation for Wearable Biosignals

DeepFeature: 基于迭代上下文感知的可穿戴生物信号特征生成

Kaiwei Liu, Yuting He, Bufang Yang, Mu Yuan, Chun Man Victor Wong, Ho Pong Andrew Sze, Zhenyu Yan, Hongkai Chen

机构 * The Chinese University of Hong Kong(香港中文大学) The Education University of Hong Kong(香港教育大学) Hong Kong Applied Science and Technology Research Institute(香港应用科学和技术研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 DeepFeature是一种基于大语言模型的上下文感知特征生成框架,通过多源特征生成机制和迭代特征细化过程,提升可穿戴生物信号的特征提取效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 6 篇

2607.21832 2026-07-27 cs.SE cs.LG 新提交 81%

How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests

人工智能编码代理如何为软件开发做出贡献?对代理拉取请求的实证研究

Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse Khomh

机构 * Polytechnique Montréal(蒙特利尔大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 研究人工智能编码代理对软件开发的贡献,通过AIDev数据集,分析代理与人工生成PR的合并率差异、任务分布及关键特征,从实证和纵向角度理解其在软件开发中的作用、优点及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21909 2026-07-27 cs.SE 新提交 79%

Claim Plane: Enforceable Change Intents and Dynamic Scope for Parallel Coding Agents

声明平面:并行编码代理的可执行变更意图和动态范围

Maxim Nikolaev

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究并行编码代理变更问题,提出声明平面架构,工作者声明变更意图,控制平面管理,执行时处理突变,通过CooperBench机制检查展示可行性,为未来模型升级提供基础。

Comments 10 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21674 2026-07-27 cs.SE 新提交 79%

Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance

输出格式x模型标识:单轮编码代理性能中的交互效应

Yang Yang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 研究输出格式与模型交互对单轮编码代理性能的影响,通过多模型、多格式、多任务实验发现无普遍最优格式,有格式滥用问题,提出特定于模型的输出策略及工具设计原则并开源数据模板。

Comments 16 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21629 2026-07-27 hep-ph hep-th 新提交 67%

Scattering Amplitudes as Programs: Self-Evolving Search for Theory and Event Generation

作为程序的散射振幅:理论与事件生成的自演化搜索

Yi Gu, Sven Krippendorf

专题命中 软件智能体 :repository(abstract);coding agent(abstract)

AI总结 该研究将散射振幅视为程序,连接揭示解析结构与构建数值评估器的目标。通过自演化程序搜索进行缩放、结构和精确操作搜索,优化振幅计算,在多个过程测试中取得加速等成果,初步证明部分振幅优化可系统化。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21656 2026-07-27 cs.SE cs.AI 新提交 62%

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

跨模型大语言模型代码审查:应该用Claude审查Codex还是相反?

Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu

机构 * University of California, Davis(加州大学戴维斯分校) Johns Hopkins University(约翰霍普金斯大学) California State University, Long Beach(长滩加州州立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究开发者同时使用Claude和Codex进行代码审查的成本、时间及配对顺序问题,通过对116个任务的六种条件实验发现,Claude审查Codex草稿效果好,反向则不佳,有用的配对是不对称的,应Claude审查Codex。

Comments This paper had been accepted by Agentic SE @ KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16617 2026-07-27 cs.SE cs.AI 版本更新 62%

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台

Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。

Comments 13 pages, 2 figures, and 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 3 篇

2607.20491 2026-07-27 cs.AI cs.CL cs.LG 版本更新 67%

DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making

DFAH-Bench:金融决策中可观测智能体不稳定性的基准测试

Raffi Khatchadourian

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究金融决策中智能体行为稳定性,引入DFAH-Bench基准,通过多渠道衡量。发现仅结果一致性不能完全反映稳定性,前沿模型存在决策与工具路径一致性差距,识别出三种行为模式,并开源相关代码和数据。

Comments 15 pages, 3 figures. Code, sanitized replay logs, one-command reproduction (make reproduce-paper), and an interactive results explorer: https://github.com/ibm-client-engineering/output-drift-financial-llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22368 2026-07-27 cs.AI 新提交 57%

Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

智能体基准测试能衡量能力吗?智能体人工智能时代的协议有效性

Jiaqi Shao, Hanck Chen, Wei Zhang, Maxm Pan, Bing Luo

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(昆山杜克大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究智能体基准测试分数能否衡量能力,提出协议有效性概念及HackDetect事后审计方法,通过审计多基准测试轨迹发现暴露和奖励破解证据,量化分数膨胀,强调基准测试报告应证明分数反映预期能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 57%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 3 篇

2607.21885 2026-07-27 cs.LG cs.NA eess.SP math.NA 新提交 57%

Remedying Coarsening-Based GNN Training under Heterophily via Adaptive Complementary Enhancement

通过自适应互补增强修复异质性下基于粗化的图神经网络训练

Guoming Li, Jian Yang, Xukun Wang, Zixiao Wang, Shangsong Liang, Yifan Chen

机构 * Hong Kong Baptist University(香港浸会大学) Renmin University of China(中国人民大学) Chinese Academy of Sciences(中国科学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Sun Yat-sen University(中山大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 研究基于粗化的GNN训练在异构图上性能下降问题,提出自适应互补增强(ACE)策略,通过重新整合粗化丢弃信息、应用正则化及不确定性加权,在异构图基准上提升性能,同构图上保持竞争力且计算开销小。

Comments Accepted at the 42nd Conference on Uncertainty in Artificial Intelligence, UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21187 2026-07-27 cs.SE 版本更新 57%

Change Impact Recommendation for JavaScript: Lessons from History and Runtime Analysis

JavaScript变更影响推荐:来自历史和运行时分析的教训

Sadjad Tavakoli, Saba Alimadadi

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 针对JavaScript动态特性导致的依赖推断难题,通过结合历史共变模式挖掘和动态依赖分析,提出混合方法Caprese,实验表明两种信号互补,混合推荐效果更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16801 2026-07-27 cs.GR q-bio.TO 50%

TAMP-OS: An Open-Source Workflow for Tactile 3D-Printable Lithographs

TAMP-OS:触觉3D可打印光刻胶的开源工作流

Robert Faulkner, Natalia Gonzalez-Vazquez, Victoria Gamez, Karly E. Cohen, Gunther Richter, Abigale Stangl, Andrew K. Schulz

专题命中 仓库级理解 :repository(abstract)

AI总结 提出一个低成本、开源的工作流,用于从显微镜图像生成触觉光刻文件,通过3D打印实现科学图像的可触达性。

Comments 3 figures, Abigale Stangl and Andrew K. Schulz are co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏