arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-27 至 2026-07-27 共收录 10 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 10 篇

2607.16617 2026-07-27 cs.SE cs.AI 版本更新 84%

DataFlow-Harness: A Grounded Code-Agent Platform for Constructing Editable LLM Data Pipelines

DataFlow-Harness:用于构建可编辑大语言模型数据管道的基础代码代理平台

Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究针对大语言模型数据处理工作流中编码代理脚本无法自动转化为可编辑工件的问题,提出DataFlow-Harness平台,通过类型化增量突变引导构建DAG,结合多种技术,在数据工程基准测试中取得高通过率,降低成本和延迟。

Comments 13 pages, 2 figures, and 5 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21832 2026-07-27 cs.SE cs.LG 新提交 81%

How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests

人工智能编码代理如何为软件开发做出贡献?对代理拉取请求的实证研究

Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse Khomh

机构 * Polytechnique Montréal(蒙特利尔大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.LG、cs.SE

AI总结 研究人工智能编码代理对软件开发的贡献,通过AIDev数据集,分析代理与人工生成PR的合并率差异、任务分布及关键特征,从实证和纵向角度理解其在软件开发中的作用、优点及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21482 2026-07-27 cs.AI cs.CL 版本更新 81%

Agentic coding without the cloud: evaluating open-weight large language models on longitudinal data preparation tasks

无需云端的智能编码:在纵向数据准备任务中评估开放权重的大语言模型

Mack Nixon, Liam Wright, Yevgeniya Kovalchuk, Alison Fang-Wei Wu, Martin Danka, Andy Boyd, David Bann

专题命中 软件智能体 :agentic(title);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 研究在纵向数据准备任务中评估开放权重的大语言模型,介绍开源框架,含真实数据集、任务定义和评估程序,通过基准测试发现当前先进模型表现良好,为治理受限研究中的AI辅助数据准备提供可行路径。

Comments Presented at SLLS 2026; accepted at CLS 2026 and RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21674 2026-07-27 cs.SE 新提交 79%

Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance

输出格式x模型标识:单轮编码代理性能中的交互效应

Yang Yang

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究输出格式与模型交互对单轮编码代理性能的影响,通过多模型、多格式、多任务实验发现无普遍最优格式,有格式滥用问题,提出特定于模型的输出策略及工具设计原则并开源数据模板。

Comments 16 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21656 2026-07-27 cs.SE cs.AI 新提交 66%

Cross-Model LLM Code Review: Should you use Claude to review Codex or vice versa?

跨模型大语言模型代码审查:应该用Claude审查Codex还是相反?

Zuodong Xiang, Yike Zhang, YueMing Zhang, Hailu Xu

机构 * University of California, Davis(加州大学戴维斯分校) Johns Hopkins University(约翰霍普金斯大学) California State University, Long Beach(长滩加州州立大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE;agentic(comments)

AI总结 研究开发者同时使用Claude和Codex进行代码审查的成本、时间及配对顺序问题,通过对116个任务的六种条件实验发现,Claude审查Codex草稿效果好,反向则不佳,有用的配对是不对称的,应Claude审查Codex。

Comments This paper had been accepted by Agentic SE @ KDD'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21677 2026-07-27 cs.SE cs.AI 新提交 62%

Enhancing SLMs for Sustainable Code Optimization in Radio-Astronomy

增强小型语言模型以实现射电天文学中的可持续代码优化

Elisa Chiarotto, Jingbo Li, P. Chris Broekema, Rob V. van Nieuwpoort

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 研究利用小型语言模型(SLMs)优化射电天文学代码,通过多采样生成策略和纳入编译器反馈两种方式增强SLMs,提高代码生成质量和性能,用更少计算资源匹配或超越大型单生成模型,且使所有测试模型持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21672 2026-07-27 cs.SE cs.AI cs.CV 新提交 62%

Pixels for Programs? A Cross-Provider Case Study of Input-Token Accounting for Source Code as Text and Images

像素换程序?关于将源代码作为文本和图像的输入令牌计费的跨供应商案例研究

Ronak Bhalgami

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究将源代码作为文本和图像时商业API如何计费,通过可重复案例研究,涵盖五种编程语言、多种源长度及多个模型别名,得出不同模型的图像与文本比率及收支平衡行为差异,还发布了重现研究所需的资料。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21641 2026-07-27 cs.SE cs.AI 新提交 62%

Tool-Guided Retrieval-Augmented Repair for Securing LLM-Generated C Code

用于保护大语言模型生成的C代码的工具引导检索增强修复

Vidyut Sriram, Saatvik Pradhan, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究大语言模型生成C代码可靠性问题,提出结合编译诊断、CodeQL静态分析等及检索先前修复模式的分析与修复工作流程,在相关C编程任务上评估,该方法有效降低了基线模型的编译失败率和安全缺陷率,提升了代码安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21909 2026-07-27 cs.SE 新提交 57%

Claim Plane: Enforceable Change Intents and Dynamic Scope for Parallel Coding Agents

声明平面:并行编码代理的可执行变更意图和动态范围

Maxim Nikolaev

专题命中 软件智能体 :planning(abstract);分类 cs.SE

AI总结 研究并行编码代理变更问题,提出声明平面架构,工作者声明变更意图,控制平面管理,执行时处理突变,通过CooperBench机制检查展示可行性,为未来模型升级提供基础。

Comments 10 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18119 2026-07-27 cs.AI 版本更新 57%

Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?

超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?

Jing Ye, Yiwen Duan, Yonghong Yu, Victor Ma, Yang Gao, Xing Chen

机构 * ByteDance Inc.(字节跳动公司)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏