arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-13 至 2026-08-13 共收录 26 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 6 篇

2608.11513 2026-08-13 cs.SE cs.AI cs.CL 新提交 82%

Do Influence Tactics Matter? Investigating Prompt Framing Effects in LLM Code Generation

影响策略重要吗?研究大语言模型代码生成中的提示词框架效应

Alex Deaconu, Anubhav Gupta, Manaal Basha, Nicholas Haydu, Gema Rodríguez-Pérez

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本研究首次大规模实证探究基于心理学的影响策略诱导的提示词框架对LLM代码生成的影响,发现强调紧迫性的框架会降低代码正确性与安全性,为设计人机交互提供实践见解。

Comments Accepted for publication in Empirical Software Engineering. This is the accepted manuscript version. 37 pages, 3 figures

Journal ref Empirical Software Engineering 32 (2026) 13

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11394 2026-08-13 cs.SE 新提交 79%

GraphAlignCoder: Aligning Program and Proof Graphs for Code Generation

GraphAlignCoder:对齐程序与证明图的代码生成框架

Yueke Zhang, Zihan Fang, Kevin Leach, Yu Huang

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 GraphAlignCoder是将显式正确性结构迁移至代码生成的训练框架,通过对齐程序与证明图提升性能,在多个基准测试中优于现有方法,验证图注入与验证到代码的整合是关键。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03818 2026-08-13 cs.LG cs.AI cs.PL 版本更新 67%

Program Semantic Inequivalence Game with Large Language Models

基于大语言模型的程序语义不等价博弈

Antonio Valerio Miceli-Barone, Vaishak Belle, Ali Payani

机构 * University of Edinburgh(爱丁堡大学) Cisco Systems(思科系统)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG、cs.PL

AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11674 2026-08-13 cs.LG cs.AI 新提交 62%

GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束

Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11965 2026-08-13 cs.SE 新提交 57%

Developing LLM-based Multi-Agent Systems in Software Engineering: A Mixed-Method Experience Report

在软件工程中开发基于大语言模型(LLM)的多智能体系统:一项混合方法经验报告

Mariama Celi Serafim De Oliveira, Motunrayo Osatohanmen Ibiyo, Marco Gianrusso, Claudio Di Sipio, Davide Di Ruscio, Phuong T. Nguyen

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文通过定量和定性分析,梳理软件工程中基于LLM的MAS现有框架,发现其基本组件覆盖良好但缺高级功能,摘要任务ROUGE分数无显著差异,为相关人员选框架提供指导。

Comments The paper has been peer reviewed and accepted for publication with the Empirical Software Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08891 2026-08-13 cs.CE 版本更新 50%

Ortho2CAD: 3D CAD generation from orthographic drawings using vision language models

Ortho2CAD:使用视觉语言模型从正投影图生成3D CAD

Aditya Joglekar, Amit Regmi, Kenji Shimada, Levent Burak Kara

专题命中 代码生成 :code generation(abstract)

AI总结 研究旨在解决工程设计中从正投影图到3D CAD模型转换的问题,核心方法是利用视觉语言模型Ortho2CAD,通过监督微调与强化学习训练,借助绘图生成器实现大规模学习,主要贡献是代码有效率高且3D CAD精度超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 7 篇

2608.11386 2026-08-13 cs.SE 新提交 83%

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

关键在于接口:评估工具架构如何影响编码智能体行为

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE

AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11727 2026-08-13 cs.AI 新提交 79%

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

Harness-IF:评估编码智能体在不同指令层面的指令遵循能力

Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。

Comments 26 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11338 2026-08-13 cs.CL cs.LG 新提交 62%

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

更好、更快、更强:程序化技能学习最能降低智能体成本

Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11232 2026-08-13 cs.CL cs.AI 新提交 62%

Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试

Ruoxi Zhao, Maziar Raissi

机构 * University of California, Riverside(加利福尼亚大学河滨分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。

Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11772 2026-08-13 cs.CL 新提交 57%

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

修复前诊断:将智能体故障转化为选择性自修正

Pan Wang, Yihao Hu, Hang Wang, Zirui Lv, Xin Zhang, Jianshe Li, Jiang-Ming Yang, Wei Wu, Yongqi Tong

机构 * Ant International(蚂蚁国际)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本研究提出诊断引导的修复框架DARC,通过先诊断故障类型再进行选择性自修正,在ALFWorld等三个任务场景中提升了智能体平均任务性能并减少资源消耗,为缺乏类编译器反馈的领域构建可靠智能体提供了实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11460 2026-08-13 cs.CL 新提交 57%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11340 2026-08-13 cs.NI cs.AI 新提交 57%

Self-evolving network verifiers

自演进网络验证器

Ioannis Protogeros, Tibor Schneider, Laurent Vanbever

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 该研究提出一种自动演进的网络验证器,通过编码智能体与可信预言机的反例引导循环,让基于SMT的验证器自主学习新网络功能,解决手动维护模型的难题。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2608.11436 2026-08-13 cs.CR 新提交 50%

When Agents Talk: Honeytokens under Shared Memory

当智能体对话时:共享内存下的蜜罐

Joshua S. Gans

专题命中 测试生成 :repository(abstract)

AI总结 该研究通过2026年网络能力评估案例,分析共享内存下蜜罐的安全缺陷,提出将令牌身份存于私有引用监视器等架构应对方案,指出蜜罐仍需单独安全边界。

Comments artificial intelligence, cybersecurity, honeytokens, defensive deception, shared memory, intrusion detection

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 5 篇

2608.11246 2026-08-13 cs.AI cs.LG cs.RO 新提交 62%

Towards the Harness of Embodied Agents

迈向具身智能体的管控

Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。

Comments Project page: https://eit-hai.github.io/thea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29717 2026-08-13 cond-mat.mtrl-sci cs.AI cs.LG 版本更新 62%

Optimizing Expert-Designed Crystal Graph Networks for Band-Gap Prediction with an Autonomous LLM Research Loop

利用自主LLM研究循环优化专家设计的晶体图网络用于带隙预测

Chenmu Zhang, Boris I. Yakobson

机构 * Department of Materials Science and NanoEngineering(材料科学与纳米工程系)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出一个自主LLM研究循环,在MatBench带隙基准上构建了无需外部预训练的最准确模型,超越了所有17个专家设计模型,通过实现元素对特征和空间群嵌入等已知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06849 2026-08-13 cs.AI cs.CL 版本更新 62%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12262 2026-08-13 cs.CV cs.AI 新提交 57%

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

Diagram-MMU:面向科学图表的多模态基准测试

Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(阿德莱德大学AIML) SUTD(新加坡科技设计大学) Southeast University(东南大学) East China Normal University(华东师范大学) University of Oxford(牛津大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-13 cs.AI 新提交 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: https://electronicarts.github.io/AutoWorldModelBench/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 7 篇

2608.10450 2026-08-13 cs.SE cs.AI cs.MA cs.NE 版本更新 73%

Persistent Recursive Worlds Enable Autonomous Software Evolution

持久递归世界支持自主软件演化

Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出 Genesis 框架,以持久递归世界替代持久智能体,成功构建 C 编译器、重实现 MESA 模块,实现长周期软件开发并获显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07341 2026-08-13 cs.SE cs.LG 版本更新 62%

ReCodeAgent: A Multi-agent Workflow for Language-Agnostic Translation and Validation of Large-Scale Repositories

ReCodeAgent:一种多智能体工作流用于语言无关的大规模仓库翻译与验证

Ali Reza Ibrahimzada, Brandon Paulsen, Daniel Kroening, Reyhaneh Jabbarvand

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.LG

AI总结 ReCodeAgent通过多智能体方法实现大规模仓库代码翻译与验证的语言无关性,提升翻译正确率并降低成本,验证其效率和设计影响。

Comments Published in ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20667 2026-08-13 cs.SE cs.AI 版本更新 62%

REVERE: Reflective Evolving Research Engineer

REVERE:面向科学工作流的反思性进化研究工程师

Balaji Dinesh Gangireddi, Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

机构 * TCS Research(TCS研究) Yale University(耶鲁大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI

AI总结 REVERE通过全局训练上下文学习和反思优化框架,提升科研编码任务性能,实现4.50%、3.51%和4.89%的提升。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11755 2026-08-13 cs.SD cs.CL 新提交 57%

MuseCritic: Learning Multi-Aspect Song Rewards through Natural-Language Aesthetic Critiques

MuseCritic:通过自然语言审美评论学习多维度歌曲奖励

Jiabao Zhuang, Changhao Jiang, Hanchen Wang, Jiahao Chen, Zhixiong Yang, Zhenghao Xiang, Yifei Cao, Jiajun Sun, Hui Li, Ming Zhang, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本研究提出MUSECRITIC半标量奖励模型,通过两阶段训练生成多维度自然语言评论预测歌曲奖励,在SongEval、Music Arena等数据集上效果优于现有方法,结合GRPO还提升了Muse-0.6B的多项审美指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05286 2026-08-13 cs.SE 57%

Deep Learning Methods for Software Requirement Classification: A Performance Study on the PURE dataset

Fatemeh Khayashi, Behnaz Jamasb, Reza Akbari, Pirooz Shamsinejadbabaki

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11348 2026-08-13 cs.CR 新提交 50%

An Empirical Study of Output-to-Input Loops for Black-Box Backdoor Detection in Fine-Tuned Open-Weight LLMs

针对微调开源权重大语言模型的黑盒后门检测的输出-输入循环的实证研究

Md. Nahid Hasan, Mohammad Arif Hossain

专题命中 仓库级理解 :repository(abstract)

AI总结 本研究提出self-feeding黑盒测试方法,通过将LLM自身输出反馈为输入检测后门,在6个开源权重LLM上实现高模型级检测精度,仅需文本级查询访问即可作为模型安全的低成本初查手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11262 2026-08-13 physics.data-an hep-ex hep-lat hep-ph 新提交 50%

Analytically Consistent Reconstruction of Finite Data Using Padé Sequences

利用帕德序列对有限数据进行解析一致的重构

Emerson Díaz, Balma Duch, Pere Masjuan

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究提出一种基于帕德序列的算法,将弗罗萨尔特双极点作为诊断对象,可从含不确定性的有限数据中重构解析结构,区分真实特征与虚假结构,已通过多种函数和数据集验证,代码存于GitLab。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏