arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-12 至 2026-06-12 共收录 21 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2606.12864 2026-06-12 cs.SE cs.AI 新提交 81%

Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming

超越问题求解:用于评估竞赛编程中代码生成、攻击和修复的UOJ-Bench基准

Tingqiang Xu, Hangrui Zhou, Tianle Cai, Alex Gu, Kaifeng Lyu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 提出UOJ-Bench基准,通过代码生成、攻击和修复三项任务评估LLM在竞赛编程中的问题求解与人类代码错误识别能力,发现最强模型在一次性评估中无法识别超过50%的错误提交,但测试时扩展可提升至90%以上,且能发现约5%的满分提交中的错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12916 2026-06-12 cs.AI cs.CL cs.LG 新提交 67%

MDForge: Agentic Molecular Dynamics Pipeline Design under Sparse Simulator Feedback

MDForge:稀疏模拟器反馈下的智能分子动力学流水线设计

Zehong Wang, Yijun Ma, Connor R. Schmidt, Tianyi Ma, Weixiang Sun, Ziming Li, Xiaoguang Guo, Chuxu Zhang, Matthew J. Webber, Yanfang Ye

机构 * University of Notre Dame(圣母大学) University of Connecticut(康涅狄格大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MDForge,利用LLM智能体通过多智能体辩论将稀疏奖励稠密化,自动设计分子动力学流水线,在SAMPL基准上达到专家水平,并发现新型高亲和力CB[7]结合剂。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12647 2026-06-12 cs.CC cs.AI cs.LG 新提交 62%

Token Complexity Theory for AI-Augmented Computing

AI增强计算的Token复杂度理论

Jie Wang

机构 * Richard Miner School of Computing and Information Sciences, University of Massachusetts, Lowell, MA(理查德·米纳尔计算与信息科学学院,马萨诸塞大学洛厄尔分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出Token复杂度作为AI增强计算中查询与响应成本的形式化度量,建立AI-Oracle图灵机框架,证明单调性、凸性、价格敏感性和任务排序的价格相对性等基本定理。

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11863 2026-06-12 cs.AI cs.CL 版本更新 62%

CreativeBench: Benchmarking and Enhancing Machine Creativity via Self-Evolving Challenges

CreativeBench: 通过自我进化挑战基准测试和增强机器创造力

Zi-Han Wang, Lam Nguyen, Zhengyang Zhao, Mengyue Yang, Chengwei Qin, Yujiu Yang, Linyi Yang

机构 * Southern University of Science and Technology(南方科技大学) Tsinghua University(清华大学) Peking University(北京大学) University of Bristol(布里斯托大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Xi’an Jiaotong University(西安交通大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出CreativeBench基准,基于认知框架通过代码生成评估机器创造力,包含组合与探索两个子集,利用逆向工程和自我博弈自动生成挑战,并通过质量与新颖性乘积的指标区分创造与幻觉。

Comments ACL 2026. Project page: https://zethwang.github.io/creativebench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13380 2026-06-12 quant-ph cs.AI 新提交 57%

An LLM System for Autonomous Variational Quantum Circuit Design

用于自主变分量子电路设计的大语言模型系统

Kenya Sakka, Wataru Mizukami, Kosuke Mitarai

机构 * Center for Quantum Information and Quantum Biology(量子信息与量子生物学中心) The University of Osaka(大阪大学) Graduate School of Engineering Science(工学研究科)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出一个基于大语言模型的自主代理框架,通过迭代设计量子电路,在量子特征映射和变分量子本征求解器任务中取得优于或媲美现有方法的性能。

Comments 63 pages, 19 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01538 2026-06-12 cs.GR cs.CV cs.LG 版本更新 57%

MPMWorlds: Material-Point-Method Simulations for Inferring and Extrapolating Physical Dynamics

MPMWorlds: 用于推断和外推物理动力学的物质点法模拟

Žiga Kovačič, Kevin Ellis

机构 * Cornell University(康奈尔大学)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 通过构建2D物质点法(MPM)模拟数据集,研究从视频推断物理动力学并外推时间演化的能力,比较代码生成与视频扩散方法的优劣。

Comments 16 pages, 13 figures. Project page: https://zzigak.github.io/mpmworlds/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18817 2026-06-12 cs.LG 版本更新 57%

Multi-Token Residual Prediction

多令牌残差预测

Yufeng Xu, Zishuo Bao, Qian Wang, Zeshen Zhang, Haoqi Zhang, Bowen Peng, Ang Li, Rahul Chalamala, Yucheng Lu

机构 * New York University(纽约大学) New York University Shanghai(纽约大学上海) Nos Research(Nos研究) Modal

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出了一种轻量级模块Multi-token Residual Prediction,通过利用去噪过程中相邻步骤的logit分布相似性,在单次骨干网络前向传播中实现依赖感知的多令牌去噪,从而在成本较低的情况下提高去噪效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13389 2026-06-12 cs.CY 新提交 50%

Structuring Transparency: Developing Domain-Specific Generative AI Declaration Frameworks in Higher Education

构建透明度:开发高等教育中特定领域生成式AI声明框架

Nicholas Micallef, Olga Petrovska

专题命中 代码生成 :code generation(abstract)

AI总结 针对高等教育中通用AI声明不足的问题,提出基于GenAI使用分类法的两种任务特定声明结构(写作和编程),以促进学术诚信和AI素养。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 6 篇

2606.13175 2026-06-12 cs.SE 新提交 79%

The End of Code Review: Coding Agents Supersede Human Inspection

代码审查的终结:编码代理取代人工审查

Martin Monperrus

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文论证基于大型语言模型的编码代理已超越传统人工代码审查的能力阈值,能以更低成本、更高吞吐量实现审查目标,并指出人工审查与AI协作的路径不可持续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13174 2026-06-12 cs.LG cs.CL 新提交 76%

Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents

与你合作得更好:将用户修正编译为编码代理的运行时强制

Yujun Zhou, Kehan Guo, Haomin Zhuang, Xiangqi Wang, Yue Huang, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Nuno Moniz, Nitesh V. Chawla, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) IBM Research(IBM研究院) Tencent AI Lab(腾讯AI实验室)

专题命中 软件智能体 :coding agent(title);分类 cs.CL、cs.LG

AI总结 提出TRACE方法,通过将用户修正编译为原子规则并在运行时强制执行,显著减少编码代理在后续任务中的偏好违反,优于纯记忆方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13468 2026-06-12 cs.SE cs.AI 新提交 62%

Understanding the Rejection of Fixes Generated by Agentic Pull Requests -- Insights from the AIDev Dataset

理解AI代理生成的拉取请求修复被拒绝的原因——来自AIDev数据集的洞察

Mahmoud Abujadallah, Ali Arabat, Mohammed Sayagh

机构 * École de Technologie Supérieure(埃克塞技术学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 通过分析AIDev数据集,发现46.41%的AI代理(Copilot、Devin、Cursor、Claude)提出的代码修复被拒绝。本文对306个未合并的PR进行定性研究,归纳出14个拒绝原因,分为四类,并提出了改进模型引导的建议。

Comments 5 pages, 2 figures, MSR '26: Proceedings of the 23rd International Conference on Mining Software Repositories, April 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13449 2026-06-12 cs.SE cs.AI 新提交 62%

Toward Instructions-as-Code: Understanding the Impact of Instruction Files on Agentic Pull Requests

面向指令即代码:理解指令文件对智能体拉取请求的影响

Ali Arabat, Mohammed Sayagh

机构 * École de Technologie Supérieure

专题命中 软件智能体 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 通过分析148个项目的15549个智能体PR,发现指令文件对合并率、代码变更量和合并工作量无一致正面影响,但成功项目指令文件更长且结构更清晰,提出“指令即代码”研究方向。

Comments 5 pages, 8 figures, 23rd International Conference on Mining Software Repositories, April 13--14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13643 2026-06-12 cs.CL 新提交 57%

Recursive Agent Harnesses

递归智能体框架

Elias Lumer, Sahil Sen, Kevin Paul, Vamse Kumar Subbiah

机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 提出递归智能体框架(RAH),通过代码优先的框架递归扩展模型递归,在长上下文推理中显著提升编码智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12834 2026-06-12 cs.AI 新提交 57%

Fantastic Scientific Agents and How to Build Them: AgentBuild for Rietveld Refinement

神奇的科学智能体及其构建方法:用于Rietveld精修的AgentBuild

Woong Shin, Craig A. Bridges, Marshall T. McDonnell, Rafael Ferreira da Silva

机构 * UT-Battelle, LLC(UT-Battelle有限责任公司) US Department of Energy (DOE)(美国能源部)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出AgentBuild框架,通过科学家编写的合同(包含评分标准、课程和知识库)自动构建科学智能体,用于X射线衍射数据的Rietveld精修,实现可复用的智能体编译而非手动调优。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2605.22092 2026-06-12 cs.NI cs.SE 版本更新 70%

Astragalus: Automatic Configuration Repair for Production Networks

Astragalus: 为生产网络实现自动配置修复

Zhenrong Gu, Peng Zhang, Xing Feng, Xu Liu

专题命中 程序修复 :program repair(abstract);repository(abstract);分类 cs.SE

AI总结 本文提出Astragalus,一种基于语法的自动配置修复方法,通过多次迭代的『定位-修复-验证』流程,在生产网络中有效修复了多种类型的配置错误。

Comments 13 pages body, 14 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2606.12608 2026-06-12 cs.CL cs.LG 新提交 62%

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

购物推理基准:面向多轮对话购物助手的专家编写基准

Shuxian Fan, Seonwoo Min, Youna Hu, Botao Xia, Jayakrishnan Unnikrishnan, Rowan Musselmann, Yifan Gao, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13192 2026-06-12 cs.AI 新提交 57%

Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach

基于多模态大语言模型的移动用户体验推理:任务、基准与方法

Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao

机构 * Ant Group(蚂蚁集团)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。

Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 3 篇

2606.12040 2026-06-12 cs.AI cs.GR 新提交 57%

A Lightweight Multi-Agent Framework for Automated Concrete Barrier Design

一种用于自动混凝土护栏设计的轻量级多智能体框架

Wanting Wang, Xiye Ma, Yuyang He, Minghui Cheng, Ran Cao

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 提出基于AutoGen的“生成-评估-优化”闭环多智能体框架,实现混凝土护栏自动设计,准确率超98%,且8B参数轻量模型可优于631B旗舰模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12585 2026-06-12 econ.GN cs.HC q-fin.EC 新提交 50%

Revisiting the ABCs of Working with AI: A Replication with Radiologists

重新审视与AI合作的ABC:一项针对放射科医生的复制研究

Daniel Martin

专题命中 仓库级理解 :repository(abstract)

AI总结 本研究在放射科医生分析胸部X光片的场景中,复制了Caplin等人关于能力和信念校准影响AI辅助收益的发现,验证了其外部有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13627 2026-06-12 hep-th gr-qc math-ph math.MP 新提交 50%

A Graphical Coaction for FRW Integrals from Partial/Relative Twisted (Co)homology

FRW 积分的图形余作用:来自部分/相对扭曲(上)同调

Andrew J. McLeod, Andrzej Pokraka, Lecheng Ren

专题命中 仓库级理解 :repository(abstract)

AI总结 利用部分/相对扭曲(上)同调中的相交理论,为共形耦合标量理论中的 FRW 积分构造了图形余作用,揭示了微分方程组合结构并开发了计算工具。

Comments 60+8 pages; many figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 程序分析与验证 1 篇

2606.13298 2026-06-12 cs.SE cs.AI 新提交 62%

Mining Architectural Quality Under Agentic AI Adoption: A Causal Study of Java Repositories

在智能体AI采用下的架构质量挖掘:Java仓库的因果研究

Oliver Aleksander Larsen, Mahyar T. Moghaddam

机构 * SDU Software Engineering, University of Southern Denmark(SDU软件工程,丹麦南部大学)

专题命中 程序分析与验证 :repository(abstract);分类 cs.SE、cs.AI

AI总结 通过差分差分设计和Borusyak插值估计器,研究智能体AI工具采用对Java仓库架构气味密度(ASD)的因果影响,发现ASD下降6.7%源于代码量增长,而非架构改进。

Comments 16 pages. Accepted for presentation at the 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA) 2026, Krakow, Poland, 2-4 September 2026, and for publication in the Springer LNCS proceedings. This is the author's accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏