arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-13 至 2026-05-13 共收录 22 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2605.12201 2026-05-13 cs.SE cs.AI 81%

Uncertainty Quantification for LLM-based Code Generation

基于大语言模型的代码生成的不确定性量化

Senrong Xu, Yuhao Tan, Yanke Zhou, Guangyuan Wu, Zenan Li, Yuan Yao, Taolue Chen, Feng Xu, Xiaoxing Ma

机构 * State Key Lab of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ETH Zürich(苏黎世联邦理工学院) Birkbeck, University of London(伦敦大学伯克贝克学院)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出RisCoSet方法,通过多重假设检验构建风险控制的预测集,用于大语言模型代码生成任务,有效减少代码移除并提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11307 2026-05-13 cs.CV cs.LG 79%

Vision2Code: A Multi-Domain Benchmark for Evaluating Image-to-Code Generation

Vision2Code:一个多领域评估图像到代码生成的基准

Ajay Vikram Periasami, Junlin Wang, Bhuwan Dhingra

机构 * Duke University(杜克大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 Vision2Code提出一个无需参考代码的多领域图像到代码生成评估框架,通过2169个测试示例评估模型生成代码的质量,发现性能依赖于领域,且通过筛选器的模型输出可提升生成能力。

Comments Project page: https://image2code.github.io/vision2code/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11027 2026-05-13 cs.SE cs.AI 73%

From Code-Centric to Intent-Centric Software Engineering: A Reflexive Thematic Analysis of Generative AI, Agentic Systems, and Engineering Accountability

从代码导向到意图导向的软件工程:生成式人工智能、代理系统和工程问责的反思主题分析

Elyson De La Cruz

机构 * University of the Cumberlands(卡姆伯兰大学)

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本文通过反思性主题分析和解释现象学分析,探讨生成式人工智能、代理系统如何推动软件工程从代码导向转向意图导向,强调意图指定、上下文整理、架构知识和问责的重要性。

Comments 24 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10865 2026-05-13 cs.AI cs.CV cs.SE 73%

BenchCAD: A Comprehensive, Industry-Standard Benchmark for Programmatic CAD

BenchCAD: 一个全面的、行业标准的程序化CAD基准测试

Haozhe Zhang, Kaichen Liu, Miaomiao Chen, Lei Li, Shaojie Yang, Cheng Peng, Hanjie Chen

机构 * University of Virginia(弗吉尼亚大学) University of California, San Diego(加州大学圣地亚哥分校) Rice University(莱斯大学)

专题命中 代码生成 :code generation(abstract);program synthesis(abstract);分类 cs.SE、cs.AI

AI总结 BenchCAD通过视觉问答、代码问答、图像到代码生成和指令引导的代码编辑评估模型,发现当前系统在生成精确参数化CAD程序方面存在不足,需进一步改进工业应用能力。

Comments 9 page 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11922 2026-05-13 cs.SE cs.CL 62%

StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning

StepCodeReasoner: 通过强化学习对齐代码推理与分步执行轨迹

Hao Wang, Rui Li, Lei Sha, Jie M. Zhang

机构 * Beihang University, Beijing, China(北京航空航天大学) Peking University, Beijing, China(北京大学) Zhongguancun Laboratory, Beijing, China(中关村实验室) King's College London, United Kingdom(伦敦国王学院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 本文提出StepCodeReasoner框架,通过引入显式的中间执行状态监督,将代码推理转化为可验证的分步执行建模问题,并通过Bi-Level GRPO算法提升结构化信用分配,实验表明其在代码推理和生成任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11235 2026-05-13 cs.LG cs.AI 62%

Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

将课程判断内部化以优化大语言模型强化微调

Han Zheng, Yining Ma, Karthick Gunasekaran, Bharathan Balaji, Zheng Du, Shiv Vitaladevuni, Cathy Wu

机构 * MIT(麻省理工学院) Amazon AGI(亚马逊人工智能实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出METIS框架,通过内部化课程判断提升LLM强化微调效率与性能,利用训练结果动态分配训练资源,实现闭环优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05752 2026-05-13 cs.CL cs.SE 62%

AutoMonitor-Bench: Evaluating the Reliability of LLM-Based Misbehavior Monitor

AutoMonitor-Bench:评估基于LLM的误行监控可靠性

Shu Yang, Jingyu Hu, Tong Li, Hanqi Yan, Wenxuan Wang, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) University of Bristol(布里斯托大学) Washington University in St. Louis(圣路易斯华盛顿大学) King’s College London(伦敦国王学院) Renmin University of China(中国人民大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 本文提出AutoMonitor-Bench,首个系统评估LLM误行监控可靠性的基准,包含3010个标注样本,通过MR和FAR指标评估12个模型,揭示监控性能的差异及安全与效用的权衡。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22168 2026-05-13 cs.DC cs.PL 57%

TileLoom: Automatic Dataflow Planning for Tile-Based Languages on Spatial Dataflow Accelerators

TileLoom:面向空间数据流加速器的tile基语言自动数据流规划

Wei Li, Zhenyu Bai, Heru Wang, Pranav Dangi, Zhiqiang Zhang, Cheng Tan, Huiying Lan, Weng-Fai Wong, Tulika Mitra

专题命中 代码生成 :code generation(abstract);分类 cs.PL

AI总结 TileLoom通过MLIR框架实现tile基程序到空间数据流架构的编译,通过分布式核心和芯片内网络提升数据复用与通信效率,实验显示其性能与厂商库相当。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 5 篇

2605.11495 2026-05-13 cs.HC 78%

Hedwig: Dynamic Autonomy for Coding Agents Under Local Oversight

Hedwig:在局部监督下编码代理的动态自主性

Tanjal Shukla, K. J. Kevin Feng, Leijie Wang, Mohammad Rostami, Amy X. Zhang

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 Hedwig通过动态调整自主性水平,减少开发者与编码代理协作中的摩擦,提升任务执行效率。

Comments accepted to ACM CAIS 2026 demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11442 2026-05-13 cs.CR cs.AI cs.CL 62%

Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection

单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起

Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST (GZ)(香港科技大学(广州))

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12493 2026-05-13 cs.CL 57%

LongMemEval-V2: Evaluating Long-Term Agent Memory Toward Experienced Colleagues

LongMemEval-V2:评估长期代理记忆以成为经验丰富的同事

Di Wu, Zixiang Ji, Asmi Kawatkar, Bryan Kwan, Jia-Chen Gu, Nanyun Peng, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 LongMemEval-V2通过451个手动整理的问题评估代理记忆系统是否能帮助代理在定制环境中获取经验,采用上下文收集方法并提出两种记忆方法,实验显示AgentRunbook-C在准确率上表现最佳。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12366 2026-05-13 cs.AI 57%

Classifier Context Rot: Monitor Performance Degrades with Context Length

分类器上下文旋转:通过上下文长度监控性能退化

Sam Martin, Fabien Roger

机构 * Anthropic Fellows Program(Anthropic fellows项目)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 研究发现当前前沿模型在长上下文情况下难以检测危险行为,通过提示技术可部分缓解此问题,强调长上下文退化对监控性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12270 2026-05-13 cs.SE 57%

Characterizing the Failure Modes of LLMs in Resolving Real-World GitHub Issues

表征LLMs在解决现实世界GitHub问题中的故障模式

Yanjie Jiang, Yian Huang, Guancheng Wang, Junjie Chen, Hui Liu, Lionel Briand

专题命中 软件智能体 :program repair(abstract);分类 cs.SE

AI总结 本文通过评估三种先进模型在SWE-bench Verified数据集上的表现,揭示了LLMs在复杂修复任务中故障模式的分类,发现策略制定和逻辑综合是错误率最高的阶段,而故障定位错误率最低,同时揭示了不同模型在鲁棒性和成本上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2604.06485 2026-05-13 cs.LG cs.AI 62%

Inference-Time Code Selection via Symbolic Equivalence Partitioning

推理时通过符号等价划分进行代码选择

David Cho, Yifan Wang, Fanping Sui, Ananth Grama

机构 * Texas Instruments(德州仪器)

专题命中 测试生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SEP框架,通过符号执行将候选程序划分为功能等价类,提升推理时代码选择的准确性,无需辅助测试生成或额外LLM推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 4 篇

2603.09678 2026-05-13 cs.AI cs.LG cs.SE 67%

EsoLang-Bench: Evaluating Genuine Reasoning in Large Language Models via Esoteric Programming Languages

EsoLang-Bench: 通过奇特编程语言评估大语言模型的真实推理能力

Aman Sharma, Paras Chopra

机构 * Lossfunk

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 EsoLang-Bench通过五种奇特编程语言评估大语言模型在分布外编程语言上的推理能力,发现前沿模型在处理陌生语言时存在显著能力差距。

Comments 45 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11006 2026-05-13 cs.SE cs.AI 62%

An Execution-Verified Multi-Language Benchmark for Code Semantic Reasoning

一个经过执行验证的多语言基准用于代码语义推理

Yikun Li, Jinfeng Jiang, Ting Zhang, Chengran Yang, Chenxing Zhong, Yin Yide, Leow Wen Bin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

机构 * Singapore Management University(新加坡管理大学) Monash University(墨尔本大学) Nanjing University of Science and Technology(南京理工大学) GovTech Singapore(新加坡政府科技局)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出TraceEval,首个经过执行验证的多语言代码语义推理基准,通过验证执行消除标注偏差,评估10个LLM在零样本下的表现,展示了其在代码语义推理中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11269 2026-05-13 gr-qc astro-ph.HE astro-ph.IM cs.AI 57%

gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy

gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试

Tousif Islam, Digvijay Wadekar, Zihan Zhou

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03061 2026-05-13 cs.CV 50%

Can Nano Banana 2 Replace Traditional Image Restoration Models? An Evaluation of Its Performance on Image Restoration Tasks

Nano Banana 2能否替代传统图像修复模型?对其在图像修复任务上的性能评估

Weixiong Sun, Xiang Yin, Chao Dong

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 代码评测 :repository(abstract)

AI总结 本文评估了Nano Banana 2在图像修复任务中的性能,发现提示设计至关重要,简洁提示和显式保真约束能平衡重建与感知质量。模型在全参考性能上表现竞争,用户研究中表现优异,但在感知质量与修复保真度之间存在差距,需改进可控性与保真度评估。

Comments Accepted by CVPR 2026 Workshop AAVM

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 4 篇

2605.12364 2026-05-13 cs.CR cs.LG cs.MA 57%

Attacks and Mitigations for Distributed Governance of Agentic AI under Byzantine Adversaries

针对拜占庭攻击者下的分布式代理AI治理的攻击与缓解措施

Matthew D. Laws, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本文分析了 compromised Provider 发起的攻击,并提出三种解决方案,在安全与性能之间进行权衡。

Comments 18 pages, 18 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12159 2026-05-13 cs.AI cs.GR 57%

ALGOGEN: Tool-Generated Verifiable Traces for Reliable Algorithm Visualization

ALGOGEN: 工具生成的可验证轨迹用于可靠的算法可视化

Kunpeng Liao, Yuexiao Ma, Yisheng Lin, Hualin Zeng, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 ALGOGEN通过分离算法执行与渲染,利用可视化轨迹代数和渲染风格语言提高算法可视化生成的可靠性,实验表明其在复杂任务中有效减少LLM幻觉,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11809 2026-05-13 cs.AI 57%

Beyond World-Frame Action Heads: Motion-Centric Action Frames for Vision-Language-Action Models

超越世界坐标动作头:面向视觉-语言-动作模型的运动中心动作框架

Huoren Yang, Jianchao Zhao, Hu Yusong, Qiguan Ou, Yuyang Gao, Wei Ke, Yuhang He, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) One Robotics Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出MCF-Proto,一种轻量级动作头,通过运动中心动作框架和原型基动作参数化,提升VLA模型对机器人操作行为的组织与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07552 2026-05-13 cs.CV 50%

VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network

VIMCAN: 基于混合Mamba-交叉注意力网络的视觉-惯性3D人体姿态估计

Zepeng Yang, Junxuan Bai, Hao Li, Ju Dai, Junjun Pan, Yongfeng Yin, Bin Li

机构 * Beihang University(北航) Peng Cheng Laboratory(鹏城实验室) Capital University of Physical Education and Sports(首都体育学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 仓库级理解 :repository(abstract)

AI总结 VIMCAN结合Mamba的高效序列建模与交叉注意力的空间推理,实现RGB关键点与穿戴式IMU数据的鲁棒融合,取得更优精度和实时推理性能。

Comments Accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏