arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-17 至 2026-03-17 共收录 5 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 5 篇

2506.06251 2026-03-17 cs.SE cs.AI 81%

DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation

DesignBench: 一个全面的基于MLLM的前端代码生成基准测试

Jingyu Xiao, Ming Wang, Man Ho Lam, Yuxuan Wan, Junliang Liu, Yintong Huo, Michael R. Lyu

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13251 2026-03-17 cs.AI 74%

ManiBench: A Benchmark for Testing Visual-Logic Drift and Syntactic Hallucinations in Manim Code Generation

ManiBench:一个用于测试Manim代码生成中视觉-逻辑漂移和语法幻觉的基准测试

Nabin Oli

机构 * Sunway College Kathmandu(加德满都阳光学院) Birmingham City University(伯明翰城市大学)

专题命中 代码评测 :code generation(title);分类 cs.AI

AI总结 ManiBench旨在评估LLM在生成Manim CE代码时的性能,针对语法幻觉和视觉-逻辑漂移两种关键失败模式,包含150-200个问题,涵盖微积分、线性代数、概率、拓扑和AI等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 73%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14870 2026-03-17 cs.LG cs.AI 62%

IgPose: A Generative Data-Augmented Pipeline for Robust Immunoglobulin-Antigen Binding Prediction

IgPose:一种生成式数据增强管道,用于鲁棒的免疫球蛋白-抗原结合预测

Tien-Cuong Bui, Injae Chung, Wonjun Lee, Junsu Ko, Juyong Lee

机构 * Arontier Co., Ltd.(阿罗尼尔公司) Department of Molecular Medicine and Biopharmaceutical Sciences(分子医学与生物制药科学系) Graduate School of Convergence Science and Technology(融合科学与技术研究生院) Seoul National University(首尔国立大学) Research Institute of Pharmaceutical Science, College of Pharmacy(药学研究 institute,药学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 IgPose通过生成式数据增强管道和结合等效图神经网络等方法,提升免疫球蛋白与抗原结合预测的鲁棒性,实现高通量抗体发现。

Comments 11 pages, 4 figures, Bioinformatics

Journal ref Bioinformatics 42 (2026) btag076

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13287 2026-03-17 cs.LG cs.AI 62%

From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code

从随机答案到可验证推理:利用LLM生成代码的可解释决策

Anirudh Jaidev Mahesh, Ben Griffin, Fuat Alican, Joseph Ternasky, Zakari Salifu, Kelvin Amoaba, Yagiz Ihlamur, Aaron Ontoyin Yin, Aikins Laryea, Afriyie Samuel, Yigit Ihlamur

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Oxford(牛津大学) Vela Research(Vela研究公司) Amazon(亚马逊)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将LLM视为代码生成器而非实例评估器,通过生成可执行决策逻辑提升决策可解释性与可重复性,在创业资本创始人筛选中实现更高精度与可验证性。

Comments 12 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏