A Code Comprehension Benchmark for Large Language Models for Code
机构 * IIT Bombay(印度理工学院博伊斯分校) ; IBM Research(IBM研究院)
专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE、cs.CL、cs.AI
Comments 10 Pages, 5 Figures
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
机构 * IIT Bombay(印度理工学院博伊斯分校) ; IBM Research(IBM研究院)
专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE、cs.CL、cs.AI
Comments 10 Pages, 5 Figures
专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI、cs.LG
专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.CL、cs.AI
Comments 25 pages
专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.CL、cs.AI
专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE、cs.CL、cs.AI
Comments ICLR 2023 (notable-top-25%); code and data are available at https://github.com/shuyanzhou/docprompting
基准测试足够强大吗?基于突变的诊断和回归套件的增强
专题命中 代码评测 :repository(title);分类 cs.SE
AI总结 本文提出STING框架,通过语义改变的程序变体增强回归测试,提高基准测试的可靠性。实验显示,77%的实例存在至少一个存活变体,测试覆盖率提升,修复率下降,揭示了基准测试的不足。
Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)
PERFOPT-Bench:评估软件性能优化中的编码代理
专题命中 代码评测 :coding agent(title);分类 cs.SE
AI总结 该研究介绍PERFOPT-Bench基准,用于评估软件性能优化中编码代理的完整性能工程循环。通过7个长期任务评估7个不同的代理堆栈,发现优化性能取决于工作负载,原始加速作基准分数不安全,还提出中继试验可恢复额外空间。
DecompRL: 通过学习模块化代码生成解决更难的问题
机构 * FAIR at Meta ; Inria, \'Ecole Normale Sup\'erieure
专题命中 代码评测 :code generation(title);分类 cs.LG
AI总结 提出DecompRL算法,通过强化学习将问题分解为可复用的子函数,重组模块生成候选解,将GPU瓶颈转移至CPU评估,在LiveCodeBench和CodeContests上超越标准RL基线。
RelBench v2:关系数据的大型基准和存储库
机构 * Stanford University(斯坦福大学) ; National University of Singapore(新加坡国立大学) ; University of Ljubljana(卢布尔雅那大学) ; Kumo AI ; University of Oxford(牛津大学)
专题命中 代码评测 :repository(title);分类 cs.LG
AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。
Comments Published at ICLR 2026. Website: https://relbench.stanford.edu
EVM-QuestBench: 一个基于执行的自然语言交易代码生成基准测试
机构 * Gradient ; Soochow University(苏州大学)
专题命中 代码评测 :code generation(title);分类 cs.CL
AI总结 本文提出EVM-QuestBench,一个基于执行的自然语言交易脚本生成基准测试,包含107个任务,通过动态评估和模块化架构评估20个模型,发现单步精度与多步流程完成存在显著差异。
Comments 10 pages, 13 figures
ManiBench:一个用于测试Manim代码生成中视觉-逻辑漂移和语法幻觉的基准测试
机构 * Sunway College Kathmandu(加德满都阳光学院) ; Birmingham City University(伯明翰城市大学)
专题命中 代码评测 :code generation(title);分类 cs.AI
AI总结 ManiBench旨在评估LLM在生成Manim CE代码时的性能,针对语法幻觉和视觉-逻辑漂移两种关键失败模式,包含150-200个问题,涵盖微积分、线性代数、概率、拓扑和AI等领域。
MoEKD:混合专家知识蒸馏用于鲁棒且高性能的压缩代码模型
专题命中 代码评测 :code model(title);分类 cs.SE
AI总结 本文提出MoEKD框架,通过混合专家架构实现多专家知识蒸馏,提升压缩模型的鲁棒性和性能,实验表明在漏洞检测任务中,MoEKD在对抗鲁棒性和预测性能上均优于现有基线方法。
Comments Accepted to the Research Track of the Evaluation and Assessment in Software Engineering (EASE) 2026
NotSoTiny: 一个大规模、活体的RTL代码生成基准
机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) ; Universitat Politecnica de Catalunya(加泰罗尼亚理工大学)
专题命中 代码评测 :code generation(title);分类 cs.AI
AI总结 NotSoTiny是一个大规模、活体的RTL代码生成基准,通过评估LLM生成结构丰富且具有上下文意识的RTL代码的能力,以克服当前LLM在硬件设计中的限制并推动技术发展。
Comments 9 pages, 5 figures
机构 * IRISA(里索斯研究所)
专题命中 代码评测 :program synthesis(title);分类 cs.AI
Comments 54 pages
专题命中 代码评测 :code generation(title);分类 cs.CL
专题命中 代码评测 :repository(title);分类 cs.CL
Comments 15 pages include References
腾讯工作伙伴基准测试:一个具有抗污染任务构建的多领域编码智能体基准测试
机构 * Tencent(腾讯) ; Youtu Lab(腾讯优图实验室) ; Keen Security Lab(腾讯安全科恩实验室) ; Workbuddy(腾讯工作伙伴) ; Yunding Security Lab(腾讯云鼎实验室)
专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL
AI总结 介绍腾讯工作伙伴基准测试这一多领域编码智能体评估套件,核心是统一评估框架,任务经反向设计防污染,数据集公开,四个子集探测工作不同方面,以统一格式和协议运行,还给出跨模型排行榜。
Comments 30 pages, 9 figures. Project page: https://workbuddybench.com/ ; code: https://github.com/Tencent/workbuddy-bench ; dataset: https://huggingface.co/datasets/tencent/workbuddy-bench
Vision2Web: 一个用于视觉网站开发的分层基准,包含代理验证
机构 * Tsinghua University(清华大学)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.AI
AI总结 本文提出Vision2Web基准,用于评估视觉网站开发能力,包含193个任务和16类,通过GUI代理验证器和基于VLM的裁判器评估多个视觉语言模型,揭示了在全栈开发中现有模型的性能差距。
ATM:基于CID的预写准入机制用于多智能体代码协同合成
专题命中 代码评测 :software agent(abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 提出ATM框架,通过CID代理和适配器引导的原子化,解决多智能体LLM系统中并发写意图的准入、组合与序列化问题,支持可审计性和有限恢复能力。
Comments 40 pages, 8 figures. Source code and supplementary artifact links are described in the manuscript appendix
TIP: on-policy distillation 中的 token 重要性
专题命中 代码评测 :repository(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本研究探讨了在 on-policy 知识蒸馏中哪些 token 对学习信号最有用,提出了一种基于学生熵和教师-学生分歧的双轴分类方法,并通过实验验证了在有限内存条件下使用少量 token 进行蒸馏的有效性。
VeriEquivBench:一种无需真实地面真相的正式可验证代码评估等价分数
机构 * Huazhong University of Science and Technology(华中科技大学) ; University of Alberta(阿尔伯塔大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Hong Kong University of Science and Technology(香港科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI、cs.PL
AI总结 本文提出VeriEquivBench,通过2389个复杂算法问题评估正式可验证代码的生成与推理能力,揭示当前LLM在生成正式规范和代码方面的挑战,推动可扩展可靠编码代理的发展。
CODMAS:一种基于辩证多智能体协作的结构化RTL优化框架
机构 * National Taiwan University(国立台湾大学) ; IBM Research(IBM研究院)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.PL
AI总结 CODMAS通过结合结构化辩证推理与领域感知代码生成和确定性评估,实现RTL优化自动化,显著提升了时钟门控的功耗降低和流水线的延迟减少效果。
Journal ref EACL 2026
MobileKernelBench: LLMs能否为移动设备编写高效的内核?
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.AI、cs.LG
AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。
Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/
MapCoder-Lite:将多智能体编码 distilling 进单一小型 LLM
机构 * Hanyang University(翰阳大学) ; Samsung SDS(三星SDS)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.AI
AI总结 MapCoder-Lite通过三支柱方法将多智能体编码distilling进单一7B模型,显著提升代码生成性能并降低资源消耗。
在软件工程中评估AI模型:一项综述、搜索工具和统一方法以提高基准质量
机构 * EEMCS faculty, Delft University of Technology(代尔夫特理工大学EEMCS学院)
专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE、cs.AI
AI总结 本文提出BenchScout和BenchFrame,通过统一框架提升软件工程AI模型的基准质量,改进现有基准并验证其有效性。
Comments Accepted for publication in IEEE Transactions on Software Engineering
DeepCode: 开放代理编程
机构 * The University of Hong Kong(香港大学)
专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI
AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。
Comments for source code, please see https://github.com/HKUDS/DeepCode
DAComp: 在全数据智能生命周期中跨领域评估数据代理
机构 * Institute of Automation, CAS(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.CL、cs.AI
AI总结 DAComp通过210个任务评估数据代理在数据工程与分析中的能力,揭示现有代理在复杂流程编排和开放性推理中的不足。
对Hugging Face模型进行软件工程活动的分类:自动化与发现
机构 * Universitat Politècnica de Catalunya(政治与技术大学) ; Singapore Management University(新加坡管理大学)
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.LG
AI总结 本文通过分类Hugging Face上的预训练模型,揭示了软件工程中模型的应用现状与不足,为自动化场景提供了基础。
机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) ; Fudan University(复旦大学) ; Shanghai Institute of Artificial Intelligence for Education(教育人工智能研究所) ; East China Normal University(华东师范大学) ; School of Information, Renmin University of China(信息学院,中国人民大学) ; School of Smart Governance, Renmin University of China(智能治理学院,中国人民大学)
专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.AI
Comments Accepted by CIKM 2025
机构 * University of Massachusetts(马萨诸塞大学) ; Rutgers University(罗格斯大学)
专题命中 代码评测 :code model(abstract);repository(abstract);分类 cs.SE、cs.AI