arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-12 至 2026-05-12 共收录 11 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 11 篇

2602.12606 2026-05-12 cs.LG 74%

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

RelBench v2:关系数据的大型基准和存储库

Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Ljubljana(卢布尔雅那大学) Kumo AI University of Oxford(牛津大学)

专题命中 代码评测 :repository(title);分类 cs.LG

AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。

Comments Published at ICLR 2026. Website: https://relbench.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08658 2026-05-12 cs.LG cs.AI cs.SE 67%

Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching

Sketch-and-Verify: 通过程序草图实现推理时间扩展

Shan Jiang, Zijian Yi, Chenguang Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出SKETCHVERIFY方法,通过程序草图生成多样化候选方案,验证后选择最优,提升模型性能,同时探讨K与M的权衡关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10597 2026-05-12 cs.SE cs.AI 62%

CrackMeBench: Binary Reverse Engineering for Agents

CrackMeBench:用于代理的二进制逆向工程

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 CrackMeBench旨在评估语言模型代理在教育类CrackMe逆向工程任务中的能力,通过确定性二进制验证问题,结合公开校准CrackMe和生成任务,测试代理在无网络LinuxDocker沙箱中的表现,提供可重复的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10737 2026-05-12 cs.CL cs.LG 62%

PolyTruth: Multilingual Disinformation Detection using Transformer-Based Language Models

PolyTruth:基于Transformer语言模型的多语言虚假信息检测

Zaur Gouliev, Jennifer Waters, Chengqian Wang

机构 * School of Information & Communication Studies(信息与通信研究学院) University College Dublin(都柏林大学学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.LG

AI总结 本文通过比较五种多语言Transformer模型在虚假信息检测任务中的表现,揭示了不同模型在多语言环境下的性能差异及局限性,提出了PolyTruth Disinfo Corpus数据集以促进进一步研究。

Comments 11 pages, 5 figures, 4 tables. Submitted to arXiv in Computation and Language

Journal ref Machine Learning and Principles and Practice of Knowledge Discovery in Databases, ECML PKDD 2025, Communications in Computer and Information Science, vol. 2843, pp. 353-367, Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07024 2026-05-12 cs.LG cs.AI 62%

Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks

Delulu:一种经过验证的多语言基准,用于检测填充中间任务中的代码幻觉

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 Delulu是一个包含1951个跨7种语言和4种幻觉类型的填充中间任务样本的多语言基准,通过对抗性流程筛选出经过验证的样本,评估了11种开放式FIM模型,证明了任务内在难度而非模型家族特定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10890 2026-05-12 cs.SE 57%

CppPerf: An Automated Pipeline and Dataset for Performance-Improving C++ Commits

CppPerf:一个用于性能改进C++提交的自动化流水线和数据集

Tommy Ho, Khashayar Etemadi, Zhendong Su

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出CppPerf-Mine流水线,通过结合结构化提交过滤、LLM分类器和容器化构建测试阶段,挖掘改进执行时间的补丁,并构建包含347个手动验证补丁的CppPerf-DB数据集,评估仓库级修复工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10159 2026-05-12 cs.LG cs.NA math.NA physics.comp-ph 57%

jNO: A JAX Library for Neural Operator and Foundation Model Training

jNO:用于神经算子和基础模型训练的JAX库

Leon Armbruster, Rathan Ramesh, Georg Kruse, Christopher Straub

机构 * Fraunhofer Institute for Integrated Systems and Device Technology(弗劳恩霍夫整合系统与器件技术研究所)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 jNO是一个基于JAX的神经算子库,支持数据驱动和物理引导的训练,通过统一的符号语言编译优化流程,实现算子回归、网格感知残差评估和PDE约束训练的无缝切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09636 2026-05-12 cs.AI 57%

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准

Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Rice University(里士满大学) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Alibaba Group(阿里巴巴集团)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09408 2026-05-12 cs.LG cs.SI stat.ML 57%

GravityGraphSAGE: Link Prediction in Directed Attributed Graphs

GravityGraphSAGE:有向属性图中的链接预测

Riccardo Porcedda, Francesca Chiaromonte, Fabrizio Lillo, Andrea Vandin

机构 * Department of Excellence L’EMbeDS, Sant’Anna School of Advanced Studies(卓越部门L’EMbeDS,圣安娜高级研究学校) Department of Computer Science, University of Pisa(比萨大学计算机科学系) Department of Statistics and Huck Institutes of the Life Sciences, The Pennsylvania State University(统计学与生命科学学院,宾夕法尼亚州立大学) Class of Science, Scuola Normale Superiore(科学班级,正规大学) DTU Technical University of Denmark(丹麦技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出Gravity-GraphSAGE模型,通过改进GraphSAGE实现有向链接预测,优于现有图深度学习方法,在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09473 2026-05-12 cs.NI 50%

PolicyCache-SDN: Hierarchical Intra-Path Learning for Adaptive SDN Traffic Control

PolicyCache-SDN:分层路径内学习用于自适应SDN流量控制

Wenyang Jia, Jingjing Wang, Ziwei Yan, Tanren Liu, Yakun Ren, Kai Lei

专题命中 代码评测 :repository(abstract)

AI总结 PolicyCache-SDN通过分层路径内学习实现自适应SDN流量控制,提升核心链路利用率并降低网络延迟和SLA违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04425 2026-05-12 cs.NI cs.SY eess.IV eess.SY 50%

TeleSim: A Network-Aware Testbed and Benchmark Dataset for Telerobotic Applications

TeleSim: 一种网络感知的测试床和基准数据集用于远程机器人应用

Zexin Deng, Zhenhui Yuan, Longhao Zou

专题命中 代码评测 :repository(abstract)

AI总结 TeleSim通过模拟不同网络条件下的远程机器人任务,提供了一种网络感知的测试床和基准数据集,用于评估远程机器人系统在异构网络环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏