arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2410.21349 2025-06-23 cs.LG cs.AI cs.PF 62%

FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system

Zeyuan Li, Yangfan He, Lewei He, Jianhui Wang, Tianyu Shi, Bin Lei, Yuchen Li, Qiuwu Chen

机构 * School of Software, South China Normal University(南方科技大学软件学院) University of Minnesota - Twin Cities(明尼苏达大学双城分校) University of Electronic Science and Technology of China(电子科技大学) University of Toronto(多伦多大学) University of Connecticut(康涅狄格大学) AI center, AIGCode Inc.(AIGCode公司人工智能中心)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15251 2025-06-19 cs.LG cs.AI 62%

Singular Value Decomposition on Kronecker Adaptation for Large Language Model

Yee Hin Chong, Peng Qu

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13832 2025-06-19 cs.SE cs.AI 62%

FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation

Hongda Zhu, Yiwen Zhang, Bing Zhao, Jingzhe Ding, Siyao Liu, Tong Liu, Dandan Wang, Yanan Liu, Zhaojian Li

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-罗quant研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00319 2025-06-19 cs.LG cs.AI 62%

Data Augmentation Policy Search for Long-Term Forecasting

Liran Nochumsohn, Omri Azencot

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments TMLR 2025

Journal ref Transactions on Machine Learning Research, 2025. https://openreview.net/forum?id=Wnd0XY0twh

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18379 2025-06-18 cs.CR cs.AI cs.SE 62%

MALSIGHT: Exploring Malicious Source Code and Benign Pseudocode for Iterative Binary Malware Summarization

Haolang Lu, Hongrui Peng, Guoshun Nan, Jiaoyang Cui, Cheng Wang, Weifei Jin, Songtao Wang, Shengli Pan, Xiaofeng Tao

机构 * National Engineering Research Center for Mobile Network Technologies(移动网络技术国家工程研究中心) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Laboratory(中关村实验室)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.AI

Comments Accepted by IEEE Transactions on Information Forensics & Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11221 2025-06-16 cs.AI cs.CL cs.LO 62%

LLM-as-a-Fuzzy-Judge: Fine-Tuning Large Language Models as a Clinical Evaluation Judge with Fuzzy Logic

Weibing Zheng, Laurah Turner, Jess Kropczynski, Murat Ozer, Tri Nguyen, Shane Halse

机构 * University of Cincinnati(辛辛那提大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 1 figure, 2025 IFSA World Congress NAFIPS Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10989 2025-06-16 cs.SE cs.AI 62%

Prompt engineering and framework: implementation to increase code reliability based guideline for LLMs

Rogelio Cruz, Jonatan Contreras, Francisco Guerrero, Ezequiel Rodriguez, Carlos Valdez, Citlali Carrillo

机构 * IBM Technologies(IBM技术)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08743 2025-06-11 cs.IR cs.AI cs.DB cs.LG 62%

Bridging RDF Knowledge Graphs with Graph Neural Networks for Semantically-Rich Recommender Systems

Michael Färber, David Lamprecht, Yuni Susanti

机构 * ScaDS.AI \& TU Dresden, Dresden, Germany metaphacts GmbH, Walldorf, Germany Fujitsu Ltd., Japan

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments Accepted at DASFAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06957 2025-06-10 cs.LG cs.AI 62%

Policy Filtration for RLHF to Mitigate Noise in Reward Models

Chuheng Zhang, Wei Shen, Li Zhao, Xuyun Zhang, Xiaolong Xu, Wanchun Dou, Jiang Bian

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

Comments ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04670 2025-06-05 cs.SE cs.AI 62%

LLM Code Customization with Visual Results: A Benchmark on TikZ

Charly Reux, Mathieu Acher, Djamel Eddine Khelladi, Olivier Barais, Clément Quinton

机构 * Univ Rennes, Inria, IRISA, INSA(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所、法国工业与应用科学学院) Univ Rennes, Inria, CNRS, IUF, IRISA(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所、法国国家信息与自动化研究所、法国国家信息与自动化研究所) Univ Rennes, Inria, CNRS, IRISA(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所、法国国家信息与自动化研究所) Univ. Lille, CNRS, Inria(里昂大学、法国国家科学研究中心、法国国家信息与自动化研究所) Univ. Rennes, IRISA, Inria(里昂大学、法国国家信息与自动化研究所、法国国家信息与自动化研究所)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Journal ref EASE 2025 - Evaluation and Assessment in Software Engineering, Jun 2025, Istanbul, Turkey. pp.1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02314 2025-06-04 cs.AI cs.CL 62%

ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code

Tianyu Hua, Harper Hua, Violet Xiang, Benjamin Klieger, Sang T. Truong, Weixin Liang, Fan-Yun Sun, Nick Haber

机构 * Stanford University(斯坦福大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00943 2025-06-03 cs.SE cs.AI 62%

Legal Compliance Evaluation of Smart Contracts Generated By Large Language Models

Chanuka Wijayakoon, Hai Dong, H. M. N. Dilum Bandara, Zahir Tari, Anurag Soin

机构 * School of Computing Technologies, RMIT University(RMIT大学计算机技术学院) CSIRO’s Data61(CSIRO数据61研究中心) University of Technology, Sydney(悉尼技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Comments Accepted for publication at IEEE International Conference on Blockchain and Cryptocurrency (ICBC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00676 2025-06-03 cs.LG cs.AI 62%

SafeTuneBed: A Toolkit for Benchmarking LLM Safety Alignment in Fine-Tuning

Saad Hossain, Samanvay Vajpayee, Sirisha Rambhatla

机构 * Critical ML Lab(关键机器学习实验室) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16167 2025-06-03 cs.SE cs.CL 62%

CodeReviewQA: The Code Review Comprehension Assessment for Large Language Models

Hong Yi Lin, Chunhua Liu, Haoyu Gao, Patanamon Thongtanunam, Christoph Treude

机构 * The University of Melbourne(墨尔本大学) Singapore Management University(新加坡管理学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments The paper is published in Findings of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23239 2025-05-30 cs.SE cs.AI 62%

OSS-UAgent: An Agent-based Usability Evaluation Framework for Open Source Software

Lingkai Meng, Yu Shao, Long Yuan, Longbin Lai, Peng Cheng, Wenyuan Yu, Wenjie Zhang, Xuemin Lin, Jingren Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Wuhan University of Technology(武汉理工大学) Alibaba Group(阿里巴巴集团) Tongji University(同济大学) University of New South Wales(新南威尔士大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08008 2025-05-30 cs.LG cs.CL cs.HC 62%

Sample-Efficient Human Evaluation of Large Language Models via Maximum Discrepancy Competition

Kehua Feng, Keyan Ding, Hongzhi Tan, Kede Ma, Zhihua Wang, Shuangquan Guo, Yuzhou Cheng, Ge Sun, Guozhou Zheng, Qiang Zhang, Huajun Chen

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

Comments 35 pages, 6 figures, Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20184 2025-05-27 cs.CL cs.AI 62%

THiNK: Can Large Language Models Think-aloud?

Yongan Yu, Mengqian Wu, Yiran Lin, Nikki G. Lobczowski

机构 * McGill University(麦吉尔大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19502 2025-05-27 cs.SE cs.AI 62%

CODE-DITING: A Reasoning-Based Metric for Functional Alignment in Code Evaluation

Guang Yang, Yu Zhou, Xiang Chen, Wei Zheng, Xing Hu, Xin Zhou, David Lo, Taolue Chen

机构 * College of Computer Science and Technology(计算机科学与技术学院) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) School of Software(软件学院) School of Software Technology(软件技术学院) School of Computing and Information Systems(计算与信息系统学院) School of Computing and Mathematical Sciences(计算与数学科学学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17149 2025-05-26 cs.CL cs.AI 62%

Large Language Models for Predictive Analysis: How Far Are They?

Qin Chen, Yuanyi Ren, Xiaojun Ma, Yuyang Shi

机构 * Peking University(北京大学) Harvard University(哈佛大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15253 2025-05-23 cs.CL cs.LG 62%

Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators

Yilun Zhou, Austin Xu, Peifeng Wang, Caiming Xiong, Shafiq Joty

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

Comments ICML 2025. The first two authors contributed equally. The codebase is at https://github.com/SalesforceAIResearch/jetts-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13178 2025-05-22 cs.LG cs.AI 62%

Benchmarking Post-Training Quantization in LLMs: Comprehensive Taxonomy, Unified Evaluation, and Comparative Analysis

Jiaqi Zhao, Ming Wang, Miao Zhang, Yuzhang Shang, Xuebo Liu, Yaowei Wang, Min Zhang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 3 fugures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15469 2025-05-22 cs.SE cs.AI 62%

A Qualitative Investigation into LLM-Generated Multilingual Code Comments and Automatic Evaluation Metrics

Jonathan Katzy, Yongcheng Huang, Gopal-Raj Panchu, Maksym Ziemlewski, Paris Loizides, Sander Vermeulen, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.AI

Comments Accepted PROMISE '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15189 2025-05-13 cs.SE cs.CL 62%

EffiLearner: Enhancing Efficiency of Generated Code via Self-Optimization

Dong Huang, Jianbo Dai, Han Weng, Puzhen Wu, Yuhao Qing, Heming Cui, Zhijiang Guo, Jie M. Zhang

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02037 2025-05-13 cs.SE cs.CL 62%

EffiBench: Benchmarking the Efficiency of Automatically Generated Code

Dong Huang, Yuhao Qing, Weiyi Shang, Heming Cui, Jie M. Zhang

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments Camera Ready for NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14338 2025-05-12 cs.CL cs.SE 62%

English Please: Evaluating Machine Translation with Large Language Models for Multilingual Bug Reports

Avinash Patil, Siru Tao, Aryan Jadon

机构 * Juniper Networks Inc.(Juniper网络公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL

Comments 8 Pages, 4 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02854 2025-05-07 cs.CL cs.AI 62%

Ensuring Reproducibility in Generative AI Systems for General Use Cases: A Framework for Regression Testing and Open Datasets

Masumi Morishige, Ryo Koshihara

机构 * Galirage Inc.(加利拉格公司)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20673 2025-04-30 cs.SE cs.AI 62%

CoCo-Bench: A Comprehensive Code Benchmark For Multi-task Large Language Model Evaluation

Wenjing Yin, Tianze Sun, Yijiong Yu, Jiawei Fang, Guangyao Su, Jiancheng Wang, Zekun Wang, Wei Wang, Ran Chen, Ziyun Dai, Shuai Yuan, Menghang Dong, Peng Luo, Dong Cao, Da Lei, Yajun Zhang, Hao Chen, Xiang Ma, Yong Liu, Weifeng Liu, Yuanjian Xu, Ji Pei

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Comments Submitted to ACL 2025. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19444 2025-04-29 cs.SE cs.CL 62%

Large Language Models are Qualified Benchmark Builders: Rebuilding Pre-Training Datasets for Advancing Code Intelligence Tasks

Kang Yang, Xinjun Mao, Shangwen Wang, Yanlin Wang, Tanghaoran Zhang, Bo Lin, Yihao Qin, Zhang Zhang, Yao Lu, Kamal Al-Sabahi

机构 * College of Computer, National University of Defense Technology(计算机学院,国防科技大学) Sun Yat-sen University(中山大学) College of Banking and Financial Studies(金融学院)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.CL

Comments Awarded the ACM SIGSOFT Distinguished Paper Award in ICPC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16263 2025-04-24 cs.LG cs.AI 62%

Gradient-Optimized Fuzzy Classifier: A Benchmark Study Against State-of-the-Art Models

Magnus Sieverding, Nathan Steffen, Kelly Cohen

机构 * University of Cincinnati(辛辛那提大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06193 2025-04-22 cs.SE cs.AI 62%

Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering

Ruiqi Wang, Jiyu Guo, Cuiyun Gao, Guodong Fan, Chun Yong Chong, Xin Xia

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Monash University Malaysia(墨尔本大学马来西亚分校) Zhejiang University(浙江大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Comments Accepted by ISSTA 2025: https://conf.researchr.org/details/issta-2025/issta-2025-papers/85/Can-LLMs-replace-Human-Evaluators-An-Empirical-Study-of-LLM-as-a-Judge-in-Software-E

详情

展开后加载摘要…

URL PDF HTML 收藏