arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2509.24091 2025-12-04 cs.SE cs.AI cs.PF 62%

PerfBench: Can Agents Resolve Real-World Performance Bugs?

PerfBench: 代理能否解决现实中的性能缺陷?

Spandan Garg, Roshanak Zilouchian Moghaddam, Neel Sundaresan

机构 * Microsoft Corporation(微软公司)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 PerfBench通过引入新的基准测试,评估代理解决性能缺陷的能力,发现现有代理在性能优化任务上表现不佳,但通过改进工具和指导可提升至20%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12286 2025-12-02 cs.AI cs.SE 62%

The SWE-Bench Illusion: When State-of-the-Art LLMs Remember Instead of Reason

SWE-Bench 的错觉:当最先进的大语言模型记住而不是推理

Shanchao Liang, Spandan Garg, Roshanak Zilouchian Moghaddam

机构 * Purdue University(普渡大学) Microsoft(微软)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文指出,SWE-Bench 的高表现可能源于记忆而非推理,通过两个诊断任务揭示模型在软件工程任务中的能力限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24616 2025-12-02 cs.CL cs.AI 62%

Eye of Judgement: Dissecting the Evaluation of Russian-speaking LLMs with POLLUX

Judgment Eye: 解剖俄罗斯语LLM评估的POLLUX

Nikita Martynov, Anastasia Mordasheva, Dmitriy Gorbetskiy, Danil Astafurov, Ulyana Isaeva, Elina Basyrova, Sergey Skachkov, Victoria Berestova, Nikolay Ivanov, Valeriia Zanina, Alena Fenogenova

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 POLLUX通过细粒度任务分类和LLM评估器,提供可解释的俄语生成模型评估方法。

Comments short version

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22377 2025-12-01 cs.LG cs.AI physics.data-an 62%

A Systematic Literature Review of Spatio-Temporal Graph Neural Network Models for Time Series Forecasting and Classification

时空图神经网络模型在时间序列预测与分类中的系统文献综述

Flavio Corradini, Flavio Gerosa, Marco Gori, Carlo Lucheroni, Marco Piangerelli, Martina Zannotti

机构 * School of Science and Technology, University of Camerino(科学与技术学院,坎皮诺大学) DIISM, University of Siena(DIISM,锡耶纳大学) Syeew s.r.l.(Syeew公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了时空图神经网络在时间序列预测与分类中的应用,全面分析了不同模型的性能对比及现存挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20955 2025-11-27 cs.SE cs.AI 62%

SpaceX: Exploring metrics with the SPACE model for developer productivity

SpaceX:探索SPACE模型用于开发者生产力的度量

Sanchit Kaul, Kevin Nhu, Jason Eissayou, Ivan Eser, Victor Borup

机构 * University Of California, Davis(加州大学戴维斯分校)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 SpaceX研究通过SPACE模型探索开发者生产力的多维度量,揭示负面情绪与提交频率的正相关性,并提出复合生产力分数以解决开发者效能异质性问题。

Comments Code available at https://github.com/knhu/ECS260Project

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07071 2025-11-21 q-fin.TR cs.AI cs.LG q-fin.CP 62%

TRADES: Generating Realistic Market Simulations with Diffusion Models

TRADES: 使用扩散模型生成逼真市场模拟

Leonardo Berti, Bardh Prenkaj, Paola Velardi

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 TRADES通过基于变换器的扩散模型生成逼真市场模拟,提升合成数据在金融任务中的应用价值。

Comments 8 pages

Journal ref ECAI 2025. Volume 413: Pages 3703 - 3710

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13998 2025-11-19 cs.SE cs.AI 62%

LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering

Jielin Qiu, Zuxin Liu, Zhiwei Liu, Rithesh Murthy, Jianguo Zhang, Haolin Chen, Shiyu Wang, Ming Zhu, Liangwei Yang, Juntao Tan, Roshan Ram, Akshara Prabhakar, Tulika Awalgaonkar, Zixiang Chen, Zhepeng Cen, Cheng Qian, Shelby Heinecke, Weiran Yao, Silvio Savarese, Caiming Xiong, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

Comments 54-pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18646 2025-11-19 cs.AI cs.CL 62%

Beyond Benchmark: LLMs Evaluation with an Anthropomorphic and Value-oriented Roadmap

Jun Wang, Ninglun Gu, Kailai Zhang, Zijiao Zhang, Yelun Bao, Jin Yang, Xu Yin, Liwei Liu, Yihuan Liu, Pengyong Li, Gary G. Yen, Junchi Yan

机构 * Department of Networks, China Mobile Communications Group Co.,Ltd.(中国移动通信集团有限公司网络部) Xidian University(西安电子科技大学) Oklahoma State University(俄克拉荷马州立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments Preprint. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11933 2025-11-18 cs.CL cs.LG 62%

InData: Towards Secure Multi-Step, Tool-Based Data Analysis

Karthikeyan K, Raghuveer Thirukovalluru, Bhuwan Dhingra, David Edwin Carlson

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19319 2025-11-14 cs.CL cs.AI 62%

FHIR-AgentBench: Benchmarking LLM Agents for Realistic Interoperable EHR Question Answering

Gyubok Lee, Elea Bach, Eric Yang, Tom Pollard, Alistair Johnson, Edward Choi, Yugang jia, Jong Ha Lee

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院) Verily Life Sciences(Verily 生物科技) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09748 2025-11-14 cs.CL cs.AI 62%

How Small Can You Go? Compact Language Models for On-Device Critical Error Detection in Machine Translation

Muskaan Chopra, Lorenz Sparrenberg, Sarthak Khanna, Rafet Sifa

机构 * Fraunhofer IAIS - Department of Media Engineering(弗劳恩霍夫人工智能研究所-媒体工程部门) University of Bonn - Department of Computer Science(波恩大学-计算机科学系) Lamarr Institute for Machine Learning(拉马尔人工智能与机器学习研究所)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments Accepted in IEEE BigData 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08896 2025-11-13 cs.CV cs.AI cs.LG 62%

Classifying Histopathologic Glioblastoma Sub-regions with EfficientNet

Sanyukta Adap, Ujjwal Baid, Spyridon Bakas

机构 * Division of Computational Pathology, Department of Pathology \& Laboratory Medicine, Indiana University School of Medicine, Indianapolis, IN, USA Indiana University Melvin Bren Simon Comprehensive Cancer Center, Indianapolis, IN, USA Department of Radiology \& Imaging Sciences, Indiana University School of Medicine, Indianapolis, IN, USA Department of Biostatistics \& Health Data Science, Indiana University School of Medicine, Indianapolis, IN, USA Department of Neurological Surgery, Indiana University School of Medicine, Indianapolis, IN, USA Department of Computer Science, Luddy School of Informatics, Computing Engineering, Indiana University, Indianapolis, IN, USA Corresponding authors: , , Equal senior authors

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02724 2025-11-13 eess.SP cs.AI cs.LG 62%

Veli: Unsupervised Method and Unified Benchmark for Low-Cost Air Quality Sensor Correction

Yahia Dalbah, Marcel Worring, Yen-Chia Hsu

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments Main content: 7 pages, 9 Figures, 3 Tables. Appendix: 4 pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20411 2025-11-05 cs.SE cs.CL 62%

SWE-rebench: An Automated Pipeline for Task Collection and Decontaminated Evaluation of Software Engineering Agents

Ibragim Badertdinov, Alexander Golubev, Maksim Nekrashevich, Anton Shevtsov, Simon Karasik, Andrei Andriushchenko, Maria Trofimova, Daria Litvintseva, Boris Yangel

机构 * Nebius

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

Comments Dataset: https://huggingface.co/datasets/nebius/SWE-rebench, SWE-rebench leaderboard https://swe-rebench.com NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26101 2025-11-04 cs.CL cs.PL quant-ph 62%

QCoder Benchmark: Bridging Language Generation and Quantum Hardware through Simulator-Based Feedback

Taku Mikuriya, Tatsuya Ishigaki, Masayuki Kawarada, Shunya Minami, Tadashi Kadowaki, Yohichi Suzuki, Soshun Naito, Shunya Takata, Takumi Kato, Tamotsu Basseda, Reo Yamada, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) Yokohama National University(Yokohama国立大学) CyberAgent, Inc.(CyberAgent公司) DENSO CORPORATION(DENSO公司) The University of Tokyo(东京大学) Keio University(庆应义塾大学) NTT DATA GROUP Corporation(NTT DATA集团公司) Miletos inc.(Miletos公司) University of Tsukuba(筑波大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.PL

Comments Accepted to INLG2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26423 2025-10-31 cs.SE cs.CL 62%

Nexus: Execution-Grounded Multi-Agent Test Oracle Synthesis

Dong Huang, Mingzhe Du, Jie M. Zhang, Zheng Lin, Meng Luo, Qianru Zhang, See-Kiong Ng

机构 * NUS(新加坡国立大学)

专题命中 代码评测 :program repair(abstract);分类 cs.SE、cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26094 2025-10-31 cs.AI cs.LG 62%

Lean4Physics: Comprehensive Reasoning Framework for College-level Physics in Lean4

Yuxin Li, Minghao Liu, Ruida Wang, Wenzhao Ji, Zhitao He, Rui Pan, Junming Huang, Tong Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Princeton University(普林斯顿大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24677 2025-10-29 cs.CL cs.AI 62%

Dissecting Role Cognition in Medical LLMs via Neuronal Ablation

Xun Liang, Huayi Lai, Hanyu Wang, Wentao Zhang, Linfeng Zhang, Yanfang Chen, Feiyu Xiong, Zhiyu Li

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Center of Machine Learning Research, Peking University(北京大学机器学习研究中心) School of Artificial Intelligence, Shanghai Jiaotong University(上海交通大学人工智能学院) Health Informatics Committee of the China Society for Scientific and Technical Information, Renmin University of China(中国科学技术信息学会健康信息技术委员会,中国人民大学) Institute for Advanced Algorithms Research (IAAR), Shanghai, China(先进算法研究所(IAAR),上海,中国) Memtensor Research Center, Shanghai, China(Memtensor研究中心,上海,中国)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23169 2025-10-29 cs.CL cs.SE 62%

MATCH: Task-Driven Code Evaluation through Contrastive Learning

Marah Ghoummaid, Vladimir Tchuiev, Ofek Glick, Michal Moshkovitz, Dotan Di Castro

机构 * Bosch Research(博世研究)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16724 2025-10-29 cs.AI cs.CL 62%

A Comprehensive Survey on Reinforcement Learning-based Agentic Search: Foundations, Roles, Optimizations, Evaluations, and Applications

Minhua Lin, Zongyu Wu, Zhichao Xu, Hui Liu, Xianfeng Tang, Qi He, Charu Aggarwal, Hui Liu, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) The University of Utah(犹他大学) Amazon(亚马逊) Microsoft(微软) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心) Michigan State University(密歇根州立大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments 38 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.10361 2025-10-28 cs.LG cs.AI cs.GT 62%

Human Choice Prediction in Language-based Persuasion Games: Simulation-based Off-Policy Evaluation

Eilam Shapira, Omer Madmon, Reut Apel, Moshe Tennenholtz, Roi Reichart

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL), 2025. Pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06186 2025-10-27 cs.CL cs.AI 62%

RECODE-H: A Benchmark for Research Code Development with Interactive Human Feedback

Chunyu Miao, Henry Peng Zou, Yangning Li, Yankai Chen, Yibo Wang, Fangxin Wang, Yifan Li, Wooseong Yang, Bowei He, Xinni Zhang, Dianzhi Yu, Hanchen Yang, Hoang H Nguyen, Yue Zhou, Jie Yang, Jizhou Guo, Wenzhe Fan, Chin-Yuan Yeh, Panpan Meng, Liancheng Fang, Jinhu Qi, Wei-Chieh Huang, Zhengyao Gu, Yuwei Han, Langzhou He, Yuyao Yang, Yinghui Li, Hai-Tao Zheng, Xue Liu, Irwin King, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Tsinghua University(清华大学) McGill University(麦吉尔大学) MBZUAI(麦吉尔大学人工智能研究所) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Shanghai Jiao Tong University(上海交通大学) National Taiwan University(国立台湾大学) Xi’an Jiaotong University(西安交通大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments Code and dataset are available at github.com/ChunyuMiao98/RECODE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16062 2025-10-23 cs.CL cs.AI 62%

Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs

Guiyao Tie, Zenghui Yuan, Zeli Zhao, Chaoran Hu, Tianhe Gu, Ruihang Zhang, Sizhe Zhang, Junran Wu, Xiaoyue Tu, Ming Jin, Qingsong Wen, Lixing Chen, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Griffith University(格里菲斯大学) Squirrel Ai Learning(squirrel ai 学习) Shanghai Jiaotong University(上海交通大学) Lehigh University(莱斯大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

Comments 47 pages, 25 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18328 2025-10-22 cs.LG cs.AI 62%

Scalable, Explainable and Provably Robust Anomaly Detection with One-Step Flow Matching

Zhong Li, Qi Huang, Yuxuan Zhu, Lincen Yang, Mohammad Mohammadi Amiri, Niki van Stein, Matthijs van Leeuwen

机构 * The Leiden Institute of Advanced Computer Science (LIACS), Leiden University(莱顿先进计算机科学研究所(LIACS)、莱顿大学) Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系) The Intelligent Computing Research Center, Great Bay University(大湾大学智能计算研究中心)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments Paper accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02672 2025-10-22 cs.CL cs.AI 62%

EvaLearn: Quantifying the Learning Capability and Efficiency of LLMs via Sequential Problem Solving

Shihan Dou, Ming Zhang, Chenhao Huang, Jiayi Chen, Feng Chen, Shichun Liu, Yan Liu, Chenxiao Liu, Cheng Zhong, Zongzhang Zhang, Tao Gui, Chao Xin, Chengzhi Wei, Lin Yan, Yonghui Wu, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) ByteDance Seed(字节跳动种子) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025. 47 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17163 2025-10-21 cs.SE cs.AI 62%

TREAT: A Code LLMs Trustworthiness / Reliability Evaluation and Testing Framework

Shuzheng Gao, Eric John Li, Man Ho Lam, Jingyu Xiao, Yuxuan Wan, Chaozheng Wang, Ng Man Tik, Michael R. Lyu

机构 * ARISE Lab, Department of Computer Science and Engineering(ARISE实验室,计算机科学与工程系)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13992 2025-10-17 cs.SE cs.LG 62%

Signature in Code Backdoor Detection, how far are we?

Quoc Hung Le, Thanh Le-Cong, Bach Le, Bowen Xu

机构 * North Carolina State University(北卡罗来纳州立大学) The University of Melbourne(墨尔本大学)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.LG

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09493 2025-10-13 cs.LG cs.AI 62%

Performance Analysis of Machine Learning Algorithms in Chronic Kidney Disease Prediction

Iftekhar Ahmed, Tanzil Ebad Chowdhury, Biggo Bushon Routh, Nafisa Tasmiya, Shadman Sakib, Adil Ahmed Chowdhury

机构 * Leading University(领先大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 7 figures, Presented at the 2022 IEEE 13th Annual Information Technology, Electronics and Mobile Communication Conference (IEMCON), pp. 0417-0423

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07740 2025-10-10 cs.SE cs.AI 62%

AppForge: From Assistant to Independent Developer -- Are GPTs Ready for Software Development?

Dezhi Ran, Yuan Cao, Mengzhou Wu, Simin Chen, Yuzhe Guo, Jun Ren, Zihe Song, Hao Yu, Jialei Wei, Linyi Li, Wei Yang, Baishakhi Ray, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU)) School of Computer Science, Peking University, China(北京大学计算机科学学院) Columbia University, USA(哥伦比亚大学) Beijing Jiaotong University, China(北京交通大学) University of Texas at Dallas, USA(德克萨斯大学达拉斯分校) Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学) Fudan University Institute of Systems for Advanced Computing, Shanghai, China(复旦大学先进计算系统研究所) Simon Fraser University, Canada(西蒙弗雷泽大学) Shanghai Institute of Systems for Open Computing, Shanghai, China(上海开放计算系统研究所)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

Comments Under Review. Benchmark and leadboards at https://appforge-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06275 2025-10-09 cs.CL cs.AI 62%

Reproducibility Study of "XRec: Large Language Models for Explainable Recommendation"

Ranjan Mishra, Julian I. Bibo, Quinten van Engelen, Henk Schaapman

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏