arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2508.02621 2025-10-14 cs.AI cs.CL cs.LG cs.MA 67%

HealthFlow: A Self-Evolving AI Agent with Meta Planning for Autonomous Healthcare Research

Yinghao Zhu, Yifan Qi, Zixiang Wang, Lei Gu, Dehao Sui, Haoran Hu, Xichen Zhang, Ziyi He, Junjun He, Liantao Ma, Lequan Yu

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code: https://github.com/yhzhu99/HealthFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17521 2025-10-01 cs.LG cs.AI cs.CL 67%

Recent Advances in Large Langauge Model Benchmarks against Data Contamination: From Static to Dynamic Evaluation

Simin Chen, Yiming Chen, Zexin Li, Yifan Jiang, Zhongwei Wan, Yixin He, Dezhi Ran, Tianle Gu, Haizhou Li, Tao Xie, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) National University of Singapore(国立新加坡大学) University of California, Riverside(加州大学河滨分校) University of Southern California(南加州大学) The Ohio State University(俄亥俄州立大学) Peking University(北京大学) Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Github Link: https://github.com/SeekingDream/Static-to-Dynamic-LLMEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19708 2025-09-25 cs.SE cs.AI cs.LG 67%

Intuition to Evidence: Measuring AI's True Impact on Developer Productivity

Anand Kumar, Vishal Khare, Deepak Sharma, Satyam Kumar, Vijay Saini, Anshul Yadav, Sachendra Jain, Ankit Rana, Pratham Verma, Vaibhav Meena, Avinash Edubilli

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

Comments 16 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21482 2025-09-01 cs.CL cs.AI cs.LG 67%

HSFN: Hierarchical Selection for Fake News Detection building Heterogeneous Ensemble

Sara B. Coutinho, Rafael M. O. Cruz, Francimaria R. S. Nascimento, George D. C. Cavalcanti

机构 * Centro de Informática (CIn), Universidade Federal de Pernambuco (UFPE)(计算机学院(CIn),佛罗里达州立大学(UFPE)) École de Technologie Supérieure (ÉTS), Université du Québec(高级技术学院(ÉTS),魁北克大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by IEEE International Conference on Systems, Man, and Cybernetics (SMC) - IEEE SMC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17568 2025-08-26 cs.CV cs.AI cs.CE cs.LG cs.PL 67%

MetaGen: A DSL, Database, and Benchmark for VLM-Assisted Metamaterial Generation

Liane Makatura, Benjamin Jones, Siyuan Bian, Wojciech Matusik

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG、cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10026 2025-08-15 cs.CL cs.AI cs.LG 67%

SABER: Switchable and Balanced Training for Efficient LLM Reasoning

Kai Zhao, Yanjun Zhao, Jiaming Song, Shien He, Lusheng Zhang, Qiang Zhang, Tianjiao Li

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23194 2025-08-01 cs.CL cs.AI cs.LG 67%

Geak: Introducing Triton Kernel AI Agent & Evaluation Benchmarks

Jianghui Wang, Vinay Joshi, Saptarshi Majumder, Xu Chao, Bin Ding, Ziqiong Liu, Pratik Prabhanjan Brahma, Dong Li, Zicheng Liu, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19598 2025-07-29 cs.CL cs.AI cs.CR cs.LG 67%

MOCHA: Are Code Language Models Robust Against Multi-Turn Malicious Coding Prompts?

Muntasir Wahed, Xiaona Zhou, Kiet A. Nguyen, Tianjiao Yu, Nirav Diwan, Gang Wang, Dilek Hakkani-Tür, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Winner Defender Team at Amazon Nova AI Challenge 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08333 2025-07-10 cs.SE cs.AI cs.CL 67%

CodeMirage: Hallucinations in Code Generated by Large Language Models

Vibhor Agarwal, Yulong Pei, Salwa Alamir, Xiaomo Liu

机构 * University of Surrey(萨里大学) JP Morgan AI Research(摩根大通AI研究)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

Comments Accepted at AutoMates @ IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15194 2025-06-30 cs.CL cs.AI cs.LG cs.PF 67%

MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark

Qihao Zhao, Yangyu Huang, Tengchao Lv, Lei Cui, Qinzheng Sun, Shaoguang Mao, Xin Zhang, Ying Xin, Qiufeng Yin, Scarlett Li, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21182 2025-06-27 cs.CL cs.AI cs.SE 67%

Maintaining MTEB: Towards Long Term Usability and Reproducibility of Embedding Benchmarks

Isaac Chung, Imene Kerboua, Marton Kardos, Roman Solomatin, Kenneth Enevoldsen

机构 * ITMO University(ITMO大学) Aarhus University(奥胡斯大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23419 2025-06-03 cs.SE cs.AI cs.CL 67%

SWE-bench Goes Live!

Linghao Zhang, Shilin He, Chaoyun Zhang, Yu Kang, Bowen Li, Chengxing Xie, Junhao Wang, Maoquan Wang, Yufan Huang, Shengyu Fu, Elsie Nallipogu, Qingwei Lin, Yingnong Dang, Saravan Rajmohan, Dongmei Zhang

机构 * Microsoft(微软)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

Comments Homepage: \url{https://swe-bench-live.github.io/}, Code: \url{https://github.com/SWE-bench-Live}, Dataset: \url{https://huggingface.co/SWE-bench-Live}

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13948 2025-06-03 cs.AI cs.CL cs.LG 67%

CityGPT: Empowering Urban Spatial Cognition of Large Language Models

Jie Feng, Tianhui Liu, Yuwei Du, Siqi Guo, Yuming Lin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、BNRist、清华大学) School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院、北京交通大学) Department of Electronic Engineering, Tsinghua University(电子工程系、清华大学) Department of Urban Planning, Tsinghua University(城市规划系、清华大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by KDD 2025 Research Track, https://github.com/tsinghua-fib-lab/CityGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00482 2025-06-03 cs.LG cs.AI cs.CL 67%

BenchHub: A Unified Benchmark Suite for Holistic and Customizable LLM Evaluation

Eunsu Kim, Haneul Yoo, Guijin Son, Hitesh Patel, Amit Agarwal, Alice Oh

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05528 2025-06-02 cs.CV cs.AI cs.CL cs.LG 67%

X-Transfer Attacks: Towards Super Transferable Adversarial Attacks on CLIP

Hanxun Huang, Sarah Erfani, Yige Li, Xingjun Ma, James Bailey

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08313 2025-05-28 cs.LG cs.AI cs.CL cs.CV 67%

Can Large Language Models Understand Symbolic Graphics Programs?

Zeju Qiu, Weiyang Liu, Haiwen Feng, Zhen Liu, Tim Z. Xiao, Katherine M. Collins, Joshua B. Tenenbaum, Adrian Weller, Michael J. Black, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Cambridge(剑桥大学) MIT(麻省理工学院)

专题命中 代码评测 :program synthesis(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025 Spotlight (v4: 47 pages, 26 figures, project page: https://sgp-bench.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01718 2025-05-27 cs.SE cs.AI cs.CL 67%

ACECODER: Acing Coder RL via Automated Test-Case Synthesis

Huaye Zeng, Dongfu Jiang, Haozhe Wang, Ping Nie, Xiaotong Chen, Wenhu Chen

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.CL、cs.AI

Comments 9 pages, 4 figure, 11 tables. Accepted to ACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14396 2025-05-21 cs.AI cs.CL cs.LG 67%

Causal Cartographer: From Mapping to Reasoning Over Counterfactual Worlds

Gaël Gendron, Jože M. Rožanec, Michael Witbrock, Gillian Dobbie

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 29 pages, 9 pages for the main paper, 20 pages for the references and appendix, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09021 2025-05-15 cs.SE cs.AI cs.PL 67%

AI-Mediated Code Comment Improvement

Maria Dhakal, Chia-Yi Su, Robert Wallace, Chris Fakhimi, Aakash Bansal, Toby Li, Yu Huang, Collin McMillan

机构 * Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,诺丁汉大学) Division of Computer Science and Engineering, Louisiana State University(计算机科学与工程分校,路易斯安那州立大学) Department of Computer Science, Vanderbilt University(计算机科学系,范德比大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI、cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12963 2025-05-01 cs.CL cs.AI cs.LG 67%

Open Llama2 Model for the Lithuanian Language

Artūras Nakvosas, Povilas Daniušis, Vytas Mulevičius

机构 * Neurotechnology(神经技术)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, 8 figures, 5 tables

Journal ref Informatica, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12365 2025-04-18 cs.SE cs.AI cs.LG 67%

Themisto: Jupyter-Based Runtime Benchmark

Konstantin Grotov, Sergey Titov

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

Comments Accepted to the third Deep Learning for Code (DL4C) workshop @ ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16514 2025-04-17 cs.AR cs.AI cs.LG cs.PL 67%

VeriMind: Agentic LLM for Automated Verilog Generation with a Novel Evaluation Metric

Bardia Nadimi, Ghali Omar Boutaib, Hao Zheng

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG、cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07803 2025-04-11 cs.CL cs.AI cs.LG 67%

A System for Comprehensive Assessment of RAG Frameworks

Mattia Rengo, Senad Beadini, Domenico Alfano, Roberto Abbruzzese

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Technical Report, 7 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08823 2025-03-25 cs.AR cs.AI cs.CL cs.ET cs.LG 67%

ResBench: Benchmarking LLM-Generated FPGA Designs with Resource Awareness

Ce Guo, Tong Zhao

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

Comments to be published in International Symposium on Highly Efficient Accelerators and Reconfigurable Technologies 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16402 2025-03-21 cs.AI cs.CL cs.LG 67%

The Emperor's New Clothes in Benchmarking? A Rigorous Examination of Mitigation Strategies for LLM Benchmark Data Contamination

Yifan Sun, Han Wang, Dongbai Li, Gang Wang, Huan Zhang

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14183 2025-03-19 cs.SE cs.AI cs.PL 67%

Can LLMs Enable Verification in Mainstream Programming?

Aleksandr Shefer, Igor Engel, Stanislav Alekseev, Daniil Berezun, Ekaterina Verbitskaia, Anton Podkopaev

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10292 2025-03-07 cs.AI cs.CL cs.LG 67%

Automatically Labeling Clinical Trial Outcomes: A Large-Scale Benchmark for Drug Development

Chufan Gao, Jathurshan Pradeepkumar, Trisha Das, Shivashankar Thati, Jimeng Sun

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08587 2025-03-03 cs.CL cs.AI cs.LG 67%

CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery

Xiaoshuai Song, Muxi Diao, Guanting Dong, Zhengyang Wang, Yujia Fu, Runqi Qiao, Zhexu Wang, Dayuan Fu, Huangxuan Wu, Bin Liang, Weihao Zeng, Yejie Wang, Zhuoma GongQue, Jianing Yu, Qiuna Tan, Weiran Xu

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05010 2025-02-26 cs.SE cs.AI cs.LG 67%

Scattered Forest Search: Smarter Code Space Exploration with LLMs

Jonathan Light, Yue Wu, Yiyou Sun, Wenchao Yu, Yanchi liu, Xujiang Zhao, Ziniu Hu, Haifeng Chen, Wei Cheng

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

Comments Accepted at ICLR 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13897 2025-02-20 cs.CL cs.AI cs.LG 67%

DataSciBench: An LLM Agent Benchmark for Data Science

Dan Zhang, Sining Zhoubian, Min Cai, Fengzu Li, Lekang Yang, Wei Wang, Tianjiao Dong, Ziniu Hu, Jie Tang, Yisong Yue

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 40 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏