arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1729 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1729 篇

2406.19532 2025-06-10 cs.DM cs.LG 57%

Differentiable Quadratic Optimization For The Maximum Independent Set Problem

Ismail Alkhouri, Cedric Le Denmat, Yingjie Li, Cunxi Yu, Jia Liu, Rongrong Wang, Alvaro Velasquez

专题命中 代码评测 :repository(abstract);分类 cs.LG

Journal ref International Conference on Machine Learning 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04894 2025-06-06 cs.CL 57%

ICPC-Eval: Probing the Frontiers of LLM Reasoning with Competitive Programming Contests

Shiyi Xu, Yiwen Hu, Yingqian Min, Zhipeng Chen, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03546 2025-06-05 cs.RO cs.AI cs.MA 57%

From Virtual Agents to Robot Teams: A Multi-Robot Framework Evaluation in High-Stakes Healthcare Context

Yuanchen Bai, Zijian Ding, Angelique Taylor

机构 * Cornell University(康奈尔大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00296 2025-06-03 cs.SE 57%

CRScore++: Reinforcement Learning with Verifiable Tool and AI Feedback for Code Review

Manav Nitin Kapadnis, Atharva Naik, Carolyn Rose

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03854 2025-06-02 cs.CL 57%

Vision-Language Models Struggle to Align Entities across Modalities

Iñigo Alonso, Gorka Azkune, Ander Salaberria, Jeremy Barnes, Oier Lopez de Lacalle

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted Findings ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13392 2025-05-27 cs.LG 57%

Time Series Embedding Methods for Classification Tasks: A Review

Habib Irani, Yasamin Ghahremani, Arshia Kermani, Vangelis Metsis

机构 * Department of Computer Science(计算机科学系) Texas State University(德克萨斯州立大学) San Marcos, TX 78666

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18015 2025-05-26 cs.CV cs.LG 57%

SemSegBench & DetecBench: Benchmarking Reliability and Generalization Beyond Classification

Shashank Agnihotri, David Schader, Jonas Jakubassa, Nico Sharei, Simon Kral, Mehmet Ege Kaçar, Ruben Weber, Margret Keuper

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments First seven listed authors have equal contribution. GitHub: https://github.com/shashankskagnihotri/benchmarking_reliability_generalization. arXiv admin note: text overlap with arXiv:2505.05091

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02506 2025-05-21 cs.CL 57%

ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use

Junjie Ye, Zhengyin Du, Xuesong Yao, Weijian Lin, Yufei Xu, Zehui Chen, Zaiyuan Wang, Sining Zhu, Zhiheng Xi, Siyu Yuan, Tao Gui, Qi Zhang, Xuanjing Huang, Jiecao Chen

机构 * Fudan University(复旦大学) ByteDance(字节跳动) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13004 2025-05-20 cs.CL 57%

EffiBench-X: A Multi-Language Benchmark for Measuring Efficiency of LLM-Generated Code

Yuhao Qing, Boyu Zhu, Mingzhe Du, Zhijiang Guo, Terry Yue Zhuo, Qianru Zhang, Jie M. Zhang, Heming Cui, Siu-Ming Yiu, Dong Huang, See-Kiong Ng, Luu Anh Tuan

机构 * HKU(香港大学) UCL(伦敦大学学院) NTU(南洋理工大学) NUS(新加坡国立大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) Monash University(莫纳什大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织Data61分部) KCL(伦敦大学国王学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12798 2025-05-20 cs.AI 57%

BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models

Yige Li, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13001 2025-05-20 cs.AI 57%

CRUXEval-X: A Benchmark for Multilingual Code Reasoning, Understanding and Execution

Ruiyang Xu, Jialun Cao, Yaojie Lu, Ming Wen, Hongyu Lin, Xianpei Han, Ben He, Shing-Chi Cheung, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科技大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

Comments 18pages, Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09116 2025-05-15 cs.CL 57%

P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs

Yidan Zhang, Yu Wan, Boyi Deng, Baosong Yang, Haoran Wei, Fei Huang, Bowen Yu, Junyang Lin, Fei Huang, Jingren Zhou

机构 * Tongyi Lab, Alibaba Group Inc(通义实验室,阿里巴巴集团)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08485 2025-05-14 cs.AI stat.ML 57%

BAT: Benchmark for Auto-bidding Task

Alexandra Khirianova, Ekaterina Solodneva, Andrey Pudovikov, Sergey Osokin, Egor Samosvat, Yuriy Dorn, Alexander Ledovsky, Yana Zenkova

机构 * Avito(阿维托) Lebedev Physical Institute of the Russian Academy of Sciences(俄罗斯科学院列别杰夫物理研究所) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Lomonosov Moscow State University(莫斯科国立罗曼诺夫大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 11 pages, 10 figures, WWW 2025 conference

Journal ref J.Proceedings of the ACM on Web Conference 1 (2025) 2657

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16267 2025-05-14 cs.SD cs.LG eess.AS q-bio.QM 57%

A Classification Benchmark for Artificial Intelligence Detection of Laryngeal Cancer from Patient Voice

Mary Paterson, James Moor, Luisa Cutillo

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments 16 pages, 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07425 2025-05-13 cs.SE 57%

A Systematic Literature Review on Neural Code Translation

Xiang Chen, Jiacheng Xue, Xiaofei Xie, Caokai Liang, Xiaolin Ju

专题命中 代码评测 :code model(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05326 2025-05-09 cs.SE 57%

TS-Detector : Detecting Feature Toggle Usage Patterns

Tajmilur Rahman, Mengzhe Fei, Tushar Sharma, Chanchal Roy

专题命中 代码评测 :repository(abstract);分类 cs.SE

Comments 33rd ACM International Conference on the Foundations of Software Engineering, June 23--28, 2025, Trondheim, Norway

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04844 2025-05-09 cs.CL 57%

Osiris: A Lightweight Open-Source Hallucination Detection System

Alex Shan, John Bauer, Christopher D. Manning

机构 * Stanford University(斯坦福大学) Stanford HAI(斯坦福HAI)

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments Stanford 191W

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01627 2025-05-06 cs.LG cs.CE 57%

A Domain Adaptation of Large Language Models for Classifying Mechanical Assembly Components

Fatemeh Elhambakhsh, Daniele Grandi, Hyunwoong Ko

机构 * School of Computing and Augmented Intelligence, Arizona State University, Tempe, AZ(Arizona State大学计算机与增强智能学院) Autodesk, San Francisco, CA(Autodesk公司) School of Manufacturing Systems and Networks, Arizona State University, Mesa, AZ(Arizona State大学制造系统与网络学院)

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20121 2025-04-30 cs.LG 57%

Benchmarking Transferability: A Framework for Fair and Robust Evaluation

Alireza Kazemi, Helia Rezvani, Mahsa Baktashmotlagh

机构 * The University of Queensland(昆士兰大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19335 2025-04-29 cs.SE 57%

Exploring the Impact of Integrating UI Testing in CI/CD Workflows on GitHub

Xiaoxiao Gan, Chris Brown

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18838 2025-04-29 cs.CL 57%

Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks

Yixin Cao, Shibo Hong, Xinze Li, Jiahao Ying, Yubo Ma, Haiyuan Liang, Yantao Liu, Zijun Yao, Xiaozhi Wang, Dan Huang, Wenxuan Zhang, Lifu Huang, Muhao Chen, Lei Hou, Qianru Sun, Xingjun Ma, Zuxuan Wu, Min-Yen Kan, David Lo, Qi Zhang, Heng Ji, Jing Jiang, Juanzi Li, Aixin Sun, Xuanjing Huang, Tat-Seng Chua, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Tsinghua University(清华大学) Singapore University of Technology and Design(新加坡科技设计大学) University of California Davis(加州大学戴维斯分校) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Australian National University(澳大利亚国立大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16109 2025-04-24 cs.LG 57%

Representation Learning for Tabular Data: A Comprehensive Survey

Jun-Peng Jiang, Si-Yang Liu, Hao-Run Cai, Qile Zhou, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07346 2025-04-22 cs.CL 57%

BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models

Xu Huang, Wenhao Zhu, Hanxu Hu, Conghui He, Lei Li, Shujian Huang, Fei Yuan

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12558 2025-04-18 cs.IR cs.CL 57%

Benchmarking LLM-based Relevance Judgment Methods

Negar Arabzadeh, Charles L. A. Clarke

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12516 2025-04-18 cs.CL 57%

BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents

Jason Wei, Zhiqing Sun, Spencer Papay, Scott McKinney, Jeffrey Han, Isa Fulford, Hyung Won Chung, Alex Tachard Passos, William Fedus, Amelia Glaese

专题命中 代码评测 :coding agent(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00264 2025-04-15 cs.AI cs.CV 57%

TurtleBench: A Visual Programming Benchmark in Turtle Geometry

Sina Rismanchian, Yasaman Razeghi, Sameer Singh, Shayan Doroudi

专题命中 代码评测 :code generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06719 2025-04-10 cs.CV cs.AI 57%

Masked Scene Modeling: Narrowing the Gap Between Supervised and Self-Supervised Learning in 3D Scene Understanding

Pedro Hermosilla, Christian Stippel, Leon Sick

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01999 2025-04-10 cs.SE 57%

CodeMMLU: A Multi-Task Benchmark for Assessing Code Understanding & Reasoning Capabilities of CodeLLMs

Dung Nguyen Manh, Thang Phan Chau, Nam Le Hai, Thong T. Doan, Nam V. Nguyen, Quang Pham, Nghi D. Q. Bui

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04657 2025-04-08 cs.LG 57%

ACE-RLHF: Automated Code Evaluation and Socratic Feedback Generation Tool using Large Language Models and Reinforcement Learning with Human Feedback

Tasnia Rahman, Sathish A. P. Kumar, Sumit Jha, Arvind Ramanathan

专题命中 代码评测 :program repair(abstract);分类 cs.LG

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19804 2025-03-28 cs.CL 57%

Does RAG Introduce Unfairness in LLMs? Evaluating Fairness in Retrieval-Augmented Generation Systems

Xuyang Wu, Shuowei Li, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments Published at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏