arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1729 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1729 篇

2507.18140 2025-11-06 cs.CL 57%

MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning

Xiaoyuan Li, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01527 2025-11-04 cs.AI 57%

TPS-Bench: Evaluating AI Agents' Tool Planning \& Scheduling Abilities in Compounding Tasks

Hanwen Xu, Xuyao Huang, Yuzhe Liu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00872 2025-11-04 cs.SE 57%

A Comprehensive Empirical Evaluation of Agent Frameworks on Code-centric Software Engineering Tasks

Zhuowen Yin, Cuifeng Gao, Chunsong Fan, Wenzhang Yang, Yinxing Xue, Lijun Zhang

专题命中 代码评测 :program repair(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10446 2025-11-03 cs.CL 57%

Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models

Zemin Huang, Zhiyang Chen, Zijun Wang, Tiancheng Li, Guo-Jun Qi

机构 * Zhejiang Univeristy(浙江大学) MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Matterwave Intelligence Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所以高级技术研究所)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025. Code link: https://github.com/maple-research-lab/LLaDOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14681 2025-10-31 cs.CL 57%

Massive Supervised Fine-tuning Experiments Reveal How Data, Layer, and Training Factors Shape LLM Alignment Quality

Yuto Harada, Yusuke Yamauchi, Yusuke Oda, Yohei Oseki, Yusuke Miyao, Yu Takagi

机构 * NII LLMC(日本信息处理学会大语言模型中心) The University of Tokyo(东京大学) NAIST(日本科学技术大学) Nagoya Institute of Technology(名古屋技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference). Models and evaluation results available at: https://github.com/llm-jp/massive-sft

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26287 2025-10-31 cs.SE 57%

Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search

Guochang Li, Yuchen Liu, Zhen Qin, Yunkun Wang, Jianping Zhong, Chen Zhi, Binhua Li, Fei Huang, Yongbin Li, Shuiguang Deng

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24452 2025-10-29 cs.DC cs.LG 57%

ARIMA_PLUS: Large-scale, Accurate, Automatic and Interpretable In-Database Time Series Forecasting and Anomaly Detection in Google BigQuery

Xi Cheng, Weijie Shen, Haoming Chen, Chaoyi Shen, Jean Ortega, Jiashang Liu, Steve Thomas, Honglin Zheng, Haoyun Wu, Yuxiang Li, Casey Lichtendahl, Jenny Ortiz, Gang Liu, Haiyang Qi, Omid Fatemieh, Chris Fry, Jing Jing Long

机构 * Google(谷歌)

专题命中 代码评测 :repository(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14856 2025-10-24 cs.SE 57%

CodeFuse-CR-Bench: A Comprehensiveness-aware Benchmark for End-to-End Code Review Evaluation in Python Projects

Hanyang Guo, Xunjin Zheng, Zihan Liao, Hang Yu, Peng DI, Ziyin Zhang, Hong-Ning Dai

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18468 2025-10-22 cs.CL 57%

IMB: An Italian Medical Benchmark for Question Answering

Antonio Romano, Giuseppe Riccio, Mariano Barone, Marco Postiglione, Vincenzo Moscato

机构 * University of Naples Federico II, Department of Electrical Engineering(那不勒斯费德里科二世大学电子工程系) Consorzio Interuniversitario Nazionale per l'Informatica (CINI) - ITEM National Lab(国家信息计算联合研究中心(CINI)- ITEM国家实验室) Northwestern University, Department of Computer Science, McCormick School of Engineering(西北大学计算机科学系,工程学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

Journal ref CLIC-it 2025: Eleventh Italian Conference on Computational Linguistics, Cagliari, Italy, September 24-26, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17376 2025-10-21 cs.SE 57%

AdapTrack: Constrained Decoding without Distorting LLM's Output Intent

Yongmin Li, Jia Li, Ge Li, Zhi Jin

专题命中 代码评测 :code generation(abstract);分类 cs.SE

Comments to be published in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14700 2025-10-17 cs.SE cs.CR 57%

LLM Agents for Automated Web Vulnerability Reproduction: Are We There Yet?

Bin Liu, Yanjie Zhao, Guoai Xu, Haoyu Wang

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20534 2025-10-17 cs.PL cs.MS cs.SC 57%

Efficient Symbolic Computation via Hash Consing

Bowen Zhu, Aayush Sabharwal, Songchen Tan, Yingbo Ma, Alan Edelman, Christopher Rackauckas

专题命中 代码评测 :code generation(abstract);分类 cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14471 2025-10-17 cs.CL 57%

Why We Build Local Large Language Models: An Observational Analysis from 35 Japanese and Multilingual LLMs

Koshiro Saito, Sakae Mizuki, Masanari Ohi, Taishi Nakamura, Taihei Shiotani, Koki Maeda, Youmi Ma, Kakeru Hattori, Kazuki Fujii, Takumi Okamoto, Shigeki Ishida, Hiroya Takamura, Rio Yokota, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted as a spotlight at the 1st workshop on Multilingual and Equitable Language Technologies (MELT), COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04364 2025-10-16 cs.MA cs.CL 57%

Benchmarking LLMs' Swarm intelligence

Kai Ruan, Mowen Huang, Ji-Rong Wen, Hao Sun

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(人工智能学院,中国人民大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24394 2025-10-14 cs.CY cs.AI 57%

The 2025 OpenAI Preparedness Framework does not guarantee any AI risk mitigation practices: a proof-of-concept for affordance analyses of AI safety policies

Sam Coggins, Alexander K. Saeri, Katherine A. Daniell, Lorenn P. Ruster, Jessie Liu, Jenny L. Davis

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 19 pages, 5 tables, 1 figure; minor ambiguities clarified, typos corrected, author affiliations added

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13735 2025-10-14 cs.CL 57%

EEG-MedRAG: Enhancing EEG-based Clinical Decision-Making via Hierarchical Hypergraph Retrieval-Augmented Generation

Yi Wang, Haoran Luo, Lu Meng, Ziyu Jia, Xinliang Zhou, Qingsong Wen

机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学) Foshan Graduate School of Innovation, Northeastern University(创新佛山研究生院,东北大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) Squirrel Ai Learning

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03046 2025-10-13 cs.LG 57%

Graph Transformer with Disease Subgraph Positional Encoding for Improved Comorbidity Prediction

Xihan Qin, Li Liao

专题命中 代码评测 :repository(abstract);分类 cs.LG

Journal ref Quantitative Biology 13, no. 4 (2025): e70008

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05899 2025-10-13 cs.SE 57%

Prompt engineering and its implications on the energy consumption of Large Language Models

Riccardo Rubei, Aicha Moussaid, Claudio di Sipio, Davide di Ruscio

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16185 2025-10-09 cs.CL 57%

ParamBench: A Graduate-Level Benchmark for Evaluating LLM Understanding on Indic Subjects

Ayush Maheshwari, Kaushal Sharma, Vivek Patel, Aditya Maheshwari

专题命中 代码评测 :code generation(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05468 2025-10-09 cs.CL 57%

LatteReview: A Multi-Agent Framework for Systematic Review Automation Using Large Language Models

Pouria Rouzrokh, Bardia Khosravi, Parsa Rouzrokh, Moein Shariatnia

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments 31 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06014 2025-10-08 cs.AI 57%

ARISE: An Adaptive Resolution-Aware Metric for Test-Time Scaling Evaluation in Large Reasoning Models

Zhangyue Yin, Qiushi Sun, Zhiyuan Zeng, Zhiyuan Yu, Qipeng Guo, Xuanjing Huang, Xipeng Qiu

机构 * Fudan University(复旦大学) The University of Hong Kong(香港大学) Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19271 2025-10-08 cs.SE 57%

VerifyThisBench: Generating Code, Specifications, and Proofs All at Once

Xun Deng, Sicheng Zhong, Barış Bayazıt, Andreas Veneris, Fan Long, Xujie Si

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04257 2025-10-07 cs.CR cs.AI 57%

AgentTypo: Adaptive Typographic Prompt Injection Attacks against Black-box Multimodal Agents

Yanjie Li, Yiming Cao, Dong Wang, Bin Xiao

机构 * Computing Department of Hong Kong Polytechnic University(香港理工大学计算机系) Computing Department, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 13 pages, 8 figures. Submitted to IEEE Transactions on Information Forensics & Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01576 2025-10-03 cs.CV cs.AI cs.HC 57%

Guiding Multimodal Large Language Models with Blind and Low Vision People Visual Questions for Proactive Visual Interpretations

Ricardo Gonzalez Penuela, Felipe Arias-Russi, Victor Capriles

专题命中 代码评测 :repository(abstract);分类 cs.AI

Comments 7 pages, 2 figure, 2 tables, CV4A11y Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00946 2025-10-02 cs.SE 57%

ChatGPT in Introductory Programming: Counterbalanced Evaluation of Code Quality, Conceptual Learning, and Student Perceptions

Shiza Andleeb, Brandon Kantorski, Jeffrey C. Carver

专题命中 代码评测 :code generation(abstract);分类 cs.SE

Comments Accepted to SIGCITE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26111 2025-10-01 cs.SE 57%

A Multi-Language Object-Oriented Programming Benchmark for Large Language Models

Shuai Wang, Liang Ding, Li Shen, Yong Luo, Han Hu, Lefei Zhang, Fu Lin

专题命中 代码评测 :code generation(abstract);分类 cs.SE

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01245 2025-10-01 cs.AI cs.MA cs.OS 57%

Towards Agentic OS: An LLM Agent Framework for Linux Schedulers

Yusheng Zheng, Yanpeng Hu, Wei Zhang, Andi Quinn

机构 * UC Santa Cruz, CA, USA(加州大学圣克ruz分校) University of Connecticut(康涅狄格大学) ShanghaiTech University(上海科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

Journal ref MLforSystem 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20136 2025-09-25 cs.SE 57%

V-GameGym: Visual Game Generation for Code Large Language Models

Wei Zhang, Jack Yang, Renshuai Tao, Lingzheng Chai, Shawn Guo, Jiajun Wu, Xiaoming Chen, Ganqu Cui, Ning Ding, Xander Xu, Hu Wei, Bowen Zhou

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03616 2025-09-24 cs.AI 57%

EvoAgentX: An Automated Framework for Evolving Agentic Workflows

Yingxu Wang, Siwei Liu, Jinyuan Fang, Zaiqiao Meng

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) University of Aberdeen(阿伯丁大学) University of Glasgow(格拉斯哥大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14498 2025-09-23 cs.CL 57%

LLaSA: A Sensor-Aware LLM for Natural Language Reasoning of Human Activity from IMU Data

Sheikh Asif Imran, Mohammad Nur Hossain Khan, Subrata Biswas, Bashima Islam

机构 * Worcester Polytechnic Institute(沃斯特理工大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏