arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2512.06248 2025-12-09 cs.SE 57%

CFCEval: Evaluating Security Aspects in Code Generated by Large Language Models

CFCEval: 评估大型语言模型生成代码的安全性方面

Cheng Cheng, Jinqiu Yang

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CFCEval通过引入MLVBench和ELRM指标,有效评估大型语言模型生成代码的质量与安全性,提升代码评估的准确性和全面性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23471 2025-12-08 cs.SE 57%

Synthesizing Performance Constraints for Evaluating and Improving Code Efficiency

为评估和提升代码效率合成性能约束

Jun Yang, Cheng-Chi Wang, Bogdan Alexandru Stoica, Kexin Pei

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 WEDGE通过生成性能压力输入,提升代码优化效果,释放PERFFORGE测试以评估未来高效代码生成方法。

Comments Accepted by Neurips 2025 (main poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04759 2025-12-05 cs.CL 57%

Challenging the Abilities of Large Language Models in Italian: a Community Initiative

挑战大型语言模型在意大利语中的能力:一项社区倡议

Malvina Nissim, Danilo Croce, Viviana Patti, Pierpaolo Basile, Giuseppe Attanasio, Elio Musacchio, Matteo Rinaldi, Federico Borazio, Maria Francis, Jacopo Gili, Daniel Scalena, Begoña Altuna, Ekhi Azurmendi, Valerio Basile, Luisa Bentivogli, Arianna Bisazza, Marianna Bolognesi, Dominique Brunato, Tommaso Caselli, Silvia Casola, Maria Cassese, Mauro Cettolo, Claudia Collacciani, Leonardo De Cosmo, Maria Pia Di Buono, Andrea Esuli, Julen Etxaniz, Chiara Ferrando, Alessia Fidelangeli, Simona Frenda, Achille Fusco, Marco Gaido, Andrea Galassi, Federico Galli, Luca Giordano, Mattia Goffetti, Itziar Gonzalez-Dios, Lorenzo Gregori, Giulia Grundler, Sandro Iannaccone, Chunyang Jiang, Moreno La Quatra, Francesca Lagioia, Soda Marem Lo, Marco Madeddu, Bernardo Magnini, Raffaele Manna, Fabio Mercorio, Paola Merlo, Arianna Muti, Vivi Nastase, Matteo Negri, Dario Onorati, Elena Palmieri, Sara Papi, Lucia Passaro, Giulia Pensa, Andrea Piergentili, Daniele Potertì, Giovanni Puccetti, Federico Ranaldi, Leonardo Ranaldi, Andrea Amelio Ravelli, Martina Rosola, Elena Sofia Ruzzetti, Giuseppe Samo, Andrea Santilli, Piera Santin, Gabriele Sarti, Giovanni Sartor, Beatrice Savoldi, Antonio Serino, Andrea Seveso, Lucia Siciliani, Paolo Torroni, Rossella Varvara, Andrea Zaninello, Asya Zanollo, Fabio Massimo Zanzotto, Kamyar Zeinalipour, Andrea Zugarini

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 CALAMITA是一项针对意大利语的社区驱动基准测试项目,通过多样化任务和统一评估流程,系统评估大型语言模型的能力,为其他语言提供评估范例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11059 2025-12-03 cs.SE 57%

Defects4C: Benchmarking Large Language Model Repair Capability with C/C++ Bugs

Defects4C:利用C/C++漏洞基准测试大语言模型的修复能力

Jian Wang, Xiaofei Xie, Qiang Hu, Shangqing Liu, Jiongchi Yu, Jiaolong Kong, Yi Li

专题命中 代码评测 :program repair(abstract);分类 cs.SE

AI总结 Defects4C通过提供高质量C/C++漏洞基准测试,评估大语言模型在修复C/C++程序中的有效性,揭示当前技术的局限性并推动未来研究。

Comments ASE-2025 main research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01735 2025-12-02 cs.LG 57%

Automating modeling in mechanics: LLMs as designers of physics-constrained neural networks for constitutive modeling of materials

力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模

Marius Tacke, Matthias Busch, Kian Abdolazizi, Jonas Eichinger, Kevin Linka, Christian Cyron, Roland Aydin

机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) Helmholtz-Zentrum Hereon(海德堡中心) Hamburg University of Technology(汉堡技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03665 2025-12-02 cs.DC cs.AI 57%

LLM & HPC:Benchmarking DeepSeek's Performance in High-Performance Computing Tasks

LLM与HPC:在高性能计算任务中评估DeepSeek的性能

Noujoud Nader, Patrick Diehl, Steve Brandt, Hartmut Kaiser

机构 * Center of Computation and Technology(计算与技术中心) Louisiana State University(路易斯安那州立大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文评估了DeepSeek在高性能计算任务中生成代码的能力,发现其在扩展性和执行效率上逊于GPT-4。

Comments 9 pages, 2 figures, 3 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00215 2025-12-02 cs.SE 57%

Demystifying Errors in LLM Reasoning Traces: An Empirical Study of Code Execution Simulation

解析LLM推理轨迹中的错误:对代码执行模拟的实证研究

Mohammad Abdollahi, Khandaker Rifah Tasnia, Soumit Kanti Saha, Jinqiu Yang, Song Wang, Hadi Hemmati

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究通过实证分析揭示LLM推理轨迹中的错误类型,开发了九类错误分类体系,并展示工具增强推理可有效提升LLM的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21380 2025-11-27 cs.SE 57%

Multi-Agent Systems for Dataset Adaptation in Software Engineering: Capabilities, Limitations, and Future Directions

多智能体系统在软件工程数据集适应中的应用:能力、限制与未来方向

Jingyi Chen, Xiaoyan Guo, Songqiang Chen, Shing-Chi Cheung, Jiasi Shen

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文研究了多智能体系统在软件工程数据集适应中的能力与限制,发现提示干预能显著提升适应效果,为未来更可靠的智能体发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01658 2025-11-27 cs.CL 57%

A Survey on Inference Engines for Large Language Models: Perspectives on Optimization and Efficiency

对大型语言模型推理引擎的综述:优化与效率的视角

Sihyeong Park, Sungryeol Jeon, Chaelyn Lee, Seokhun Jeon, Byung-Soo Kim, Jemin Lee

机构 * Korea Electronics Technology Institute(韩国电子技术研究所) Electronics and Telecommunications Research Institute(电子电信研究院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型推理引擎的优化与效率,评估了25种开源和商用引擎,探讨了其设计目标及生态系统成熟度,并提供未来研究方向和公开存储库。

Comments Under review; 106 pages; 46 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17432 2025-11-26 cs.CV cs.CL 57%

Video Understanding with Large Language Models: A Survey

利用大语言模型进行视频理解:综述

Yolo Y. Tang, Jing Bi, Siting Xu, Luchuan Song, Susan Liang, Teng Wang, Daoan Zhang, Jie An, Jingyang Lin, Rongyi Zhu, Ali Vosoughi, Chao Huang, Zeliang Zhang, Pinxin Liu, Mingqian Feng, Feng Zheng, Jianguo Zhang, Ping Luo, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。

Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19273 2025-11-25 cs.LG 57%

Scalable Bayesian Network Structure Learning Using Tsetlin Machine to Constrain the Search Space

利用Tsetlin机约束搜索空间的可扩展贝叶斯网络结构学习

Kunal Dumbre, Lei Jiao, Ole-Christoffer Granmo

机构 * Department of ICT University of Agder(信息与通信技术系阿格德大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出利用Tsetlin机约束搜索空间,以提高贝叶斯网络结构学习的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18966 2025-11-25 cs.AI cs.CR 57%

LLM-CSEC: Empirical Evaluation of Security in C/C++ Code Generated by Large Language Models

LLM-CSEC: 对大型语言模型生成的C/C++代码安全性的实证评估

Muhammad Usman Shahid, Chuadhry Mujeeb Ahmed, Rajiv Ranjan

机构 * Independent Researcher(独立研究者) Newcastle University(新castle大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究评估了大型语言模型生成的C/C++代码安全性,发现存在大量漏洞,强调开发人员需谨慎使用此类代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17125 2025-11-25 cs.SE 57%

Large Language Model Unlearning for Source Code

大型语言模型的源代码去学习

Xue Jiang, Yihong Dong, Huangzhao Zhang, Tangxinyu Wang, Zheng Fang, Yingwei Ma, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, Yongbin Li, Ge Li

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本研究提出PROD方法,通过精确去学习源代码中的违规片段,提升代码生成的可靠性与安全性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18450 2025-11-25 cs.AI 57%

ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints

ORIGAMISPACE:基于数学约束的多模态大语言模型多步空间推理基准测试

Rui Xu, Dakuan Lu, Zicheng Zhao, Xiaoyu Tan, Xintao Wang, Siyu Yuan, Jiangjie Chen, Yinghui Xu

机构 * Fudan University(复旦大学) SII INF Technology(INF技术)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 ORIGAMISPACE通过折纸任务评估多模态大语言模型在多步空间推理和数学约束处理中的能力,提出四个评估任务并探索强化学习训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18249 2025-11-25 cs.SE 57%

LLM Assisted Coding with Metamorphic Specification Mutation Agent

基于元形态规范变异代理的LLM编码

Mostafijur Rahman Akhond, Gias Uddin

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CodeMetaAgent通过元形态关系驱动LLM代理,提升代码生成准确性与覆盖率,有效解决规范不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16709 2025-11-24 cs.CR cs.AI 57%

AutoBackdoor: Automating Backdoor Attacks via LLM Agents

AutoBackdoor: 通过LLM代理自动化后门攻击

Yige Li, Zhe Li, Wei Zhao, Nay Myat Min, Hanxun Huang, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 AutoBackdoor通过LLM代理自动化后门攻击,实现高效触发器生成和毒化数据构建,验证了对抗防御的脆弱性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16224 2025-11-24 cs.SE 57%

Beyond Code Similarity: Benchmarking the Plausibility, Efficiency, and Complexity of LLM-Generated Smart Contracts

超越代码相似性:评估LLM生成智能合约的可信度、效率和复杂性

Francesco Salzano, Simone Scalabrino, Rocco Oliveto, Remo Pareschi

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文评估了LLM生成智能合约的可信度、效率和复杂性,发现检索增强生成显著提升了功能正确性,但生成代码仍需专家验证。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12194 2025-11-24 cs.AI 57%

ResearStudio: A Human-Intervenable Framework for Building Controllable Deep-Research Agents

ResearStudio: 一种可人工干预的构建可控深度研究代理的框架

Linyi Yang, Yixuan Weng

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 ResearStudio是一种可人工干预的深度研究代理框架,通过实时人类控制与自动化相结合,在GAIA基准中取得最佳性能。

Comments EMNLP 2025 Demo, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06387 2025-11-21 hep-th cs.LG 57%

Learning the Inverse Ryu--Takayanagi Formula with Transformers

利用Transformer学习逆Ryu-Takayanagi公式

Sejin Kim

机构 * KIAS(韩国基础科学研究院)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文利用Transformer模型学习逆Ryu-Takayanagi公式,通过数据驱动的方法重构黑洞函数并外推至无horizon背景。

Comments 15 pages, 6 figures, miner changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14876 2025-11-20 cs.CR cs.CV cs.LG cs.RO 57%

Attacking Autonomous Driving Agents with Adversarial Machine Learning: A Holistic Evaluation with the CARLA Leaderboard

Henry Wong, Clement Fung, Weiran Lin, Karen Li, Stanley Chen, Lujo Bauer

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01668 2025-11-18 cs.AI 57%

Hybrid Retrieval-Augmented Generation Agent for Trustworthy Legal Question Answering in Judicial Forensics

Yueqing Xi, Yifan Bai, Huasen Luo, Weiliang Wen, Hui Liu, Haoliang Li

机构 * Department of Electronic Engineering, City University of Hong Kong(DongGuan)(香港城市大学(东莞)电子工程系) Department of Electronic Engineering, City University of Hong Kong(香港城市大学电子工程系)

专题命中 代码评测 :repository(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09708 2025-11-14 cs.LG 57%

Efficient Hyperdimensional Computing with Modular Composite Representations

Marco Angioli, Christopher J. Kymn, Antonello Rosato, Amy Loutfi, Mauro Olivieri, Denis Kleyko

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) University of California at Berkeley(加州大学伯克利分校) Örebro University(欧雷布罗大学) Linköping University(林哈姆斯大学) RISE Research Institutes of Sweden(瑞典RISE研究所)

专题命中 代码评测 :code model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07698 2025-11-12 cs.SE 57%

Smart but Costly? Benchmarking LLMs on Functional Accuracy and Energy Efficiency

Mohammadjavad Mehditabar, Saurabhsingh Rajput, Antonio Mastropaolo, Tushar Sharma

专题命中 代码评测 :code generation(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23071 2025-11-07 cs.CL 57%

Text2VectorSQL: Towards a Unified Interface for Vector Search and SQL Queries

Zhengren Wang, Dongwen Yao, Bozhou Li, Dongsheng Ma, Bo Li, Zhiyu Li, Feiyu Xiong, Bin Cui, Linpeng Tang, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) OriginHub Technology(OriginHub科技) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18140 2025-11-06 cs.CL 57%

MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning

Xiaoyuan Li, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01527 2025-11-04 cs.AI 57%

TPS-Bench: Evaluating AI Agents' Tool Planning \& Scheduling Abilities in Compounding Tasks

Hanwen Xu, Xuyao Huang, Yuzhe Liu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00872 2025-11-04 cs.SE 57%

A Comprehensive Empirical Evaluation of Agent Frameworks on Code-centric Software Engineering Tasks

Zhuowen Yin, Cuifeng Gao, Chunsong Fan, Wenzhang Yang, Yinxing Xue, Lijun Zhang

专题命中 代码评测 :program repair(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10446 2025-11-03 cs.CL 57%

Reinforcing the Diffusion Chain of Lateral Thought with Diffusion Language Models

Zemin Huang, Zhiyang Chen, Zijun Wang, Tiancheng Li, Guo-Jun Qi

机构 * Zhejiang Univeristy(浙江大学) MAPLE Lab, Westlake University(西湖大学MAPLE实验室) Matterwave Intelligence Institute of Advanced Technology, Westlake Institute for Advanced Study(西湖研究所以高级技术研究所)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted to NeurIPS 2025. Code link: https://github.com/maple-research-lab/LLaDOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14681 2025-10-31 cs.CL 57%

Massive Supervised Fine-tuning Experiments Reveal How Data, Layer, and Training Factors Shape LLM Alignment Quality

Yuto Harada, Yusuke Yamauchi, Yusuke Oda, Yohei Oseki, Yusuke Miyao, Yu Takagi

机构 * NII LLMC(日本信息处理学会大语言模型中心) The University of Tokyo(东京大学) NAIST(日本科学技术大学) Nagoya Institute of Technology(名古屋技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference). Models and evaluation results available at: https://github.com/llm-jp/massive-sft

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26287 2025-10-31 cs.SE 57%

Empowering RepoQA-Agent based on Reinforcement Learning Driven by Monte-carlo Tree Search

Guochang Li, Yuchen Liu, Zhen Qin, Yunkun Wang, Jianping Zhong, Chen Zhi, Binhua Li, Fei Huang, Yongbin Li, Shuiguang Deng

专题命中 代码评测 :repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏