arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2601.21403 2026-01-30 cs.AI cs.MA 57%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19510 2026-01-30 cs.RO cs.CL 57%

ALRM: Agentic LLM for Robotic Manipulation

ALRM:用于机器人操作的代理LLM

Vitor Gaboardi dos Santos, Ibrahim Khadraoui, Ibrahim Farhat, Hamza Yous, Samy Teffahi, Hakim Hacid

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 ALRM提出了一种基于LLM的代理框架,通过ReAct推理循环实现机器人操作的模块化执行,支持代码生成和工具规划模式,实验表明其在多步骤推理和语言多样性任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19949 2026-01-29 eess.AS cs.CL cs.SD eess.SP 57%

RIR-Mega-Speech: A Reverberant Speech Corpus with Comprehensive Acoustic Metadata and Reproducible Evaluation

RIR-Mega-Speech:一个具有全面声学元数据和可重复评估的混响语音语料库

Mandip Goswami

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 RIR-Mega-Speech通过提供具有全面声学元数据和可重复评估的混响语音语料库,为语音识别研究提供标准化资源,验证混响对识别性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19637 2026-01-28 cs.CL 57%

RATE: Reviewer Profiling and Annotation-free Training for Expertise Ranking in Peer Review Systems

RATE:同行评审系统中基于专家排名的评审员建模与无标注训练

Weicong Liu, Zixuan Yang, Yibo Zhao, Xiang Li

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 RATE通过构建基于关键词的评审员资料和弱偏好监督,实现同行评审系统中专家排名的高精度匹配与训练。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17048 2026-01-27 cs.CV cs.AI 57%

SiMiC: Context-Aware Silicon Microstructure Characterization Using Attention-Based Convolutional Neural Networks for Field-Emission Tip Analysis

SiMiC:基于注意力卷积神经网络的硅微结构上下文感知表征用于场发射尖端分析

Jing Jie Tan, Rupert Schreiner, Matthias Hausladen, Ali Asgharzade, Simon Edler, Julian Bartsch, Michael Bachmann, Andreas Schels, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum

机构 * Department of Mechatronics and Biomedical Engineering, Lee Kong Chian Faculty of Engineering and Science, Universiti Tunku Abdul Rahman, Malaysia(机电与生物医学工程系,Lee Kong Chian工程与科学学院,塔努克阿卜杜勒拉曼大学,马来西亚) KETEK GmbH, Munich, Germany(KETEK公司,慕尼黑,德国)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 SiMiC利用注意力卷积神经网络对场发射尖端的硅微结构进行上下文感知表征,提升微结构分析的精度与可解释性。

Journal ref Journal of Vacuum Science and Technology B (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16354 2026-01-26 cs.CR cs.AI 57%

NOIR: Privacy-Preserving Generation of Code with Open-Source LLMs

NOIR:基于开源LLM的隐私保护代码生成

Khoa Nguyen, Khiem Ton, NhatHai Phan, Issa Khalil, Khang Tran, Cristian Borcea, Ruoming Jin, Abdallah Khreishah, My T. Thai

机构 * New Jersey Institute of Technology(新泽西理工学院) Hamad Bin Khalifa University(哈利法大学) Kent State University(肯特州立大学) University of Florida(佛罗里达大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 NOIR通过客户端本地处理和隐私保护机制,实现对开源LLM生成代码的隐私保护,显著提升代码生成性能和安全性。

Comments To appear at Usenix Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14122 2026-01-26 cs.CL cs.CY cs.ET 57%

Benchmarking LLMs for Political Science: A United Nations Perspective

对政治科学的LLM进行基准测试:一个联合国视角

Yueqing Liang, Liangwei Yang, Chen Wang, Congying Xia, Rui Meng, Xiongxiao Xu, Haoran Wang, Ali Payani, Kai Shu

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出联合国基准(UNBench),用于评估LLMs在政治科学中的能力,涵盖联合国决策过程的三个阶段。

Comments This paper has been accepted at AAAI 2026 as an oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02900 2026-01-22 cs.CV cs.AI cs.GR cs.HC cs.MM 57%

Advancing Talking Head Generation: A Comprehensive Survey of Multi-Modal Methodologies, Datasets, Evaluation Metrics, and Loss Functions

推进说话头生成:多模态方法、数据集、评估指标和损失函数的全面综述

Vineet Kumar Rakesh, Soumya Mazumdar, Research Pratim Maity, Sarbajit Pal, Amitabha Das, Tapas Samanta

机构 * Engineering Sciences, Homi Bhabha National Institute Training School Complex(工程科学,霍米·巴赫瓦全国研究所培训学校) Computer and Informatics Group, VECC 1/AF(计算机与信息组,VECC 1/AF)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文全面综述了说话头生成的多模态方法、数据集、评估指标和损失函数,探讨了技术挑战与未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14027 2026-01-21 cs.AI 57%

Numina-Lean-Agent: An Open and General Agentic Reasoning System for Formal Mathematics

Numina-Lean-Agent: 一种面向形式数学的开放且通用的代理推理系统

Junqi Liu, Zihao Zhou, Zekai Zhu, Marco Dos Santos, Weikun He, Jiawei Liu, Ran Wang, Yunzhou Xie, Junqiao Zhao, Qiufeng Wang, Lihong Zhi, Jia Li, Wenda Li

机构 * Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Tongji University(同济大学) University of Cambridge(剑桥大学) Imperial College London(伦敦帝国学院) University of Edinburgh(爱丁堡大学) University of Liverpool(利物浦大学) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 Numina-Lean-Agent通过通用编码代理实现形式数学推理,解决Putnam 2025全部问题并成功形式化Brascamp-Lieb定理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10904 2026-01-19 cs.AI 57%

ARC Prize 2025: Technical Report

ARC 2025奖项:技术报告

François Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers

专题命中 代码评测 :program synthesis(abstract);分类 cs.AI

AI总结 本文探讨了ARC-AGI-2基准竞赛中精炼循环对AGI进展的作用,分析了当前AI推理的局限性,并预览了ARC-AGI-3的交互推理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00010 2026-01-16 cs.CL 57%

PlotCraft: Pushing the Limits of LLMs for Complex and Interactive Data Visualization

PlotCraft: 推动大语言模型在复杂和交互式数据可视化中的极限

Jiajun Zhang, Jianke Zhang, Zeyu Cui, Jiaxi Yang, Lei Zhang, Binyuan Hui, Qiang Liu, Zilei Wang, Liang Wang, Junyang Lin

机构 * USTC(University of Science and Technology of China) THU(Tsinghua University) Alibaba Group(阿里巴巴集团) CASIA(Chinese Academy of Sciences Institute of Automation) SIAT(State Key Laboratory of Information Security)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 PlotCraft 提出了一种新的基准和数据集,用于评估大语言模型在复杂和交互式数据可视化任务中的性能,展示了 PlotCraftor 在复杂任务中的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10104 2026-01-16 cs.CV cs.AI 57%

MathDoc: Benchmarking Structured Extraction and Active Refusal on Noisy Mathematics Exam Papers

MathDoc: 评估噪声数学试卷上的结构化提取和主动拒绝基准

Chenyue Zhou, Jiayi Tuo, Shitong Qin, Wei Dai, Mingxuan Wang, Ziwei Zhao, Duoyang Li, Shiyang Su, Yanxi Lu, Yanbiao Ma

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Gaotu Techedu Inc.(高途科技公司) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) University of Science and Technology of China(中国科学技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MathDoc是首个针对噪声数学试卷的结构化提取和主动拒绝评估基准,揭示了当前MLLMs在处理退化文档时的可靠性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06786 2026-01-13 cs.CL 57%

EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs

EpiCaR: 了解未知对提高大语言模型的推理能力至关重要

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09993 2026-01-12 cs.AI 57%

SPAN: Benchmarking and Improving Cross-Calendar Temporal Reasoning of Large Language Models

SPAN:大型语言模型跨日历时间推理的基准测试与改进

Zhongjian Miao, Hao Fu, Chen Wei

机构 * Li Auto(利亚特)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 SPAN通过开发时间代理提升大型语言模型跨日历时间推理能力,实验显示其准确率高达95.31%

Comments Accepted at the AAAI 2026 conference. This version includes the supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03432 2026-01-08 cs.SE 57%

CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models

CodeEval: 一种面向代码训练大语言模型的教育性评估方法

Danny Brahman, Mohammad Mahoor

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CodeEval通过多维基准数据集和开源执行框架,针对代码训练大语言模型的评估与改进提供教育性方法。

Comments Accepted at the International Joint Conference on Natural Language Processing & Asia-Pacific Chapter of the Association for Computational Linguistics, 2025. Will be published at ACL anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02569 2026-01-07 cs.CL 57%

LoRA-Drop: Temporal LoRA Decoding for Efficient LLM Inference

LoRA-Drop:用于高效LLM推理的时序LoRA解码

Hossein Rajabzadeh, Maryam Dialameh, Chul B. Park, Il-Min Kim, Hyock Ju Kwon

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Queen’s University(皇后大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 LoRA-Drop通过时序计算计划和低秩LoRA校正,实现高效LLM推理,提升解码速度2.6倍并减少45-55%的KV缓存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00481 2026-01-05 cs.NI cs.AI 57%

MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability

MAESTRO:多智能体评估套件用于测试、可靠性与可观测性

Tie Ma, Yixi Chen, Vaastav Anand, Alessandro Cornacchia, Amândio R. Faustino, Guanheng Liu, Shan Zhang, Hongbin Luo, Suhaib A. Fahmy, Zafar A. Qazi, Marco Canini

机构 * Beihang University(北航大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00213 2026-01-05 cs.CR cs.CL 57%

Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak

LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破

Haoran Gu, Handing Wang, Yi Mei, Mengjie Zhang, Yaochu Jin

机构 * Xidian University(西安电子科技大学) Victoria University of Wellington(威灵顿维多利亚大学) Westlake University(西湖大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24400 2026-01-01 cs.CR cs.SE 57%

SourceBroken: A large-scale analysis on the (un)reliability of SourceRank in the PyPI ecosystem

SourceBroken: 对PyPI生态系统中SourceRank可靠性的大规模分析

Biagio Montaruli, Serena Elisa Ponta, Luca Compagna, Davide Balzarotti

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 SourceBroken研究发现SourceRank在PyPI生态系统中存在可靠性问题,其未能及时反映软件包删除,导致恶意与良性软件包评分重叠,URL混淆攻击显著增加。

Comments Accpted for the 41st ACM/SIGAPP Symposium on Applied Computing (SAC '26), March 23--27, 2026, Thessaloniki, Greece

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22216 2025-12-30 cs.SE 57%

Syntax Is Not Enough: An Empirical Study of Small Transformer Models for Neural Code Repair

语法不够:小型Transformer模型在神经代码修复中的实证研究

Shaunak Samant

专题命中 代码评测 :program repair(abstract);分类 cs.SE

AI总结 本研究通过实验证明,小型Transformer模型在修复Java错误时,虽然能生成语法正确的代码,但无法达到语义正确的修复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19424 2025-12-23 cs.CL 57%

CodeSimpleQA: Scaling Factuality in Code Large Language Models

CodeSimpleQA: 在代码大语言模型中提升事实性

Jian Yang, Wei Zhang, Yizhi Li, Shawn Guo, Haowen Wang, Aishan Liu, Ge Zhang, Zili Wang, Zhoujun Li, Xianglong Liu, Weifeng Lv

机构 * Beihang University(北航大学) Manchester(曼彻斯特) M-A-P StepFun

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 CodeSimpleQA通过构建双语基准测试和后训练框架,提升代码大语言模型在编程知识事实准确性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18456 2025-12-23 cs.CR cs.AI 57%

SoK: Understanding (New) Security Issues Across AI4Code Use Cases

SoK:理解(新的)AI4Code使用案例中的安全问题

Qilong Wu, Taoran Li, Tianyang Zhou, Varun Chandrasekaran

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文通过调查AI4Code在三个核心应用中的安全问题,指出基准测试偏见、数据泄露和对抗鲁棒性不足等挑战,并提出安全默认实践、全面检测基准和翻译增强语言等改进方向。

Comments 39 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11361 2025-12-23 cs.CL 57%

VLDBench Evaluating Multimodal Disinformation with Regulatory Alignment

VLDBench:评估具有监管对齐的多模态虚假信息

Shaina Raza, Ashmal Vayani, Aditya Jain, Aravind Narayanan, Vahid Reza Khazaie, Syed Raza Bashir, Elham Dolatabadi, Gias Uddin, Christos Emmanouilidis, Rizwan Qureshi, Mubarak Shah

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。

Comments Accepted in Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 57%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22821 2025-12-19 cs.SE 57%

Identifying and Mitigating API Misuse in Large Language Models

识别和缓解大语言模型中的API误用

Terry Yue Zhuo, Junda He, Jiamou Sun, Zhenchang Xing, David Lo, John Grundy, Xiaoning Du

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文提出Dr.Fix方法,通过分类法指导LLM自动修复生成代码中的API误用问题,提升修复精度。

Comments Accepted at IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12461 2025-12-16 cs.CL 57%

Is GPT-OSS Good? A Comprehensive Evaluation of OpenAI's Latest Open Source Models

GPT-OSS好吗?对OpenAI最新开源模型的综合评估

Ziqian Bi, Keyu Chen, Chiung-Yi Tseng, Danyang Zhang, Tianyang Wang, Hongying Luo, Lu Chen, Junming Huang, Jibin Guan, Junfeng Hao, Xinyuan Song, Junhao Song

机构 * AI Agent Lab, Vokram Group(AI代理实验室,Vokram集团) Purdue University(普渡大学) Georgia Institute of Technology(佐治亚理工学院) University of Minnesota(明尼苏达大学) Emory University(埃默里大学) Imperial College London(伦敦帝国学院)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 GPT-OSS在代码生成方面表现优异,但在多语言任务上存在不足,研究发现稀疏架构扩展未必能带来性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16407 2025-12-11 cs.SE 57%

CREME: Robustness Enhancement of Code LLMs via Layer-Aware Model Editing

通过层感知模型编辑提升代码LLM的鲁棒性

Shuhan Liu, Xing Hu, Kerui Huang, Xiaohu Yang, David Lo, Xin Xia

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CREME通过识别并编辑鲁棒性敏感层,提升代码生成模型对提示扰动的鲁棒性,显著提高扰动提示下的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08998 2025-12-11 eess.IV cs.AI cs.CV 57%

DermETAS-SNA LLM: A Dermatology Focused Evolutionary Transformer Architecture Search with StackNet Augmented LLM Assistant

DermETAS-SNA LLM:一种专注于皮肤科的进化Transformer架构搜索与StackNet增强LLM助手

Nitya Phani Santosh Oruganty, Keerthi Vemula Murali, Chun-Kit Ngan, Paulo Bandeira Pinho

机构 * Data Science Program, Worcester Polytechnic Institute, Massachusetts, USA(沃斯特理工学院数据科学项目,马萨诸塞州,美国) Computer Science Department, Worcester Polytechnic Institute, Massachusetts, USA(沃斯特理工学院计算机科学系,马萨诸塞州,美国) PASE Advisory Group, New Jersey, USA(PASE顾问小组,新泽西州,美国)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 DermETAS-SNA LLM结合进化Transformer架构搜索与StackNet增强LLM,旨在提升皮肤病诊断的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08867 2025-12-10 cs.SE 57%

SimpleDevQA: Benchmarking Large Language Models on Development Knowledge QA

SimpleDevQA:在开发知识问答上评估大语言模型

Jing Zhang, Lianghong Guo, Yanlin Wang, Mingwei Liu, Jiachi Chen, Yuchi Ma, Ensheng Shi, Terry Yue Zhuo, Hongyu Zhang, Zibin Zheng

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 SimpleDevQA是一个基于真实用户对话构建的多语言基准,用于评估大语言模型在开发知识问答任务中的表现,通过三阶段流程生成2740个问答对,发现代码LLM在该任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07186 2025-12-09 cs.CV cs.AI 57%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏