arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 865 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 111 篇

2608.02407 2026-08-04 cs.CR cs.AI 新提交 57%

Antares: Foundation Models for Agentic Vulnerability Localization

Antares:用于智能体漏洞定位的基础模型

Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 该研究提出基于IBM Granite的Antares系列紧凑语言模型,经两阶段训练用于智能体漏洞定位,其30亿参数版本性能接近GPT-5.5且远超更大模型,推理高效低成本。

Comments 57 pages, 12 figures, technical report for antares

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01149 2026-08-04 cs.AI 新提交 57%

PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

PATH-Bench:面向终身智能体的路径依赖评估基准

Xidong Yang, Xingyi Zhang, Wenhao Li, Wenyan Liu, Junjie Sheng, Yun Hua, Wei Yin, Tao Fang, Chuyun Shen, Xiangfeng Wang

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00915 2026-08-04 cs.LG 新提交 57%

UpliftBench: Revealing Outcome-Regime and Objective Mismatch in Uplift Evaluation

UpliftBench:揭示uplift评估中的结果 regime 与目标不匹配问题

Binshuang Li

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 UpliftBench评估12种uplift估计器,发现基准分歧源于指标而非模型,揭示Qini等指标与效应准确性一致性不足等问题,发布可复现基准工具。

Comments 25 pages, 9 figures. Code, data, and results: https://github.com/binshuangli/uplift-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00711 2026-08-04 cs.AI 新提交 57%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交 57%

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00227 2026-08-04 cs.SE 新提交 57%

Source Code Authorship Attribution Does Not Generalize from Competitions to Classrooms

源代码作者身份归属无法从竞赛场景泛化到课堂场景

Serhii Yemets, Marek Horváth

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本研究发现,针对Google Code Jam竞赛数据微调的CodeBERT等模型,在课程作业数据集上的作者身份归属性能远低于随机基线,竞赛场景的基准无法泛化到教育场景,需针对性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 57%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26777 2026-07-30 cs.SE 新提交 57%

CodeSpec: Dual Executable Specifications for Agentic Long-Horizon Feature Development

CodeSpec:面向智能体长周期功能开发的双可执行规范

Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26451 2026-07-30 cs.SE 新提交 57%

ExplainBench: Evaluating Code Explanations from Agents

ExplainBench:评估智能体生成的代码解释

Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25992 2026-07-29 cs.DB cs.AI 新提交 57%

MemLens: A Value-Aware Memory Management System with Interactive Analytics for LLM-based Agents

MemLens:一种用于基于大语言模型的智能体的具有交互式分析的价值感知内存管理系统

Shuyue Wei, Chang Liu, Zimu Zhou, Yongxin Tong, Lizhen Cui

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究针对基于LLM的智能体内存管理问题,提出价值感知内存管理系统MemLens,通过端到端交互式分析仪表板展示内存生命周期,经学习助手应用程序帮助用户比较策略,可实现高效、可解释和个性化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23225 2026-07-28 cs.LG 新提交 57%

ParasGB: A Graph Benchmark Suite for Parasitic Estimation on AMS Circuits

ParasGB:用于 AMS 电路寄生估计的图形基准套件

Jiajun Zou, Jiawei Liu, Ao Liu, Junnong Tian, Yibin Zhang, Chengjie Liu, Yuxi Wang, Shan Shen, Wenhua Gu, Jun Yang, Wenjian Yu

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 研究针对 AMS 电路寄生估计问题,引入 ParasGB 开源基准套件,提供大规模异构 RC 网络与统一评估协议,用标准化流程对 GNN 架构基准测试,揭示相关挑战,为电路图学习和寄生感知模型开发提供可重复研究平台。

Comments Published at ICCAD2026. Full appendix version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22654 2026-07-28 cs.AI 新提交 57%

MINT-V2X: A Mobility-Integrated Network Trajectory Dataset for Predictive Resource Management

MINT-V2X:用于预测资源管理的移动集成网络轨迹数据集

Abdullah Anjum, Abdolazim Rezaei, Mehdi Sookhak

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文介绍用于预测资源管理的移动集成网络轨迹数据集MINT-V2X,它通过耦合SUMO与OMNeT++/Simu5G生成,经多项测试验证,包含大量同步数据点,通过案例研究证明其在RSU负载预测上比仅用网络历史基线性能更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22588 2026-07-28 cs.AI cs.DC 新提交 57%

ParBench: A Benchmark for Reliable Evaluation of LLM Parallel Code Translation

ParBench:用于可靠评估大语言模型并行代码翻译的基准测试

Samyak Jhaveri, Erel Kaplan, Tom Yotam, Le Chen, Tomer Bitan, Niranjan Hasabnis, Gal Oren

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 研究针对大语言模型并行代码翻译缺乏可靠评估方法的问题,提出ParBench基准框架,通过声明性规范评估,涵盖多开源套件与跨API翻译方向,经源增强测试,揭示了当前并行代码翻译存在的如方向不对称等障碍。

Comments 57 pages, 22 figures, 11 tables; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22573 2026-07-28 cs.AI cond-mat.mtrl-sci physics.comp-ph 新提交 57%

PhononBench-MP40: a spectrum-resolved benchmark dataset for phonon stability

PhononBench-MP40:用于声子稳定性的光谱分辨基准数据集

Wen-Kao Li, Ze-Feng Gao, Zhong-Yi Lu

机构 * School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China(中国人民大学物理学院及量子态构建与调控教育部重点实验室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究针对计算材料筛选中虚声子模式瓶颈,提出PhononBench-MP40数据集,源于47969个MP40任务,含4类记录。通过科学数据银行公开,配套GitHub仓库提供代码等,为相关研究提供可审计参考。

Comments 18 pages, 3 figures, includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22368 2026-07-27 cs.AI 新提交 57%

Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI

智能体基准测试能衡量能力吗?智能体人工智能时代的协议有效性

Jiaqi Shao, Hanck Chen, Wei Zhang, Maxm Pan, Bing Luo

机构 * Tencent(腾讯) The Hong Kong University of Science and Technology(香港科技大学) Duke Kunshan University(昆山杜克大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究智能体基准测试分数能否衡量能力,提出协议有效性概念及HackDetect事后审计方法,通过审计多基准测试轨迹发现暴露和奖励破解证据,量化分数膨胀,强调基准测试报告应证明分数反映预期能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21003 2026-07-24 cs.LG 新提交 57%

ADABORD: a novel AdaBoost approach for ordinal classification

ADABORD:一种用于有序分类的新型AdaBoost方法

Rafael Ayllón-Gavilán, Francisco José Martínez-Estudillo, David Guijo-Rubio, César Hervás-Martínez, Pedro A. Gutiérrez

机构 * IMIBIC(IMIBIC(初级保健临床流行病学研究部)) Universidad de Córdoba(科尔多瓦大学) Universidad Loyola Andalucía(安达卢西亚洛约拉大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 研究有序分类问题,提出ADABORD框架,将类别顺序特性融入AdaBoost算法关键组件,在TOC-UCO库与七种方法比较,实验表明其显著优于竞品,尤其在多类数据集上,且公开代码等方便后续研究。

Comments 42 pages, 6 figures, 7 tables. Submitted to CS top tier journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20518 2026-07-24 cs.AI 新提交 57%

CANN Bench: Benchmarking Agent Generated Kernels against Real NPU and Algorithmic Limits

CANN基准测试:针对真实NPU和算法限制对代理生成的内核进行基准测试

Xue-Jian Gao, Deng Pan, Yueming Su, Jiasheng Li, Bin Du, Fengming Zhu, Chengdi Ma, Junyi Fan, Qichen Liao, Chengqiu Hu, Xinxian Chen, Lingchao Zheng, Jun Li, Jiwei Yang, Yuwei Fan

机构 * Huawei(华为)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究针对人工智能代理生成的算子内核在Ascend NPU上缺乏通用评估基线的问题,提出CANN Bench基准测试,涵盖多算子和测试用例,采用三维加权综合评分,为Ascend生态系统提供评估算子编写能力的标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18462 2026-07-22 cs.SE 新提交 57%

Beyond Resolved Rate: A Non-Functional Quality Study

超越解决率:非功能性质量研究

Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 研究对比新旧模型在存储库级修复任务中生成补丁的非功能性质量,通过两个案例研究,用CodeQL等工具评估,发现新模型解决实例更多,但非功能性指标无一致改善,旨在推动对模型软件工程能力的全面评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16979 2026-07-21 cs.SE 新提交 57%

When Post-Anchor Metrics Fail: Stabilization Regimes in AI-Evidence Open-Source Projects

当后锚定指标失败时:人工智能证据开源项目中的稳定机制

Hudson Craig, Benjamin Barlog, Chenggang Wang, Longwei Wang, Zedong Peng

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 研究人工智能证据开源项目中架构变更后稳定义务衡量问题,指出后锚定稳定密度指标失败,引入稳定机制并人工验证校准,强调需受控设计与机制感知归因来可靠识别稳定义务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14541 2026-07-17 cs.AI 新提交 57%

Are LLM-Generated GPU Kernels Production-Ready? A Trace-Driven Benchmark and Optimization Agent

大语言模型生成的GPU内核能否用于生产?基于追踪的基准测试与优化代理

Lingyun Yang, Yuxiao Wang, Shenghao Liang, Linfeng Yang, Daocheng Ying, Chunbo You, Rui Zhang, Luping Wang, Yinghao Yu, Guodong Yang, Liping Zhang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 研究大语言模型生成GPU内核用于生产的可行性,提出Atrex-Bench基准测试,发现现有模型表现不佳。为此发布Atrex-Kernel-Agent优化代理,结合多种技术,经案例研究能将回退转换为匹配或超越生产基线的内核。

Comments Both artifacts are released as open source: Atrex-Bench (https://github.com/alibaba/atrex-bench) and Atrex-Kernel-Agent (https://github.com/alibaba/atrex-kernel-agent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12835 2026-07-15 cs.CL 新提交 57%

Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

大语言模型能写出可靠的评分标准吗?实验复现的元评估

Hanhua Hong, Yizhi Li, Jiaoyan Chen, Luu Gia Huy, Sophia Ananiadou, Jung-jae Kim, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Institute for Infocomm Research (I²R), A*STAR(资讯通信研究院(I²R),新加坡科技研究局) IQuest Research(IQuest研究公司) ELLIS Manchester(ELLIS曼彻斯特) University of Information Technology, VNU(越南国家大学信息技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 研究大语言模型生成的论文复现评分标准,将其 reformulate 为清单样式,在两个骨干模型上评估四种生成设置,通过语义相似性和分数对齐进行元评估,结果显示增强设置改善下游评估对齐,同时指出其存在过于细化、偏向高分和适应性差等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07400 2026-07-09 cs.SE 新提交 57%

Evaluating Static and Process Evidence for Code Authorship in Programming Education

评估编程教育中代码作者身份的静态和过程证据

Marek Horváth

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 研究编程教育中代码作者身份问题,通过任务感知评估对比不同环境,发现竞赛数据信号强,教育数据集弱,添加过程特征可提升其性能,表明过程模式能补充最终代码信号,模型适合作教师决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05197 2026-07-07 cs.SE 新提交 57%

Is Three the Magic Number? An Empirical Evaluation of LLM-Based Repair Loops

三是神奇数字吗?基于大语言模型的修复循环的实证评估

Tobias Kiecker, Eik Reichmann, Hosung Kang, Gabin An, Lars Grunske

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 研究基于大语言模型的修复循环迭代限制,通过多个软件工程任务观察到收益递减模式,前几次迭代收获大,后续贡献小,还发现修复行为受工作流编排和反馈设计影响更大。

Comments 4 Pages (+1 for references), NIER Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00895 2026-07-02 cs.CL 新提交 57%

Beyond Document Grounding: Span-Level Hallucination Detection over Code, Tool Output, and Documents

超越文档基础:代码、工具输出和文档上的跨度级幻觉检测

Ádám Kovács, Bowei He, Xue Liu, István Boros, Szilveszter Tóth, Gábor Recski

机构 * KR Labs(KR实验室) MBZUAI(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) TU Wien(维也纳工业大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31551 2026-07-01 cs.CL 新提交 57%

AutoTrainess: Teaching Language Models to Improve Language Models Autonomously

AutoTrainess: 教语言模型自主改进语言模型

Zhaojian Yu, Penghao Yin, Shuzheng Gao, Shilin He, Kai Cai, Xiao-Ping Zhang

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 提出AutoTrainess智能体,通过外部化人类经验为工作流和约束,在PostTrainBench上超越CLI基线,平均得分从23.21提升至26.94。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30703 2026-07-01 cs.PL 新提交 57%

NSynC: Normalised Synthesis of Computation

NSynC:计算的归一化综合

Zoey Shepherd, Ohad Kammar, Elizabeth Polgreen

专题命中 代码评测 :program synthesis(abstract);分类 cs.PL

AI总结 提出NSynC方法,通过直接枚举语义而非语法来避免程序综合中的语义重复,实现8.93倍加速。

Comments 21 pages (of which 17 in appendix), 12 figures (of which 11 in appendix). Accepted to SYNT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26927 2026-06-26 cs.SE 新提交 57%

Are LLMs Ready for Anti-Pattern Detection in Microservice Architectures?

LLM 是否准备好检测微服务架构中的反模式?

Marco De Luca, Domenico Amalfitano, Porfirio Tramontana, Anna Rita Fasolino

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文研究大型语言模型(LLM)通过提示分析微服务仓库静态制品来检测16种架构反模式的能力,与静态分析工具MARS对比,发现LLM在局部、异构或语义丰富的反模式上表现有竞争力,但在需要结构或跨服务依赖证据时受限,可作为补充工具。

Comments accepted at ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25193 2026-06-25 cs.SE 新提交 57%

LLM4MTLs: Automated Generation and Empirical Evaluation of Model Transformation Languages

LLM4MTLs:模型转换语言的自动生成与实证评估

Bowen Jiang, Nathan Hagel, Haowei Cheng, Benedikt Jutz, Arne Lange, Weixing Zhang, Rahul Sharma, Ralf Reussner, Anne Koziolek

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 提出LLM4MTLs工作流,通过少样本提示、语法提示和辅助方法组合,自动生成并评估LLM编写的模型转换代码,发现少样本提示能提升语法质量但语义改进有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22167 2026-06-23 cs.LG 新提交 57%

Early-Exit Graph Neural Networks for Link Prediction

用于链接预测的早期退出图神经网络

Roman Knyazhitskiy, Andrea Giuseppe Di Francesco

机构 * University of Cambridge(剑桥大学) Sapienza University of Rome(罗马大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出一种无需辅助损失的早期退出策略,在GCN和SAS-GNN骨干网络上实现链接预测的加速,同时保持或提升预测质量。

Comments Accepted at LoG@Pisa 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21113 2026-06-23 cs.CV cs.LG 新提交 57%

Object-Centric Dataset Resources for Constrained-Data Image Generation and Augmentation

面向受限数据图像生成与增强的以对象为中心的数据集资源

Vasile Marian, Yong-Bin Kang, Alexander Buddery

机构 * The University of Queensland(昆士兰大学) Swinburne University of Technology(斯威本科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 针对少样本场景下的对象中心图像生成,提出三个标准化数据集资源(Cityscapes-Pedestrian、TrafficSigns、COCO PottedPlant),提供256×256裁剪、边界框标注及重建脚本,支持受控比较与评估。

Comments 5 pages including references, 2 figures, 2 tables. Dataset and related files at https://github.com/Latzi/object-centric-low-data-datasets and https://doi.org/10.5281/zenodo.20573001

详情

展开后加载摘要…

URL PDF HTML 收藏