arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-04 至 2026-08-04 共收录 10 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 10 篇

2608.00267 2026-08-04 cs.SE cs.CL 新提交 81%

LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

LoopsBench:在基准测试编码智能体中从 harness 工程转向 loop 工程

Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 代码评测 :coding agent(title,abstract);分类 cs.SE、cs.CL

AI总结 该研究针对编码智能体基准测试中持续执行洞察不足的问题,推出长周期基准 LoopsBench,含112个多领域任务,评估得最强配置解决25%任务,开源相关数据代码。

Comments Project page: https://loopsbench.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03356 2026-08-04 cs.SE 57%

POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference

POSTCONDBENCH:形式化后置条件推理中的正确性与完备性基准测试

Gehao Zhang, Juan Zhai

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出POSTCONDBENCH多语言基准,用于评估LLM生成方法级后置条件的能力,发现正确性与完备性差距显著,仓库级依赖及方法复杂性会加剧该差距。

Journal ref In Findings of the Association for Computational Linguistics: ACL 2026, pages 35478-35507, San Diego, California, United States. Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02407 2026-08-04 cs.CR cs.AI 新提交 57%

Antares: Foundation Models for Agentic Vulnerability Localization

Antares:用于智能体漏洞定位的基础模型

Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 该研究提出基于IBM Granite的Antares系列紧凑语言模型,经两阶段训练用于智能体漏洞定位,其30亿参数版本性能接近GPT-5.5且远超更大模型,推理高效低成本。

Comments 57 pages, 12 figures, technical report for antares

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01149 2026-08-04 cs.AI 新提交 57%

PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

PATH-Bench:面向终身智能体的路径依赖评估基准

Xidong Yang, Xingyi Zhang, Wenhao Li, Wenyan Liu, Junjie Sheng, Yun Hua, Wei Yin, Tao Fang, Chuyun Shen, Xiangfeng Wang

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00915 2026-08-04 cs.LG 新提交 57%

UpliftBench: Revealing Outcome-Regime and Objective Mismatch in Uplift Evaluation

UpliftBench:揭示uplift评估中的结果 regime 与目标不匹配问题

Binshuang Li

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 UpliftBench评估12种uplift估计器,发现基准分歧源于指标而非模型,揭示Qini等指标与效应准确性一致性不足等问题,发布可复现基准工具。

Comments 25 pages, 9 figures. Code, data, and results: https://github.com/binshuangli/uplift-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00711 2026-08-04 cs.AI 新提交 57%

Tracing the Cascade: A Topology-Aware Evaluation Framework for Scientific Agent Hallucinations

追踪级联:一种面向科学智能体幻觉的拓扑感知评估框架

Xinshun Feng, Ziqi Miao, Lijun Li, Jing Shao

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 该研究针对科学智能体幻觉的拓扑结构评估缺口,提出SCHEMA框架,通过构建科学概念图等方式评估,发现幻觉集中于知识枢纽、最终准确率与推理轨迹诚实性脱钩,为高风险科学应用提供机制级评估方案。

Comments 36 pages, 7 figures and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交 57%

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00227 2026-08-04 cs.SE 新提交 57%

Source Code Authorship Attribution Does Not Generalize from Competitions to Classrooms

源代码作者身份归属无法从竞赛场景泛化到课堂场景

Serhii Yemets, Marek Horváth

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本研究发现,针对Google Code Jam竞赛数据微调的CodeBERT等模型,在课程作业数据集上的作者身份归属性能远低于随机基线,竞赛场景的基准无法泛化到教育场景,需针对性验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01077 2026-08-04 cs.RO 新提交 50%

VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

VespaSeg:一种用于指代表达分割的资源感知“先定位后分割”流水线

Savindu Dilshan Wickramasinghe

机构 * University of Moratuwa(莫拉图瓦大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文针对指代表达分割中整体式模型部署成本高的问题,提出模块化流水线VespaSeg,采用轻量型视觉-语言模型定位与MobileSAM分割,经适配后在RefCOCO数据集上实现高精度,且内存占用低、推理速度快。

Comments 5 pages, 3 figures. Code and result artifacts: https://github.com/Savidilsh/VespaSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00461 2026-08-04 physics.ins-det hep-ex 新提交 50%

An eightfold equivalence-preserving speedup of the JUNO OMILREC vertex and energy reconstruction

JUNO OMILREC顶点与能量重建的八倍等效保持加速

Guangbao Sun, Qishan Liu, Wenjie Wu, Jun Cao, Xuefeng Ding, Wenxing Fang, Wuming Luo, Liangjian Wen, Zeyuan Yu, Xiang Zhou

专题命中 代码评测 :coding agent(abstract)

AI总结 本研究针对JUNO的OMILREC重建算法,通过分阶段等效保持优化实现了最高8.6倍的单线程加速,保持物理输出一致,为大型探测器似然重建加速提供了可转移模板。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏