arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-12 至 2026-08-12 共收录 7 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 7 篇

2603.26337 2026-08-12 cs.SE 版本更新 79%

RACE-Bench: A Reasoning-Augmented Benchmark for Repository-Level Code Agents on Feature Addition

一个用于评估具有中间推理的仓库级代码代理的基准测试:在特性添加任务上

Shuhan Liu, Zhiyi Zhao, Xing Hu, Kui Liu, Xiaohu Yang, Xin Xia

专题命中 代码评测 :repository(title,abstract);分类 cs.SE

AI总结 本文提出RACE-bench基准,用于评估仓库级代码代理在特性添加任务中的推理能力,通过执行补丁验证和结构化中间推理地面真相,分析代理的推理质量与实现步骤转换性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25589 2026-08-12 cs.CV cs.AI cs.CL 版本更新 62%

Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact

放射学视觉语言模型基准的法证可重复性审计:从预期协议到发布工件

Mateusz Kozłowski

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 对胸部X光视觉语言模型试点进行法证可重复性审计,追踪提示绑定等多方面情况,发现存在图像渲染、数据分割等问题,重建队列改变统计值,撤回原声明并指定机器可验证控制。

Comments Withdrawn by the author. On further review, the archived artifacts underlying this audit are too incomplete to support the reported statistics, and the paper's conclusions do not follow from the available evidence. The work is withdrawn in full; earlier versions should not be cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13201 2026-08-12 cs.CL cs.AI 版本更新 62%

InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

InfiniteScienceGym:一个无界的、程序生成的科学分析基准

Oliver Bentham, Vivek Srikumar

机构 * Kahlert School of Computing(卡勒特计算学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InfiniteScienceGym,通过程序生成科学仓库和可验证问答任务,评估证据推理、回避和工具分析能力,发现现有模型在回答不可答问题上存在显著缺陷。

Comments 31 pages, 5 figures, 8 tables. Accepted to COLM 2026. See https://infinitesciencegym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10145 2026-08-12 cs.LG 新提交 57%

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

评估协议决定结果:在TwoRoom上独立复现LeWorldModel

Joyjeet Singh

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。

Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15237 2026-08-12 stat.ME cs.LG stat.ML 交叉投稿 57%

Optimized Sequential Testing for Binary Ensemble Classifiers

二元集成分类器的优化序贯测试

Joseph Kalman, Amit Moscovich

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出一种序贯测试方法,通过提前停止基模型评估来降低二元集成分类器的计算成本,同时控制与完整集成的不一致率,并利用线性规划求解最优停止策略。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11470 2026-08-12 cs.CL 版本更新 57%

The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes

LLM推理的周期表:推理范式、方法与失败模式的结构化综述

Avinash Anand, Mahisha Ramesh, Avni Mittal, Ashutosh Kumar, Rishitej Reddy Vyalla, Erik Cambria, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工大学) Nvidia AI Center (SNAIC)(英伟达人工智能中心(SNAIC)) MIDAS Lab, IIIT Delhi(IIIT德里MIDAS实验室) MIDAS Lab, IIT Mandi(IIT曼迪MIDAS实验室) Owl Autonomous Imaging, Inc.(Owl自主成像公司) College of Computing & Data Science, NTU Singapore(新加坡南洋理工大学计算与数据科学学院) NVIDIA AI Technology Centre, Singapore(英伟达新加坡人工智能技术中心) Department of Computer Science and Engineering, IIT Kanpur(IIT坎普尔计算机科学与工程系)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本文系统综述了300多篇论文,提出LLM推理研究的结构化分类法,涵盖多种推理范式,分析方法论趋势,并总结常见限制与失败模式,旨在为开发更鲁棒、可解释和可泛化的推理系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21947 2026-08-12 physics.comp-ph physics.atom-ph 版本更新 50%

AMELI: Angular Matrix Elements of Lanthanide Ions

AMELI: 镧系离子的角矩阵元

Reinhard Caspary

专题命中 代码评测 :repository(abstract)

AI总结 提出基于Slater行列式基和Racah分类的通用框架,计算f^N组态中任意球张量算符的角矩阵元,并构建开源数据库AMELI,以精确算术消除浮点误差,替代传统半经验计算表格。

Comments v2: Abstract, introduction and conclusion rewritten to clarify the novelty and intention of this work. Added Wybourne crystal field Hamiltonians in Section IV G. Improved phase synchronization in Section V B. New Section IX "Application Examples" v3: Minor errors and typographic flaws corrected

详情

展开后加载摘要…

URL PDF HTML 收藏