arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-30 至 2026-07-30 共收录 7 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 7 篇

2607.26117 2026-07-30 cs.SE cs.AI cs.LG 新提交 78%

Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models

再试一次,不要回头:小型代码模型中盲重采样优于自我修复

Yuvraj Verma

专题命中 代码评测 :code model(title);分类 cs.SE、cs.AI、cs.LG

AI总结 该研究针对MBPP+数据集在三种规模代码模型上发现,盲重采样在7B以下表现最优,成本远低于其他重试方法,而基于自身失败尝试的自我修复存在锚定效应导致的性能损失。

Comments Code, pre-registrations and run traces: https://github.com/vermayuvraj/self-improving-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22768 2026-07-30 cs.CL 版本更新 70%

ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation

ML2B:评估大语言模型跨语言ML流水线生成能力的基准

Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

机构 * HSE University(俄罗斯伏尔加格勒国立大学) Constructor University(Constructor大学) National University of Singapore(新加坡国立大学)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.CL

AI总结 ML2B是首个评估大语言模型跨语言ML流水线生成能力的基准,含多领域多语言任务,实验发现跨语言性能退化高度依赖任务,挑战了传统多语言模型能力假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26656 2026-07-30 cs.CR cs.AI cs.SE 新提交 62%

Graph Is the Verifier: Agentic Reinforcement Learning for Interprocedural Vulnerability Detection

图作为验证器:用于过程间漏洞检测的智能体强化学习

Yikun Li, Ting Zhang, Jiakun Liu, Jinfeng Jiang, Yuheng Yieh, Yixin Yang, Wen Bin Leow, Yide Yin, Yintong Huo, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对现有漏洞检测孤立处理函数的问题,提出基于CPG的智能体强化学习框架VulAgentRL,通过图验证设计可靠奖励并预热初始化策略,在仓库级划分下的严格指标及多场景中均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26777 2026-07-30 cs.SE 新提交 57%

CodeSpec: Dual Executable Specifications for Agentic Long-Horizon Feature Development

CodeSpec:面向智能体长周期功能开发的双可执行规范

Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26451 2026-07-30 cs.SE 新提交 57%

ExplainBench: Evaluating Code Explanations from Agents

ExplainBench:评估智能体生成的代码解释

Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01153 2026-07-30 cs.CL cs.AI cs.SE 版本更新 56%

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准

Brett Reynolds

机构 * Humber Polytechnic(汉博理工学院) University of Toronto(多伦多大学)

专题命中 代码评测 :分类 cs.SE、cs.CL、cs.AI;repository(comments)

AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。

Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08729 2026-07-30 cs.CV 版本更新 50%

WaspMOT: A Benchmark for Long-Term Multi-Object Tracking of Trichogramma Wasps

WaspMOT:赤眼蜂长期多目标跟踪基准

Tomasz Stanczyk, Yuan Gao, Hardik Agarwal, Seongro Yoon, Tiantao Zhang, Vincent Calcagno, Francois Bremond

机构 * Inria(法国国家信息与自动化技术研究院) INRAE Institut Sophia Agrobiotech(法国国家农业生物技术研究院) Université Côte d'Azur(蔚蓝海岸大学) Indian Institute of Technology Delhi(德里印度理工学院) Institute of Plant Protection, Chinese Academy of Agricultural Sciences(中国农业科学院植物保护研究所)

专题命中 代码评测 :repository(abstract)

AI总结 研究针对多目标跟踪在长期身份保持评估不足的问题,引入WaspMOT基准,通过对赤眼蜂长时间跟踪构建数据集,评估五种检测跟踪方法,发现都有轨迹碎片化问题,简单拼接基线可提升性能,揭示了现有方法局限。

Journal ref AVSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏