arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-21 至 2026-07-21 共收录 42 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 5 篇

2607.06411 2026-07-21 cs.SE cs.AI cs.CL 版本更新 83%

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench:一个具有原生编写的俄语任务规范的仓库级智能编码基准测试

Evgeny Shilov

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :repository(title);coding agent(abstract,comments);分类 cs.SE、cs.CL、cs.AI

AI总结 RuBench 1.0是含25个俄语任务的仓库级智能编码基准测试,任务源于开源仓库修复提交,按客户请求风格编写。评估多种产品配置,报告运行结果,发现最佳配置解决78.7%任务,还发现产品替换模型问题,为智能编码评估提供新基准。

Comments 20 pages, 1 figure, 9 tables. v2 adds Round 2: Russian-market coding agents (SourceCraft CLI, Koda CLI), Antigravity with Gemini 3.1 Pro / 3.5 Flash, and Codex CLI with GPT-5.6 on the same frozen task set, plus a tool-call contamination re-audit (network + disk layers). Data, full trajectories and harness: https://github.com/eugeneshilow/rubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 75%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26648 2026-07-21 cs.SE cs.AI 版本更新 73%

Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification

Vision2Web: 一个用于视觉网站开发的分层基准,包含代理验证

Zehai He, Wenyi Hong, Zhen Yang, Ziyang Pan, Mingdao Liu, Xiaotao Gu, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Vision2Web基准,用于评估视觉网站开发能力,包含193个任务和16类,通过GUI代理验证器和基于VLM的裁判器评估多个视觉语言模型,揭示了在全栈开发中现有模型的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16979 2026-07-21 cs.SE 新提交 57%

When Post-Anchor Metrics Fail: Stabilization Regimes in AI-Evidence Open-Source Projects

当后锚定指标失败时:人工智能证据开源项目中的稳定机制

Hudson Craig, Benjamin Barlog, Chenggang Wang, Longwei Wang, Zedong Peng

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 研究人工智能证据开源项目中架构变更后稳定义务衡量问题,指出后锚定稳定密度指标失败,引入稳定机制并人工验证校准,强调需受控设计与机制感知归因来可靠识别稳定义务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 57%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 仓库级理解 6 篇

2602.22446 2026-07-21 cs.LG cs.AI 62%

ECHO: Encoding Communities via High-order Operators

ECHO:通过高阶运算编码社区

Emilio Ferrara

机构 * Thomas Lord Department of Computer Science, University of Southern California(美国南加州大学汤姆·劳德计算机科学系)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 ECHO通过高阶运算和自监督架构,解决社区检测中的拓扑与语义瓶颈,实现高效准确的社区划分。

Journal ref Machine Learning with Applications, Volume 25, 100930, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17838 2026-07-21 cs.LG cs.AI 版本更新 62%

Posts of Peril: Detecting Information About Hazards in Text

危险帖子:检测文本中的危害信息

Keith Burghardt, Daniel M. T. Fessler, Chyna Tang, Anne Pisor, Kristina Lerman

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究如何检测文本中的危害信息,开发新模型并基于标注X帖子训练,应用于地缘政治事件数据集,发现危害信息常见,无机账户有特定讨论模式,为信息战环境下危害探索迈出第一步。

Comments 21 pages, 14 figures

Journal ref In: ICWSM 2026, 20(1), 370-390 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17957 2026-07-21 cs.SE 新提交 57%

DepRepair: LLM-Based Source-Code Repair for Dependency Breaking Changes

DepRepair:基于大语言模型的针对依赖项破坏更改的源代码修复

Shenghao Yang, Bo Lu, Yaochen Liu, Yu Kang, Qiongfang Zhang, Chetan Bansal, Saravan Rajmohan, Minghua Ma

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 研究软件项目因第三方库更新致依赖项破坏更改的问题,提出DepRepair单调用大语言模型方法,通过证据过滤器、用法定位器和子类别感知指南,基于结构化上游证据修复,在DepBench基准测试中取得高可执行通过率。

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17147 2026-07-21 cs.CR cs.CL 新提交 57%

SlotGuard: Stop Oversharing Private Local Context in LLM Agent Transcri

SlotGuard:阻止大语言模型代理转录中过度共享私有本地上下文

Haocheng Xia, Yongjoo Park

机构 * Siebel School of Computing(计算机科学系) Data Science, University of Illinois Urbana-Champaign(数据科学,伊利诺伊大学厄巴纳-香槟分校)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 研究大语言模型代理转录本隐私泄露问题,提出SlotGuard方法,通过重写结构绑定、替换机密值、链接跨轮引用等操作隐藏敏感数据,在保持代理性能的同时大幅降低凭证泄漏率。

Comments ICML 2026 AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02947 2026-07-21 econ.GN cs.CL q-fin.EC 版本更新 57%

FOI-O: A global ontology and verification framework for Freedom of Information process modelling

FOI-O:新西兰首个用于信息自由流程建模的本体与验证方法包

Dylan A Mordaunt

机构 * Faculty of Health, Education and Psychology, Victoria University of Wellington(维多利亚大学健康、教育与心理学学院) College of Medicine and Public Health, Flinders University(弗林德斯大学医学院和公共卫生学院) Centre for Health Policy, The University of Melbourne(墨尔本大学健康政策中心)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 针对公共信息请求记录混杂多类数据的问题,提出FOI-O可复用流程建模与验证框架,基于新西兰相关法案实现首个验证配置文件,提供多类标准化语义与流程工具资产。

Comments 22 pages, 4 figures, 9 tables, ancillary supplement; revised manuscript with expanded provenance, versioning, and navigation documentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25468 2026-07-21 cs.DL 版本更新 50%

Metadata conflicts and their impact on DataCite metadata completeness in disciplinary research data repositories

提升元数据流——在学科研究数据存储库中同时使用多种元数据模式

Dorothea Strecker

专题命中 仓库级理解 :repository(abstract)

AI总结 研究探讨了学科研究数据存储库中同时使用多种元数据模式的挑战,发现优化模式映射可显著改进DataCite元数据记录,但学科影响元数据完整性,需进一步完善。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他AI编程 1 篇

2601.17525 2026-07-21 cond-mat.mes-hall 版本更新 50%

An expandable kinetic Monte Carlo platform for modelling electron transport through chiral molecules

用于模拟电子通过手性分子传输的可扩展动力学蒙特卡罗平台

Silvia Giménez-Santamarina, Andrés Mora Martínez, Gérliz M. Gutiérrez-Finol, Alejandro Gaita-Ariño

专题命中 其他AI编程 :code model(abstract)

AI总结 研究旨在建模电子通过手性分子传输的不同理论,编写动力学蒙特卡罗代码,可模拟外部电压下电子输运,区分自旋电流,通过相关参数对分子进行参数化,获得自旋滤波值及低电压下消失的效应等。

详情

展开后加载摘要…

URL PDF HTML 收藏