arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 159 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 仓库级理解 159 篇

2607.19653 2026-07-23 cs.SE cs.AI 新提交 84%

PerfAgent: Profiler-Guided Iterative Refinement for Repository-Level Code Optimization

PerfAgent:用于仓库级代码优化的分析器引导迭代优化

Ryan Deng, Yuanzhe Liu, Bastian Lipka, Yao Ma, Xuhao Chen, Tim Kaler, Jatin Ganhotra

机构 * Massachusetts Institute of Technology(麻省理工学院) Rensselaer Polytechnic Institute(罗切斯特理工学院) IBM(IBM公司) Michigan State University(密歇根州立大学)

专题命中 仓库级理解 :repository(title,abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28235 2026-06-29 cs.SE cs.AI 新提交 84%

Govern the Repository, Not the Agent: Measuring Ecosystem-Level Risk in AI-Native Software

治理仓库,而非智能体:衡量AI原生软件中的生态系统级风险

Daniel Russo

机构 * Daniel Russo(丹尼尔·鲁索)

专题命中 仓库级理解 :repository(title,abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究发现,AI智能体贡献的代码在仓库层面产生的集成摩擦比人类贡献高约两倍,表明风险源于生态系统而非单个智能体,建议从生态系统层面进行治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交 84%

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 仓库级理解 :repository(title,abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21217 2026-07-24 cs.AI 新提交 83%

ICAE-Bench: Evaluating Coding Agents as Interactive Project Builders

ICAE-Bench:将编码智能体评估为交互式项目构建者

Zhongyuan Peng, Dan Huang, Chuyu Zhang, Caijun Xu, Changyi Xiao, Shibo Hong, David Lo, Lin Qiu, Xuezhi Cao, Jiyuan He, Yixin Cao

机构 * Meituan(美团)

专题命中 仓库级理解 :coding agent(title,abstract);repository(abstract);分类 cs.AI

AI总结 研究针对编码智能体在交互式项目构建中作用转变,现有基准未跟上的问题,提出ICAE-Bench基准。从模糊需求出发,经自动化用户智能体模拟动态范式,引入避免需求模糊性、确保用户模拟质量、公平评估开放式仓库的关键设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10084 2026-08-12 eess.IV cs.CV 新提交 82%

When Repository Labels Are Not Image-Level Truth: A Supervision Auditing Framework for Chest Radiograph AI

当仓库标签并非图像级真值:面向胸部X光AI的监督审计框架

Yesika Alexandra Agudelo-Londoño, Jhon Wilmer Pino-Román, Brahian Carrera Rodríguez, José Miguel Castañeda-Bedoya, Juan Pablo Gómez-López, Aura C. Puche-Sarmiento, Niharika S. D'Souza, Juan Sebastian Osorio-Valencia, Jon E. Duque-Grajales, Jazmín Ximena Suárez-Revelo, Jorge Mario Vélez-Arango, Gabriel Castrillón

专题命中 仓库级理解 :repository(title,abstract)

AI总结 针对胸部X光仓库标签非图像级真值的问题,提出RSA框架,以MIMIC-CXR心脏肥大数据为例发现其标签与专家评估一致性极低,用专家精选队列训练的DenseNet121模型达0.853的ROC-AUC,强调监督审计的重要性。

Comments Accepted (oral) at the 3rd MICCAI Student Board (MSB) EMERGE Workshop, MICCAI 2026. This is the authors' version; the final authenticated version will appear in Springer Lecture Notes in Computer Science (LNCS). 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05141 2026-08-06 cs.AI cs.LG cs.SE 新提交 82%

OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

OctoLong:跨仓库代码上下文的训练中优化增强长上下文建模

Indraneil Paul, Falko Helm, Goran Glavaš, Iryna Gurevych

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 该研究提出OctoLong流水线,通过跨仓库代码上下文的训练中优化,训练出OctoLong-Instruct长上下文开源LMs,用其替代12%传统语料库可显著提升长上下文相关任务性能及短场景API使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18237 2026-06-17 cs.CL cs.AI cs.LG 新提交 82%

ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计

Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Datadog

专题命中 仓库级理解 :repository(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07611 2026-06-09 cs.IR cs.AI cs.LG cs.SE 新提交 82%

MIRAGE: Metadata-Integrated Repository Analysis and Guided Enhancement for MSR Datasets

MIRAGE:面向MSR数据集的元数据集成仓库分析与引导增强

Aabia Ather, Muhammad Usayd Ather, Qurat-Ul-Ain Somroo, Muhammad Khuram Shahzad

机构 * SEECS, NUST(软件工程系,努斯兰大学)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 提出通过元数据丰富化、FAIR评估和主题驱动分析改进MSR数据集分析的方法,扩展了数据集目录并揭示了仓库站点和格式对引用与可用性的影响。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06471 2026-08-10 cs.CR cs.AI cs.SE 新提交 81%

CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training

CyberForge:用于网络安全智能体训练的、基于代码仓库级别的经验证漏洞注入框架

Amine Lbath, Manan Suri, Aurelien Delaitre, Vadim Okun, Massih-Reza Amini, Ram D. Sriram, Dinesh Manocha

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 本研究提出CyberForge框架,通过向真实C/C++项目注入漏洞生成经验证的代码仓库级安全训练数据,微调后可提升智能体在SEC-bench和PatchEval上的漏洞修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03558 2026-08-05 cs.SE 新提交 79%

EffiHolmes: Differential Profiling-Guided Repository Level Time Inefficiency Fix Localization

EffiHolmes:基于差分分析的仓库级时间低效修复定位

Haowen Yang, Yun Peng, Zishuo Ding

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 EffiHolmes是基于LLM的仓库级时间低效修复定位框架,通过差分分析等技术提升定位精度,在RepoEffi-Bench上优于多种基线方法,且跨模型规模稳健。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). 13 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28775 2026-08-03 cs.SE 新提交 79%

Repository-Aware Metamorphic Relation Generation for Augmented Reality Applications using Large Language Models

基于大型语言模型的增强现实应用的仓库感知变形关系生成

Dibyendu Brinto Bose, Jiawei Qin, Chris Brown

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 本文提出一种结合仓库级上下文与推理编排的流水线,利用大型语言模型生成优化的变形关系,在142个移动AR仓库数据集上验证了该方法可构建可靠的领域相关测试预言,能有效检测代码变异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25996 2026-07-29 cs.SE 新提交 79%

RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models

RepoReasoner:评估长上下文语言模型的仓库级代码推理能力

Yanlin Wang, Suiquan Wang, Yanli Wang, Bowen Zhang, Daya Guo, Jiachi Chen, Zibin Zheng

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 研究针对现有代码推理基准测试局限,引入RepoReasoner评估仓库级代码推理,通过多阶段管道构建基准,评估输出预测和调用链预测能力,发现当前LLMs在仓库级推理存在局限,为未来相关研究提供方向。

Comments Published in FSE'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13439 2026-07-16 cs.CR cs.SE 新提交 79%

DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection

DREA:用于仓库级漏洞检测的解耦推理与探索代理

Mingyang Sun, Guozhu Meng

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 研究针对大语言模型用于仓库级漏洞检测时的不足,提出DREA框架,通过规划与探索代理解耦,实现目标导向上下文获取。构建RepoPairBench评估,提升配对正确性,降低成本,还发现安全推理质量是当前大语言模型的瓶颈。

Comments Accepted for presentation at Internetware 2026. 12 pages, 4 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01764 2026-07-03 cs.AI 新提交 79%

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 仓库级理解 :repository(title,abstract);分类 cs.AI

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01213 2026-07-02 cs.SE 新提交 79%

RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue

RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究

Zhihao Lin, Mingyi Zhou, Zhensu Sun, Yizhuo Yang, Renyu Yang, David Lo, Li Li

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00911 2026-07-02 cs.SE 新提交 79%

From Registry to Repository: How AI Agent Skills Are Written, Adapted, and Maintained

从注册表到仓库:AI代理技能如何编写、适配和维护

Haoyu Gao, Jai Lal Lulla, Hong Yi Lin, Sebastian Baltes, Christoph Treude, Mansooreh Zahedi

专题命中 仓库级理解 :repository(title);coding agent(abstract);分类 cs.SE

AI总结 本研究首次对AI代理技能作为工程制品进行实证分析,通过挖掘公共注册表和GitHub仓库中的技能,发现技能重用多为一次性复制,定制化主要适配本地环境,而行为契约几乎不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31206 2026-07-01 cs.SE 新提交 79%

FeatX: Editing Software by Editing Features for Repository-Level Code Evolution

FeatX: 通过编辑特征来编辑软件以实现仓库级代码演化

Xutian Li, Yifeng Zhu, Xianlin Zhao, Yanzhen Zou, Lu Zhang, Bing Xie

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 提出特征导向工具FeatX,通过提取层次化史诗-特征结构并调用三阶段演化代理,将特征编辑转化为代码补丁,显著降低认知负荷并提升修改定位F1达42.6%。

Comments 4 pages, Accepted to the Tools and Datasets Track of ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28279 2026-06-29 cs.AR cs.AI 新提交 79%

Agentic Hardware Design as Repository-Level Code Evolution

代理硬件设计作为仓库级代码演化

Cunxi Yu, Chenhui Deng, Nathaniel Pinckney, Brucek Khailany

机构 * NVIDIA Research(NVIDIA研究)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.AI

AI总结 提出HORIZON自演化代理框架,将硬件设计视为仓库级代码演化,通过Markdown编译项目包和免手代理循环实现全自动基准测试,在多个基准上达到100%完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05855 2026-08-07 cs.DC 新提交 78%

RepoOMP: Repository-Aware Hotspot OpenMP Parallelization via Dependency-Aware Context Reduction

RepoOMP:基于仓库感知的热点OpenMP并行化方法——通过依赖感知的上下文缩减

Yongjie Qian, Ke Gao, Zhibin Zhang, Shaohui Peng, Ling Li

专题命中 仓库级理解 :repository(title,abstract)

AI总结 RepoOMP是一种混合框架,通过构建MAP和STC,在951个热点上实现平均加速比8.23×至8.96×,降低智能体令牌成本,为仓库热点并行化提供证据引导的工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01138 2026-07-02 cs.CR 新提交 78%

Antaeus: Hunting Repository-Level Logic Vulnerabilities via Context-Grounded LLM Reasoning

Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞

Michele Armillotta, Nicolò Romandini, Rebecca Montanari, Lorenzo Cavallaro

专题命中 仓库级理解 :repository(title,abstract)

AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25271 2026-06-25 cs.HC 新提交 78%

Co-designing a Preliminary Repository of Augmented Reality Concepts for Real-Time Emotion Regulation

共同设计用于实时情绪调节的增强现实概念初步库

Graciela Camacho-Fidalgo, Edgar Rojas-Muñoz

专题命中 仓库级理解 :repository(title,abstract)

AI总结 通过两阶段参与式设计,结合焦虑倾向个体和心理健康专家的意见,构建了包含8个主题簇和106个设计想法的增强现实干预库,以支持实时情绪调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21658 2026-06-23 hep-ex astro-ph.IM hep-ph 新提交 78%

Towards LLM-Powered Automation of a Dark Matter Constraint Repository

基于大语言模型的暗物质约束库自动化

Lanqing Yuan, Karthik Ramanathan

专题命中 仓库级理解 :repository(title,abstract)

AI总结 提出一个LLM流水线,从arXiv论文中提取暗物质约束曲线并生成拉取请求,在基准测试中达到90.5%的耦合类型分类准确率和0.33 dex的中位残差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11241 2026-06-11 cs.DL cond-mat.mtrl-sci 新提交 78%

APTLAS: An Indexed APT Literature Repository

APTLAS:一个索引化的APT文献库

Bavley Guerguis, Nabil Bassim

专题命中 仓库级理解 :repository(title,abstract)

AI总结 针对原子探针层析技术(APT)文献分散且缺乏领域特定元数据的问题,构建了包含约2300条记录并附带元数据的索引库APTLAS,支持按材料体系、仪器等过滤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13285 2026-07-16 cs.AI cs.SE 新提交 73%

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

Harness手册:使不断演进的智能体框架具有可读性、可导航性和可编辑性

Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang

机构 * Tencent(腾讯) Indiana University(印第安纳大学) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学)

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能体框架演进中行为定位难的问题,提出通过Harness手册和行为引导的渐进式披露,以行为为中心自动合成框架表示并辅助规划,提高行为定位和编辑计划质量,助力复杂智能体系统发展。

Comments 29 pages, 6 figures. Project page: https://ruhan-wang.github.io/Harness-Handbook/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09902 2026-07-14 cs.SE cs.AI 新提交 73%

Do These Violent Delights Have Violent Ends? Measuring the Post-Merge Fate of Agentic Code

这些暴力的愉悦会有暴力的结局吗?衡量代理代码合并后的命运

Chunqiu Steven Xia, Courtney Miller

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) George Washington University(乔治华盛顿大学)

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究代理代码合并后的命运,通过对182个仓库实证分析,发现其虽与人工维护率相似,但需更高纠正性维护率,还引入更多问题,且维护负担与仓库特征有关,强调评估设计代理工具要兼顾安全性与可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15769 2026-07-20 cs.SE cs.CY 新提交 70%

Making Agent-Mediated Contributions Governable: A Project-Level Governance Manifest for Open-Source AI Collaboration

使代理介导的贡献具有可治理性:开源人工智能协作的项目级治理宣言

Jinjin Gao, Luyang Li, Shufen Guo, Ligang He, Xiaoning Sun

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究开源人工智能协作中代理介导贡献的治理问题,开发代理治理宣言(AGM)作为双向治理合同,通过实验验证其有效性,构建三层框架,推进合规数字创新治理并保留维护者决策权。

Comments Preprint. Under journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11095 2026-08-12 cs.AI cs.LG cs.SE 新提交 67%

Why Does CLAUDE.md Keep Growing? Catastrophic Remembering in Agentic Coding

CLAUDE.md 为何不断膨胀?智能体编码中的灾难性记忆

Kushal Chakrabarti

机构 * South Park Commons(南公园社区)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 该研究针对智能体编码中提示文件无限制膨胀的问题,提出通过提示注释消除多余指令,可使现实中智能体指令遵循能力提升多达23.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03036 2026-08-05 cs.SE cs.AI cs.LG 新提交 67%

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

野外环境下的大语言模型服务:框架、方法与系统设计的实证研究

Forough Majidi, Mohammad Mehdi Morovati, Foutse Khomh, Heng Li

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本研究通过实证分析开源软件系统中5种LLM服务框架的应用情况,明确了框架使用特点、常用服务方法及应用场景,为相关人员提供了实践见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27528 2026-07-31 cs.CR cs.AI cs.CL cs.SE 新提交 67%

ThreatForest: Multi-Agent Attack Tree Generation with Pluggable TTP Framework Mapping

ThreatForest:基于可插拔TTP框架映射的多智能体攻击树生成方法

Cristian Leo, Anton Dykyi, Danny Cortegaca, Daniel Begimher, Prakash Jha

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 ThreatForest是首个将代码仓库转化为带TTP映射攻击树及对应缓解措施的端到端多智能体系统,其嵌入编码器是TTP映射准确率的核心瓶颈,相关基准框架可用于同类系统测试。

Comments 20 pages, 12 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07907 2026-07-10 cs.LG cs.AI cs.CL cs.CR cs.MM 新提交 67%

Multimodal Unlearning Across Vision, Language, Video, and Audio: Survey of Methods, Datasets, and Benchmarks

跨视觉、语言、视频和音频的多模态遗忘:方法、数据集和基准的综述

Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 综述跨视觉、语言、音频和视频的多模态遗忘,基于相关进展等提供统一视角,通过分类法系统比较模型架构和模态,阐明权衡,强调开放问题与实际考虑,支持未来研究与部署,并发布存储库。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏