arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 3933 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 仓库级理解 3933 篇

2602.14690 2026-07-02 cs.SE 版本更新 57%

Harness Engineering for Agentic AI Coding Tools: An Exploratory Study

配置代理AI编码工具:探索性研究

Matthias Galster, Seyedmoein Mohsenimofidi, Jai Lal Lulla, Muhammad Auwal Abubakar, Christoph Treude, Sebastian Baltes

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文探讨了代理AI编码工具的配置机制,分析了多种工具的配置方法,发现Context Files主导配置,并提出AGENTS.md作为通用标准。

Comments 10 pages, 7 figures, 3 tables, based on "Configuring Agentic AI Coding Tools: An Exploratory Study" published in Proceedings of the 3rd ACM/IEEE International Conference on AI-powered Software (AIware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31354 2026-07-01 cs.SE 新提交 57%

Mutating the "Immutable": A Large-Scale Study of Git Tag Alterations

改变“不可变”:Git 标签变更的大规模研究

Solal Rapaport, Laurent Pautet, Samuel Tardieu, Stefano Zacchiroli, Théo Zimmermann

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 通过分析3.284亿软件仓库,发现1020万次标签变更影响18.9万仓库,并与Nixpkgs交叉验证表明标签变更导致可重现构建失败,建议使用加密提交哈希固定依赖并建立审计日志。

Journal ref 2026 ACM Conference on Reproducibility and Replicability, Jul 2026, Delft, Netherlands

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22593 2026-07-01 cs.SE cs.CR 新提交 57%

On Good Authority: Release-Authority Measurement for Registry-Mediated Package Ecosystems

论良好权威:注册中心中介的包生态系统的发布权威度量

Igor Santos-Grueiro

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 提出一种前驱感知的发布权威记录,通过比较发布路径证据(发布者、仓库、工作流、来源、签名、中介)识别策略触发的发布路径不连续性,经npm等五个生态系统的审计样本验证,触发策略可有效筛选需审查的发布。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16436 2026-07-01 cs.LG 版本更新 57%

DISCOVER: A Solver for Distributional Counterfactual Explanations

DISCOVER: 一种用于分布反事实解释的求解器

Yikai Gu, Lele Cao, Bo Zhao, Lei Lei, Lei You

机构 * Technical University of Denmark(丹麦技术大学) Aalto University(阿尔托大学) Xi'an Jiaotong University(西安交通大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 提出DISCOVER,一种模型无关的分布反事实解释求解器,通过预算化提议-选择搜索范式替代梯度优化,利用最优传输几何指导采样,实现非可微模型下的分布对齐。

Comments 22 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29785 2026-06-30 cs.SE 57%

Uncovering Similar but Different Packages in PyPI and Potential Security Threats

揭示 PyPI 中相似但不同的包及潜在安全威胁

Sunha Park, Soojin Han, Seunghoon Woo

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究大规模分析 PyPI 中的包复制现象,发现大量复制包复制现有包的大部分代码,导致漏洞传播和恶意包生成,并通过三种视角揭示其关键特征和威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29606 2026-06-30 cs.SE 57%

Connecting the Models: A Global Mega-model of MDE Projects on GitHub

连接模型:GitHub上MDE项目的全局大模型

Jesús Sánchez Cuadrado

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 通过挖掘7436个GitHub项目中的32.5万多个MDE工件,构建数据集并恢复每个项目的元模型,进而建立全局元模型,以研究模型驱动工程在实践中的使用和组合情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28346 2026-06-30 cs.CY cs.SE 57%

PySynthea: A Python-Native Framework for Scalable Synthetic Healthcare Data Generation

PySynthea:一个用于可扩展合成医疗数据生成的Python原生框架

Roberto Cruz, David Rey-Blanco

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 针对Synthea部署复杂且与Python工作流集成困难的问题,提出Python原生框架PySynthea,通过模块化生成、可配置模拟管道和标准格式支持,提升可访问性和可扩展性。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27386 2026-06-29 cs.DL cs.AI 新提交 57%

Agentic Publication Protocol: An Attempt to Modernize Scientific Publication

Agentic Publication Protocol:科学出版现代化的一次尝试

Sirui Lu, Xiao-Liang Qi

机构 * Max-Planck-Institut für Quantenoptik(马克斯·普朗克量子光学研究所) Munich Center for Quantum Science and Technology(慕尼黑量子科学与技术中心) Leinweber Institute for Theoretical Physics(莱因韦伯理论物理研究所)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 提出Agentic Publication Protocol(APP),一种将论文与代码、数据、环境信息及智能体指令打包的轻量级仓库格式,使未来研究者能直接使用操作知识。

Comments 16 pages, 5 figures and 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27041 2026-06-26 cs.LO cs.PL 新提交 57%

Formalizing a Many-Sorted Hybrid Polyadic Modal Logic in Lean

在Lean中形式化多类混合多模态逻辑

Andrei-Alexandru Oltean, Bogdan Macovei, Ioana Leuştean

专题命中 仓库级理解 :repository(abstract);分类 cs.PL

AI总结 本文在Lean中形式化了一个多类签名和多模态算子的混合模态逻辑,提供DSL用于定义语言和协议,并证明了其可靠性定理,展示了在代码验证、BAN逻辑和S5系统中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27055 2026-06-26 astro-ph.EP astro-ph.IM astro-ph.SR cs.CG cs.SE 新提交 57%

Solarsystem: A Validated Lightweight Python Package for Planetary Positions and Solar-Lunar Event Calculations

Solarsystem: 一个经过验证的轻量级Python包,用于行星位置和太阳-月球事件计算

Ioannis Nasios

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文介绍solarsystem,一个轻量级、无依赖的Python包,使用解析模型计算行星位置和太阳-月球事件,经JPL DE440星历验证,平均经度偏差0.44角分,纬度偏差0.16角分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23984 2026-06-24 cs.SE 新提交 57%

Domain-Driven Design in Practice: A Mining Study of Maintenance and Evolution in Open-Source Repositories

领域驱动设计实践:开源仓库中维护与演化的挖掘研究

Weixing Zhang, Bowen Jiang, Yuhong Fu, Haowei Cheng, Mario Herb, Anne Koziolek

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 通过挖掘GitHub仓库,研究领域驱动设计战术构建块的分布、演化及其对软件维护质量的影响,量化边界上下文违规的规模与维护关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04993 2026-06-24 cs.SE 版本更新 57%

Code Lifespan Survival Analysis (CLSA): Predicting the Survival of Source Code Lines Using AST-Aware Mining

代码寿命生存分析(CLSA):使用AST感知挖掘预测源代码行的存活

Pavel Gurov

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 提出代码寿命生存分析(CLSA)框架,在单行粒度上通过Cox比例风险模型和AST结构、行熵等静态特征预测代码删除风险,发现行熵对成熟代码有强保护作用,仓库身份是最大影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23329 2026-06-23 cs.SE 新提交 57%

Generate with CodeXHug: A Dataset to Enhance Model Cards with Code Usage Patterns

Generate with CodeXHug: 一个增强模型卡片代码使用模式的数据集

Stefano Palombo, Claudio Di Sipio, Juri Di Rocco, Davide Di Ruscio

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 提出CodeXHug数据集,从HuggingFace和GitHub收集预训练模型及其代码使用模式,通过统计分析和聚类提取代表性代码模式,以支持开发者理解和使用PTMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21787 2026-06-23 cs.SE 新提交 57%

Towards Imputation of Pre-Trained Language Model Metadata using Semantic Fingerprinting

基于语义指纹的预训练语言模型元数据插补方法

Adekunle Ajibode, Oussama Ben Sghaier, Keheliya Gallaba, Bram Adams, Ahmed E. Hassan

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 提出语义指纹(SemFin)方法,利用Hugging Face配置文件和仓库标签自动插补缺失的PTLM元数据并重建模型谱系,在317,133个模型上相比基线提升预测准确率最高31.4%,并成功处理16.6%的孤立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20966 2026-06-23 cs.SE 新提交 57%

Beyond the Grave: An Empirical Study of Dormancy and Revival in Scientific Open-Source Software

超越坟墓:科学开源软件休眠与复兴的实证研究

Addi Malviya Thakur, Bogdan Vasilescu, Audris Mockus

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 通过分析SciCat语料库中2984个休眠后复兴的项目,发现52.5%的休眠原因无法从仓库证据中确定,非持续性复兴是持续性复兴的2.14倍,生命周期原型比复兴机制更能预测可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17858 2026-06-17 cs.LG 新提交 57%

Meta-classification of one-class classification models using ranking correlation and nearest neighbor

使用排序相关性和最近邻的一类分类模型的元分类

Toshitaka Hayashi, Hamido Fujita, Dalibor Cimr, Richard Cimler, Jitka Kühnová

机构 * Faculty of Science, University of Hradec Kralove(赫拉德茨-克拉洛韦大学理学院) Malaysia-Japan International Institute of Technology (MJIIT), Universiti Teknologi Malaysia(马来西亚-日本国际技术学院,马来西亚理工大学) Regional Research Center, Iwate Prefectural University(岩手县立大学区域研究中心)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 提出用排序相关性和最近邻对一类分类模型进行元分类,实验表明能高精度区分数据集、算法和超参数,本质是数据集分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17628 2026-06-17 cs.CL 新提交 57%

OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation

OPD-Evolver:通过在线策略蒸馏培养整体智能体进化器

Guibin Zhang, Xun Xu, Yanwei Yue, Zikun Su, Wangchunshu Zhou, Xiaobin Hu, Shuicheng Yan

机构 * LV-NUS Lab(林文实验室) FDU(福建大学) PKU(北京大学) Bytedance Inc.(字节跳动公司)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 提出OPD-Evolver框架,通过快慢双循环和在线策略自蒸馏,使智能体学会选择、使用、编写和维护经验,在多个基准上超越现有方法,并让小模型挑战大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18032 2026-06-17 math.NA cs.LG cs.NA physics.comp-ph 新提交 57%

INI-VPINN: A Variational Physics-Informed Neural Network with Implicit Neumann and Interface Handling for Multi-Material Domains with Geometric Singularities

INI-VPINN:一种隐式处理纽曼边界和界面的变分物理信息神经网络,适用于具有几何奇异性的多材料域

Shayan Dodge, Alessandro Formisano, Sami Barmada

机构 * DESTeC University of Pisa(DESTeC 帕尔米斯大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 提出一种新的弱形式物理信息神经网络INI-VPINN,通过隐式处理纽曼边界和界面条件,无需额外损失项或多子域网络,在多材料问题中实现更高精度和更快收敛。

Comments Preprint version. Under peer review. Code available at: https://github.com/ShayanDodge/INI-VPINN

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15783 2026-06-16 cs.CL 新提交 57%

ttda704 at SemEval-2026 Task 4: Modeling Narrative Structures via Pseudonymization and Multi-View Sentence Alignment

ttda704 在 SemEval-2026 任务 4:通过假名化和多视角句子对齐建模叙事结构

Tai Tran Tan, An Dinh Thien

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(胡志明市信息技术大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国立大学胡志明市分校)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 提出基于对比学习和微调句子变换器的叙事相似度方法,包括单视角(智能层冻结)和多视角(主题/情节/结局投影头+自监督对齐)两条流水线,在合成数据上训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13295 2026-06-16 stat.ML cs.LG stat.ME 新提交 57%

Simultaneous Latent Budget Trees for Stratified Classification

用于分层分类的同时潜在预算树

Simultaneous Latent Budget Trees for Stratified Classification Cristian Buoncompagni, Stefano Pellegrino, Giulia Vannucci, Raffaele Dubbioso, Roberta Siciliano

机构 * Department of Physics, University of Naples Federico II(物理系,那不勒斯费德里科二世大学) Department of Electrical Engineering and Information Technologies, University of Naples Federico II(电气工程与信息科技系,那不勒斯费德里科二世大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 提出同时潜在预算树框架,通过模型驱动的分裂规则处理分层因素,实现可解释分类,并应用于肌萎缩侧索硬化症性别差异分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04592 2026-06-16 cs.CL cs.CV 交叉投稿 57%

From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models

从静态推理到动态交互:流式大型语言模型综述

Junlong Tong, Zilong Wang, YuJie Ren, Peiran Yin, Hao Wu, Wei Zhang, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究院)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文统一了流式LLM的定义,提出系统分类法,综述其方法、应用与未来方向。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14616 2026-06-15 cs.SE 新提交 57%

GitHub Template Repositories: Served Domains, Maintenance, and Practitioner Guidelines

GitHub 模板仓库:服务领域、维护与从业者指南

Leuson Da Silva, Altaf Allah Abbassi, Imen Trabelsi, Paulo Borba, Foutse Khomh

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 通过对五种主流编程语言的 GitHub 模板仓库进行大规模实证研究,分析了模板的服务领域、维护特征及质量问题,并提出了设计和管理模板的实用指南。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13392 2026-06-15 cs.AI 新提交 57%

MiniMax Sparse Attention

MiniMax 稀疏注意力

Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, Jinkai Hu, Jiayao Li, Rui Gao, Zekun Li, Songquan Zhu, Jingkai Zhou, Pengyu Zhao

机构 * MiniMax Peking University(北京大学) NVIDIA(英伟达) Zhejiang University(浙江大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。

Comments 30 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15196 2026-06-15 stat.ML cs.LG 57%

A Review on Self-Supervised Learning for Time Series Anomaly Detection: Recent Advances and Open Challenges

时间序列异常检测中自监督学习的综述:最新进展与开放挑战

Aitor Sánchez-Ferrera, Borja Calvo, Jose A. Lozano

机构 * University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU) Basque Center for Applied Mathematics (BCAM)(巴斯克应用数学中心)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本文综述了时间序列异常检测中自监督学习的最新方法,提出分类体系以理解其多样性,并提供GitHub仓库供后续更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12040 2026-06-12 cs.AI cs.GR 新提交 57%

A Lightweight Multi-Agent Framework for Automated Concrete Barrier Design

一种用于自动混凝土护栏设计的轻量级多智能体框架

Wanting Wang, Xiye Ma, Yuyang He, Minghui Cheng, Ran Cao

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 提出基于AutoGen的“生成-评估-优化”闭环多智能体框架,实现混凝土护栏自动设计,准确率超98%,且8B参数轻量模型可优于631B旗舰模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11462 2026-06-11 cs.SE 新提交 57%

Defeater Cards: Characterizing and Managing Safety Assurance Case Defeaters

Defeater Cards: 表征和管理安全保证案例的击败者

Usman Gohar, Michael C. Hunter, Salil Purandare, Jordan J. Rios, Myra B. Cohen, Robyn R. Lutz

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 提出Defeater Cards结构化文档,基于5W1H框架系统表征、推理和管理安全案例中的击败者,通过跨领域案例研究验证其暴露隐藏假设、发现推理缺口和支持持续演化的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04397 2026-06-10 cs.SE cs.IR 版本更新 57%

Context-as-AI-Service: Surfacing Cross-File Dependency Chains for LLM-Generated Developer Documentation

上下文即服务:为LLM生成的开发者文档揭示跨文件依赖链

Ameya Gawde, Vyzantinos Repantis, Harshvardhan Singh, Lucy Moys

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 提出Context-as-a-Service (CaaS)检索层,通过索引代码库并支持关键词与语义搜索,帮助LLM代理在生成或审查文档时追踪跨文件依赖链,实验表明CaaS能发现基线遗漏的错误并减少时间和输入令牌消耗。

Comments 8 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09290 2026-06-10 cs.SE cs.CE cs.MA 版本更新 57%

ToolRosella: Translating Code Repositories into Standardized Tools for Scientific Agents

ToolRosella: 将代码仓库翻译为科学智能体的标准化工具

Shimin Di, Xujie Yuan, Hanghui Guo, Chaoqian Ouyang, Yongxu Liu, Ling Yue, Zhangze Chen, Libin Zheng, Jia Zhu, Shaowu Pan, Jian Yin, Yong Rui, Min-Ling Zhang

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 提出ToolRosella框架,通过仓库分析、工具接口构建、执行测试和迭代修复,自动将异构科学代码仓库转化为标准化、可被智能体调用的工具,在122个仓库上达到61.5%的转换成功率,下游任务成功率为84.0%。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08970 2026-06-09 cs.AI 新提交 57%

An Effective Router for Vision-Language Model Selection

一种有效的视觉-语言模型选择路由器

Can Wang, Shengwei Wang, Bolin Zhang, Zhiying Tu, Dianhui Chu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 针对视觉-语言模型(VLM)选择中数据缺乏、特征表示无效和模型空间僵化的问题,提出ARMS路由器,通过增强输入信号和扩展训练策略,在分布内和分布外测试集上表现优异,仅800M参数即可超越GPT-4o。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08944 2026-06-09 cs.AR cs.PL 新提交 57%

LongRTL: Graph-Similarity-Guided LLM-driven Long Context RTL Optimization

LongRTL:基于图相似性的LLM驱动的长上下文RTL优化

Yuyang Ye, Che-Kuan Shen, Xiangfei Hu, Yuchen Liu, Shuo Yin, Xufeng Yao, Bei Yu, Tsung-Yi Ho

专题命中 仓库级理解 :code generation(abstract);分类 cs.PL

AI总结 提出一种基于图相似性的LLM驱动RTL优化框架,通过分区、优化和重构三个智能体解决长上下文RTL代码的优化问题。

Comments 7 pages, 6 figures, 5 tables, conference

详情

展开后加载摘要…

URL PDF HTML 收藏