arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-12 至 2026-05-12 共收录 55 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 12 篇

2605.09534 2026-05-12 cs.CR cs.AI 57%

Governing AI-Assisted Security Operations: A Design Science Framework for Operational Decision Support

治理人工智能辅助的安全运营:一种用于操作决策支持的设计科学框架

Elyson A. De La Cruz, Rishikesh Sahay, Md Rasel Al Mamun

机构 * Department of Artificial Intelligence, University of the Cumberlands(人工智能系,坎伯兰大学) Department of Management Information Systems, University of Illinois Springfield(管理信息系统系,伊利诺伊大学斯普林菲尔德分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出了一种设计科学框架,用于在高风险数字基础设施中管理人工智能辅助的操作决策支持,通过定义设计提案、角色问责制、成熟阶段、质量门禁、评估标准和证据边界。

Comments 28 pages, 1 listing, 1 figure, 20 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09055 2026-05-12 cs.RO cs.AI cs.MA 57%

Octopus Protocol: One-Shot Hardware Discovery and Control for AI Agents via Infrastructure-as-Prompts

Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制

Quilee Simeon, Justin M. Wei, Yile Fan

机构 * MIT(麻省理工学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08382 2026-05-12 cs.CR cs.CL cs.CY 57%

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL

AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08258 2026-05-12 cs.MA 50%

Designing Intelligent Enterprise Agents: A Capability-Aligned Multi-Agent Architecture

设计智能企业代理:一种能力对齐的多代理架构

John deVadoss

专题命中 软件智能体 :software agent(abstract)

AI总结 本文提出CEAD架构,通过能力对齐设计优化企业代理系统,评估显示其在安全成功率上优于其他架构。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码评测 11 篇

2602.12606 2026-05-12 cs.LG 74%

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

RelBench v2:关系数据的大型基准和存储库

Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Ljubljana(卢布尔雅那大学) Kumo AI University of Oxford(牛津大学)

专题命中 代码评测 :repository(title);分类 cs.LG

AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。

Comments Published at ICLR 2026. Website: https://relbench.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08658 2026-05-12 cs.LG cs.AI cs.SE 67%

Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching

Sketch-and-Verify: 通过程序草图实现推理时间扩展

Shan Jiang, Zijian Yi, Chenguang Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 代码评测 :code model(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出SKETCHVERIFY方法,通过程序草图生成多样化候选方案,验证后选择最优,提升模型性能,同时探讨K与M的权衡关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10597 2026-05-12 cs.SE cs.AI 62%

CrackMeBench: Binary Reverse Engineering for Agents

CrackMeBench:用于代理的二进制逆向工程

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 CrackMeBench旨在评估语言模型代理在教育类CrackMe逆向工程任务中的能力,通过确定性二进制验证问题,结合公开校准CrackMe和生成任务,测试代理在无网络LinuxDocker沙箱中的表现,提供可重复的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10737 2026-05-12 cs.CL cs.LG 62%

PolyTruth: Multilingual Disinformation Detection using Transformer-Based Language Models

PolyTruth:基于Transformer语言模型的多语言虚假信息检测

Zaur Gouliev, Jennifer Waters, Chengqian Wang

机构 * School of Information & Communication Studies(信息与通信研究学院) University College Dublin(都柏林大学学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.LG

AI总结 本文通过比较五种多语言Transformer模型在虚假信息检测任务中的表现,揭示了不同模型在多语言环境下的性能差异及局限性,提出了PolyTruth Disinfo Corpus数据集以促进进一步研究。

Comments 11 pages, 5 figures, 4 tables. Submitted to arXiv in Computation and Language

Journal ref Machine Learning and Principles and Practice of Knowledge Discovery in Databases, ECML PKDD 2025, Communications in Computer and Information Science, vol. 2843, pp. 353-367, Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07024 2026-05-12 cs.LG cs.AI 62%

Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks

Delulu:一种经过验证的多语言基准,用于检测填充中间任务中的代码幻觉

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 Delulu是一个包含1951个跨7种语言和4种幻觉类型的填充中间任务样本的多语言基准,通过对抗性流程筛选出经过验证的样本,评估了11种开放式FIM模型,证明了任务内在难度而非模型家族特定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10890 2026-05-12 cs.SE 57%

CppPerf: An Automated Pipeline and Dataset for Performance-Improving C++ Commits

CppPerf:一个用于性能改进C++提交的自动化流水线和数据集

Tommy Ho, Khashayar Etemadi, Zhendong Su

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出CppPerf-Mine流水线,通过结合结构化提交过滤、LLM分类器和容器化构建测试阶段,挖掘改进执行时间的补丁,并构建包含347个手动验证补丁的CppPerf-DB数据集,评估仓库级修复工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10159 2026-05-12 cs.LG cs.NA math.NA physics.comp-ph 57%

jNO: A JAX Library for Neural Operator and Foundation Model Training

jNO:用于神经算子和基础模型训练的JAX库

Leon Armbruster, Rathan Ramesh, Georg Kruse, Christopher Straub

机构 * Fraunhofer Institute for Integrated Systems and Device Technology(弗劳恩霍夫整合系统与器件技术研究所)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 jNO是一个基于JAX的神经算子库,支持数据驱动和物理引导的训练,通过统一的符号语言编译优化流程,实现算子回归、网格感知残差评估和PDE约束训练的无缝切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09636 2026-05-12 cs.AI 57%

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准

Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Rice University(里士满大学) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Alibaba Group(阿里巴巴集团)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09408 2026-05-12 cs.LG cs.SI stat.ML 57%

GravityGraphSAGE: Link Prediction in Directed Attributed Graphs

GravityGraphSAGE:有向属性图中的链接预测

Riccardo Porcedda, Francesca Chiaromonte, Fabrizio Lillo, Andrea Vandin

机构 * Department of Excellence L’EMbeDS, Sant’Anna School of Advanced Studies(卓越部门L’EMbeDS,圣安娜高级研究学校) Department of Computer Science, University of Pisa(比萨大学计算机科学系) Department of Statistics and Huck Institutes of the Life Sciences, The Pennsylvania State University(统计学与生命科学学院,宾夕法尼亚州立大学) Class of Science, Scuola Normale Superiore(科学班级,正规大学) DTU Technical University of Denmark(丹麦技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出Gravity-GraphSAGE模型,通过改进GraphSAGE实现有向链接预测,优于现有图深度学习方法,在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09473 2026-05-12 cs.NI 50%

PolicyCache-SDN: Hierarchical Intra-Path Learning for Adaptive SDN Traffic Control

PolicyCache-SDN:分层路径内学习用于自适应SDN流量控制

Wenyang Jia, Jingjing Wang, Ziwei Yan, Tanren Liu, Yakun Ren, Kai Lei

专题命中 代码评测 :repository(abstract)

AI总结 PolicyCache-SDN通过分层路径内学习实现自适应SDN流量控制,提升核心链路利用率并降低网络延迟和SLA违规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04425 2026-05-12 cs.NI cs.SY eess.IV eess.SY 50%

TeleSim: A Network-Aware Testbed and Benchmark Dataset for Telerobotic Applications

TeleSim: 一种网络感知的测试床和基准数据集用于远程机器人应用

Zexin Deng, Zhenhui Yuan, Longhao Zou

专题命中 代码评测 :repository(abstract)

AI总结 TeleSim通过模拟不同网络条件下的远程机器人任务,提供了一种网络感知的测试床和基准数据集,用于评估远程机器人系统在异构网络环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 仓库级理解 9 篇

2605.08448 2026-05-12 cs.AI cs.CL 62%

LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification

基于大语言模型的半监督方法用于社交媒体危机数据分类

Jacob Ativo, Bharaneeshwar Balasubramaniyam, Anh Tran, Khushboo Gupta, Hongmin Li, Doina Caragea, Cornelia Caragea

机构 * Independent Researcher(独立研究者)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型引导的半监督学习在社交媒体危机数据分类中的应用,比较了VerifyMatch和LLM引导的协同训练方法,发现LLM引导的协同训练在低资源环境下表现优异,同时验证了知识迁移的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03761 2026-05-12 cs.CR cs.AI 57%

You Have Been LaTeXpOsEd: A Systematic Analysis of Information Leakage in Preprint Archives Using Large Language Models

你已被LaTeXpOsEd:利用大语言模型对预印本档案中的信息泄露进行系统分析

Richard A. Dubniczky, Bertalan Borsos, Tamas Bisztray, Norbert Tihanyi

机构 * Eötvös Loránd University(埃奥瓦大学) University of Oslo(奥斯陆大学) Sztaki Technology Innovation Institute(技术创新研究所)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文通过分析10万份arXiv提交的1.2TB源数据,揭示了预印本档案中存在大量敏感信息泄露问题,提出LaTeXpOsEd框架结合模式匹配、逻辑过滤和大语言模型检测隐藏披露,揭露了PII泄露、GPS标记文件等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08956 2026-05-12 cs.AI 57%

Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery

代理式AI科学家并非为自主科学发现而建

Harshit Bisht, Vinay Kumar, Kevin Maik Jablonka, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系) Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学有机与大分子化学实验室) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学能源与环境化学中心) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena)(耶拿海德堡聚合物能源应用研究所(HIPOLE耶拿))

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文指出,尽管代理式AI科学家能作为合作者,但其设计并非为自主科学发现。挑战包括问题选择偏差、实验室知识缺失、输出多样性压缩及缺乏实验反馈,需重新审视基础设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08435 2026-05-12 cs.SE 57%

A Dataset of Agentic AI Coding Tool Configurations

一种代理AI编码工具配置数据集

Matthias Galster, Seyedmoein Mohsenimofidi, Levi Böhme, Jai Lal Lulla, Muhammad Auwal Abubakar, Christoph Treude, Sebastian Baltes

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文提出一个包含40585个开源仓库的AI编码工具配置数据集,涵盖5种工具和8种配置机制,用于研究上下文工程、AI工具采用模式和人机协作。

Comments 9 pages, 8 figures, 2 tables, Proceedings of the 3rd ACM/IEEE International Conference on AI-powered Software (AIware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10881 2026-05-12 astro-ph.HE astro-ph.GA 50%

Characterizing Pulsar Distances Using HI Kinematics

利用HI动力学特征表征脉冲星距离

S. Romero-Ruiz, S. K. Ocker

专题命中 仓库级理解 :repository(abstract)

AI总结 本文基于HI径向速度数据,利用先进银河系旋转曲线计算66个脉冲星的动能距离,结果与已有视差测量一致,且与NE2025电子密度模型一致。

Comments 4 pages, 1 figure, published in RNAAS; dataset available at https://doi.org/10.5281/zenodo.19775798; code at https://github.com/stella-ocker/psr-HI-kinematics

Journal ref Steven Romero-Ruiz and Stella Koch Ocker 2026 Res. Notes AAS 10 109

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10423 2026-05-12 astro-ph.IM astro-ph.HE 50%

SAPLE: Swift Analysis Pipeline for Lightcurve Extraction

SAPLE:快速光度曲线提取分析流水线

Lea Marcotulli, Núria Torres-Albà

专题命中 仓库级理解 :repository(abstract)

AI总结 SAPLE是一款用于提取Swift-UVOT和Swift-XRT数据及光谱信息的半自动化流水线,提供吸收校正后的特定通量,填补了社区现有工具的空白。

Comments 9 pages, 4 Figures, 2 Tables; prepared for submission to the Open Journal of Astrophysics. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09594 2026-05-12 cs.CR 50%

Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills

相信我,导入这个:通过恶意代理技能进行依赖引导攻击

Yiyong Liu, Chia-Yi Hsu, Chun-Ying Huang, Michael Backes, Rui Wen, Chia-Mu Yu

专题命中 仓库级理解 :coding agent(abstract)

AI总结 研究提出依赖引导攻击,通过恶意技能引导编码代理生成恶意包,无需修改模型或数据,展示出软件供应链中的新攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08092 2026-05-12 cs.CY 50%

Million Tutoring Moves (MTM): An Open Multimodal Dataset for the Science of Tutoring

百万辅导动作(MTM):一个开放的多模态数据集用于辅导科学

René Kizilcec, Kirk Vanacore, Zhuqian Zhou, Doug Pietrzak, Jorge Dias, Haocheng Zhang, Bakhtawar Ahtisham, Joshua Marland, Rachel Slama, Justin Reich, Kenneth Koedinger

专题命中 仓库级理解 :repository(abstract)

AI总结 本文介绍MTM数据集,旨在通过大规模、可重用的多模态交互数据推动辅导科学。MTM v1包含4654份数学辅导记录,为后续更广泛的数据集奠定基础,支持研究教学过程、改进辅导实践及开发基于真实教育交互的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24934 2026-05-12 cs.RO cs.SY eess.SY 50%

TEACar: An Open-Source Autonomous Driving Platform

TEACar:一个开源的自动驾驶平台

Zhongzheng Zhang, Maxwell Ruyle, Andrew Kappes, Tyler Ruble, William Shaoul, Dana Moreno, Jack Penn, Ivan Ruchkin

机构 * Trustworthy Engineered Autonomy (TEA) Lab, Department of Electrical and Computer Engineering, University of Florida(可信工程自主性实验室,电气与计算机工程系,佛罗里达大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出TEACar,一个模块化、低成本的自动驾驶测试平台,通过四层结构分离感知、计算、执行和电源子系统,提升结构刚性并简化重构。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 程序分析与验证 1 篇

2605.08247 2026-05-12 cs.PL cs.AI 62%

LLM Translation of Compiler Intermediate Representation

编译器中间表示的大型语言模型翻译

Andrea Valenzuela Ramirez, Cristian Gutierrez-Gomez, Marta Barroso, Dario Garcia-Gasulla, Sara Royuela

机构 * Barcelona Supercomputing Center, Universitat Politècnica de Catalunya(巴塞罗那超级计算中心,加泰罗尼亚理工大学) Barcelona Supercomputing Center(巴塞罗那超级计算中心)

专题命中 程序分析与验证 :code generation(abstract);分类 cs.AI、cs.PL

AI总结 本文提出IRIS-14B模型,通过训练实现GIMPLE到LLVM IR的翻译,展示了大型语言模型在编译器中间表示转换中的高效性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏