arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 110 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 110 篇

2606.10255 2026-06-10 eess.IV cs.CV cs.DL cs.LG physics.bio-ph 新提交 57%

POPSICLE: Benchmark Datasets for Segmentation and Localization in CryoET

POPSICLE: 用于冷冻电镜断层扫描中分割和定位的基准数据集

Jonathan Schwartz, Utz Heinrich Ermel, C. Braxton Owens, Zhuowen Zhao, Ariana Peck, Gus L. W. Hart, Grant J. Jensen, Bridget Carragher, Dari Kimanius

机构 * Biohub Brigham Young University

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出POPSICLE基准套件,基于CryoET数据门户构建,涵盖真核和原核系统、纯化与原位样本,支持体素分割和稀疏定位任务,旨在解决冷冻电镜断层扫描中缺乏标准化基准的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08976 2026-06-09 cs.AI 新提交 57%

RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

RTL-BenchLS:面向大语言模型的RTL推理与生成的大规模基准

Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出大规模基准RTL-BenchLS,包含超1万个形式验证的Verilog设计,并引入三项自监督推理任务,解决现有基准规模小、任务单一的问题,评估显示当前最佳模型性能较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06662 2026-06-08 cs.SE 新提交 57%

AutoPipelineAI: Context-Aware CI/CD Pipeline Generation from Natural Language

AutoPipelineAI: 基于自然语言的上下文感知CI/CD流水线生成

Youssef Mohamed Aboelfotoh, Mohamed Ahmed Hemdan, Mohammad El-Ramly, Khlood Hassan, Mahmoud Saleh Saad, Ahmed Mohamed Tolba, Seif Gamal Abdelmonem

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 提出AutoPipelineAI系统,利用大语言模型从自然语言描述生成CI/CD流水线配置,集成仓库感知分析、自动验证和反馈机制,降低DevOps配置复杂度。

Comments 7 pages, 1 figure, 6 tables, 16 references, IMSA Conference 11-12 July 2026, International Conference on Intelligent Methods, Systems, and Applications 2026 #70415,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13104 2026-07-16 cs.AI cs.CL cs.LG 新提交 56%

Self-Improvements in Modern Agentic Systems: A Survey

现代智能系统中的自我改进:一项综述

Zhe Ren, Yimeng Chen, Dandan Guo, Guowei Rong, Tonghui Li, R. B. Xiong, Qingfeng Lan, Wenyi Wang, Li Nanbo, Yibo Yang, Mingchen Zhuge, Jürgen Schmidhuber

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) University of Alberta(阿尔伯塔大学) The Swiss AI Lab IDSIA/USI/SUPSI(瑞士人工智能实验室IDSIA/USI/SUPSI)

专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 综述现代自我改进智能体从研究走向部署,目标是经验驱动的可控进化。提出系统级框架,将智能体视为基础模型与操作支架的耦合配置,自我改进形式化为更新算子,还组织回顾了相关工作、应用、评估等内容并展望未来。

Comments 97 pages, 12 figures. Project page: https://selfimproving-agent.github.io/ Repository: https://github.com/selfimproving-agent/awesome-Self-Improving-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13441 2026-08-14 cs.CV 新提交 50%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 代码评测 :code generation(abstract)

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04536 2026-08-06 cs.DB 新提交 50%

From Research Questions to Columns: Operationalization-Aware Data Discovery

从研究问题到列:感知操作化的数据发现

Houming Chen, H. V. Jagadish

专题命中 代码评测 :repository(abstract)

AI总结 该研究提出感知操作化的数据发现(OADD)任务,构建基准OADD-Bench,评估多种方法后发现OADD仍是未解决问题,其中OADD定向智能体表现最佳。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01077 2026-08-04 cs.RO 新提交 50%

VespaSeg: A Resource-Aware Ground-then-Segment Pipeline for Referring Expression Segmentation

VespaSeg:一种用于指代表达分割的资源感知“先定位后分割”流水线

Savindu Dilshan Wickramasinghe

机构 * University of Moratuwa(莫拉图瓦大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文针对指代表达分割中整体式模型部署成本高的问题,提出模块化流水线VespaSeg,采用轻量型视觉-语言模型定位与MobileSAM分割,经适配后在RefCOCO数据集上实现高精度,且内存占用低、推理速度快。

Comments 5 pages, 3 figures. Code and result artifacts: https://github.com/Savidilsh/VespaSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00461 2026-08-04 physics.ins-det hep-ex 新提交 50%

An eightfold equivalence-preserving speedup of the JUNO OMILREC vertex and energy reconstruction

JUNO OMILREC顶点与能量重建的八倍等效保持加速

Guangbao Sun, Qishan Liu, Wenjie Wu, Jun Cao, Xuefeng Ding, Wenxing Fang, Wuming Luo, Liangjian Wen, Zeyuan Yu, Xiang Zhou

专题命中 代码评测 :coding agent(abstract)

AI总结 本研究针对JUNO的OMILREC重建算法,通过分阶段等效保持优化实现了最高8.6倍的单线程加速,保持物理输出一致,为大型探测器似然重建加速提供了可转移模板。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29417 2026-08-03 cs.CR 新提交 50%

Enforcing Cryptographic Distributed-VCS Access Control with No Trust on Servers

在不信任服务器的情况下实施密码学分布式版本控制系统访问控制

Xin Xu, Zhen Yang, Quanwei Cai, Jingqiang Lin, Liangqin Ren, Bo Chen, Yongfeng Huang

专题命中 代码评测 :repository(abstract)

AI总结 针对现有分布式VCS访问控制需中央服务器参与、写权限细粒度控制缺失的问题,提出基于ABE和ABS的DVAC方案,借助以太坊智能合约实现无中央服务器的文件粒度读写访问控制,原型开销较小且可与Git集成。

Comments Accepted manuscript. 15 pages, 7 figures. Published in Journal of Information Security and Applications, Vol. 93 (2025), Article 104103

Journal ref Journal of Information Security and Applications, 93 (2025), 104103

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14027 2026-07-16 cs.NE 新提交 50%

SPECS: Speciated Evolutionary Circuit Synthesis

SPECS:特定进化电路合成

Yağız Gençer, Stefan Uhlich, Andrea Bonetti, Arun Venkitaraman, Chia-Yu Hsieh, Lorenzo Servadei

专题命中 代码评测 :repository(abstract)

AI总结 提出用于自动模拟电路合成的SPECS遗传算法,借鉴NEAT原理,重新制定基因组表示并调整遗传算子,纳入布线约束和物种形成,在计算电路合成任务中,其解决方案质量和可靠性优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 50%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 代码评测 :repository(abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09882 2026-07-14 quant-ph cs.DC cs.PF 新提交 50%

Benchmarking Zero-Setup Quantum Circuit Simulators

零设置量子电路模拟器的基准测试

Arul Rhik Mazumder, Mohammed Zuhair Mullath, Hayk Tepanyan

专题命中 代码评测 :repository(abstract)

AI总结 该研究对GPU加速的MPS和PPS量子模拟方法进行基准测试,比较多个工具,发现MPS中GPU运行时随键维度次二次缩放,PPS中GPU在特定基准测试下加速显著且能达高精度,还提供模拟器特征描述及代码配置仓库。

Comments 12 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06000 2026-07-08 cs.CR 新提交 50%

Context-to-Execution Integrity for LLM Agents

语言模型代理的上下文到执行完整性

Igor Santos-Grueiro

专题命中 代码评测 :repository(abstract)

AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05413 2026-07-08 cs.CY 新提交 50%

Measuring the Invisible: Evaluating the Impact of Public Funding on Open Source Software

衡量无形:评估公共资金对开源软件的影响

Laia Domenech Burin

专题命中 代码评测 :repository(abstract)

AI总结 研究公共资金对开源软件的影响,结合目标-问题-指标框架与广义合成控制法,估计主权科技基金对OSS仓库活动的因果效应,发现资金对项目速度指标有显著正向影响,为公共OSS资金评估框架设计提供实践启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04825 2026-07-07 cs.MA 新提交 50%

Dynamic Airspace Management for UAVs in Evolving Urban Environments: Collaborative Coordination and Human Safety

动态空域管理用于不断演变的城市环境中的无人机:协同协调与人类安全

Lin Sun, Yuhang Wang, Fan Meng Hong, Haopeng Chen, Yan Jiao, Yongming Xu

专题命中 代码评测 :repository(abstract)

AI总结 针对复杂城市环境中无人机安全运行难题,提出协作多无人机空域管理系统Pharos,介于分布式与集中式范式间,采用MAPPO算法,经仿真验证其有效协调能力及在减少人类恐惧、提升空间利用率方面优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00387 2026-07-02 eess.AS 新提交 50%

From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning

从目标到应用:对齐音频自监督学习中的架构偏差

Kele Xu, Yulu Fang, Boda Zhou, Yulin Sun, Qisheng Xu, Qiya Song, Jin Zhang, Cheng Yang, Huaimin Wang

专题命中 代码评测 :repository(abstract)

AI总结 本文通过预训练目标、架构归纳偏差与下游应用的对齐,系统分析音频自监督学习,围绕五种范式讨论不同监督信号对表征的影响,并关联到CNN、RNN、状态空间模型、Transformer及混合架构的偏差,最后解读在语音、环境声、音乐、医学及多模态等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22868 2026-06-23 eess.AS 新提交 50%

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

MSU-Bench:面向对话多说话人场景中以说话人为中心的理解

Zhaokai Sun, Shuai Wang, Zhennan Lin, Chengyou Wang, Dehui Gao, Yuang Cao, Chunjiang He, Pan Zhou, Lei Xie

专题命中 代码评测 :repository(abstract)

AI总结 提出MSU-Bench基准,包含16个说话人中心任务和2300个问答实例,用于评估多说话人对话中的说话人定位与推理能力,揭示现有模型在复杂场景下的不足。

Comments 4 pages, accepted by interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16871 2026-06-16 cs.MA 新提交 50%

Human-on-the-Bridge: Scalable Evaluation for AI Agents

Human-on-the-Bridge: 可扩展的AI智能体评估方法

Fouad Bousetouane

专题命中 代码评测 :code generation(abstract)

AI总结 提出Human-on-the-Bridge (HOB)范式,通过专家预先策划可复用的评估智能体(包括领域上下文、红队陷阱、陪审员角色等),结合ProofAgent测试框架进行多轮对抗评估,实现可扩展的AI智能体行为评估。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11563 2026-06-11 cs.CV cs.RO 新提交 50%

Cross-Modal Benchmarking for Robotic Perception in Natural Environments

自然环境中机器人感知的跨模态基准测试

David Hall, Joshua Knights, Mark Cox, Peyman Moghadam

机构 * CSIRO Robotics, CSIRO, Australia(CSIRO机器人研究所,CSIRO,澳大利亚) University of Sydney (USyd), Australia(悉尼大学(USyd),澳大利亚) Queensland University of Technology (QUT), Australia(昆士兰理工大学(QUT),澳大利亚)

专题命中 代码评测 :repository(abstract)

AI总结 针对自然环境中机器人感知的挑战,提出WildCross跨模态基准,用于大规模自然场景下的地点识别和度量深度估计,并扩展了度量深度估计实验。

Comments Accepted to the IEEE ICRA Workshop on Open Challenges for Rigorous Robot Perception 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07851 2026-06-09 physics.med-ph 新提交 50%

ULMShare: A Large-Scale In Vivo Ultrasound Localization Microscopy Dataset for Microvascular Imaging

ULMShare:用于微血管成像的大规模体内超声定位显微镜数据集

Brice Rauby, Nin Ghigo, Gerardo Ramos-Palacios, Alexis Leconte, Stephen A. Lee, Alice Wu, Paul Xing, Oleksandra Gulenko, Louis Caron, Antoine Malescot, Eric Martineau, Jonathan Porée, Maxime Gasse, Ravi L. Rungta, Abbas F. Sadikot, Jean Provost

专题命中 代码评测 :repository(abstract)

AI总结 本文介绍ULMShare,一个包含99次全脑经颅超声定位显微镜采集的开放数据集,旨在为微血管成像方法开发、验证和基准测试提供标准化资源。

详情

展开后加载摘要…

URL PDF HTML 收藏