arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-15 至 2026-05-15 共收录 5 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 5 篇

2605.14415 2026-05-15 cs.SE cs.AI cs.CL 82%

SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades

SWE-Chain:基于链式发布级包升级的编码代理基准测试

Man Ho Lam, Chaozheng Wang, Hange Liu, Jingyu Xiao, Haau-sing Li, Jen-tse Huang, Terry Yue Zhuo, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Independent(独立) ELLIS Technical University of Darmstadt(达姆施塔特技术大学) Johns Hopkins University(约翰霍普金斯大学) Monash University(墨尔本大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-Chain通过链式发布级包升级评估编码代理,包含12个升级链和155个版本过渡,揭示当前代理在连续维护中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13950 2026-05-15 cs.LG cs.AI hep-ex hep-ph 62%

Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction

Collider-Bench:通过粒子物理分析复现评估AI代理

Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, David Shih

机构 * New High Energy Theory Center(新高能理论中心) Department of Physics & Astronomy(物理与天文学系) Rutgers University(罗格斯大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Collider-Bench,评估AI代理能否仅通过公开论文和开源软件复现LHC实验分析,强调物理推理和领域知识的重要性,结果显示无代理能超越物理学家在环解决方案。

Comments 23 pages | 9 figures | 4 tables | Code: https://github.com/dfaroughy/Collider-Bench | Task Corpus: https://huggingface.co/datasets/Dariusfar/ColliderBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14671 2026-05-15 cond-mat.mtrl-sci cs.AI 57%

Agentic Design of Compositional Descriptors via Autoresearch for Materials Science Applications

通过Autoresearch进行组合描述符的代理设计用于材料科学应用

Matteo Cobelli, Stefano Sanvito

机构 * School of Physics(物理系) CRANN Institute, Trinity College, Dublin 2, Dublin, Ireland(CRANN研究所,三一学院,都柏林2号,都柏林,爱尔兰)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文通过Autoresearch框架设计输入描述符,利用大语言模型生成化学化合物的组合描述符,并通过随机森林工作流评估,提升了材料性质预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12808 2026-05-15 cs.LG 57%

Neurodata Without Boredom: Benchmarking Agentic AI for Data Reuse

神经数据无厌倦:评估代理AI的数据重用基准测试

Ling-Qi Zhang, Kristin Branson

机构 * HHMI Janelia Research Campus(HHMI贾能利亚研究中心)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 本文探讨了代理AI在神经数据重用中的应用,通过八篇研究论文评估了通用编码代理在处理多模态数据和任务解码中的表现,发现其在子任务中表现良好,但难以实现端到端无错误解决方案,提出了数据共享的最佳实践。

Comments v2: Added forgotten acknowledgments section

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15187 2026-05-15 cs.CV cs.GR cs.RO 50%

Articraft: An Agentic System for Scalable Articulated 3D Asset Generation

Articraft: 一种可扩展的拟人化3D资产生成代理系统

Matt Zhou, Ruining Li, Xiaoyang Lyu, Zhaomou Song, Zhening Huang, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi, Shangzhe Wu

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :coding agent(abstract)

AI总结 本文提出Articraft代理系统,利用大语言模型生成大规模拟人化3D资产,构建了包含10000+资产的Articraft-10K数据集,应用于机器人仿真和虚拟现实等下游任务。

Comments Project page: https://articraft3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏