arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-02-24 至 2026-02-24 共收录 23 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 10 篇

2602.18800 2026-02-24 cs.SE cs.AI cs.LG 82%

Operational Robustness of LLMs on Code Generation

在代码生成上的大语言模型操作鲁棒性

Debalina Ghosh Paul, Hong Zhu, Ian Bayley

机构 * School of Engineering, Computing and Mathematics, Oxford Brookes University(工程、计算与数学学院,奥克斯伯里大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出了一种评估大语言模型在代码生成任务中鲁棒性的方法,通过分析自然语言描述的最小变化来评估模型性能,并对四种先进模型进行了实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19276 2026-02-24 cs.SE 79%

ComUICoder: Component-based Reusable UI Code Generation for Complex Websites via Semantic Segmentation and Element-wise Feedback

ComUICoder:基于语义分割和元素反馈的组件式可重用UI代码生成用于复杂网站

Jingyu Xiao, Jiantong Qin, Shuoqi Li, Man Ho Lam, Yuxuan Wan, Jen-tse Huang, Yintong Huo, Michael R. Lyu

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 ComUICoder通过语义分割和元素反馈技术,提升复杂网站中可重用UI代码的生成质量与重用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08783 2026-02-24 cs.LG cs.AI cs.CL cs.NA math.NA 67%

CodePDE: An Inference Framework for LLM-driven PDE Solver Generation

CodePDE:基于LLM的PDE求解器生成推理框架

Shanda Li, Tanya Marwah, Junhong Shen, Weiwei Sun, Andrej Risteski, Yiming Yang, Ameet Talwalkar

机构 * Carnegie Mellon University(卡内基梅隆大学) Flatiron Institute(Flatiron研究院) Polymathic AI(多学科人工智能) Datadog

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CodePDE通过大语言模型生成PDE求解器,展示了LLM在复杂数学问题中的强大能力及潜在应用价值。

Comments TMLR. Code available at https://github.com/LithiumDA/CodePDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18628 2026-02-24 cs.LG cs.AI 62%

Non-Interfering Weight Fields: Treating Model Parameters as a Continuously Extensible Function

非干扰权重场:将模型参数视为可扩展的连续函数

Sarim Chaudhry

机构 * Purdue University(普渡大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非干扰权重场(NIWF)框架,通过将模型参数视为可扩展的连续函数,解决大型语言模型中的灾难性遗忘问题,实现能力的版本控制与灵活管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20144 2026-02-24 eess.SY cs.AI cs.NI cs.SY 57%

Agentic AI for Scalable and Robust Optical Systems Control

面向可扩展和鲁棒光学系统控制的代理AI

Zehao Wang, Mingzhe Han, Wei Cheng, Yue-Kai Huang, Philip Ji, Denton Wu, Mahdi Safari, Flemming Holtorf, Kenaish AlQubaisi, Norbert M. Linke, Danyang Zhuo, Yiran Chen, Ting Wang, Dirk Englund, Tingjun Chen

机构 * Department of Electrical and Computer Engineering, Duke University(电气与计算机工程系,杜克大学) Duke Quantum Center and Department of Physics, Duke University(杜克量子中心和物理系,杜克大学) Department of Computer Science, Duke University(计算机科学系,杜克大学) NEC Laboratories America(NEC美国实验室) Axiomatic AI(公理AI) Joint Quantum Institute, Department of Physics, and the National Quantum Laboratory (QLab), University of Maryland(联合量子研究所、物理系以及国家量子实验室(QLab),马里兰大学) Research Laboratory of Electronics, Massachusetts Institute of Technology(电子研究实验室,麻省理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 AgentOptics通过代理AI框架实现异构光学系统的可扩展和鲁棒自主控制,展示了高保真任务成功率和多任务协调能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03817 2026-02-24 cs.LG stat.ML 57%

TROLL: Trust Regions improve Reinforcement Learning for Large Language Models

TROLL:通过信任区域改进大型语言模型的强化学习

Philipp Becker, Niklas Freymuth, Serge Thilges, Fabian Otto, Gerhard Neumann

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 TROLL通过引入基于信任区域的离散可微投影,改进了大型语言模型的强化学习训练,提升了训练速度、稳定性和最终成功率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19407 2026-02-24 cs.SE 57%

Multi-CoLoR: Context-Aware Localization and Reasoning across Multi-Language Codebases

多语言代码库中的上下文感知定位与推理:Multi-CoLoR

Indira Vats, Sanjukta De, Subhayan Roy, Saurabh Bodhe, Lejin Varghese, Max Kiehn, Yonas Bedasso, Marsha Chechik

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 Multi-CoLoR通过结合组织知识检索与图推理,提升多语言代码库中的定位准确性与效率。

Comments This paper has been accepted for publication at the 33rd IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18541 2026-02-24 cs.SE 57%

LAPIS: Lightweight API Specification for Intelligent Systems

LAPIS:轻量级智能系统API规范

Daniel Garcia

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 LAPIS是一种为LLM优化的轻量级API规范格式,通过减少token使用并保留语义信息,提升智能系统对API的处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18453 2026-02-24 cs.CY cs.AI 57%

LLM-Assisted Replication for Quantitative Social Science

大语言模型辅助的定量社会科学复制

So Kubota, Hiromu Yakura, Samuel Coavoux, Sho Yamada, Yuki Nakamura

机构 * Graduate School of Economics, Tohoku University(东北大学经济学研究生院) Max Planck Institute for Human Development(马克斯·普朗克人类发展研究所) CREST, ENSAE, Institut Polytechnique de Paris(巴黎高等理工学院CREST与ENSAE) Graduate School of Public Policy, The University of Tokyo(东京大学公共政策研究生院) Faculty of Engineering, The University of Tokyo(东京大学工学部)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本研究提出基于大语言模型的自动化系统,用于复制社会科学论文的统计分析并检测潜在问题,旨在提升研究的可验证性和完整性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07831 2026-02-24 cs.CR 50%

Protected QR Code-based Anti-counterfeit System for Pharmaceutical Manufacturing

用于药品制造的受保护的二维码防伪系统

Md Masruk Aulia, Nitol Saha, Md. Mostafizur Rahman

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出了一种基于受保护二维码的防伪系统,通过安全生成和加密传输技术,保障药品供应链信息的安全性和唯一性。

Journal ref Procedia CIRP 138 (2026) 322-327

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2602.19594 2026-02-24 cs.LG 79%

ISO-Bench: Can Coding Agents Optimize Real-World Inference Workloads?

ISO-Bench: 编码代理能否优化现实世界的推理工作负载?

Ayush Nangia, Shikhar Mishra, Aman Gokrani, Paras Chopra

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.LG

AI总结 ISO-Bench通过结合硬指标和软指标评估编码代理在现实世界推理优化任务中的能力,发现无单一代理占优,且模型与支架均影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19441 2026-02-24 cs.SE cs.AI 73%

When AI Teammates Meet Code Review: Collaboration Signals Shaping the Integration of Agent-Authored Pull Requests

当AI队友遇见代码审查:协作信号塑造代理编写的拉取请求整合

Costain Nachuma, Minhaz Zibran

机构 * Idaho State University USA(爱达荷州立大学)

专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究探讨了AI代理提交的拉取请求在代码审查中的整合效果,发现审查员参与和协作信号对整合成功至关重要。

Comments 5 pages, 2 figures, 1 table. Accepted at the 23rd International Conference on Mining Software Repositories (MSR 2026), Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19383 2026-02-24 cs.SE 57%

On the Variability of Source Code in Maven Package Rebuilds

关于Maven包重建中源代码变化性的研究

Jens Dietrich, Behnaz Hassanshahi

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 本文研究了Maven包重建中源代码变化性问题,发现构建扩展生成的代码导致非等价源代码,提出应对策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13069 2026-02-24 cs.AI 57%

Ambig-SWE: Interactive Agents to Overcome Underspecificity in Software Engineering

Ambig-SWE: 交互式代理以克服软件工程中的不充分性

Sanidhya Vijayvargiya, Xuhui Zhou, Akhila Yerukola, Maarten Sap, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 软件智能体 :code generation(abstract);分类 cs.AI

AI总结 Ambig-SWE研究LLM代理在交互式代码生成中处理不充分指令的能力,通过检测不充分性、提问澄清和利用交互提升性能,发现交互能显著提高74%的性能。

Comments 22 pages, 7 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 3 篇

2602.20048 2026-02-24 cs.AI cs.SE 62%

CodeCompass: Navigating the Navigation Paradox in Agentic Code Intelligence

CodeCompass: 在代理代码智能中导航悖论的探索

Tarakanath Paipuru

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 CodeCompass通过基于图的结构导航提升代码智能代理在隐藏依赖任务中的性能,揭示导航与检索本质不同,需显式引导代理利用结构上下文。

Comments 23 pages, 7 figures. Research study with 258 trials on SWE-bench-lite tasks. Code and data: https://github.com/tpaip607/research-codecompass

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00672 2026-02-24 cs.LG cs.AI 62%

ML-Tool-Bench: Tool-Augmented Planning for ML Tasks

ML-Tool-Bench: 为机器学习任务增强的工具辅助规划

Yaswanth Chittepu, Raghavendra Addanki, Tung Mai, Anup Rao, Branislav Kveton

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ML-Tool-Bench,通过引入内存中的命名对象管理,评估工具增强的ML代理,改进了ReAct方法,提升了16.52个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01678 2026-02-24 cs.LG 57%

HeurekaBench: A Benchmarking Framework for AI Co-scientist

HeurekaBench: 一个用于AI合作者的基准评估框架

Siba Smarak Panigrahi, Jovana Videnović, Maria Brbić

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL))

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 HeurekaBench通过创建基于真实科学流程的基准,为评估AI合作者提供了一种方法,通过半自动流程生成探索性问题,并展示了批评模块对提升代理性能的效果。

Comments 33 pages, 5 figures, 7 tables. Code available at https://github.com/mlbio-epfl/HeurekaBench. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 6 篇

2602.10471 2026-02-24 cs.SE cs.CL 81%

TestExplora: Benchmarking LLMs for Proactive Bug Discovery via Repository-Level Test Generation

TestExplora: 通过仓库级测试生成对LLMs进行主动bug发现的基准测试

Steven Liu, Jane Luo, Xin Zhang, Aofan Liu, Hao Liu, Jie Wu, Ziyang Huang, Yangyu Huang, Yu Kang, Scarlett Li

机构 * Microsoft(微软公司) School of ECE, Peking University(北京大学电子工程学院) Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.CL

AI总结 TestExplora通过仓库级测试生成评估LLMs在主动bug发现中的能力,揭示了当前模型在复杂交互和代理探索方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09467 2026-02-24 cs.SE 79%

Toward Linking Declined Proposals and Source Code: An Exploratory Study on the Go Repository

迈向衰减提案与源代码的关联:对Go仓库的探索性研究

Sota Nakashima, Masanari Kondo, Mahmoud Alfadel, Aly Ahmad, Toshihiro Nakae, Hidenori Matsuzaki, Yasutaka Kamei

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE

AI总结 本研究首次尝试建立被拒绝的贡献与源代码之间的追溯性链接,通过LLM驱动的流水线实现了高准确率的链接生成,并分析了影响链接生成的因素。

Comments 11 pages, MSR2026 Technical Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17160 2026-02-24 stat.ML cs.AI cs.LG stat.ME 62%

Information-Theoretic Causal Bounds under Unmeasured Confounding

信息论视角下的未测量混杂因素下的因果界限

Yonghan Jung, Bogyeong Kang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种信息论框架,通过数据驱动的方法在未测量混杂因素下实现因果效应的精确识别,无需外部参数或假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19714 2026-02-24 cs.HC cs.SE 57%

Git Takes Two: Split-View Awareness for Collaborative Learning of Distributed Workflows in Git

Git需要两个人:用于协作学习分布式工作流的分屏意识

Joel Bucher, Lahari Goswami, Sverrir Thorgeirsson, April Yi Wang

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 GitAcademy通过分屏协作模式帮助新手学习Git的分布式工作流,提升协作意识和社交存在感。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19608 2026-02-24 cs.CV cs.AI 57%

Satellite-Based Detection of Looted Archaeological Sites Using Machine Learning

基于卫星的考古遗址盗掘检测使用机器学习

Girmaw Abebe Tadesse, Titien Bartette, Andrew Hassanali, Allen Kim, Jonathan Chemla, Andrew Zolli, Yves Ubelmann, Caleb Robinson, Inbal Becker-Reshef, Juan Lavista Ferres

机构 * Microsoft AI for Good Research Lab(微软AI for Good研究实验室) Iconem Planet Labs PBC(Planet Labs公司)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 利用机器学习和卫星图像检测考古遗址盗掘,通过CNN和传统ML方法对比,实现高精度识别

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18644 2026-02-24 cs.SE 57%

Modeling and Recovering Hierarchical Structural Architectures of ROS 2 Systems from Code and Launch Configurations using LLM-based Agents

基于LLM代理的ROS 2系统层次结构架构建模与恢复

Mohamed Benchat, Dominique Briechle, Raj Chanchad, Mitbhai Chauhan, Meet Chavda, Ruidi He, Dhruv Jajadiya, Dhruv Kapadiya, Nidhiben Kaswala, Daniel Osterholz, Andreas Rausch, Meng Zhang

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文提出基于UML的ROS 2系统层次结构架构建模方法,并结合LLM代理实现从代码和配置文件中自动化恢复架构模型,提升系统可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏