arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-17 至 2026-04-17 共收录 17 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2604.14631 2026-04-17 cs.CL cs.AI 81%

StoryCoder: Narrative Reformulation for Structured Reasoning in LLM Code Generation

StoryCoder: 为LLM代码生成中的结构化推理提供叙述改写

Geonhui Jang, Dongyoon Han, YoungJoon Yoo

机构 * Dept. of Artificial Intelligence, Chung-Ang University(Chung-Ang 大学人工智能系) NAVER AI Lab(NAVER AI 实验室)

专题命中 代码生成 :code generation(title,abstract);分类 cs.CL、cs.AI

AI总结 StoryCoder通过将代码生成问题转化为连贯的自然语言叙述,提升模型推理和规划能力,实验显示在多个数据集上平均提升18.7%的零样本准确率,且改进了算法策略和代码结构。

Comments 21 pages, 12 figures. ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14564 2026-04-17 cs.AI cs.CL 81%

MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation

MARS$^2$:通过强化学习提升多智能体树搜索用于代码生成

Pengfei Li, Shijie Wang, Fangyuan Li, Yikun Fu, Kaifeng Liu, Kaiyan Zhang, Dazhi Zhang, Yuqiang Li, Biqing Qi, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

专题命中 代码生成 :code generation(title,abstract);分类 cs.CL、cs.AI

AI总结 MARS$^2$通过多智能体协作与树搜索结合,提升强化学习在代码生成中的性能,实验表明其在多种模型和训练设置下均有效。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13290 2026-04-17 cs.PL 79%

Presynthesis: Towards Scaling Up Program Synthesis with Finer-Grained Abstract Semantics

Presynthesis:迈向通过更细粒度抽象语义扩大程序合成的规模

Rui Dong, Qingyue Wu, Danny Ding, Zheng Guo, Ruyi Ji, Xinyu Wang

专题命中 代码生成 :program synthesis(title,abstract);分类 cs.PL

AI总结 本文提出Presynthesis方法,通过引入离线预合成阶段,利用树自动机和oracle提升程序合成效率,显著优于现有方法。

Comments Published at PLDI 2026

Journal ref Proc. ACM Program. Lang. 10, PLDI, Article 210 (June 2026), 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14696 2026-04-17 physics.data-an 78%

Development of an LLM-Based System for Automatic Code Generation from HEP Publications

基于大语言模型的自动代码生成系统开发:从高能物理出版物中生成可执行分析代码

Masahiko Saito, Tomoe Kishimoto, Junichi Tanaka

专题命中 代码生成 :code generation(title,abstract)

AI总结 本文提出利用大语言模型从高能物理论文中提取分析流程并生成可执行代码,验证了其在高能物理分析中的可行性与局限性。

Comments Proceedings of the International Symposium on Grids and Clouds (ISGC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14682 2026-04-17 cs.AI cs.CL 62%

Acceptance Dynamics Across Cognitive Domains in Speculative Decoding

跨认知领域接受动态的推测解码

Saif Mahmoud

机构 * College of Engineering, Al Ain University Abu Dhabi, United Arab Emirates(阿联酋阿因大学工程学院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于树的推测解码接受动态,分析了不同NLP任务领域对接受概率的影响,发现任务类型比树深度更能预测接受率,且聊天领域表现出较高的熵和接受率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 1 篇

2604.14609 2026-04-17 cs.AI physics.comp-ph 57%

El Agente Forjador: Task-Driven Agent Generation for Quantum Simulation

El Agente Forjador:面向量子模拟的任务驱动代理生成

Zijian Zhang, Aiwei Yin, Amaan Baweja, Jiaru Bai, Ignacio Gustin, Varinia Bernales, Alán Aspuru-Guzik

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Chemistry, University of Toronto(多伦多大学化学系) Department of Materials Science & Engineering, University of Toronto(多伦多大学材料科学与工程系) Department of Chemical Engineering & Applied Chemistry, University of Toronto(多伦多大学化学工程与应用化学系) Acceleration Consortium(加速联盟) Vector Institute for Artificial Intelligence(人工智能矢量研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute (CIFAR)) NVIDIA

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出El Agente Forjador框架,通过四阶段流程自主生成和复用计算工具,提升量子化学和动力学任务的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2604.14709 2026-04-17 cs.AI 57%

HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks

HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试

Fan Cui, Hongyuan Hou, Zizhang Luo, Chenyun Yin, Yun Liang

机构 * Peking University(北京大学)

专题命中 程序修复 :repository(abstract);分类 cs.AI

AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2506.02954 2026-04-17 cs.SE 74%

Mutation-Guided Unit Test Generation with a Large Language Model

基于大语言模型的突变指导单元测试生成

Guancheng Wang, Qinghua Xu, Lionel Briand, Kui Liu

专题命中 测试生成 :unit test generation(title);分类 cs.SE

AI总结 本文提出MUTGEN方法,利用突变反馈提升测试覆盖率,优于EvoSuite和传统提示方法,在突变分数上表现更优,并探讨了LLM生成的局限性。

Comments Accepted in IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 4 篇

2604.06296 2026-04-17 cs.LG cs.AI cs.MA cs.SE 67%

AgentOpt v0.1 Technical Report: Client-Side Optimization for LLM-Based Agent

AgentOpt v0.1 技术报告:基于LLM的代理的客户端优化

Wenyue Hua, Sripad Karne, Qian Xie, Armaan Agrawal, Nikos Pagonas, Kostis Kaffes, Tianyi Peng

机构 * Microsoft Research, AI Frontiers(微软研究院,人工智能前沿) Cornell University(康奈尔大学) Columbia University(哥伦比亚大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出AgentOpt框架,用于解决LLM代理客户端资源分配问题,通过多种搜索算法优化模型选择和资源分配,提升效率与效果。

Comments 24 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23121 2026-04-17 cs.CL cs.AI 62%

Uncovering the Fragility of Trustworthy LLMs through Chinese Textual Ambiguity

通过中文文本歧义揭示可信大语言模型的脆弱性

Xinwei Wu, Haojie Li, Hongyu Liu, Xinyu Ji, Ruohan Li, Yule Chen, Yigeng Zhang

机构 * Chalmers University of Technology(楚德斯技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在处理中文歧义文本时的脆弱性,通过创建基准数据集发现模型在歧义处理上存在显著缺陷,影响实际应用。

Comments Accepted at KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models (Agentic & GenAI Evaluation Workshop KDD '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15151 2026-04-17 cs.CL 57%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14828 2026-04-17 cs.CL 57%

Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench

Pangu-ACE:适应性级联专家用于EduBench教育响应生成

Dinghao Li, Wenlong Zhou, Zhimin Chen, Yuehan Peng, Hong Ni, Chengfu Zou, Guoyu Shi, Yaochen Li

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 Pangu-ACE通过级联专家系统提升教育响应质量,在EduBench基准上实现更高效的计算分配,改进确定性和格式有效性,同时保持较低的直接请求比例。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 5 篇

2604.15082 2026-04-17 cs.AR cs.AI 57%

Autonomous Evolution of EDA Tools: Multi-Agent Self-Evolved ABC

自主进化EDA工具:多智能体自进化ABC

Cunxi Yu, Haoxing Ren

机构 * NVIDIA Research(NVIDIA研究) University of Maryland(马里兰大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文提出首个自进化逻辑综合框架,利用大语言模型代理自主改进ABC逻辑综合系统源代码,通过多套基准测试验证其在大规模代码层面的自主进化能力。

Comments 7 pages; To appear at DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12646 2026-04-17 cs.SE 57%

Research Artifacts in Secondary Studies: A Systematic Mapping in Software Engineering

二次研究中的研究物:软件工程中的系统映射

Aleksi Huotala, Miikka Kuutila, Mika Mäntylä

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文通过系统映射分析了2013-2023年间537项二次研究中研究物的报告情况,发现仅31.5%的研究包含研究物,但随时间推移有所提升,2023年仍有62%的研究提供研究物,但永久存储的比例较低。

Comments Published in Information and Software Technology (Volume 187, November 2025, 107830)

Journal ref Information and Software Technology Information and Software Technology,187,2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15065 2026-04-17 cs.CV 50%

Learning Where to Embed: Noise-Aware Positional Embedding for Query Retrieval in Small-Object Detection

学习嵌入位置:面向小目标检测查询检索的噪声感知位置嵌入

Yangchen Zeng, Zhenyu Yu, Dongming Jiang, Wenbo Zhang, Yifan Hong, Zhanhua Hu, Jiao Luo, Kangning Cui

机构 * Southeast University(东南大学) Fudan University(复旦大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校) Zhejiang Normal University(浙江师范大学) Data Space Research Institute, Hefei Comprehensive National Science Center(合肥综合国家科学中心数据空间研究院) Rice University(里士满大学) Huazhong Agricultural University(华中农业大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Wake Forest University(威克森林大学)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出HELP框架,通过选择性保留前景区域的位置编码来学习嵌入位置,结合热图引导的位置嵌入机制和线性蛇卷积提升小目标检索性能,实现参数减少59.4%的同时保持精度。

Comments Accepted to ACM ICMR 2026; 14 pages, 6 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13001 2026-04-17 cs.RO 50%

XRZero-G0: Pushing the Frontier of Dexterous Robotic Manipulation with Interfaces, Quality and Ratios

XRZero-G0:通过接口、质量和比例推动灵巧机器人操作的前沿

James Wang, Primo Pu, Zephyr Fung, Alex Wang, Sam Wang, Bender Deng, Kevin Wang, Zivid Liu, Chris Pan, Panda Yang, Andy Zhai, Lucy Liang, Shalfun Li, Johnny Sun, Jacky Xu, Will Tian, Kai Yan, Kohler Ye, Scott Li, Qian Wang, Roy Gan, Hao Wang

机构 * X SQUARE ROBOT(X SQUARE机器人)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出XRZero-G0系统,通过 ergonomic 接口和数据混合策略提升数据收集效率,实现高质量数据集,使机器人操作在无真实机器人数据的情况下也能达到高性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10433 2026-04-17 eess.SP 50%

Robust Localization in Modern Cellular Networks using Global Map Features

在现代蜂窝网络中使用全球地图特征实现鲁棒定位

Junshi Chen, Xuhong Li, Russ Whiton, Erik Leitinger, Fredrik Tufvesson

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出一种扩展的MP-SLAM方法,结合全局地图特征库提升定位精度,通过概率假说密度滤波器实现鲁棒且准确的定位,在密集城市环境中优于传统传感器和MP-SLAM方法。

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE Open Journal of Signal Processing, vol. 7, pp. 356-372, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏