arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-04-15 至 2026-04-15 共收录 30 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 14 篇

2505.18646 2026-04-15 cs.SE cs.AI cs.CL 82%

SEW: Self-Evolving Agentic Workflows for Automated Code Generation

SEW:自演化代理工作流用于自动化代码生成

Siwei Liu, Jinyuan Fang, Han Zhou, Yingxu Wang, Zaiqiao Meng

机构 * University of Aberdeen(阿伯丁大学) University of Glasgow(格拉斯哥大学) University of Cambridge(剑桥大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出SEW框架,通过自演化方法自动设计和优化多代理工作流,提升代码生成任务的性能,实验表明在LiveCodeBench上比仅使用基础LLM提升12%。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10929 2026-04-15 cs.RO 78%

Ro-SLM: Onboard Small Language Models for Robot Task Planning and Operation Code Generation

Ro-SLM:机器人任务规划与操作代码生成的 onboard 小语言模型

Wenhao Wang, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of Computer & Information Science, University of Massachusetts Dartmouth(达特茅斯大学计算机与信息科学系) Department of Computer Science & Engineering, California State University San Marcos(加州州立大学桑马克斯分校计算机科学与工程系)

专题命中 代码生成 :code generation(title,abstract)

AI总结 本文提出Ro-SLM框架,通过蒸馏大语言模型知识提升机器人任务规划与代码生成能力,实验证明其性能接近大语言模型。

Comments 25 pages, 2 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00989 2026-04-15 cs.SE 74%

Sustainable Code Generation Using Large Language Models: A Systematic Literature Review

利用大语言模型实现可持续代码生成:系统文献综述

Sabiya Banu Masthan Ali, Oussema Kirmani, Aroosa Hameed, Syed Muhammad Danish, Gautam Srivastava

专题命中 代码生成 :code generation(title);分类 cs.SE

AI总结 本文系统回顾了大语言模型生成代码的可持续性研究,分析了代码效率对环境影响,指出现有研究存在方法分散、缺乏统一评估框架的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12268 2026-04-15 cs.SE cs.CL 73%

CodeSpecBench: Benchmarking LLMs for Executable Behavioral Specification Generation

CodeSpecBench: 用于可执行行为规范生成的LLM基准测试

Zaoyu Chen, Jianbo Dai, Boyu Zhu, Jingdong Wang, Huiming Wang, Xin Xu, Haoyang Yuan, Zhijiang Guo, Xiao-Ming Wu

机构 * The Hong Kong Polytechnic University(香港理工大学) University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) CUHK (SZ)(香港中文大学(深圳)) SUTD(新加坡科技设计大学) HKUST(香港科技大学) CUHK(香港中文大学) HKUST (GZ)(香港科技大学(广州))

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL

AI总结 本文提出CodeSpecBench,一个基于执行评估协议的LLM可执行行为规范生成基准,评估了15种最新LLM在函数和仓库级任务中的表现,发现仓库级任务性能显著下降,且规范生成比代码生成更具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10992 2026-04-15 cs.CV 71%

ArtiCAD: Articulated CAD Assembly Design via Multi-Agent Code Generation

ArtiCAD: 通过多智能体代码生成实现可动CAD装配设计

Yuan Shui, Yandong Guan, Zhanwei Zhang, Juncheng Hu, Jing Zhang, Dong Xu, Qian Yu

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

专题命中 代码生成 :code generation(title)

AI总结 ArtiCAD通过多智能体系统从文本或图像生成可编辑的可动CAD装配,利用连接器定义连接点和关节参数,提升空间推理能力,通过验证步骤和回滚机制确保输出质量,验证了其在概念设计、物理原型和AI训练资产生成中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12379 2026-04-15 cs.SE cs.AI cs.LG 67%

Beyond Output Correctness: Benchmarking and Evaluating Large Language Model Reasoning in Coding Tasks

超越输出正确性:评估大型语言模型在编码任务中的推理能力

Yuangang Li, Justin Tian Jin Chen, Ethan Yu, David Hong, Iftekhar Ahmed

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21011 2026-04-15 cs.CE cs.AI cs.LG cs.MS cs.NA math.NA 62%

ALL-FEM: Agentic Large Language models Fine-tuned for Finite Element Methods

ALL-FEM:面向有限元方法的代理式大语言模型

Rushikesh Deotale, Adithya Srinivasan, Yuan Tian, Tianyi Zhang, Pavlos Vlachos, Hector Gomez

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 ALL-FEM通过代理式AI与领域专用微调LLM结合,实现固体力学、流体力学及多物理场问题的自动有限元分析,其微调模型在39个基准测试中达到71.79%的代码级成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12898 2026-04-15 cs.AI math.CO 57%

BEAM: Bi-level Memory-adaptive Algorithmic Evolution for LLM-Powered Heuristic Design

BEAM:基于LLM的双层记忆自适应算法进化用于启发式设计

Chuyang Xiang, Yichen Wei, Jiale Ma, Handing Wang, Junchi Yan

机构 * IEEE

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 BEAM通过双层优化方法,结合遗传算法和MCTS,改进LLM驱动的启发式设计,有效提升复杂代码生成效率,实验显示在CVRP混合算法设计中优化差距减少37.84%。

Comments 24 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12253 2026-04-15 cs.PL 57%

The Search for Constrained Random Generators

寻找受限随机生成器

Harrison Goldstein, Hila Peleg, Cassia Torczon, Daniel Sainati, Leonidas Lampropoulos, Benjamin C. Pierce

专题命中 代码生成 :program synthesis(abstract);分类 cs.PL

AI总结 本文提出利用演绎程序合成思想,通过生成器的指称语义设计出自动合成正确生成器的规则,解决属性驱动测试中的受限随机生成问题,提升测试用例的有效性。

Comments Published at PLDI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12214 2026-04-15 cs.SE 57%

Structural Anchors and Reasoning Fragility:Understanding CoT Robustness in LLM4Code

结构锚点与推理脆弱性:理解LLM4Code中的CoT鲁棒性

Yang Liu, Da Song, Armstrong Foundjem, Heng Li, Foutse Khomh

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文研究了CoT提示在LLM4Code中的鲁棒性,通过系统扰动分析发现其性能依赖于模型家族、任务结构和提示明确性,并识别出三种轨迹变形模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19644 2026-04-15 cs.CL 57%

CoRoVA: Compressed Representations for Vector-Augmented Code Completion

CoRoVA:用于向量增强代码补全的压缩表示

Daria Cherniuk, Nikita Sukhorukov, Danil Gusak, Nikita Sushko, Danil Sivtsov, Elena Tutubalina, Evgeny Frolov

机构 * HSE University(俄罗斯莫斯科高等教育学院)

专题命中 代码生成 :repository(abstract);分类 cs.CL

AI总结 CoRoVA通过压缩上下文提升代码补全效率,减少提示扩展并降低延迟,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06679 2026-04-15 cs.CL 57%

E2LLM: Encoder Elongated Large Language Models for Long-Context Understanding and Reasoning

E2LLM:用于长上下文理解与推理的编码器扩展大语言模型

Zihan Liao, Jun Wang, Hang Yu, Lingxiao Wei, Jianguo Li, Jun Wang, Wei Zhang

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本文提出E2LLM,通过分块压缩和适配器对齐,解决长上下文处理中的性能、效率与兼容性难题,在文档摘要和问答任务中优于现有方法。

Comments Accept by EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12172 2026-04-15 cs.CR cs.LO 50%

COBALT-TLA: A Neuro-Symbolic Verification Loop for Cross-Chain Bridge Vulnerability Discovery

COBALT-TLA:一种用于跨链桥漏洞发现的神经符号验证循环

Dominik Blain

专题命中 代码生成 :code generation(abstract)

AI总结 COBALT-TLA结合LLM与TLA+模型检查器,通过自动REPL循环发现跨链桥漏洞,首次自主识别Optimistic Relay Attack漏洞类。

Comments 4 pages, 1 table. Submitted to FMBC 2026 (Formal Methods for Blockchains)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06846 2026-04-15 cs.CR 50%

CKG-LLM: LLM-Assisted Detection of Smart Contract Access Control Vulnerabilities Based on Knowledge Graphs

CKG-LLM:基于知识图谱的智能合约访问控制漏洞检测框架

Xiaoqi Li, Hailu Kuang, Wenkai Li, Zongwei Li, Shipeng Ye

专题命中 代码生成 :code generation(abstract)

AI总结 本文提出CKG-LLM框架,利用大语言模型能力将自然语言漏洞模式转化为知识图谱查询,提升智能合约访问控制漏洞检测性能。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 3 篇

2604.12301 2026-04-15 cs.DC cs.AI cs.SE 62%

Local-Splitter: A Measurement Study of Seven Tactics for Reducing Cloud LLM Token Usage on Coding-Agent Workloads

Local-Splitter:七种减少云LLM令牌使用量策略的测量研究

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperix Labs(Sperix实验室) VIA Cybersecurity Lab, KNUST(VIA网络安全实验室,科罗尼斯特大学) Quantum and Assistive Technologies Lab, KNUST(量子与辅助技术实验室,科罗尼斯特大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了七种减少云LLM令牌使用量的策略,通过测量发现本地路由与提示压缩组合在编辑密集型任务中可节省45-79%的云令牌,而RAG密集型任务中完整策略集可节省51%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12948 2026-04-15 cs.AI 57%

Drawing on Memory: Dual-Trace Encoding Improves Cross-Session Recall in LLM Agents

基于记忆的绘制:双轨迹编码提升LLM代理跨会话回忆

Benjamin Stern, Peter Nadel

机构 * Tufts University(塔夫茨大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出双轨迹编码方法,通过将事实与具体场景描述结合,提升LLM代理在跨会话中的回忆能力,实验显示在时间推理、知识更新追踪和多会话聚合方面有显著提升。

Comments 16 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02132 2026-04-15 cs.HC 50%

Shared Control for Game Accessibility: Understanding Current Human Cooperation Practices to Inform the Design of Partial Automation Solutions

共享控制在游戏可访问性中的应用:理解当前人类合作实践以指导部分自动化解决方案的设计

Dragan Ahmetovic, Matteo Manzoni, Filippo Corti, Sergio Mascetti

专题命中 软件智能体 :software agent(abstract)

AI总结 研究通过14名有可访问性游戏经验的受访者访谈,探讨共享控制技术的实际应用、解决的可访问性挑战及自动化支持的可行性,提出自动化支持系统的指导原则。

Comments 26 pages, 1 figure

Journal ref CHI '26: Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 4 篇

2604.12978 2026-04-15 cs.CL cs.CV 57%

GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

GlotOCR Bench: OCR模型在超过少数Unicode脚本之外仍面临困难

Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner, François Yvon, Hinrich Schütze

机构 * LMU Munich(慕尼黑大学) TU Munich(慕尼黑工业大学) MCML Sorbonne Université & CNRS, ISIR(索邦大学与CNRS,ISIR)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 GlotOCR Bench评估OCR在100+Unicode脚本上的泛化能力,发现大多数模型在少于十种脚本上表现良好,最强模型也难以泛化到三十种以上脚本,表明当前OCR系统依赖语言模型预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12902 2026-04-15 cs.PL cs.DC cs.PF 57%

Towards a Linear-Algebraic Hypervisor

向线性代数虚拟机迈进

Breandan Considine

专题命中 代码评测 :program synthesis(abstract);分类 cs.PL

AI总结 本文提出一种并行虚拟机,通过评估数百万个并发数组程序,发现其在相对传统顺序评估的情况下可达到147倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12875 2026-04-15 cs.AI 57%

AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance

AISafetyBenchExplorer:一个基于指标的AI安全基准目录揭示了测量碎片化和弱基准治理

Abiodun A. Solanke

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出AISafetyBenchExplorer,通过多表结构记录195个AI安全基准的元数据、指标定义等,揭示当前基准体系中测量标准化滞后于基准繁衍的问题,强调碎片化而非稀缺性是领域的主要失败模式。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12064 2026-04-15 cs.CR cs.SE 57%

LLM-Redactor: An Empirical Evaluation of Eight Techniques for Privacy-Preserving LLM Requests

LLM-Redactor: 对八种隐私保护LLM请求技术的实证评估

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 本文评估了八种隐私保护LLM请求技术,发现组合A+B+C在保护PII和专有代码方面效果最佳,提出基于威胁模型的决策规则。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 9 篇

2604.12487 2026-04-15 cs.CL cs.AI 62%

KG-Reasoner: A Reinforced Model for End-to-End Multi-Hop Knowledge Graph Reasoning

KG-Reasoner: 一种用于端到端多跳知识图谱推理的强化模型

Shuai Wang, Yinan Yu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KG-Reasoner,通过强化学习整合多步推理至LLM的'思考'阶段,实现动态探索推理路径,实验表明其在多跳和知识密集型推理任务中表现优异。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20980 2026-04-15 cs.SE cs.CR 57%

Operationalizing Research Software for Supply Chain Security

将供应链安全应用于研究软件

Kelechi G. Kalu, Soham Rattan, Taylor R. Schorlemmer, George K. Thiruvathukal, Jeffrey C. Carver, James C. Davis

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文提出面向研究软件供应链的分类法,通过系统回顾和数据集构建,建立统一的分类体系,并展示如何利用OpenSSF Scorecard分析不同分类簇的安全信号差异。

Journal ref ICSE-JAWS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12048 2026-04-15 cs.SE 57%

ORBIT: Guided Agentic Orchestration for Autonomous C-to-Rust Transpilation

ORBIT: 用于自主C到Rust转换的引导代理 orchestration

Muhammad Farrukh, Baris Coskun, Tapti Palit, Michalis Polychronakis

专题命中 仓库级理解 :coding agent(abstract);分类 cs.SE

AI总结 ORBIT 提出一种自主代理框架,通过动态上下文收集和依赖引导 orchestration 实现项目级 C到Rust转换,显著提升大规模代码转换的准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11977 2026-04-15 cs.SE cs.DC 57%

GitFarm: Git as a Service for Large-Scale Monorepos

GitFarm: 为大规模单体仓库提供 Git 服务

Preetam Dwivedi, Akshay Hacholli, Adam Bettigole

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 针对 Uber 单体仓库中传统 Git 工作流的瓶颈问题,GitFarm 通过 gRPC API 提供状态化、身份范围化的 Git 服务,减少本地克隆和 I/O 开销,提升性能和可扩展性。

Comments 9 pages, 10 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11944 2026-04-15 cs.LG q-bio.QM 57%

A unified data format for managing diabetes time-series data: DIAbetes eXchange (DIAX)

统一管理糖尿病时间序列数据的数据格式:DIAbetes eXchange (DIAX)

Elliott C. Pryor, Marc D. Breton, Anas El Fathi

机构 * University of Virginia, Center for Diabetes Technology(弗吉尼亚大学糖尿病技术中心)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本文提出DIAX数据格式,统一糖尿病时间序列数据,促进机器学习应用的互操作性和可重复性,支持多个主流数据集。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05546 2026-04-15 cs.CL 57%

Efficient Inference for Large Vision-Language Models: Bottlenecks, Techniques, and Prospects

大型视觉-语言模型高效推理:瓶颈、技术与前景

Jun Zhang, Yicheng Ji, Feiyang Ren, Yihang Li, Bowen Zeng, Zonghao Chen, Ke Chen, Lidan Shou, Gang Chen, Huan Li

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 本文系统分析了大型视觉-语言模型推理中的效率瓶颈,提出基于推理生命周期的分类技术,探讨了信息密度、长上下文注意力管理和内存限制的平衡,并展望了未来四个前沿方向。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13028 2026-04-15 cs.CV 50%

Conflated Inverse Modeling to Generate Diverse and Temperature-Change Inducing Urban Vegetation Patterns

融合反演建模生成多样且能引起温度变化的城区植被模式

Baris Sarper Tezcan, Hrishikesh Viswanath, Rubab Saher, Daniel Aliaga

机构 * Computer Science(计算机科学) Forestry and Natural Resources(林业与自然资源)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出融合预测正模与扩散基生成反模的反演框架,用于生成多样且符合特定温度目标的城区植被模式,解决传统方法在数据稀少时无法捕捉模糊性的不足。

Comments Accepted to the CVPR 2026 EarthVision Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12886 2026-04-15 cs.CE 50%

The cross-sectional warping problem for hyperelastic beams: An efficient formulation in Voigt notation

超弹性梁的横截面扭曲问题:一种高效的Voigt记法表述

Juan C. Alzate Cobo, Tobias Henkels, Oliver Weeger

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出了一种基于Green-Lagrange应变和第二Piola-Kirchhoff应力张量的超弹性梁横截面扭曲问题的全新材料表述,利用Voigt记法实现高效数值计算,并通过开放获取库提供有限元实现及数值示例以促进可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16806 2026-04-15 cs.CV 50%

MedGS: Gaussian Splatting for Multi-Modal 3D Medical Imaging

MedGS:用于多模态3D医学影像的高斯点散射

Kacper Marzol, Ignacy Kolton, Weronika Smolak-Dyżewska, Joanna Kaleta, Żaneta Świderska-Chadaj, Marcin Mazur, Mirosław Dziekiewicz, Tomasz Markiewicz, Przemysław Spurek

机构 * Jagiellonian University, Poland(雅盖隆大学,波兰) Warsaw University of Technology, Poland(华沙理工大学,波兰) IDEAS Research Institute, Poland(IDEAS研究所,波兰) Military Institute of Medicine, Poland(军事医学研究所,波兰)

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出MedGS,一种利用内镜成像独特性质的3D重建框架,通过物理逼真重照明模型提升重建质量,实现更准确的临床应用。

详情

展开后加载摘要…

URL PDF HTML 收藏