arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-09 至 2026-03-09 共收录 15 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 5 篇

2505.23819 2026-03-09 cs.PL cs.AR cs.DC cs.PF 74%

Linear Layouts: Robust Code Generation of Efficient Tensor Computation Using $\mathbb{F}_2$

线性布局:利用$\mathbb{F}_2$实现高效张量计算的鲁棒代码生成

Keren Zhou, Mario Lezcano, Adam Goucher, Akhmed Rakhmati, Jeff Niu, Justin Lebar, Pawel Szczerbuk, Peter Bell, Phil Tillet, Thomas Raoux, Zahi Moudallal

专题命中 代码生成 :code generation(title);分类 cs.PL

AI总结 本文提出线性布局方法,利用$\mathbb{F}_2$实现高效张量计算的鲁棒代码生成,通过通用布局定义和转换减少工程工作量并修复Triton布局系统中的错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06333 2026-03-09 cs.AI cs.CL cs.LG 67%

SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement

SAHOO:递归自我改进中高阶优化目标的安全保障

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) Google, USA(谷歌) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。

Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06123 2026-03-09 cs.CL cs.LG 62%

Diffusion Language Models Are Natively Length-Aware

扩散语言模型天生具有长度感知能力

Vittorio Rossi, Giacomo Cirò, Davide Beltrame, Luca Gandolfi, Paul Röttger, Dirk Hovy

机构 * Department of Computing Sciences, Bocconi University, Milan, Italy(计算机科学系,博科尼大学,米兰,意大利)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过动态裁剪上下文窗口减少扩散语言模型生成步骤,从而提升效率并减少计算消耗,在多个基准测试中实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05696 2026-03-09 cs.CE cs.AI cs.CL cs.NA math.NA 62%

Autonomous Algorithm Discovery for Ptychography via Evolutionary LLM Reasoning

基于进化大语言模型推理的自主算法发现用于ptychography

Xiangyu Yin, Ming Du, Junjing Deng, Zhi Yang, Yimo Han, Yi Jiang

机构 * Advanced Photon Source, Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室先进光子源) Department of Materials Science and NanoEngineering, Rice University, Houston, TX, USA(材料科学与纳米工程系,德克萨斯大学里士满分校)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 Ptychi-Evolve通过进化大语言模型推理,自主发现并优化正则化算法,提升ptychography图像重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23405 2026-03-09 cs.LG 57%

Planner Aware Path Learning in Diffusion Language Models Training

扩散语言模型训练中的规划感知路径学习

Fred Zhangzhi Peng, Zachary Bezemek, Jarrid Rector-Brooks, Shuibai Zhang, Anru R. Zhang, Michael Bronstein, Alexander Tong, Avishek Joey Bose

机构 * Duke University(杜克大学) Mila Université de Montréal(蒙特利尔大学) California Institute of Technology(加州理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Oxford(牛津大学) AITHYRA Imperial College London(伦敦帝国学院)

专题命中 代码生成 :code generation(abstract);分类 cs.LG

AI总结 本文提出PAPL,一种通过规划感知路径学习提升扩散语言模型训练与推理一致性的方法,实现跨领域性能提升。

Comments Camera ready version for ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2603.05941 2026-03-09 cs.SE cs.AI 81%

XAI for Coding Agent Failures: Transforming Raw Execution Traces into Actionable Insights

代码代理故障的可解释性AI:将原始执行轨迹转化为可操作的见解

Arun Joshi

机构 * Independent Researcher(独立研究者) Islington College(伊斯林顿学院)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出了一种基于XAI的方法,通过结构化解释和可视化技术,帮助开发者更高效地理解和修复代码代理的故障问题。

Comments 17 Pages, 3 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06064 2026-03-09 cs.AI 57%

Agentic LLM Planning via Step-Wise PDDL Simulation: An Empirical Characterisation

通过分步PDDL模拟实现代理LLM规划:一项实证分析

Kai Göbel, Pierrick Lorang, Patrik Zips, Tobias Glück

机构 * AIT Austrian Institute of Technology GmbH(奥地利技术研究院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文通过PyPDDLEngine实验证明代理LLM在任务规划中相比传统方法具有小幅优势,但效果受环境反馈类型影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2603.06107 2026-03-09 cs.SE 74%

Real-World Fault Detection for C-Extended Python Projects with Automated Unit Test Generation

面向C扩展Python项目的现实世界故障检测:自动化单元测试生成

Lucas Berg, Lukas Krodinger, Stephan Lukasczyk, Annibale Panichella, Gordon Fraser, Wim Vanhoof, Xavier Devroey

专题命中 测试生成 :unit test generation(title);分类 cs.SE

AI总结 本研究提出通过分离测试生成过程的生成与执行阶段,利用子进程执行技术提升C扩展Python项目中故障检测的覆盖率和准确性。

Comments Accepted at the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST) 2026, Daejeon, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 5 篇

2603.06358 2026-03-09 cs.SE 79%

A Scalable Benchmark for Repository-Oriented Long-Horizon Conversational Context Management

面向仓库的长 horizon 对话上下文管理可扩展基准

Yang Liu, Li Zhang, Fang Liu, Ping Lin, Xinyi Li

专题命中 代码评测 :repository(title,abstract);分类 cs.SE

AI总结 本文提出LoCoEval,首个面向仓库开发场景的长 horizon 对话上下文管理基准,评估了多种方法并提出改进方案,提升了代码助手在复杂对话中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01646 2026-03-09 cs.CL cs.AI cs.LG 67%

ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge

ESGenius:对环境、社会和治理(ESG)及可持续性知识的LLM基准测试

Chaoyue He, Xin Zhou, Yi Wu, Xinjia Yu, Yan Zhang, Lei Zhang, Di Wang, Shengfei Lyu, Hong Xu, Xiaoqiao Wang, Wei Liu, Chunyan Miao

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性公司实验室) Alibaba Group(阿里巴巴集团)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ESGenius是首个针对LLM在ESG及可持续性知识评估的综合问答基准,通过RAG方法显著提升模型性能。

Comments EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 14612-14653

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05764 2026-03-09 cs.LG cs.AI 62%

TML-Bench: Benchmark for Data Science Agents on Tabular ML Tasks

TML-Bench:用于表格机器学习任务的数据科学代理基准

Mykola Pinchuk

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 TML-Bench评估10个开源LLM在Kaggle竞赛中的表现,揭示不同时间预算下模型性能的差异及稳定性。

Comments 19 pages, 16 tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10452 2026-03-09 cs.SE 57%

UniCoR: Modality Collaboration for Robust Cross-Language Hybrid Code Retrieval

UniCoR: 代码多模态协作以实现稳健的跨语言混合代码检索

Yang Yang, Li Kuang, Jiakun Liu, Zhongxin Liu, Yingjie Xia, David Lo

专题命中 代码评测 :code model(abstract);分类 cs.SE

AI总结 UniCoR通过多模态协作和自监督学习提升跨语言混合代码检索的语义理解和泛化能力。

Comments Accepted by the 48th IEEE/ACM International Conference on Software Engineering (ICSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06541 2026-03-09 cs.DB cs.AI cs.MA 57%

KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes

KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试

Eugenie Lai, Gerardo Vitagliano, Ziyu Zhang, Om Chabra, Sivaprasad Sudhir, Anna Zeng, Anton A. Zabreyko, Chenning Li, Ferdi Kossmann, Jialin Ding, Jun Chen, Markos Markakis, Matthew Russo, Weiyang Wang, Ziniu Wu, Michael J. Cafarella, Lei Cao, Samuel Madden, Tim Kraska

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent(独立研究者) University of Arizona(亚利桑那大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 2 篇

2504.08818 2026-03-09 cs.LG cs.AI 62%

From Tokenizer Bias to Backbone Capability: A Controlled Study of LLMs for Time Series Forecasting

从分词偏差到骨干能力:对用于时间序列预测的LLM进行受控研究

Xinyu Zhang, Shanshan Feng, Xutao Li, Kenghong Lin, Fan Li, Pengfei Jia

机构 * Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文通过设计三个具有相同架构但不同预训练策略的模型,研究了LLM在时间序列预测中的性能,发现其表现有限,无法超越专门训练的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04169 2026-03-09 cs.DB 50%

Efficient Query Rewrite Rule Discovery via Standardized Enumeration and Learning-to-Rank(extend)

通过标准化枚举和学习排序高效发现查询重写规则(扩展)

Yuan Zhang, Yuxing Chen, Yuekun Yu, Jinbin Huang, Rui Mao, Anqun Pan, Lixiong Zheng, Jianbin Qin

专题命中 仓库级理解 :repository(abstract)

AI总结 SLER通过标准化枚举和学习排序方法,高效发现大规模查询重写规则,构建超过100万条规则的库,支持复杂查询计划模板。

详情

展开后加载摘要…

URL PDF HTML 收藏