arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-11 至 2026-03-11 共收录 19 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 7 篇

2510.13756 2026-03-11 cs.CV cs.AI cs.LG 76%

RECODE: Reasoning Through Code Generation for Visual Question Answering

RECODE: 通过代码生成进行视觉问答的推理

Junhong Shen, Mu Cai, Bo Hu, Ameet Talwalkar, David A Ross, Cordelia Schmid, Alireza Fathi

专题命中 代码生成 :code generation(title);分类 cs.AI、cs.LG

AI总结 RECODE通过代码生成实现视觉问答的可验证推理,优于传统方法。

Comments The authors are withdrawing this manuscript temporarily to conduct additional checks of the experimental setup and implementation. We plan to post an updated version after completing these checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12642 2026-03-11 cs.SE cs.AI quant-ph 76%

QSpark: Towards Reliable Qiskit Code Generation

QSpark:迈向可靠的Qiskit代码生成

Kiana Kheiri, Aamna Aamir, Andriy Miranskyy, Chen Ding

机构 * Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI

AI总结 QSpark通过GRPO和ORPO方法提升Qiskit代码生成的可靠性,在基准测试中取得显著成绩,但仍有提升空间。

Journal ref In Proceedings of the 3rd International Workshop on AI for Quantum and Quantum for AI (AIQxQIA 2025), co-located with ECAI 2025, CEUR Workshop Proceedings, Vol. 4153, Paper 6, pp. 1-12, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09951 2026-03-11 cs.LG cs.AI cs.SE 67%

Towards a Neural Debugger for Python

迈向Python的神经调试器

Maximilian Beck, Jonas Gehring, Jannik Kossen, Gabriel Synnaeve

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出神经调试器,通过模拟传统调试器实现交互式代码执行控制,提升神经模型在代码执行预测与逆向推理中的能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14093 2026-03-11 cs.SE cs.AI cs.CL 67%

Reasoning Efficiently Through Adaptive Chain-of-Thought Compression: A Self-Optimizing Framework

通过自适应链式推理压缩实现高效推理:一个自优化框架

Kerui Huang, Shuhan Liu, Xing Hu, Tongtong Xu, Lingfeng Bao, Xin Xia

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SEER通过自适应压缩链式推理,提升LLM在软件工程和数学任务中的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09906 2026-03-11 cs.CL 57%

Thinking to Recall: How Reasoning Unlocks Parametric Knowledge in LLMs

思考以回忆:推理如何解锁大语言模型中的参数知识

Zorik Gekhman, Roee Aharoni, Eran Ofek, Mor Geva, Roi Reichart, Jonathan Herzig

机构 * Technion - Israel Institute of Technology(技术学院-以色列理工学院) Tel Aviv University(特拉维夫大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 本研究发现推理通过计算缓冲效应和事实优先机制提升大语言模型对参数知识的回忆能力,但可能增加幻觉风险,通过优化推理轨迹可提高模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09004 2026-03-11 cs.SE 57%

Can AI Agents Generate Microservices? How Far are We?

AI代理能否生成微服务?我们距离多远?

Bassam Adnan, Matteo Esposito, Davide Taibi, Karthik Vaidhyanathan

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文研究了AI代理生成微服务的能力,发现渐进式生成在单元测试中表现较好,而清洁状态生成在集成测试中表现更优,但整体上仍需人类监督。

Comments 10 pages, 7 figures, accepted at the 2026 IEEE International Conference on Software Architecture (ICSA 2026). This is the pre-print version; the camera-ready version is published by IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18315 2026-03-11 cs.NI 50%

CovertComBench: A First Domain-Specific Testbed for LLMs in Wireless Covert Communication

CovertComBench: 一个用于无线隐蔽通信中LLM的首个领域特定测试平台

Zhaozhi Liu, Jiaxin Chen, Yuanai Xie, Yuna Jiang, Minrui Xu, Xiao Zhang, Pan Lai, Zan Zhou

专题命中 代码生成 :code generation(abstract)

AI总结 CovertComBench是首个用于评估LLM在无线隐蔽通信中安全约束优化能力的领域特定测试平台,揭示了LLM在高阶数学推导上的不足,强调需通过外部工具增强构建可信无线AI系统。

Comments 6 pages, corrected a typo: "DeepSeek-R1:70B" was previously incorrectly written as "DeepSeek-V3.2:70B"

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2603.08993 2026-03-11 cs.SE cs.AI cs.CR cs.PL 67%

Arbiter: Detecting Interference in LLM Agent System Prompts

Arbiter:检测LLM代理系统提示中的干扰

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 Arbiter通过结合形式评估规则和多模型LLM扫描,检测LLM代理系统提示中的干扰模式,发现152个问题并揭示漏洞类别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06931 2026-03-11 cs.LO 50%

LLM2SMT: Building an SMT Solver with Zero Human-Written Code

LLM2SMT:构建一个无需人工编写代码的SMT求解器

Mikoláš Janota, Mirek Olšák

专题命中 软件智能体 :coding agent(abstract)

AI总结 LLM2SMT通过无需人工编写代码的方式,构建了一个基于DPLL(T)风格的QF_UF SMT求解器,实现了同余闭包算法并生成证明,展示了其在SMT-LIB基准测试中的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2603.09544 2026-03-11 cs.CR 78%

Compartmentalization-Aware Automated Program Repair

具有 compartmentalization 意识的自动化程序修复

Jia Hu, Youcheng Sun, Pierre Olivier

专题命中 程序修复 :program repair(title,abstract)

AI总结 本文提出了一种专门针对 compartment 接口安全的 APR 框架,通过整合 fuzzer、补丁生成和验证组件,自动化修复 cross-compartment 接口漏洞。

Comments Accepted to appear in ICSE's Journal Ahead Workshop (JAWs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04936 2026-03-11 cs.PL cs.SE 62%

Floating-Point Usage on GitHub: A Large-Scale Study of Statically Typed Languages

GitHub上的浮点数使用:静态类型语言的大规模研究

Andrea Gilot, Tobias Wrigstad, Eva Darulova

专题命中 程序修复 :program repair(abstract);分类 cs.SE、cs.PL

AI总结 本文通过大规模研究GitHub仓库中的浮点数使用,揭示了现实世界中浮点数运算的广泛应用,并发布数据集以帮助改进自动推理技术。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 2 篇

2603.08806 2026-03-11 cs.SE cs.AI 62%

Test-Driven AI Agent Definition (TDAD): Compiling Tool-Using Agents from Behavioral Specifications

基于行为规范的AI代理定义(TDAD):从行为规范编译工具使用代理

Tzafrir Rehan

机构 * Fiverr Labs(Fiverr 实验室)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 TDAD通过编译行为规范生成可执行测试,确保工具使用代理在生产环境中的行为合规性,提升测试质量和回归安全性。

Comments 9 pages, 2 figures, open benchmark at https://github.com/f-labs-io/tdad-paper-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 57%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 5 篇

2603.08718 2026-03-11 cs.AR cs.AI 79%

CktEvo: Repository-Level RTL Code Benchmark for Design Evolution

CktEvo: 用于设计演化的仓库级RTL代码基准

Zhengyuan Shi, Jingxin Wang, Tairan Cheng, Changran Xu, Weikang Qian, Qiang Xu

机构 * The Chinese University of Hong Kong(中国香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 仓库级理解 :repository(title,abstract);分类 cs.AI

AI总结 CktEvo提出一个用于仓库级RTL代码演化的基准和框架,通过闭环框架实现PPA改进,无需人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09192 2026-03-11 cs.AI 57%

Explainable Innovation Engine: Dual-Tree Agent-RAG with Methods-as-Nodes and Verifiable Write-Back

可解释的创新引擎:双树代理-RAG与方法作为节点和可验证的写回

Renwei Meng

机构 * Anhui University(安徽大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本研究提出了一种双树代理-RAG框架,通过方法作为节点和可验证的写回机制,提升代理系统在可控、可解释和可验证创新方面的性能。

Comments 15pages, 4figures, code available on Github

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07036 2026-03-11 cs.HC 50%

Monetizing Generative AI: YouTubers' Collective Knowledge on Earning from Generative AI Content

利用生成式AI:YouTubers集体知识中的通过生成式AI内容获利

Shuo Niu, Yao Lyu, He Zhang, Na Li, Bumjin Kim, Jie Cai

专题命中 仓库级理解 :repository(abstract)

AI总结 研究探讨YouTubers如何通过集体构建的GenAI知识,利用生成式AI内容实现盈利,并揭示其中的结构性张力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18075 2026-03-11 cs.CR 50%

PyPitfall: Dependency Chaos and Software Supply Chain Vulnerabilities in Python

PyPitfall:Python中依赖混沌与软件供应链漏洞

Jacob Mahon, Chenxi Hou, Zhihao Yao

专题命中 仓库级理解 :repository(abstract)

AI总结 PyPitfall通过分析PyPI生态系统的依赖结构,揭示了Python软件供应链中脆弱依赖的广泛存在及其安全影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16094 2026-03-11 hep-ph astro-ph.IM 50%

FLARE: FCCee b2Luigi Automated Reconstruction And Event processing

FLARE:FCCee b2Luigi 自动化重建与事件处理

Cameron Harris, Aman Desai

专题命中 仓库级理解 :repository(abstract)

AI总结 FLARE 是一个用于 FCCee 分析的开源工作流编排工具,通过 b2luigi 实现自动化重建和事件处理,支持多种 MC 数据工作流生成器。

Journal ref Comput.Phys.Commun. 322 (2026) 110062

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 程序分析与验证 1 篇

2603.06731 2026-03-11 cs.PL cs.LG 62%

PolyBlocks: A Compiler Infrastructure for AI Chips and Programming Frameworks

PolyBlocks:面向AI芯片和编程框架的编译器基础设施

Uday Bondhugula, Akshay Baviskar, Navdeep Katel, Vimal Patel, Anoop JS, Arnab Dutta

机构 * Polymage Labs(Polymage实验室) Indian Institute of Science(印度科学研究院)

专题命中 程序分析与验证 :code generation(abstract);分类 cs.LG、cs.PL

AI总结 PolyBlocks是一种基于MLIR的编译器基础设施,通过自动代码生成和优化,实现AI编程框架到AI芯片的高效转换。

Comments Fixed the "Acknowledgments" section that was missing phrases

详情

展开后加载摘要…

URL PDF HTML 收藏