arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-19 至 2026-06-19 共收录 20 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 3 篇

2606.19988 2026-06-19 cs.SE 新提交 88%

Repository-Level Solidity Code Generation with Large Language Models: From Prompting to Fine-Tuning

基于大语言模型的仓库级Solidity代码生成:从提示到微调

Shi Chen, Rongcun Wang, Yuan Tian, Xiaoyuan Xie, Wei Song, Rubing Huang

专题命中 代码生成 :code generation(title,abstract);repository(title,abstract);分类 cs.SE

AI总结 提出SolidityBench基准和SolidityScore指标,评估多种LLM方法在仓库级Solidity代码生成中的表现,发现监督微调最有效。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20517 2026-06-19 cs.AI cs.PL 新提交 62%

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

Multi-LCB: 将 LiveCodeBench 扩展到多种编程语言

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

机构 * GigaCode Yandex School of Data Analysis, Applied AI Institute(Yandex数据分析学院,应用人工智能研究所)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.PL

AI总结 提出 Multi-LCB 基准,将 LiveCodeBench 的 Python 任务扩展到 12 种编程语言,评估 LLM 跨语言代码生成能力,发现 Python 过拟合和语言特定污染等问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19644 2026-06-19 cs.SE 新提交 57%

Prompt Quality and Pull Request Outcomes: A Stage-Based Empirical Study of LLM-Assisted Development

提示质量与拉取请求结果:基于阶段的LLM辅助开发实证研究

Richard Sserunjogi, Daniel Ogenrwot, John Businge

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 通过分析265个开发者与ChatGPT的交互,研究提示结构(上下文、具体性、验证)对LLM辅助开发中代码生成、采纳和集成深度的影响,发现不同维度在不同阶段有不同作用。

Comments 48 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2606.19613 2026-06-19 cs.SE cs.AI 新提交 81%

StaminaBench: Stress-Testing Coding Agents over 100 Interaction Turns

StaminaBench: 对编码智能体进行100轮交互的压力测试

Vlad Sobal, Shuo Yang, Yuting Zhang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理人工智能)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出StaminaBench基准,通过100轮连续变更请求测试编码智能体的耐力,发现所有模型在5-6轮内失败,而测试反馈和重试机制可将通过轮数提升12倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20158 2026-06-19 cs.SE 新提交 79%

N-Version Programming with Coding Agents

使用编码代理的N版本编程

Javier Ron, Benoit Baudry, Martin Monperrus

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 本文在当代AI编码代理背景下重新审视N版本编程,通过Knight-Leveson实验评估代理系统、模型和实现语言的多样性对故障模式的影响,发现常见模式故障,但多数投票三版本单元显著降低故障数,证明该策略的工程实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25160 2026-06-19 cs.AI 版本更新 74%

ScaleWoB: Guiding GUI Agents with Coding Agents via Large-Scale Environmental Synthesis

SimuWoB: 模拟真实世界移动应用以实现快速且保真的GUI智能体基准测试

Guohong Liu, Jialei Ye, Pengzhi Gao, Wei Liu, Jian Luan, Yunxin Liu, Yuanchun Li

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) University of Electronic Science and Technology of China(电子科技大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队)

专题命中 软件智能体 :coding agent(title);分类 cs.AI

AI总结 针对现有移动GUI智能体基准测试与现实应用之间的差距,提出全合成基准SimuWoB,通过鲁棒的虚拟环境生成框架合成高保真任务和环境,自动提供有效奖励,实现对复杂长程交互的高效可重复评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19616 2026-06-19 cs.SE cs.AI cs.MA 新提交 62%

Before the Pull Request: Mining Multi-Agent Coordination

在拉取请求之前:挖掘多智能体协调

Dipankar Sarkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 针对自主编码智能体在拉取请求中协调不足的问题,提出基于git的协调基板grite,通过事件日志减少重复和冲突工作,提升吞吐量,并自动恢复多种故障模式。

Comments 9 pages, 2 tables. LNCS format. Code, dataset, and mining toolkit: https://github.com/neul-labs/grite

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19388 2026-06-19 cs.SE cs.CL cs.HC 新提交 62%

Beyond the GUI Paradigm: Do Mobile Agents Need the Phone Screen?

超越GUI范式:移动代理是否需要手机屏幕?

Li Gu, Zihuan Jiang, Linqiang Guo, Zhixiang Chi, Ziqiang Wang, Huan Liu, Yuanhao Yu, Tse-Hsun Chen, Yang Wang

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) Concordia University(康科迪亚大学) University of Toronto(多伦多大学) McMaster University(麦马斯特大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 本文挑战移动代理的GUI主导范式,提出CLI应同等重要,通过实验证明CLI代理在AndroidWorld和MobileWorld上超越GUI基线,并引入CLI-Advantage任务套件展示其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19980 2026-06-19 cs.AI 新提交 57%

ENPIRE: Agentic Robot Policy Self-Improvement in the Real World

ENPIRE: 现实世界中智能体机器人策略的自我改进

Wenli Xiao, Jia Xie, Tonghe Zhang, Haotian Lin, Letian "Max" Fu, Haoru Xue, Jalen Lu, Yi Yang, Cunxi Dai, Zi Wang, Jimmy Wu, Guanzhi Wang, S. Shankar Sastry, Ken Goldberg, Linxi "Jim" Fan, Yuke Zhu, Guanya Shi

机构 * NVIDIA(英伟达) CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出ENPIRE框架,通过环境重置、策略执行、结果验证和迭代优化的闭环反馈,使编码智能体自主改进机器人操作策略,在灵巧操作任务上达到99%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19419 2026-06-19 cs.RO cs.AI 新提交 57%

Playful Agentic Robot Learning

趣味性具身机器人学习

Junyi Zhang, Jiaxin Ge, Hanjun Yoo, Letian Fu, Zihan Yang, Yaowei Liu, Raj Saravanan, Shaofeng Yin, Justin Yu, Dantong Niu, Zirui Wang, Roei Herzig, Ken Goldberg, Yutong Bai, David M. Chan, Ion Stoica, Angjoo Kanazawa, Jiahui Lei, Haiwen Feng, Trevor Darrell

机构 * University of California, Berkeley(加州大学伯克利分校) Impossible Research

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 提出RATs框架,让机器人通过自主探索学习可复用技能,在LIBERO-PRO和MolmoSpaces上分别提升20.6和17.0个百分点。

Comments Project page: https://playful-rats.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16136 2026-06-19 cs.SE 57%

Seeing is Fixing: Cross-Modal Reasoning with Multimodal LLMs for Visual Software Issue Fixing

视觉即修复:基于多模态大语言模型的视觉软件问题修复

Kai Huang, Jian Zhang, Xiaofei Xie, Chunyang Chen

专题命中 软件智能体 :program repair(abstract);分类 cs.SE

AI总结 本文提出GUIRepair方法,通过多模态推理解决视觉软件问题,结合图像到代码和代码到图像的组件提升故障理解和修复验证。

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试生成 1 篇

2606.19352 2026-06-19 cs.CL cs.AI 新提交 62%

Sign-Language Datasets at Scale: A Comprehensive Survey on Resources, Benchmarks, and Annotation Standards

大规模手语数据集:资源、基准和标注标准的综合调查

Yiming Ni, Zhi-Qi Cheng, Jiayu Li, Wei Cheng

机构 * Tacoma School of Engineering & Technology, University of Washington(华盛顿大学塔科马工程与技术学院)

专题命中 测试生成 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文调查了35种手语的120个数据集,分析了模态不平衡、标注粒度和手语者偏差等挑战,并提出了24字段手语数据表以支持标准化文档和可复现评估。

Comments Accepted to ACL 2026 Main. 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 7 篇

2606.20075 2026-06-19 cs.LG cs.CL 新提交 62%

What Makes Effective Supervision in Latent Chain-of-Thought: An Information-Theoretic Analysis

什么使得潜在思维链中的监督有效:一种信息论分析

Xinghao Chen, Chak Tou Leong, Wenjin Guo, Jian Wang, Wenjie Li, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.LG

AI总结 本文从信息论角度分析潜在思维链中的监督失效问题,提出轨迹监督和空间监督两个维度,并引入统一潜在探针(ULP)量化信息保真度,揭示了信息-性能绑定关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19911 2026-06-19 cs.AI cs.CL cs.IR 新提交 62%

Multi-Agent Transactive Memory

多智能体交互记忆

To Eun Kim, Xuhong He, Dishank Jain, Ambuj Agrawal, Negar Arabzadeh, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 提出MATM框架,通过共享存储和检索智能体轨迹,实现异构智能体群体间的知识复用,提升下游任务性能并减少交互步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20550 2026-06-19 cs.DL cs.HC cs.IR 新提交 50%

Easy Reads: A Python program for making Scientific Papers on arXiv more Reader Friendly and Accessible

Easy Reads: 一个使arXiv上的科学论文更易读和更易访问的Python程序

Vishal Verma

专题命中 仓库级理解 :repository(abstract)

AI总结 针对科学论文排版紧凑、可读性差的问题,提出Easy Reads——一个自动化、端到端的开源Python程序,通过自定义字体大小和列数等格式,从arXiv获取论文并重新排版,提升可读性和可访问性。

Comments 9 pages. Open-source software project available at: https://github.com/Curious-flow/Easy-Reads

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19423 2026-06-19 hep-th 新提交 50%

Calabi-Yau Orientifold Hypersurfaces and their F-theory Uplifts

Calabi-Yau 定向折叠超曲面及其 F-理论提升

Bjoern Hassfeld, Jakob Moritz

专题命中 仓库级理解 :repository(abstract)

AI总结 提出算法构造 Calabi-Yau 三维流形定向折叠及其 F-理论提升为椭圆纤维化 Calabi-Yau 四维流形,嵌入环面簇中,并计算四维流形周期和七膜超势。

Comments 51 pages + appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20370 2026-06-19 astro-ph.IM astro-ph.GA 新提交 50%

ELMA: ELlipse-based bar MAjor axis estimator

ELMA:基于椭圆的棒主轴估计器

Bruna R. Bragança de Lima, Andressa Wille, Rafael S. de Souza, Ana L. Chies-Santos

专题命中 仓库级理解 :repository(abstract)

AI总结 提出ELMA Python包,通过迭代椭圆等照度线拟合自动估计星系棒长度,在GOODS-South的JWST/NIRCam图像上验证。

Comments 4 pages, 1 figure, published in RNAAS

Journal ref Research Notes of the AAS, Volume 10, Number 6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05017 2026-06-19 cs.AR cs.MS 版本更新 50%

GoldenFloat: A Phi-Derived Static-Split Floating-Point Family from GF4 to GF1024 with a Lucas-Exact Integer Identity

GoldenFloat: 从GF4到GF256的基于Phi的静态拆分浮点系列及其Lucas精确整数恒等式

Dmitrii Vasilev

专题命中 仓库级理解 :repository(abstract)

AI总结 提出一种由单一闭式规则生成的静态拆分浮点系列GoldenFloat,并给出多宽度RTL生成器、Lucas精确累加器路径和FPGA编解码器三个具体实现。

Comments 20 pages, single-file LaTeX, ASCII source. v2: peer-anchor updates. Adds Sarnoff P3109 (arXiv:2606.04028), AMD MXFP4 silicon (arXiv:2605.09825), NVIDIA GB10 NVFP4 measurement, companion catalog (arXiv:2606.09686), MixFP4 (arXiv:2605.31035). FL-002 expanded: (c1) GF256 bias, (c2) count drift, (g) static-split vs micro-mixing. TTSKY26a regeneration timeline added. No mathematical claims revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12303 2026-06-19 astro-ph.IM astro-ph.CO astro-ph.EP astro-ph.GA astro-ph.SR 版本更新 50%

Astrophysics Wrapped 2025: Year-in-Review of Every Astrophysics arXiv Paper from 2025

天体物理学年度总结 2025:2025年所有天体物理学arXiv论文回顾

Rommulus Francis Lewis, Hetansh Shah, Amruth Alfred

专题命中 仓库级理解 :repository(abstract)

AI总结 本文统计了2025年arXiv上所有天体物理学论文的关键词、子领域、望远镜、期刊、天体对象及作者机构等指标,并首次给出天体物理光谱指纹图谱,揭示研究热点与全球合作格局。

Comments 30 pages, 13 tables, 24 figures, comments are welcome, submitted

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 程序分析与验证 1 篇

2606.19149 2026-06-19 cs.CR cs.LG 新提交 57%

OpenAnt: LLM-Powered Vulnerability Discovery Through Code Decomposition, Adversarial Verification, and Dynamic Testing

OpenAnt:通过代码分解、对抗性验证和动态测试实现LLM驱动的漏洞发现

Nahum Korda, Gadi Evron

专题命中 程序分析与验证 :repository(abstract);分类 cs.LG

AI总结 提出OpenAnt系统,结合静态分析与LLM推理,通过代码分解、对抗性验证和动态测试三阶段流水线,在降低误报率的同时发现未知漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏