arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-25 至 2026-05-25 共收录 19 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 7 篇

2605.23772 2026-05-25 cs.AI cs.LO cs.PL cs.SE 67%

Agentic Proving for Program Verification

程序验证的智能体证明

Alessandro Sosso, Akhil Arora, Bas Spitters

机构 * Department of Computer Science(计算机科学系)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 本文评估Claude Code在Lean 4基准CLEVER上的智能体证明框架,结果显示其能生成98.8%问题的有效规范,87.5%的实现通过验证,端到端成功率达98.1%,并指出当前基准与智能体能力不匹配,需更严格的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23543 2026-05-25 cs.PL cs.SE 62%

JEDI: Java Evaluation of Declarative and Imperative Queries

JEDI: Java声明式与命令式查询评估

Filippo Schiavio, Walter Binder

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.PL

AI总结 提出JEDI基准测试套件,通过自动将SQL基准转换为Java基准,分析Stream API与命令式实现的性能差异,以指导开发者优化代码。

Journal ref 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19310 2026-05-25 cs.LG cs.AI 62%

MemReward: Graph-Based Experience Memory for LLM Reward Prediction with Limited Labels

MemReward: 基于图的经验记忆用于有限标签下的LLM奖励预测

Tianyang Luo, Tao Feng, Zhigang Hua, Yan Xie, Shuang Yang, Ge Liu, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 提出MemReward框架,利用图神经网络在少量标签下将奖励从标注样本传播到未标注样本,实现混合奖励获取策略,在数学、问答和代码生成任务上接近Oracle性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02688 2026-05-25 cond-mat.mtrl-sci cs.SE 57%

MatClaw: An Autonomous Code-First LLM Agent for End-to-End Materials Exploration

MatClaw: 一种用于端到端材料探索的自主代码优先LLM代理

Chenmu Zhang, Boris I. Yakobson

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出MatClaw,一种代码优先的LLM代理,通过直接编写和执行Python代码、结合四层记忆架构和检索增强生成,实现多代码工作流在远程HPC集群上的自主运行,并在铁电CuInP2S6的三个端到端演示中验证了其可靠性,同时通过文献自学习和专家约束弥合隐性领域知识差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05472 2026-05-25 cs.AI 57%

ALIVE: Awakening LLM Reasoning via Adversarial Learning and Instructive Verbal Evaluation

ALIVE: 通过对抗学习和指导性语言评估唤醒LLM推理

Yiwen Duan, Jing Ye, Xinpei Zhao

机构 * Independent Researcher(独立研究者)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出ALIVE框架,通过对抗学习与指导性语言反馈替代标量奖励,使模型内化推理逻辑,在数学、代码和逻辑推理任务中提升准确率、跨域泛化与自我修正能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22937 2026-05-25 cs.CL 57%

RAS: Reflection-Augmented Scaling with In-Context Learning for Executable Cypher Query Generation

RAS: 基于上下文学习的反射增强缩放用于可执行Cypher查询生成

Minseok Jung, Abhas Ricky, Muhammad Rameez Chatni

机构 * Cloudera

专题命中 代码生成 :code generation(abstract);分类 cs.CL

AI总结 提出反射增强缩放(RAS)方法,利用执行错误反馈进行上下文学习,在Text2Cypher任务中显著降低查询执行错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23273 2026-05-25 cs.MA 50%

Self-Refining Topology Optimization via an LLM-Based Multi-Agent Framework

基于LLM多智能体框架的自优化拓扑优化

Hyunjee Park, Hayoung Chung

专题命中 代码生成 :code generation(abstract)

AI总结 提出TopOptAgents多智能体系统,通过LLM协作与迭代自优化循环,自动化拓扑优化的决策与设计过程,尤其对文献覆盖不足的问题类效果显著。

Comments 28 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2512.18470 2026-05-25 cs.SE cs.AI cs.MA 81%

SWE-EVO: Benchmarking Coding Agents in Long-Horizon Software Evolution Scenarios

SWE-EVO:在长周期软件演化场景中基准测试编码智能体

Tue Le, Minh V. T. Thai, Dung Nguyen Manh, Huy Phan Nhat, Nghi D. Q. Bui

机构 * FPT Software AI Center(FPT软件人工智能中心) School of Computing and Information Systems(计算与信息系统学院) University of Melbourne(墨尔本大学) Center of AI Research(人工智能研究中心) VinUniversity(文大学)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 针对现有基准测试仅关注孤立单任务问题,提出SWE-EVO基准,包含48个需跨多文件多步骤修改的长周期任务,实验显示当前智能体在此类任务上表现显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23109 2026-05-25 cs.AI cs.DC cs.LO cs.PL 62%

Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems

归纳演绎合成:使AI能够生成形式化验证的系统

Shubham Agarwal, Alexander Krentsel, Shu Liu, Mert Cemri, Audrey Cheng, Rui Meng, Tomas Pfister, Chun-Liang Li, Sylvia Ratnasamy, Aditya Parameswaran, Matei Zaharia, Ion Stoica, Mohsen Lesani

机构 * UC Berkeley(伯克利大学) Google(谷歌) UC Santa Cruz(圣克鲁兹大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.PL

AI总结 提出归纳演绎合成(IDS)方法,通过联合增量合成实现与证明,并利用失败尝试学习,使AI在分布式系统规范上实现100%验证成功率,成本和时间远低于专家和现有AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 代码评测 5 篇

2605.17637 2026-05-25 cs.AI 83%

WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games

WebGameBench: 通过浏览器原生游戏对编码代理进行需求到应用的评估

Wenyu Zhang, Guoliang You, Tianlun, Haotian Zhao, Tianshu Zhu, Haoran Wang, Xiaoxuan Tang, Mingyang Dai, Jingnan Gu, Daxiang Dong, Jianmin Wu

机构 * Baidu(百度) University of Science and Technology of China(中国科学技术大学)

专题命中 代码评测 :coding agent(title,abstract);repository(abstract);分类 cs.AI

AI总结 提出WebGameBench基准,通过将结构化Web游戏规范转化为可浏览器访问的游戏,评估编码代理从需求到应用交付的能力,并采用运行时评估器与人类审查对齐的可用性标签。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23574 2026-05-25 cs.LG cs.SE 62%

Push Your Agent: Measuring and Enforcing Quantitative Goal Persistence in Long-Horizon LLM Agents

推动你的智能体:在长周期LLM智能体中测量和强制实现定量目标持续性

Yuandao Cai, Yuzhang Zhu, Liyou Gao, Wensheng Tang, Shengchao Qin

机构 * Independent Researcher(独立研究者) Xidian University(西安电子科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.LG

AI总结 提出PushBench基准,通过状态追踪检索控制器和积压追踪工作单元控制器,测量和提升长周期语言智能体在定量目标持续性(QGP)上的表现,防止重复提交和虚假完成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18859 2026-05-25 cs.LG cs.AI 62%

TwinRouterBench: Fast Static and Live Dynamic Evaluation for Realistic Agentic LLM Routing

TwinRouterBench:面向现实智能体LLM路由的快速静态与实时动态评估

Pei Yang, Wanyi Chen, Tongyun Yang, Pengbin Feng, Jiarong Xing, Wentao Guo, Yuhang Yao, Yuhang Han, Hanchen Li, Xu Wang, Zeyu Wang, Jie Xiao, Anjie Yang, Liang Tian, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学) Independent Researcher(独立研究者) University of Southern California(南加州大学) Rice University(Rice大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) University of the Chinese Academy of Sciences(中国科学院大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出TwinRouterBench基准,通过静态轨迹级前缀和动态智能体执行两轨,实现无需在线LLM评判的步骤级路由评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12316 2026-05-25 cs.AI cs.CL cs.CY cs.GT cs.MA 62%

GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory

GT-HarmBench:通过博弈论视角评估AI安全风险

Pepijn Cobben, Xuanqiang Angelo Huang, Thao Amelia Pham, Isabel Dahlgren, Terry Jingchen Zhang, Zhijing Jin

机构 * ETH Zürich(苏黎世联邦理工学院) Berea College(贝雷学院) University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(图宾根德国智能系统马克斯·普朗克研究所)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 提出GT-HarmBench基准,包含1535个高风险场景,基于博弈论结构(如囚徒困境、猎鹿博弈、斗鸡博弈)评估前沿AI模型在多智能体环境中的安全风险,发现模型在38%的高风险案例中未能选择对社会有益的行为,并验证了博弈论干预可提升18%的社会有益结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14642 2026-05-25 cs.CL 57%

Speak-to-Structure: Evaluating LLMs in Open-domain Natural Language-Driven Molecule Generation

Speak-to-Structure:评估大语言模型在开放域自然语言驱动的分子生成中的表现

Jiatong Li, Junxian Li, Weida Wang, Yunqing Liu, Changmeng Zheng, Yatao Bian, Dongzhan Zhou, Xiao-yong Wei, Qing Li

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 提出Speak-to-Structure基准,通过分子编辑、优化和定制生成任务评估大语言模型在开放域自然语言驱动分子生成中的创造性能力,并引入OpenMolIns指令微调数据集使Llama3.1-8B超越GPT-4o等模型。

Comments Accepted by KDD 2026. Our codes and datasets are fully accessible through the https://github.com/phenixace/S2-TOMG-Bench and https://huggingface.co/datasets/phenixace/S2-TOMG-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 仓库级理解 5 篇

2605.14634 2026-05-25 cs.SE 70%

Documentation-Guided Agentic Codebase Migration from C to Rust

文档引导的从 C 到 Rust 的智能代码库迁移

Minh Le-Anh, Anh Nguyen Hoang, Bach Le, Nghi D. Q. Bui

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 提出 RustPrint 框架,通过文档引导的智能体协调,实现仓库级别的 C 到 Rust 迁移,在编译性、特征保留和测试通过率上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17119 2026-05-25 cs.LG cs.AI 62%

Diffusion and Flow Matching Models for Tabular Data: A Survey

表格数据的扩散与流匹配模型:综述

Zhong Li, Qi Huang, Lincen Yang, Jiayang Shi, Zhao Yang, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen

机构 * Great Bay University(大湾大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) LIACS, Leiden University(莱顿大学LIACS)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了扩散模型和流匹配模型在表格数据生成、缺失值填补、可信数据生成和异常检测等任务中的应用,分析了数据工程挑战、设计选择、评估维度及开放问题。

Comments We substantially updated the previous version "Diffusion Models for Tabular Data: Challenges, Current Progress, and Future Directions" by including flow matching models for tabular data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20102 2026-05-25 cs.LG cs.AI 62%

BarrierSteer: LLM Safety via Learning Barrier Steering

BarrierSteer: 通过学习障碍引导实现大语言模型安全

Thanh Q. Tran, Arun Verma, Kiwan Wong, Bryan Kian Hsiang Low, Daniela Rus, Wei Xiao

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联合研究中心) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Worcester Polytechnic Institute(沃斯堡理工学院)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 提出 BarrierSteer 框架,通过将学习到的非线性安全约束作为控制障碍函数嵌入潜在表示空间,在推理时引导模型生成安全内容,理论保证且不修改模型参数。

Comments This paper introduces SafeBarrier, a framework that enforces safety in large language models by steering their latent representations with control barrier functions during inference, reducing adversarial and unsafe outputs

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23191 2026-05-25 cs.LG cs.IR cs.NA math.NA 57%

Expand More, Shrink Less: Shaping Effective-Rank Dynamics for Dense Scaling in Recommendation

扩展更多,收缩更少:塑造有效秩动态以实现推荐中的密集扩展

Guoming Li, Shangyu Zhang, Junwei Pan, Wentao Ning, Jin Chen, Gengsheng Xue, Chao Zhou, Shudong Huang, Haijie Gu, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Tencent Inc.(腾讯公司) Tencent Inc. Shenzhen China(腾讯公司深圳中国)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 针对推荐模型扩展中的嵌入坍缩问题,提出RankElastor架构,通过参数化全混合和GLU改进的P-FFN模块缓解有效秩的阻尼振荡,提升表示表达能力并实现稳健扩展。

Comments Accepted at the 32st ACM SIGKDD Conference on Knowledge Discovery and Data Mining (Research Track), KDD 2026 February Cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22968 2026-05-25 q-bio.QM cs.LG stat.ML 57%

Uncertainty-aware classification and triage of structural heart disease using electrocardiography and echocardiography metrics

基于心电图和超声心动图指标的结构性心脏病不确定性感知分类与分诊

Mitchel J. Colebank

机构 * Department of Mathematics, University of South Carolina(南卡罗来纳大学数学系)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本研究利用贝叶斯神经网络对心电图和超声心动图数据进行不确定性感知分类,以改进结构性心脏病的筛查和分诊。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏