arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-18 至 2026-08-18 共收录 49 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 9 篇

2608.15931 2026-08-18 cs.CL 新提交 57%

PLSQLBench: Benchmarking LLM Systems for Executable Procedural Database Programming

PLSQLBench:面向可执行过程式数据库编程的大语言模型系统基准测试

Marianne Menglin Liu, Leonid Boytsov, Daniel W. Peterson, Pramuditha Perera, Rongguang Wang, Sai Ashish Somayajula, Syed Hamza Rafique, Rohit Saini, Shubham Pathak, Sujeeth Bharadwaj, Tao Sheng, Graham Horwood, Fahad Shah, Ankan Bansal, Sujith Ravi, Dan Roth

机构 * Oracle AI, Turing Enterprise Inc(Oracle AI 图灵企业公司)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本研究提出首个过程式数据库编程基准PLSQLBench,含2865个任务实例,经8个LLM实验发现其在多方面存在困难,工具增强智能体性能有提升但仍有差距,凸显了传统基准未覆盖的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15250 2026-08-18 cs.SE 新提交 57%

Comparing Domain-Model Similarity Metrics Against Human Expert Ratings

对比领域模型相似度指标与人类专家评分

Vasiliy Seibert

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文实现5种领域模型相似度指标,对比其与39组领域模型的人类专家评分,发现无单一指标在所有标准占优,集成多指标或可替代人类专家评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-18 cs.AI 版本更新 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: this https URL (https://electronicarts.github.io/AutoWorldModelBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17216 2026-08-18 cs.AI 版本更新 57%

ML-AutoResearch: Training Machine Learning Research Agents with Automatically Generated Environments

通过合成任务扩展实现AI科学家

Ziyang Cai, Amir Saeidi, Harkirat Behl

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15205 2026-08-18 math.DG 新提交 50%

Geometric turbulence: a geodesic-regression crisis indicator for equity covariance dynamics, with evidence from African markets

几何湍流:用于股权协方差动态的测地回归危机指标——来自非洲市场的证据

E. B. Camara, Y. U. Gaba, I. G. M. Nsiloulou

专题命中 代码评测 :repository(abstract)

AI总结 该研究提出一种基于对称正定锥测地回归的几何湍流指标,可准确识别市场压力事件,其预测性能优于传统欧氏回归,对应的去风险策略能降低最大回撤。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 仓库级理解 14 篇

2608.10450 2026-08-18 cs.SE cs.AI cs.MA cs.NE 版本更新 73%

Persistent Recursive Worlds Enable Autonomous Software Evolution

持久递归世界支持自主软件演化

Beichen Huang, Zhenyu Liang, Bowen Zheng, Ran Cheng

专题命中 仓库级理解 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 该研究提出 Genesis 框架,以持久递归世界替代持久智能体,成功构建 C 编译器、重实现 MESA 模块,实现长周期软件开发并获显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07449 2026-08-18 cs.IR cs.AI cs.CL 版本更新 73%

LlamaRec-LKG-RAG: A Single-Pass, Learnable Knowledge Graph-RAG Framework for LLM-Based Ranking

LlamaRec-LKG-RAG:一种用于基于大语言模型的排序的单遍可学习知识图谱-RAG框架

Vahid Azizi, Fatemeh Koochaki

专题命中 仓库级理解 :repository(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究提出LlamaRec-LKG-RAG框架,将个性化知识图谱上下文集成到LLM推荐排序中,经ML-100K等数据集实验,在MRR等指标上较LlamaRec取得提升,为知识感知个性化推荐奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14945 2026-08-18 cs.AI cs.CL 新提交 62%

Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

信任并不足够:智能体强化学习中策略内自蒸馏的影响校准

Qizhen Lan, Xi Xiao, Xiangchen Guan, Mengchen Fan, Moule Lin, Jung Im Choi, Lijing Zhu

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI

AI总结 针对策略内自蒸馏的信任-效用不匹配问题,提出ICSD方法,在多基准任务上提升语言智能体性能,降低反向令牌的教师支持占比并提高梯度兼容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16262 2026-08-18 cs.SE 新提交 57%

Implicit, Yet Impactful: Understanding Hidden Dependencies in Java Projects

隐式却影响重大:理解Java项目中的隐藏依赖关系

Lyuye Zhang, Chengwei Liu, Fangyuan Zhang, Yiran Zhang, Yuan Zhou, Yang Liu

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本研究针对Java项目的隐式依赖问题,构建含1157个库、19812个版本及972个模块的数据集,量化其影响并分析应对措施,为开源生态系统提供解决方案。

Comments 13 pages, ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16112 2026-08-18 cs.SE 新提交 57%

Strategic Technical Debt: A Real Options Approach to Early-Stage Software Experimentation

策略性技术债务:早期软件实验的实物期权方法

Rashid Azarang, Mohammad Reza Azarang Esfandiari

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文将早期软件实验中刻意产生的技术债务视为看涨期权,明确策略性与有毒债务的边界,构建序贯模型得出关键结论,并开展两项预注册实证检验。

Comments 25 pages, 4 figures. Pre-registered empirical program: OSF bs3cr (EP3'), rvx5t (EP-Pi)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15881 2026-08-18 cs.LG cs.CE 新提交 57%

Deploying Frontier Agentic Technology in MOOSEnger, a Multiphysics-Capable AI Assistant

在多物理场AI助手MOOSEnger中部署前沿智能体技术

Zaid Abulawi, Mengnan Li, Guillaume Giudicelli, Yang Liu, Cody Permann

机构 * Texas A&M University (TAMU)(德克萨斯农工大学) Idaho National Laboratory (INL)(爱达荷国家实验室)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本研究为面向MOOSE框架的AI智能体MOOSEnger扩展本地托管模型管控层,经多类工程任务测试,MOOSEnger-GPT-5.2成功率达90%,凸显智能体管控层对多物理场仿真的支撑价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15102 2026-08-18 cs.CL 新提交 57%

A Declarative-Procedural Perspective on Expert Routing in Bilingual Mixture-of-Experts Language Models

双语混合专家语言模型中专家路由的声明式-过程式视角

Amrit Gopinath (1), Raghul (1), Durairaj Thenmozhi (2) ((1) Sri Sivasubramaniya Nadar College of Engineering, Chennai, India, (2) Shiv Nadar University Chennai, India)

机构 * Sri Sivasubramaniya Nadar College of Engineering(斯里·西瓦苏布拉马尼亚·纳达尔工程学院) Shiv Nadar University Chennai(钦奈希夫·纳达尔大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL

AI总结 该研究探究双语MoE语言模型的专家路由是否形成语言结构,对比课程学习与无课程训练的模型,发现无课程模型专业化更强但依赖随机种子,课程模型路由更均衡,揭示MoE路由可出现可解释语言组织。

Comments 15 pages, 6 figures, 12 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28850 2026-08-18 cs.LG q-fin.CP 版本更新 57%

Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents

表示签名与LLM交易智能体中的风险反馈对齐

Weicheng Xue

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 通过TradeArena测试平台研究LLM交易智能体在金融决策中的行为对齐与表示动态,发现故障前表示签名(规划嵌入漂移、流形有效秩收缩)并验证风险反馈作为外部对齐信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10023 2026-08-18 cs.LG 版本更新 57%

Model Inversion Attacks: A Survey of Approaches and Countermeasures

模型反演攻击:方法与对策综述

Zhanke Zhou, Jianing Zhu, Fengfei Yu, Xuan Li, Xiong Peng, Tongliang Liu, Bo Han

机构 * Hong Kong Baptist University(香港 Baptist 大学) The University of Sydney(悉尼大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本综述针对模型反演攻击,综合分析其在多领域的有效性及神经网络的脆弱性,对比攻击与防御的多维度要素,明确建模与优化挑战并维护相关研究知识库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00971 2026-08-18 cs.CV cs.AI 版本更新 57%

MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4

MiniGPT-反向设计:利用MiniGPT-4预测图像调整

Vahid Azizi, Fatemeh Koochaki

专题命中 仓库级理解 :repository(abstract);分类 cs.AI

AI总结 本文通过扩展和微调MiniGPT-4,使其可应用于给定源图像、编辑后图像及可选文本描述来预测图像编辑操作与参数的反向设计任务,验证了现成VLMs在复杂多模态任务中的可扩展性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15455 2026-08-18 stat.ME 新提交 50%

Competing-Risk Cure Models: A Five-Axis Systematic Review of Methodological Literature

竞争风险治愈模型:方法学文献的五轴系统综述

Nilotpal Sanyal

专题命中 仓库级理解 :repository(abstract)

AI总结 本文对26篇竞争风险治愈模型的方法学文献从五个维度进行系统综述,明确模型分类与差异,指出可重复性不足问题,为模型选择与相关研究提供支持。

Comments 34 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16418 2026-08-18 physics.chem-ph physics.atom-ph 新提交 50%

ChemReporter: A Framework for Curating and Exporting Large-Scale Chemical Datasets for MLIP Training

ChemReporter:用于整理和导出用于MLIP训练的大规模化学数据集的框架

Marie Bluntzer, Jules Tilly, Christoph Brunken

专题命中 仓库级理解 :repository(abstract)

AI总结 ChemReporter是一款模块化框架,可将异构大规模化学数据集转为统一可查询格式,经处理、查询、导出三个阶段生成MLIP可用训练数据,支持处理超内存规模数据集,已在GitHub和PyPI发布。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00446 2026-08-18 quant-ph 版本更新 50%

Identifying vulnerable nodes and detecting malicious entanglement patterns to handle st-connectivity attacks in quantum networks

识别脆弱节点并检测恶意纠缠模式以应对量子网络中的st连通性攻击

Iain Burge, Michel Barbeau, Joaquin Garcia-Alfaro

专题命中 仓库级理解 :repository(abstract)

AI总结 本文提出量子方法用于识别量子网络中维持目标连接的重要节点,并利用量子支持向量机检测恶意纠缠攻击,提升量子网络安全性。

Comments 13 pages, 6 figures, 8 sections, 50 references. Revised and extended version of a paper that appeared in the proceedings of the 40th IFIP International Conference on ICT Systems Security and Privacy Protection (IFIP SEC 2025), Maribor, Slovenia, May 21-23, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07833 2026-08-18 quant-ph cond-mat.stat-mech 版本更新 50%

Symbolic operator growth and recursion method for spin-S Ising and q-states Potts models

自旋-S伊辛模型与q态波茨模型的符号算子增长与递归方法

Igor Ermakov

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究通过符号算子增长与递归方法,精确计算了不同维度自旋-$S$伊辛模型和$q$态波茨模型的自关联函数矩,验证了通用算子增长假说,为无限温度自旋动力学的准经典方法提供了依据。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏