arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-26 至 2026-05-26 共收录 7 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 7 篇

2502.11167 2026-05-26 cs.LG cs.CL 62%

SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors

SURGE: 大型语言模型作为通用代理代码执行器的潜力

Bohan Lyu, Siqiao Huang, Zichen Liang

机构 * Department of Computer Science and Technology, Tsinghua(清华大学计算机科学与技术系) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua(清华大学交叉信息研究院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.LG

AI总结 提出SURGE基准,包含1160个问题覆盖8个关键方面,通过评估21个开源和专有LLM,研究其作为代码执行预测代理模型的可行性、扩展律、数据效率和预测准确性。

Journal ref Proceedings of The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24298 2026-05-26 cs.CR cs.AI cs.LG 62%

An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods

LLM生成代码安全性的提示方法实证评估

Mohammed Kharma, Ahmed Sabbah, Mohammad Alkhanafseh, Mohammad Hammoudeh, David Mohaisen

机构 * Department of Computer Science, Birzeit University(计算机科学系,巴勒斯坦比泽大学) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) University of Central Florida(中央佛罗里达大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 通过跨5个LLM和4种编程语言的实证评估,提出弱点感知零样本链式思考(WA-0CoT)提示策略,发现提示方法虽影响弱点类别分布,但无法显著降低漏洞频率或密度。

Comments 40 pages, 22 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09179 2026-05-26 cs.AI 57%

Hide-and-Shill: A Reinforcement Learning Framework for Market Manipulation Detection in Symphony-a Decentralized Multi-Agent System

Hide-and-Shill:面向交响乐系统中市场操纵检测的强化学习框架——一个去中心化多智能体系统

Ronghua Shi, Yiou Liu, Yuchun Feng, Lynn Ai, Bill Shi, Zhuang Liu

机构 * Department of Information Systems, City University of Hong Kong(香港城市大学信息系统系) Business School, University of New South Wales(新南威尔士大学商学院) Division of Engineering Science, University of Toronto(多伦多大学工程科学系) ProphetAI Data Technology Co., Ltd.(ProphetAI数据技术有限公司) Gradient, 3 FRASER STREET DUO TOWER, SINGAPORE(Gradient新加坡办公室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出一个多智能体强化学习框架,通过动态对抗博弈建模操纵者与检测者的交互,利用延迟代币价格反应识别可疑模式,并集成GRPO、理论奖励函数和多模态智能体管道,在去中心化交响乐系统中实现无需中心化预言机的鲁棒操纵检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00176 2026-05-26 cs.CL 57%

The LSCD Benchmark: a Testbed for Diachronic Word Meaning Tasks

LSCD基准:一个用于历时词义任务的测试平台

Dominik Schlechtweg, Sachin Yadav, Jonas Kuhn, Nikolay Arefyev

机构 * University of Stuttgart(斯图加特大学) University of Oslo(奥斯陆大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 针对词汇语义变化检测任务中评估标准不统一的问题,提出一个标准化基准库,通过模块化设计支持WiC、WSI和LSCD子任务的评估与组合。

Comments *SEM, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12850 2026-05-26 cs.CL cs.AI cs.CR cs.LG 56%

Persona-Model Collapse in Emergent Misalignment

涌现性失调中的人格模型崩溃

Davi Bastos Costa, Renato Vicente

机构 * TELUS Digital Research Hub(TELUS数字研究中心) Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所) University of São Paulo(圣保罗大学)

专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 提出人格模型崩溃假说,通过道德易感性(S)和道德稳健性(R)两个指标,证明在有害数据上微调大语言模型会导致模型模拟、区分和维持一致角色的内部能力恶化,从而引发涌现性失调。

Comments 23 pages, 7 figures, 7 tables; NeurIPS 2026 submission; Corrected code repository URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17287 2026-05-26 cs.CV 50%

LISA: Language-guided Interference-aware Spatial-Frequency Attention for Driver Gaze Estimation

LISA: 语言引导的干扰感知空间-频率注意力用于驾驶员视线估计

Jun Ma, Zhenye Yang, Ruichen Zhou, Pei Zhang, Huan Li, Jinpeng Chen

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院(国家级试点软件工程学院)) Key Laboratory of Trustworthy Distributed Computing and Service (BUPT), Ministry of Education(教育部可信分布式计算与服务重点实验室(BUPT)) School of Electrical Engineering, Guangxi University(广西大学电气工程学院) Zhejiang University(浙江大学)

专题命中 代码评测 :repository(abstract)

AI总结 提出LISA框架,结合频域先验与视觉语言知识,通过双域融合机制和训练时解耦策略,实现鲁棒的驾驶员视线估计,在遮挡和光照变化下达到最优性能。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24134 2026-05-26 cs.MA 50%

ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents

ProofAgent Harness:用于AI智能体对抗性评估的开放基础设施

Fouad Bousetouane

专题命中 代码评测 :code generation(abstract)

AI总结 提出ProofAgent Harness开放基础设施,通过对抗性多轮试验、轨迹捕获和多评委评分,实现可扩展、可审计的AI智能体对抗性评估。

Comments 48 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏