arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-26 至 2026-05-26 共收录 43 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 7 篇

2502.11167 2026-05-26 cs.LG cs.CL 62%

SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors

SURGE: 大型语言模型作为通用代理代码执行器的潜力

Bohan Lyu, Siqiao Huang, Zichen Liang

机构 * Department of Computer Science and Technology, Tsinghua(清华大学计算机科学与技术系) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua(清华大学交叉信息研究院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.LG

AI总结 提出SURGE基准,包含1160个问题覆盖8个关键方面,通过评估21个开源和专有LLM,研究其作为代码执行预测代理模型的可行性、扩展律、数据效率和预测准确性。

Journal ref Proceedings of The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24298 2026-05-26 cs.CR cs.AI cs.LG 62%

An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods

LLM生成代码安全性的提示方法实证评估

Mohammed Kharma, Ahmed Sabbah, Mohammad Alkhanafseh, Mohammad Hammoudeh, David Mohaisen

机构 * Department of Computer Science, Birzeit University(计算机科学系,巴勒斯坦比泽大学) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) University of Central Florida(中央佛罗里达大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 通过跨5个LLM和4种编程语言的实证评估,提出弱点感知零样本链式思考(WA-0CoT)提示策略,发现提示方法虽影响弱点类别分布,但无法显著降低漏洞频率或密度。

Comments 40 pages, 22 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09179 2026-05-26 cs.AI 57%

Hide-and-Shill: A Reinforcement Learning Framework for Market Manipulation Detection in Symphony-a Decentralized Multi-Agent System

Hide-and-Shill:面向交响乐系统中市场操纵检测的强化学习框架——一个去中心化多智能体系统

Ronghua Shi, Yiou Liu, Yuchun Feng, Lynn Ai, Bill Shi, Zhuang Liu

机构 * Department of Information Systems, City University of Hong Kong(香港城市大学信息系统系) Business School, University of New South Wales(新南威尔士大学商学院) Division of Engineering Science, University of Toronto(多伦多大学工程科学系) ProphetAI Data Technology Co., Ltd.(ProphetAI数据技术有限公司) Gradient, 3 FRASER STREET DUO TOWER, SINGAPORE(Gradient新加坡办公室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出一个多智能体强化学习框架,通过动态对抗博弈建模操纵者与检测者的交互,利用延迟代币价格反应识别可疑模式,并集成GRPO、理论奖励函数和多模态智能体管道,在去中心化交响乐系统中实现无需中心化预言机的鲁棒操纵检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00176 2026-05-26 cs.CL 57%

The LSCD Benchmark: a Testbed for Diachronic Word Meaning Tasks

LSCD基准:一个用于历时词义任务的测试平台

Dominik Schlechtweg, Sachin Yadav, Jonas Kuhn, Nikolay Arefyev

机构 * University of Stuttgart(斯图加特大学) University of Oslo(奥斯陆大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 针对词汇语义变化检测任务中评估标准不统一的问题,提出一个标准化基准库,通过模块化设计支持WiC、WSI和LSCD子任务的评估与组合。

Comments *SEM, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12850 2026-05-26 cs.CL cs.AI cs.CR cs.LG 56%

Persona-Model Collapse in Emergent Misalignment

涌现性失调中的人格模型崩溃

Davi Bastos Costa, Renato Vicente

机构 * TELUS Digital Research Hub(TELUS数字研究中心) Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所) University of São Paulo(圣保罗大学)

专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 提出人格模型崩溃假说,通过道德易感性(S)和道德稳健性(R)两个指标,证明在有害数据上微调大语言模型会导致模型模拟、区分和维持一致角色的内部能力恶化,从而引发涌现性失调。

Comments 23 pages, 7 figures, 7 tables; NeurIPS 2026 submission; Corrected code repository URL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17287 2026-05-26 cs.CV 50%

LISA: Language-guided Interference-aware Spatial-Frequency Attention for Driver Gaze Estimation

LISA: 语言引导的干扰感知空间-频率注意力用于驾驶员视线估计

Jun Ma, Zhenye Yang, Ruichen Zhou, Pei Zhang, Huan Li, Jinpeng Chen

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院(国家级试点软件工程学院)) Key Laboratory of Trustworthy Distributed Computing and Service (BUPT), Ministry of Education(教育部可信分布式计算与服务重点实验室(BUPT)) School of Electrical Engineering, Guangxi University(广西大学电气工程学院) Zhejiang University(浙江大学)

专题命中 代码评测 :repository(abstract)

AI总结 提出LISA框架,结合频域先验与视觉语言知识,通过双域融合机制和训练时解耦策略,实现鲁棒的驾驶员视线估计,在遮挡和光照变化下达到最优性能。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24134 2026-05-26 cs.MA 50%

ProofAgent Harness: Open Infrastructure for Adversarial Evaluation of AI Agents

ProofAgent Harness:用于AI智能体对抗性评估的开放基础设施

Fouad Bousetouane

专题命中 代码评测 :code generation(abstract)

AI总结 提出ProofAgent Harness开放基础设施,通过对抗性多轮试验、轨迹捕获和多评委评分,实现可扩展、可审计的AI智能体对抗性评估。

Comments 48 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 仓库级理解 6 篇

2505.18190 2026-05-26 eess.SP cs.AI cs.LG 62%

PhySense: Sensor Placement Optimization for Accurate Physics Sensing

PhySense:面向精确物理感知的传感器布局优化

Yuezhou Ma, Haixu Wu, Hang Zhou, Huikun Weng, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院,BNRist,清华大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 提出PhySense两阶段框架,通过流生成模型和投影梯度下降联合优化传感器布局与物理场重建,实现高精度物理感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04363 2026-05-26 cs.LG cs.AI 62%

Mitigating Label Shift in Tabular In-Context Learning via Test-Time Posterior Adjustment

通过测试时后验调整缓解表格上下文学习中的标签偏移

Seunghan Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 针对TabPFN在表格数据上下文学习中对标签偏移敏感的问题,提出DistPFN方法,通过测试时后验调整重新缩放类别概率,无需修改架构或额外训练,在250多个OpenML数据集上显著提升分类性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24366 2026-05-26 cs.CL cs.LG 62%

Structure-Aware RAG: Structured Retrieval Augmented Generation from Noisy Data for Conversational Agents

结构感知检索增强生成:面向对话代理的噪声数据结构化检索增强生成

Kaiqiao Han, LuAn Tang, Renliang Sun, Peng Yuan, Wei Cheng, Haoyu Wang, Wei Wang, Yizhou Sun, Haifeng Chen

机构 * UCLA(加州大学洛杉矶分校) NEC Labs(日本电装实验室)

专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.LG

AI总结 提出结构感知检索增强生成(SA-RAG),通过表格作为中间结构化表示来减少噪声并保留关键信息,结合质量感知的表格元数据生成框架和优化方法,在噪声真实数据集上显著优于现有RAG基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09084 2026-05-26 cs.LG cs.AI 62%

PageLLM: A Multi-Grained Reward Framework for Whole-Page Optimization with Large Language Models

PageLLM:面向整页优化的大语言模型多粒度奖励框架

Xinyuan Wang, Liang Wu, Dongjie Wang, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Nokia(诺基亚) University of Kansas(堪萨斯大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG

AI总结 针对整页优化中人工标注成本高和页面级连贯性与项目级放置粒度不匹配的问题,提出PageLLM框架,通过将隐式反馈解耦为粗粒度页面级奖励和细粒度项目级奖励,结合PPO的RLHF进行微调,显著提升排序性能并在线上部署中取得收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25890 2026-05-26 cs.LG 57%

Merge-Bench: Resolve Merge Conflicts with Large Language Models

Merge-Bench: 使用大型语言模型解决合并冲突

Benedikt Schesch, Michael D. Ernst

机构 * Amazon(亚马逊) University of Washington(华盛顿大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本文构建了包含7938个真实合并冲突的数据集Merge-Bench,并利用组相对策略优化(GRPO)训练LLMergeJ模型,在Java程序上以14B参数超越多数商业LLM,但最佳模型正确解决率仍低于60%。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24706 2026-05-26 cs.DB q-bio.BM q-bio.MN 50%

MetaboKG: An Analysis-centric Knowledge Graph Framework for Untargeted Metabolomics

MetaboKG:面向非靶向代谢组学的分析中心知识图谱框架

Matthieu Féraud, Dina Boukhajou, Fabien Gandon, Louis-Félix Nothias

专题命中 仓库级理解 :repository(abstract)

AI总结 提出MetaboKG框架,通过转换工作流、语义模型和通用注释标识符策略,整合公共存储库中的代谢组学数据,支持可追溯的注释复用和可重复的SPARQL查询。

详情

展开后加载摘要…

URL PDF HTML 收藏