arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2606.15385 2026-06-16 cs.AI 新提交 57%

Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

语言模型智能体中的奖励黑客:重新审视AI安全网格世界

Ömer Veysel Çağatan, Xuandong Zhao

机构 * KUIS AI Center, Koç University(科奇大学KUIS人工智能中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本研究将AI安全网格世界框架改编为文本评估套件,发现语言模型在零样本下出现规范博弈,通过直接奖励优化扩大观察与隐藏奖励差距,且标准缓解措施无效。

Comments 28 pages, 16 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13192 2026-06-12 cs.AI 新提交 57%

Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach

基于多模态大语言模型的移动用户体验推理:任务、基准与方法

Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao

机构 * Ant Group(蚂蚁集团)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。

Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09059 2026-06-11 cs.SE 版本更新 57%

Evaluating LLM-Generated Code: A Benchmark and Developer Study

评估大语言模型生成的代码:一个基准和开发者研究

Joanna Szych, Anne Schwerk

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文提出了一种定制的树折评估方法,用于评估大语言模型生成的代码,弥补了现有基准在代码质量和可操作性方面的不足,并通过对比三个通用大语言模型展示了其有效性。

Comments Accepted for publication at EASE '26/EQUISA workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10255 2026-06-10 eess.IV cs.CV cs.DL cs.LG physics.bio-ph 新提交 57%

POPSICLE: Benchmark Datasets for Segmentation and Localization in CryoET

POPSICLE: 用于冷冻电镜断层扫描中分割和定位的基准数据集

Jonathan Schwartz, Utz Heinrich Ermel, C. Braxton Owens, Zhuowen Zhao, Ariana Peck, Gus L. W. Hart, Grant J. Jensen, Bridget Carragher, Dari Kimanius

机构 * Biohub Brigham Young University

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出POPSICLE基准套件,基于CryoET数据门户构建,涵盖真核和原核系统、纯化与原位样本,支持体素分割和稀疏定位任务,旨在解决冷冻电镜断层扫描中缺乏标准化基准的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08976 2026-06-09 cs.AI 新提交 57%

RTL-BenchLS: A Large-Scale Benchmark for RTL Reasoning and Generation with Large Language Models

RTL-BenchLS:面向大语言模型的RTL推理与生成的大规模基准

Jing Wang, Shang Liu, Wenji Fang, Yuchao Wu, Yugao Zhu, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出大规模基准RTL-BenchLS,包含超1万个形式验证的Verilog设计,并引入三项自监督推理任务,解决现有基准规模小、任务单一的问题,评估显示当前最佳模型性能较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06662 2026-06-08 cs.SE 新提交 57%

AutoPipelineAI: Context-Aware CI/CD Pipeline Generation from Natural Language

AutoPipelineAI: 基于自然语言的上下文感知CI/CD流水线生成

Youssef Mohamed Aboelfotoh, Mohamed Ahmed Hemdan, Mohammad El-Ramly, Khlood Hassan, Mahmoud Saleh Saad, Ahmed Mohamed Tolba, Seif Gamal Abdelmonem

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 提出AutoPipelineAI系统,利用大语言模型从自然语言描述生成CI/CD流水线配置,集成仓库感知分析、自动验证和反馈机制,降低DevOps配置复杂度。

Comments 7 pages, 1 figure, 6 tables, 16 references, IMSA Conference 11-12 July 2026, International Conference on Intelligent Methods, Systems, and Applications 2026 #70415,

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05525 2026-06-05 cs.AI cs.HC 57%

SciVisAgentSkills: Design and Evaluation of Agent Skills for Scientific Data Analysis and Visualization

SciVisAgentSkills:面向科学数据分析和可视化的智能体技能设计与评估

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Shusen Liu, Chaoli Wang

机构 * Univ. Notre Dame(诺丁汉大学) LLNL(劳伦斯利弗莫尔国家实验室)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 提出SciVisAgentSkills技能库,通过编码环境假设、工具使用模式和领域启发式知识增强编码智能体,在ParaView等科学工具上实现自然语言驱动的科学可视化工作流,实验表明技能可提升任务得分并影响token效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06911 2026-06-04 cs.CR cs.AI 57%

TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering

TamperBench:系统化压力测试微调和篡改下的LLM安全性

Saad Hossain, Tom Tseng, Punya Syon Pandey, Samanvay Vajpayee, Matthew Kowal, Nayeema Nonta, Samuel Simko, Stephen Casper, Zhijing Jin, Kellin Pelrine, Sirisha Rambhatla

机构 * Critical ML Lab Waterloo Canada(Waterloo大学Critical ML实验室) FAR.AI Berkeley USA(伯克利美国FAR.AI公司) University of Toronto Toronto Canada(多伦多大学) University of Waterloo Waterloo Canada(Waterloo大学) ETH Zürich Zürich Switzerland(苏黎世联邦理工学院) MIT CSAIL Cambridge USA(麻省理工学院CSAIL实验室) University of Toronto, MPI, EuroSafeAI, Vector Institute Toronto Canada(多伦多大学、马克斯·普朗克研究所、EuroSafeAI、Vector Institute) Critical ML Lab University of Waterloo Waterloo Canada(Waterloo大学Critical ML实验室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出统一框架TamperBench,通过系统化超参数扫描评估21个开源LLM在9种篡改威胁下的安全性和实用性,发现越狱微调是最严重攻击,当前对齐阶段防御基本失效。

Comments 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03657 2026-06-03 cs.AI 57%

Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition

诊断大语言模型工具使用中的知识缺口:面向新API获取的智能体基准

Jinnuo Liu, Yue Peng, Jinhan Niu, Hongyi Wen

机构 * NYU Shanghai(纽约大学上海分校)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 提出 NovelAPIBench 基准,通过动态发现新API、分解知识包并生成可执行任务,诊断模型在API使用中的六类错误,发现检索与参数调优互补。

Comments 37 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03130 2026-06-03 cs.LG 57%

Synthetic Hallucinations, Real Gains: Hard Negatives from Frontier Models for FIM Hallucination Mitigation

合成幻觉,真实收益:来自前沿模型的硬负样本用于FIM幻觉缓解

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

专题命中 代码评测 :code model(abstract);分类 cs.LG

AI总结 针对小型开源代码模型在IDE自动补全中产生的填充中间(FIM)幻觉问题,提出一种无需执行的替代方法:利用前沿代码模型合成看似合理但错误的补全作为硬负样本,通过对比合成幻觉与真实开发者编辑的差异作为监督微调信号,在Delulu基准上提升精确匹配18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02603 2026-06-03 cs.CV cs.LG 57%

COD10K-C: Benchmarking Robustness of Camouflaged Object Detection Under Natural Image Corruptions

COD10K-C:自然图像损坏下伪装目标检测的鲁棒性基准测试

Arafat Hossain Sayem

机构 * CSE, Bangladesh University of Engineering and Technology(孟加拉国工程与技术大学计算机科学与工程系)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出COD10K-C基准,包含8种损坏类型和5个严重级别,评估伪装目标检测模型在损坏图像上的性能,并引入轻量级模型RobustCODLite,通过损坏增强、频率先验分支和不确定性一致性损失,在损坏条件下保持较高Dice分数。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16014 2026-06-03 cs.CL 57%

Ranking Free RAG: Replacing Re-ranking with Selection in RAG for Sensitive Domains

无排序RAG:用选择替代重排序以应用于敏感领域

Yash Saxena, Ankur Padia, Mandar S Chaudhary, Kalpa Gunaratna, Srinivasan Parthasarathy, Manas Gaur

机构 * University of Washington(华盛顿大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 提出METEORA框架,通过DPO微调LLM生成检索理由、统计肘部检测自适应截断和验证器过滤,在敏感领域实现可解释、高效且鲁棒的证据选择,无需重排序。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03386 2026-06-03 cs.LG 57%

Annot-Mix: Learning with Noisy Class Labels from Multiple Annotators via a Mixup Extension

Annot-Mix: 通过混合扩展从多个标注者学习带噪声类别标签

Marek Herde, Lukas Lührs, Denis Huseljic, Bernhard Sick

机构 * University of Kassel(卡塞尔大学) European Conference on Artificial Intelligence(欧洲人工智能会议) Conference on Prestigious Applications of Intelligent Systems(智能系统 prestigious 应用会议)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 提出Annot-Mix框架,通过扩展mixup处理多标注者提供的类别标签,在11个数据集上优于11种现有方法。

Comments 9 pages, 8 figures, 4 tables; post-publication arXiv version with minor editorial corrections; methodology, results, and conclusions unchanged

Journal ref ECAI 2024: 27th European Conference on Artifical Intelligence, IOS Press, pp. 2910-2918, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14725 2026-06-02 q-bio.GN cs.LG stat.AP 57%

HR-VILAGE-3K3M: A Human Respiratory Viral Immunization Longitudinal Gene Expression Dataset for Systems Immunity

HR-VILAGE-3K3M:用于系统免疫学的人类呼吸道病毒免疫纵向基因表达数据集

Xuejun Sun, Yiran Song, Xiaochen Zhou, Ruilie Cai, Yu Zhang, Xinyi Li, Rui Peng, Jialiu Xie, Yuanyuan Yan, Muyao Tang, Prem Lakshmanane, Baiming Zou, James S. Hagood, Raymond J. Pickles, Didong Li, Fei Zou, Xiaojing Zheng

机构 * Department of Biostatistics University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校生物统计学系) Department of Epidemiology and Biostatistics University of South Carolina(南卡罗来纳大学流行病学与生物统计学系) Department of Pediatrics University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校儿科系) Department of Microbiology and Immunology University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校微生物学与免疫学系)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 为解决呼吸道病毒感染研究中转录组数据分散且处理不一致的问题,构建了包含3178名受试者、66项研究的HR-VILAGE-3K3M数据集,整合了疫苗接种、病毒接种和混合暴露的批量及单细胞转录组数据,并进行了统一的预处理和质量控制,以支持生物标志物发现、免疫机制研究和分析方法开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29372 2026-05-29 cs.SE 57%

On the Road to Personalized Code Intelligence: Portraiting and Assisting Developers Based on Their In-IDE Behaviors

通往个性化代码智能之路:基于IDE内行为的开发者画像与辅助

Yuhong Liu, Yunhe Su, Zhipeng Peng, Zhiwen Luo, Lin Shi, Zhi Jin, Li Zhang

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 提出VirtualME数据基础设施,通过捕获和解释开发者在IDE中的动态编程行为,构建四维开发者画像,并集成到问答代理中实现个性化代码智能,实验显示平均提升33.80%。

Comments 23 pages, 6 figures, accepted by FSE`2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28546 2026-05-28 cs.SE 57%

A Minimal Executable Proof for Multi-Language Contract Traceability

多语言合约可追溯性的最小可执行证明

Werner Kasselman

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文通过一个包含六种语言实现的DAG-TOML合约的最小可执行证明,展示了合约、实现图、可追溯性链和审查门如何通过可执行见证者进行验证。

Comments 8 pages, 0 figures; executable artifact report. Code: https://github.com/verivus-oss/agent-assurance-papers Spec: https://github.com/verivus-oss/agent-assurance

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28398 2026-05-28 cs.AI 57%

HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

HRBench:混合推理大语言模型中思维模式切换策略的基准测试与理解

Yansong Ning, Mianpeng Liu, Jingwen Ye, Weidong Zhang, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出HRBench统一评估框架,系统研究混合推理LLM中基于提示、外部路由和推测执行三类切换策略在四种训练机制下的效率-效果权衡,揭示策略选择随模型规模和任务领域的变化规律。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00575 2026-05-27 cs.CL 57%

InfoSynth: Information-Guided Benchmark Synthesis for LLMs

InfoSynth: 信息引导的大语言模型基准合成

Ishir Garg, Neel Kolhe, Xuandong Zhao, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 提出基于信息论(KL散度和熵)的InfoSynth框架,自动生成高难度、多样化的Python编程基准,97%的测试用例和解决方案准确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09179 2026-05-26 cs.AI 57%

Hide-and-Shill: A Reinforcement Learning Framework for Market Manipulation Detection in Symphony-a Decentralized Multi-Agent System

Hide-and-Shill:面向交响乐系统中市场操纵检测的强化学习框架——一个去中心化多智能体系统

Ronghua Shi, Yiou Liu, Yuchun Feng, Lynn Ai, Bill Shi, Zhuang Liu

机构 * Department of Information Systems, City University of Hong Kong(香港城市大学信息系统系) Business School, University of New South Wales(新南威尔士大学商学院) Division of Engineering Science, University of Toronto(多伦多大学工程科学系) ProphetAI Data Technology Co., Ltd.(ProphetAI数据技术有限公司) Gradient, 3 FRASER STREET DUO TOWER, SINGAPORE(Gradient新加坡办公室)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出一个多智能体强化学习框架,通过动态对抗博弈建模操纵者与检测者的交互,利用延迟代币价格反应识别可疑模式,并集成GRPO、理论奖励函数和多模态智能体管道,在去中心化交响乐系统中实现无需中心化预言机的鲁棒操纵检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00176 2026-05-26 cs.CL 57%

The LSCD Benchmark: a Testbed for Diachronic Word Meaning Tasks

LSCD基准:一个用于历时词义任务的测试平台

Dominik Schlechtweg, Sachin Yadav, Jonas Kuhn, Nikolay Arefyev

机构 * University of Stuttgart(斯图加特大学) University of Oslo(奥斯陆大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 针对词汇语义变化检测任务中评估标准不统一的问题,提出一个标准化基准库,通过模块化设计支持WiC、WSI和LSCD子任务的评估与组合。

Comments *SEM, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14642 2026-05-25 cs.CL 57%

Speak-to-Structure: Evaluating LLMs in Open-domain Natural Language-Driven Molecule Generation

Speak-to-Structure:评估大语言模型在开放域自然语言驱动的分子生成中的表现

Jiatong Li, Junxian Li, Weida Wang, Yunqing Liu, Changmeng Zheng, Yatao Bian, Dongzhan Zhou, Xiao-yong Wei, Qing Li

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 提出Speak-to-Structure基准,通过分子编辑、优化和定制生成任务评估大语言模型在开放域自然语言驱动分子生成中的创造性能力,并引入OpenMolIns指令微调数据集使Llama3.1-8B超越GPT-4o等模型。

Comments Accepted by KDD 2026. Our codes and datasets are fully accessible through the https://github.com/phenixace/S2-TOMG-Bench and https://huggingface.co/datasets/phenixace/S2-TOMG-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21645 2026-05-22 cs.AI cs.DB 57%

AOP-Wiki EMOD 3.0: Data Model Expansions and Content Evaluation Framework for Using Agentic AI to Improve Integration between AOPs and New Approach Methodologies (NAMs)

AOP-Wiki EMOD 3.0: 数据模型扩展和内容评估框架用于利用代理AI改进AOP与新方法论(NAMs)之间的整合

Virginia K. Hench, J. Harry Caufield, Sierra A. T. Moxon, Jason M. O'Brien, Stephen W. Edwards

机构 * Open BioData Modeling(开放生物数据建模) Environmental Genomics and Systems Biology(环境基因组学与系统生物学) Lawrence Berkeley National Laboratory(伯克利国家实验室) National Wildlife Research Centre(国家野生动物研究中心) UL Research Institutes - Chemical Insights(UL研究机构-化学洞察)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出AOP-Wiki EMOD 3.0,通过数据模型扩展和内容评估框架,利用代理AI改进AOP与新方法论之间的整合,为监管科学和生物医学领域提供支持。

Comments 7 Figures and 3 Supplemental Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20539 2026-05-21 cs.LG 57%

OpenSeisML: Open Large-Scale Real Seismic and well-log Dataset for Generative AI

OpenSeisML: 开放式大规模真实地震和井历数据集用于生成式AI

Ipsita Bhar, Huseyin Tuna Erdinc, Thales Souza, Charles Jones, Felix J. Herrmann

机构 * Georgia Institute of Technology(佐治亚理工学院) Osokey Ltd(Osokey公司)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出OpenSeisML,一个开放的大型真实地震和井历数据集,用于支持生成式AI在地震反演中的应用,通过自动化数据整理流程提供可重复的地震数据准备,以训练生成模型捕捉地下属性的统计分布,从而生成多个统计上一致的现实实现用于不确定性量化。

Comments 5 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19382 2026-05-20 cs.AI 57%

PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning

PRISM:一个程序化空间-时间推理的基准测试

Qiran Zhang, Yuheng Wang, Runde Yang, Lin Wu, Jingru Fan, Shu Yao, Jie Zhang, Tianle Zhou, Huatao Li, Ruijie Shi, Yihan Li, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文提出PRISM基准测试,通过大规模人类校准的指令-代码对(共10,372个,比之前基准大20倍),评估语言模型生成空间正确动画输出的能力,并揭示执行成功率与空间正确率之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 57%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18693 2026-05-19 cs.AI 57%

SkillGenBench: Benchmarking Skill Generation Pipelines for LLM Agents

SkillGenBench: 评估LLM代理技能生成流水线的基准测试

Yifan Zhou, Zhentao Zhang, Ziming Cheng, Shuo Zhang, Qizhen Lan, Zhangquan Chen, Zhi Yang, QianyuXu, Ronghao Chen, Huacan Wang, Sen Hu

机构 * SJTU(上海交通大学) XJTU(西安交通大学) NUS(新加坡国立大学) QuantaAlpha(量子Alpha) THU(清华大学) SUFE(上海财经大学) NTU(国立.ntu) PKU(北京大学) UCAS(中国科学技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出SkillGenBench,一个用于评估LLM代理技能生成流水线的基准测试,通过统一可控的协议评估技能生成过程,涵盖任务条件生成和任务无关生成两种模式,以及基于仓库和文档的两种程序来源,揭示技能生成在不同数据源中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06754 2026-05-19 cs.SE 57%

ScarfBench: A Benchmark for Cross-Framework Application Migration in Enterprise Java

ScarfBench:企业Java应用跨框架应用迁移的基准测试

Advait Pavuluri, Bridget McGinn, Ashita Saxena, George Safta, Srikanth Tamilselvam, Raju Pavuluri, Michele Merler, Baishakhi Ray, Rahul Krishna

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 本文提出ScarfBench,一个用于评估企业Java应用跨框架迁移行为保持性的基准测试,通过专家编写实现三元组,涵盖Spring、Jakarta EE和Quarkus框架,生成102个变体和204个定向重构任务,评估了五种最先进的编码代理,并揭示了不同框架方向和架构层的难度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21654 2026-05-19 cs.LG 57%

EvilGenie: A Reward Hacking Benchmark

EvilGenie: 一个奖励黑客基准

Jonathan Gabor, Jayson Lynch, Jonathan Rosenfeld

机构 * Cambridge Boston Alignment Initiative(剑桥波士顿对齐倡议) MIT FutureTech(麻省理工 FutureTech)

专题命中 代码评测 :coding agent(abstract);分类 cs.LG

AI总结 本文提出EvilGenie基准,用于评估编程环境中奖励黑客问题,通过测试用例硬编码和测试文件编辑等方法检测奖励黑客行为,并验证了LLM判断在无歧义情况下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09817 2026-05-19 cs.SE cs.CR 57%

Evaluating Tool Cloning in Agentic-AI Ecosystems

评估代理AI生态系统中的工具克隆

Taein Kim, David Jiang, Yuepeng Hu, Yuqi Jia, Neil Gong

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 研究通过大规模测量分析代理AI生态系统中工具克隆现象,发现高相似性区域普遍存在,60%的高Jaccard候选和85%的高ssdeep候选被验证为克隆,揭示工具克隆对生态系统多样性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07045 2026-05-15 cs.CV cs.AI 57%

VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing

VLRS-Bench: 一种面向遥感的视觉-语言推理基准

Zhiming Luo, Di Wang, Haonan Guo, Jing Zhang, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏