arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 72 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 72 篇

2607.07471 2026-07-29 cs.LG cs.AI cs.CR 版本更新 62%

Where to Intervene? Benchmarking Fairness-Aware Learning on Differentially Private Synthetic Tabular Data

在何处进行干预?对差分隐私合成表格数据上的公平感知学习进行基准测试

Vinícius Gabriel Angelozzi, Héber H. Arcolezi

机构 * ÉTS Montréal(蒙特利尔高等商学院) Inria Grenoble(格勒诺布尔计算机科学及自动化研究所)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究在差分隐私合成表格数据上公平干预的效果,以自适应迭代机制为基准,在多数据集、指标及策略下评估,比较四种管道配置,发现仅DP会降效,公平干预可部分恢复公平,后处理方法权衡更优,还开源相关内容以支持研究。

Comments Paper accepted at PETS 2026. Code is available at https://github.com/vinicius-verona/dp-fair-intervention-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17528 2026-07-24 cs.AI cs.AR cs.LG 版本更新 62%

Can AI Agents Really Complete RTL-to-GDS? Lessons from Benchmarking Tool-Interactive EDA Workflows

人工智能代理真的能完成从RTL到GDS的转换吗?基准测试工具交互式EDA工作流程的经验教训

Jinyuan Deng, Zhengrui Chen, Xufeng Wei, Tianyu Xing, Chenyi Wen, Qi Sun, Cheng Zhuo

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨人工智能代理在EDA工作流程中的表现,提出FluxBench进行系统评估,涵盖多种场景并评估多项能力,引入Token ROI指标。结果显示不同代理系统架构性能有差距,特定领域技能不是提升性能的唯一关键,系统设计和基础模型能力也很重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06742 2026-07-20 cs.SE cs.AI 版本更新 62%

Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios

评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现

Ruida Hu, Xinchen Wang, Chao Peng, Cuiyun Gao, David Lo

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者,中国) Singapore Management University, Singapore(新加坡管理大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。

Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03238 2026-07-10 cs.LG cs.AI 版本更新 62%

When RLHF Fails: A Mechanistic Taxonomy of Reward Hacking, Collapse, and Evaluator Gaming

当RLHF失败时:奖励黑客、崩溃和评估者博弈的机制分类

Zelalem Abahana, David Evans, Satish Mahadevan Srinivasan, Matjaz Gams

机构 * First Citizens Bank(第一公民银行) Alma Mater Europaea University(欧洲大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文通过PPO、DPO等方法的对比实验,提出了一种基于奖励和评估者分数方向的机制分类法,将RLHF失败模式分类为可定位、可预测的训练动态。

Comments 20 pages, 8 figures; includes code, artifacts, and live demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03195 2026-07-09 cs.AI cs.SE 版本更新 62%

Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?

Terminus-4B:一个较小的模型能否在智能体执行任务中取代前沿大语言模型?

Spandan Garg, Vikram Nitin, Yufan Huang

机构 * Microsoft USA(微软公司)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究智能体终端执行任务中较小模型能否取代前沿大语言模型。提出经监督微调及强化学习训练的Terminus-4B模型,评估发现其能减少主智能体令牌使用量约30%,不影响性能,还缩小与前沿模型差距甚至超越其性能。

Comments The current article involves some product IP issues and needs to be withdrawn and re-approved

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09898 2026-06-23 cs.LG cs.AI 版本更新 62%

Learning Bug Context for PyTorch-to-JAX Translation with LLMs

学习 PyTorch 到 JAX 翻译中的 Bug 上下文

Hung Phan, Son Vu, Tuan Dinh, Nesreen Ahmed, Ali Payani, Ali Jannesari

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(Iowa State大学计算机科学系) Department of Human Science, Iowa State University, Ames, IA, USA(Iowa State大学人类科学系) Cisco AI Research, Outshift, San Jose, CA, USA(Cisco AI研究,Outshift,San Jose,加利福尼亚州,美国)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 针对 LLM 在 PyTorch 到 JAX 代码翻译中易出错的问题,构建 T2J 基准(含 bug 及修复),通过上下文学习使弱 LLM 翻译质量提升达 20%。

Comments ICML Deep Learning for Code (DL4C) workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20462 2026-06-15 cs.SE cs.CL cs.IR 版本更新 62%

Deja Vu at Scale: Paraphrase-Robust Detection of Duplicate Gherkin Steps in Behaviour-Driven Software Testing with Sentence-Transformer Embeddings and a 1.1M-Step Open Benchmark

大规模既视感:基于Sentence-Transformer嵌入和行为驱动软件测试中重复Gherkin步骤的释义鲁棒检测与110万步骤开放基准

Ali Hassaan Mughal, Noor Fatima, Muhammad Bilal

机构 * work(工作) seecs.edu.pk(SEECs大学) tum.de(图腾大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL

AI总结 针对BDD测试中Gherkin步骤重复问题,提出结合精确哈希、归一化Levenshtein、句子Transformer余弦和Levenshtein带混合的四种策略检测器,并构建跨组织语料库和标注基准,F1达0.906。

Comments 28 pages, 2 figures, 4 tables. Submitted to Information and Software Technology (Elsevier). Tool, corpus, labelled benchmark, and rubric released at https://github.com/amughalbscs16/cukereuse-release under Apache-2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15727 2026-06-09 cs.LG cs.CL 版本更新 62%

Towards Automated Kernel Generation in the Era of LLMs

面向LLM时代的自动化内核生成

Yang Yu, Peiyu Zang, Chi Hsu Tsai, Haiming Wu, Yixin Shen, Jialing Zhang, Haoyu Wang, Zhiyou Xiao, Jingze Shi, Yuyu Luo, Wentao Zhang, Chunlei Men, Guang Liu, Yonghua Lin

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Normal University(北京师范大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Cornell University(康奈尔大学) Beijing Jiaotong University(北京交通大学) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology (Guangzhou)(广州科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了利用大语言模型(LLM)和智能体系统自动化生成与优化GPU内核的方法,系统梳理了现有方法、数据集和基准,并指出了未来研究方向。

Comments In IJCAI 2026. 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11066 2026-06-08 cs.SE cs.AI 版本更新 62%

CoQuIR: A Comprehensive Benchmark for Code Quality-Aware Information Retrieval

CoQuIR:面向代码质量感知信息检索的综合基准

Jiahui Geng, Fengyu Cai, Shaobo Cui, Qing Li, Liangwei Chen, Chenyang Lyu, Haonan Li, Derui Zhu, Walter Pretschner, Heinz Koeppl, Fakhri Karray

机构 * Linköping University(林波伊大学) MBZUAI(麦肯锡人工智能研究院) TU Darmstadt(德累斯顿技术大学) Shanghai Jiao Tong University(上海交通大学) EPFL(苏黎世联邦理工学院) University of Groningen(Groningen大学) Google Tokyo(东京Google) Alibaba Group(阿里巴巴集团) TU Munich(慕尼黑技术大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出首个大规模多语言代码质量感知检索基准CoQuIR,涵盖正确性、效率、安全性和可维护性四维度,通过细粒度标注和两个质量中心指标评估23个模型,发现顶尖模型常无法区分有缺陷代码,并探索了训练方法以提升质量感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11470 2026-08-12 cs.CL 版本更新 57%

The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes

LLM推理的周期表:推理范式、方法与失败模式的结构化综述

Avinash Anand, Mahisha Ramesh, Avni Mittal, Ashutosh Kumar, Rishitej Reddy Vyalla, Erik Cambria, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工大学) Nvidia AI Center (SNAIC)(英伟达人工智能中心(SNAIC)) MIDAS Lab, IIIT Delhi(IIIT德里MIDAS实验室) MIDAS Lab, IIT Mandi(IIT曼迪MIDAS实验室) Owl Autonomous Imaging, Inc.(Owl自主成像公司) College of Computing & Data Science, NTU Singapore(新加坡南洋理工大学计算与数据科学学院) NVIDIA AI Technology Centre, Singapore(英伟达新加坡人工智能技术中心) Department of Computer Science and Engineering, IIT Kanpur(IIT坎普尔计算机科学与工程系)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本文系统综述了300多篇论文,提出LLM推理研究的结构化分类法,涵盖多种推理范式,分析方法论趋势,并总结常见限制与失败模式,旨在为开发更鲁棒、可解释和可泛化的推理系统提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29139 2026-08-11 cs.AI cs.GR cs.HC 版本更新 57%

SciVisAgentBench: A Benchmark for Evaluating Scientific Data Analysis and Visualization Agents

SciVisAgentBench:用于评估科学数据分析和可视化代理的基准测试

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Nathaniel Gorski, Jianxin Sun, Guoxi Liu, Helgi I. Ingolfsson, David Lenz, Hanqi Guo, Hongfeng Yu, Teja Leburu, Michael Molash, Bei Wang, Tom Peterka, Chaoli Wang, Shusen Liu

机构 * University of Notre Dame(圣母大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) University of Utah(犹他大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) The Ohio State University(俄亥俄州立大学) Argonne National Laboratory(阿贡国家实验室) Anthropic PBC

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出SciVisAgentBench,一个用于评估科学数据可视化代理的基准测试,涵盖四个维度,包含108个案例,结合LLM和确定性评估器进行多模态评估,揭示代理能力差距。

Comments IEEE Transactions on Visualization and Computer Graphics (IEEE VIS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29677 2026-08-06 cs.AI 版本更新 57%

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

ExtractBench:模式引导的企业文档抽取基准

Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon Suo

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 研究针对企业文档模式引导抽取的评估需求,构建首个同时评估值准确率等多指标的基准ExtractBench,发现LlamaExtract Agentic Plus在成本远低于编码智能体的情况下,准确率可与之媲美。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17529 2026-08-06 cs.SE 版本更新 57%

Automated Logging Is Language-Sensitive: A Multilingual Benchmark and Empirical Study of LLMs

单语言证据不足以支持自动化日志记录:一个多语言基准和基于LLM的实证研究

Renyi Zhong, Yichen Li, Yulun Wu, Jinxi Kuang, Yintong Huo, Michael R. Lyu

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文通过多语言基准MultiLogBench研究自动化日志记录的跨语言有效性,发现框架锚点匹配是最敏感的组件,模型排名在顶级稳定,但需多语言验证以确保鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17823 2026-07-31 cs.LG cs.CE stat.ME stat.ML 版本更新 57%

A novel k-means clustering approach using two distance measures for Gaussian data

一种使用两种距离度量的新型k-means聚类方法

Naitik Gada

机构 * School of Mathematical Sciences(数学科学学院) College of Science(科学学院) Rochester Institute of Technology(罗切斯特技术学院)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出了一种结合簇内和簇间距离度量的新型k-means聚类方法,通过Calinski-Harabasz准则确定簇数,提高聚类结果的鲁棒性和准确性。

Comments Keywords: machine learning, clustering algorithms, k-means

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11007 2026-07-29 cs.LG 版本更新 57%

TabPFN beyond Tabular Data: Calibration and Accuracy on Multimodal Embeddings

超越表格数据的TabPFN:多模态嵌入的校准与准确性

Jingxiang Zhang, Lujia Zhong, Zijie Zhu, Shuo Huang, Yuang Xu

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 研究少样本多模态分类中轻量级头部校准不佳问题,核心方法是评估TabPFN作为即插即用分类头。贡献在于其在多数据集、多编码器和多模态评估中表现优异,能提升校准并保持准确率,为校准敏感多模态分类提供指导。

Comments 19 pages, 13 figures, 10 tables. Jingxiang Zhang and Lujia Zhong contributed equally. Code: https://github.com/Jingxiang-Zhang/tabpfn-multimodal-embeddings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27243 2026-07-29 cs.IR cs.SE 版本更新 57%

NOVA: A Verification-Aware Agent Harness for Architecture Evolution in Industrial Recommender Systems

NOVA: 面向工业推荐系统架构演化的验证感知智能体框架

Shaohua Liu, Liang Fang, Yilong Sun, Shudong Huang, Qingsong Luo, Shaoxin Liu, Xiaoyang Chen, Dongqiang Liu, Chuangang Ma, Zhenzhen Chai, Henghuan Wang, Shijie Quan, Changyuan Cui, Zhangbin Zhu, Peng Chen, Wei Xu, Lei Xiao, Haijie Gu, Jie Jiang

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 提出NOVA框架,通过架构梯度、验证级联和层级任务控制实现工业推荐模型架构的自动化演化,有效减少静默失败,缩短文献到生产周期13倍以上。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31767 2026-07-28 cs.SE 版本更新 57%

JETO-Bench: A Reproducible Benchmark for Execution Time Improvement Patches in Java

JETO-Bench: Java执行时间改进补丁的可复现基准测试

Khashayar Etemadi, Zhendong Su

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 提出JETO-Mine工具,通过静态分析、动态分析和评估框架自动构建可复现的Java执行时间改进补丁基准,并构建包含660个补丁的JETO-Bench,验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 57%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 57%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05000 2026-07-17 cs.CR cs.LG 版本更新 57%

Agentic Vulnerability Reasoning on COTS Binaries

基于商用现货二进制文件的智能体漏洞推理

Hwiwon Lee, Jongseong Kim, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.LG

AI总结 研究LLM智能体对COTS二进制文件漏洞的推理能力,构建SLYP管道,结合二进制探索与动态调试验证漏洞。在COM基准测试中表现出色,发现更多真实漏洞,生成验证PoC,还发现多个零日漏洞,证明工具集和模型选择的重要性及通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02235 2026-07-15 cs.SE 版本更新 57%

Agent-Based Software Artifact Evaluation

基于代理的软件工件评估

Zhaonan Wu, Yanjie Zhao, Zhenpeng Chen, Zheng Wang, Haoyu Wang

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 研究针对软件工件评估中人工评估难及现有政策缺乏验证标准的问题,构建ArtifactGuide评分标准,设计ArtifactCopilot代理,通过实验评估,该框架提升了评估性能,提高了评审信心,还为设计高质量工件提供了实践指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07204 2026-07-14 math.OC cs.LG 版本更新 57%

Restricted Dynamic Geometric Complexity: Path-Space Reduction and Möbius--Jacobi Response

受限动态几何复杂度:结构化预处理的证书

Zavier Li

机构 * Xidian University(西安电子科技大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 研究优化几何动力学中受限动态几何复杂度,通过发展相关理论,如单调性和子流形距离原理等,将结构化预处理器问题转化为几何问题,还给出低秩谱模型等诊断接口及相关工作流程。

Comments 32 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17648 2026-07-09 cs.CL 版本更新 57%

Simulstream: Open-Source Toolkit for Evaluation and Demonstration of Streaming Speech-to-Text Translation Systems

Simulstream:用于评估和演示流式语音到文本翻译系统的开源工具包

Marco Gaido, Sara Papi, Mauro Cettolo, Matteo Negri, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 研究流式语音到文本翻译在评估上的问题,提出开源框架simulstream,支持长语音的增量和重新翻译解码,能进行质量和延迟评估及实时可视化比较,填补了相关统一解决方案的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04136 2026-07-07 cs.AI 版本更新 57%

A Technical Survey of Reinforcement Learning Techniques for Large Language Models

大语言模型强化学习技术的技术综述

Saksham Sahai Srivastava, Vaneet Aggarwal

机构 * University of Georgia(佐治亚大学) Purdue University(普渡大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18542 2026-06-24 cs.CL 版本更新 57%

Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs

业务即规则:面向LLM的业务规则流建模基准与框架

Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan

机构 * Zhejiang University of Technology(浙江工业大学) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学)

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 提出BREX基准(409份真实业务文档与2855条专家标注规则)和ExIde框架,通过可执行伪代码生成显式建模规则依赖,在13个LLM上验证了可执行接地作为归纳偏置的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07131 2026-06-23 cs.CR cs.SE 版本更新 57%

MalSkillBench: A Runtime-Verified Benchmark of Malicious Agent Skills

MalSkillBench: 一个运行时验证的恶意智能体技能基准

Wenbo Guo, Wei Zeng, Chengwei Liu, Xiaojun Jia, Yijia Xu, Lei Tang, Yong Fang, Yang Liu

专题命中 代码评测 :coding agent(abstract);分类 cs.SE

AI总结 提出MalSkillBench,首个运行时验证的恶意智能体技能基准,包含3944个恶意技能,通过闭环生成-验证-反馈流水线构建,揭示代码注入与提示注入检测的不对称性,并指出联合推理任务意图、代码和指令的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17986 2026-06-18 cs.CR cs.AI 版本更新 57%

LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection

LivePI:更真实的智能体对抗间接提示注入基准测试

Lei Zhao, Abhay Bhaskar, Edgar Dobriban

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 提出LivePI基准,覆盖7种输入表面、12种攻击/渲染家族和5种恶意目标,在真实虚拟机环境中评估多个AI智能体,发现攻击成功率10.7%-29.6%,并验证了两层防御的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09059 2026-06-11 cs.SE 版本更新 57%

Evaluating LLM-Generated Code: A Benchmark and Developer Study

评估大语言模型生成的代码:一个基准和开发者研究

Joanna Szych, Anne Schwerk

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文提出了一种定制的树折评估方法,用于评估大语言模型生成的代码,弥补了现有基准在代码质量和可操作性方面的不足,并通过对比三个通用大语言模型展示了其有效性。

Comments Accepted for publication at EASE '26/EQUISA workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01153 2026-07-30 cs.CL cs.AI cs.SE 版本更新 56%

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准

Brett Reynolds

机构 * Humber Polytechnic(汉博理工学院) University of Toronto(多伦多大学)

专题命中 代码评测 :分类 cs.SE、cs.CL、cs.AI;repository(comments)

AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。

Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22473 2026-06-09 cs.CL cs.AI cs.LG 版本更新 56%

Component Ablation for Efficient Hybrid Language Model Architectures: Performance, Resilience, and Compression Implications

组件消融用于高效混合语言模型架构:性能、鲁棒性和压缩影响

Hector Borobia, Elies Seguí-Mas, Guillermina Tormo-Carbó

机构 * Doctoral Program in Computer Science, University of Valencia(瓦伦西亚大学计算机科学博士项目)

专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 本文通过组件消融研究混合语言模型,发现注意力机制与替代序列处理路径对性能有显著影响,揭示了模型鲁棒性与压缩优化的关键因素。

Comments 25 pages, 7 figures, 6 tables; revised title, abstract, figures, and data/code repository URL

详情

展开后加载摘要…

URL PDF HTML 收藏