How Should AI Safety Benchmarks Benchmark Safety?
AI安全基准应该如何进行基准测试?
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
AI安全基准应该如何进行基准测试?
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文提出改进AI安全基准的方法,通过系统回顾210个基准,指出其技术、知识论和社会技术缺陷,并提出稳健度量和风险管理原则以提升基准有效性。
EvalSafetyGap:LLM评估-安全失败的混合调查与概念框架
机构 * Erciyes University(埃里切耶大学) ; Abdullah Gül University(阿卜杜勒拉赫曼·古尔大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract,comments);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM评估与AI安全中基准分数与潜在属性不一致的测量问题,提出混合调查与概念框架,并通过十模型审计揭示能力与鲁棒性关联不显著、安全差距主要由治理因素驱动。
Comments 74 pages, 2 figures, 4 tables. Hybrid systematic survey and conceptual framework on LLM evaluation and AI-safety failures, synthesizing 373 primary studies (2018-2026). Introduces the EvalSafetyGap framework (Instability Decomposition, Alignment Trilemma) and reports an exploratory ten-model audit. Submitted as a review/survey article; not currently under consideration elsewhere
注意力忽视视觉风险:多模态安全对齐的风险适应性转向
机构 * Seoul National University(首尔大学) ; KU Leuven(鲁汶大学)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract)
AI总结 本文提出MoRAS,通过简洁的视觉上下文增强关键安全区域的视觉注意力,以实现多模态安全对齐,减少推理开销并提升泛化能力。
面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准
机构 * Humber Polytechnic(汉博理工学院) ; University of Toronto(多伦多大学)
专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI
AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。
Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository
MedFailBench:用于医学人工智能安全边界检查的临床医生构建的开源基准测试
机构 * Kutahya Emet Dr. Fazil Dogan State Hospital(屈塔希亚埃梅特法齐尔·多安州立医院)
专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI
AI总结 MedFailBench提出不同问题,构建合成基准测试和失败图谱,通过严重程度和安全门类型标记医学人工智能错误,当前版本含44个合成病例等内容,以特定许可形式发布并带有DOI。
Comments 6 pages; synthetic benchmark reviewed by a clinician; no patient data
心理健康AI的安全性主张必须保留时间证据
机构 * WAI USA Research Labs(WAI USA研究实验室) ; University of Kansas(堪萨斯大学)
专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI
AI总结 本文指出,心理健康AI的安全性评估常忽略时间维度,提出SCOPE-MH原则以确保评估保留时间证据,揭示对话中逐步恶化等机制,强调时间证据对安全部署的必要性。
TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估
机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) ; National Taiwan University(国立台湾大学)
专题命中 安全评测 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);prompt injection(abstract)
AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。
Comments Accepted to Conference on Language Modeling (COLM) 2026
触发式对齐:黑盒评估无法保证更新后对齐
机构 * University of Southern California(南加州大学)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 研究大语言模型更新后对齐问题,指出静态黑盒评估有局限,无法保证更新后对齐,通过理论分析和多领域实证验证,揭示模型隐藏对抗行为及与模型规模的关系,强调更新后鲁棒对齐评估的迫切性。
人工智能聊天机器人自杀风险检测与应对:开源VERA-MH安全评估的人工验证研究
机构 * Spring Health ; Harvard Medical School(哈佛医学院) ; UC Berkeley(加州大学伯克利分校) ; Yale University(耶鲁大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI
AI总结 研究针对人工智能聊天机器人用于心理支持时的安全性评估问题,以VERA-MH为基准,模拟用户与聊天机器人对话,通过持牌临床医生和基于LLM的评估器评级,验证了VERA-MH在检测自杀风险方面的可靠性,为后续研究指明方向。
Journal ref JMIR AI. 2026;5
基于价值码本的LLM文化价值对齐的分布式开放式评估
机构 * KAIST(韩国科学技术院)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 提出DOVE框架,通过率失真变分优化构建价值码本,利用不平衡最优传输度量分布对齐,解决LLM文化价值评估中的构造-组成-上下文挑战。
Comments ICML 2026 Camera Ready
为何安全护栏在不同语言中会退化?
机构 * Stanford University(斯坦福大学)
专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究通过引入多组项目反应理论框架,揭示了语言无关的安全鲁棒性、提示内在难度、全球语言处理难度和提示特定的跨语言安全差距等因素,发现安全退化并非仅在低资源语言中发生,且文化与概念不匹配也会影响安全性能。
Comments Poster at Conference on Language Modeling (COLM 2026)
HiPath: 用于结构化病理报告预测的分层视觉-语言对齐
机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) ; Department of Bioengineering and Imperial-X, Imperial College London(帝国理工学院伦敦校区生物工程系) ; Department of Pathology, Xiangtan Maternal and Child Health Hospital(湘潭 maternal and child health hospital pathology department) ; Department of Pathology, The First People’s Hospital of Xiangtan City(湘潭市第一人民医院病理科)
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出HiPath框架,通过分层补丁聚合器、对比学习和槽位掩码诊断预测,在冻结UNI2和Qwen3骨干上实现结构化病理报告预测,准确率达68.9%,安全率97.3%。
Comments 10 pages, 1 figures, 3 tables
TAME: 一种可信的智能体记忆测试时演化与系统化基准测试
机构 * East China Normal University(东华师范大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Key Laboratory of Computer Software Evaluating and Testing(上海计算机软件评测与测试重点实验室) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出TAME框架,通过执行器-评估器循环实现记忆的可信演化,解决良性任务演化中智能体可信度下降问题,在GPT-5.2 AIME上准确率提升14.6个百分点。
KrishokChat: 一个基于引用的孟加拉语农业咨询数据集与基准
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.LG
AI总结 提出KrishokChat,首个基于引用的孟加拉语农业指令微调数据集,通过分层知识节点扩展生成14.55万QA对,并引入农夫基准评估,发现微调改善格式但化学剂量泛化仍困难,强调其作为RAG知识库的价值。
对齐机制中的盲区:量化大语言模型的生物安全风险
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 本研究针对大语言模型生物安全评估盲区,构建SPIKE-Bench评估框架,发现多数模型易生成毒素序列,提出BioSafe-Guard分类器降低功能风险并开源相关资源。
Comments Accepted to COLM 2026. 40 pages, 9 figures
FinVault:在执行 grounded 环境中评估金融代理安全性的基准测试
机构 * SUFE(上海财经大学) ; CUHKSZ(香港中文大学) ; SUIBE(上海对外经贸大学) ; FDU(福建大学) ; XDU(西安电子科技大学) ; BUPT(北京邮电大学) ; Tencent(腾讯) ; UCAS(中国科学院大学) ; PKU(北京大学) ; QuantaAlpha(量子Alpha)
专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.AI
AI总结 FinVault 是首个针对金融代理的执行 grounded 安全基准测试,通过31个监管案例驱动的沙盒场景和963个测试用例,评估金融代理在现实金融环境中的安全性和防御有效性。
Comments After further review of the current submission, we have identified potential legal and intellectual property concerns associated with keeping the manuscript publicly available as a preprint. In particular, there are ongoing considerations regarding institutional affiliation information, intellectual property ownership, and related compliance matters
缺失的变量:风险评估中的社会技术对齐
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CY
AI总结 本文提出社会技术对齐STA变量,用于改进AI安全关键系统风险评估,通过案例研究展示其在捕捉社会技术安全影响方面的贡献。
Comments This paper was accepted for the IFAC World Congress 2026
SENTINEL:面向基础模型基于具身代理的安全性评估多级形式框架
机构 * Northwestern University, USA ; University of Southern California, USA ; College of William \& Mary
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI总结 SENTINEL通过形式时序逻辑多级验证框架,系统性评估基础模型具身代理在模拟环境中的物理安全性。
从提示风险到响应风险:大型语言模型安全行为的配对分析
机构 * Microsoft(微软)
专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL
AI总结 本研究通过配对分析人类标注的提示和响应记录,探讨了大型语言模型在四个危害类别(性、自残、仇恨和暴力)和有序严重性级别上的安全行为,发现61%的响应比提示减少了危害,3%的响应升级了危害,并揭示了安全行为与无害性之间的权衡。
SafeNexus:在多模态大语言模型(MLLMs)中发现与调控模态通用安全神经元
专题命中 安全评测 :safety(title,abstract);alignment(abstract)
AI总结 SafeNexus是一种跨模态安全对齐框架,通过定位并调控模态通用安全神经元,提升多模态大语言模型在跨模态威胁下的安全性,且能保留模型效用。
当行为安全评估失败时:表征层面的视角
机构 * Stanford University(斯坦福大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Technical University of Denmark(丹麦技术大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。
Comments Preprint
EgoSafe:用于视觉安全理解的第一人称移动采集基准
机构 * South China University of Technology(华南理工大学) ; Beihang University(北京航空航天大学)
专题命中 安全评测 :safety(title,abstract);alignment(abstract)
AI总结 该研究推出第一人称移动采集的视觉安全理解基准 EgoSafe-Bench,含12000个样本,用分层推理评估(HRE)协议测试,发现现有大视觉语言模型存在感知-推理解耦问题,为逻辑鲁棒视频理解系统提供评估框架
TRIDENT:评估金融、医学和法律领域大语言模型的安全性
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.CY、cs.LG
AI总结 研究针对大语言模型在金融、医学和法律领域的安全评估问题,基于相关伦理准则定义安全原则并引入Trident-Bench基准进行评估,揭示了不同模型的安全差距,为LLM安全研究提供了系统资源和研究基础。
Comments COLM 2026
AuAu: 大型语言模型中威权对齐审计基准
机构 * University of Zurich(苏黎世大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出AuAu基准,结合心理测量、情境行为测试和用户提示评估LLM的威权倾向,发现17个模型均存在显著威权响应,且系统提示可操纵多数模型。
Comments v2, 48 pages
TRUST-UP:使用安全技术的可信强化学习用于无人机追踪
专题命中 安全评测 :trustworthy(title,abstract);safety(abstract)
AI总结 提出TRUST-UP算法,通过控制障碍函数安全滤波和切换策略,实现无人机在拥挤城市环境中的安全自主追踪,满足航空认证的可信需求。
Comments Accepted manuscript. Accepted for publication in Advanced Engineering Informatics
多轮交互中的安全隐患:工具使用智能体的多轮安全风险基准与防御
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出多轮工具使用安全基准MT-AgentRisk,发现多轮设置下攻击成功率平均增加16%,并设计无训练、与工具无关的自探索防御方法ToolShield,平均降低30%攻击成功率。
TRUE:一种用于大语言模型推理的可信统一解释框架
机构 * Dalian University of Technology(大连理工大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出TRUE框架,通过可执行推理验证、可行域DAG建模和因果故障模式分析,为LLM推理提供实例级、局部结构级和类别级的多层次可验证解释。
注意间隙:任务条件化的语言和视觉模型忽略它们本可报告的安全关键信号
机构 * PolymathMinds Lab(PolymathMinds 实验室)
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究揭示任务条件化会导致语言和视觉模型抑制对共存安全关键信号的报告,形成“注意间隙”,且该现象在多种模型和任务中普遍存在,不随规模增大而减弱,使基准安全与实际安全脱钩。
Comments 62 pages (31-page article and 31-page supplementary information), 8 figures, 4 tables. v3: corrects the author metadata to the sole author, Kwan Soo Shin; revised title and abstract; adds cross-vendor and flagship validation, signal-detection and specified-task controls, and dual-process probes. Reproducibility deposit: doi:10.5281/zenodo.20826823
对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧
机构 * The University of Hong Kong(香港大学)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY
AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。
Comments ACM FAccT 2026
MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估
机构 * M42
专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI
AI总结 MEDIC通过综合评估框架揭示LLM在临床应用中的安全性和实用性差异,强调需采用组合方法以应对多维度性能权衡。
Comments Published in Transactions on Machine Learning Research (06/2026)