arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-29 至 2026-05-29 共收录 124 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 7 篇

2604.01473 2026-05-29 cs.CR cs.AI 83%

SelfGrader: LLM Jailbreak Detection via Anchored Token-Level Logits

SelfGrader: 基于锚定令牌级对数概率的LLM越狱检测

Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

机构 * Department of Computer Science and Engineering, University of Nevada, Reno(内华达大学里诺分校计算机科学与工程系) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 提出SelfGrader方法,利用锚定令牌级对数概率将越狱检测转化为数值评分问题,实现低延迟、低误报率的鲁棒检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15236 2026-05-29 cs.CR cs.AI cs.LG 82%

Jailbreaking and Mitigation of Vulnerabilities in Large Language Models

大语言模型的越狱与漏洞缓解

Benji Peng, Hanxuan Chen, Keyu Chen, Qian Niu, Ziqian Bi, Ming Liu, Pohsun Feng, Tianyang Wang, Lawrence K. Q. Yan, Yizhu Wen, Yichao Zhang, Caitlyn Heqi Yin, Xinyuan Song, Riyang Bao, Jiacheng Shi

机构 * Hunan University Changsha, PRC Georgia Institute of Technology Atlanta, USA Kyoto University Kyoto, Japan Purdue University West Lafayette, USA National Taiwan Normal University Taipei, ROC University of Liverpool Suzhou, PRC Hong Kong University of Science University of Hawaii Honolulu, USA The University of Texas at Dallas Dallas, USA University of Wisconsin-Madison Madison, USA Emory University Atlanta, USA College of William \& Mary Williamsburg, USA

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);prompt injection(abstract)

AI总结 本文综述了大语言模型在提示注入和越狱攻击下的漏洞,分类攻击方法并评估防御策略,指出研究空白与未来方向。

Journal ref Eureka 1(1) (2026) 26-61

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11331 2026-05-29 cs.LG cs.AI 81%

Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover

大型语言模型的越狱缩放定律:多项式-指数交叉

Indranil Halder, Annesya Banerjee, Cengiz Pehlevan

机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Center for Brain Science, Harvard University(哈佛大学脑科学中心)

专题命中 越狱攻击 :jailbreak(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14399 2026-05-29 cs.CV 75%

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

多轮自适应提示攻击对大型视觉-语言模型

In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

机构 * The University of Melbourne(墨尔本大学) The University of Adelaide(阿德莱德大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 提出多轮自适应提示攻击(MAPA),通过交替文本-视觉攻击动作和跨轮迭代调整攻击轨迹,显著提升对大型视觉-语言模型的多轮越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30031 2026-05-29 cs.SD cs.AI cs.CL 73%

Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation

大型音频语言模型中的音频越狱:分类、攻防分析与成本感知评估

Bo-Han Feng, Yu-Hsuan Li Liang, Chien-Feng Liu, You-Hsuan Chang, Yun-Nung Chen

机构 * National Taiwan University(台湾大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了大型音频语言模型中音频越狱攻击与防御的统一分类法和受控实证评估,揭示了声学最佳N攻击暴露了最坏情况下的音频空间漏洞,叙事框架是一种有效的低延迟语义威胁,而现有防御在鲁棒性与良性可用性之间存在权衡。

Comments Submitted to ACL ARR 2026 May

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29910 2026-05-29 cs.SE cs.AI 57%

Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents

Agora: 面向生产级共识协议中自主漏洞检测的LLM智能体

Xiang Liu, Sa Song, Zhaowei Zhang, Huiying Lan, Jason Zeng, Ming Wu, Michael Heinrich, Yong Sun, Ceyao Zhang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Information and Telecommunication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与电信工程学院) Peking University(北京大学) G Labs(0G实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出Agora,一个领域感知的多智能体框架,通过假设驱动测试和LLM协作,在Raft、EPaxos、HotStuff、BullShark四个共识实现中发现15个未知协议级逻辑漏洞,而现有LLM方法未能检测到任何此类漏洞。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红队测试 1 篇

2601.03134 2026-05-29 cs.CL 79%

The Anatomy of Conversational Scams: A Topic-Based Red Teaming Analysis of Multi-Turn Interactions in LLMs

对话式诈骗的剖析:基于主题的LLM多轮交互红队分析

Xiangzhe Yuan, Zhenhao Zhang, Haoming Tang, Siying Hu

机构 * Department of Computer Science, University of Iowa(爱荷华大学计算机科学系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系)

专题命中 红队测试 :red teaming(title);safety(abstract);分类 cs.CL

AI总结 通过LLM间模拟框架研究多轮社交工程对话中的对抗动态,分析攻击与防御策略,发现跨模型和跨语言的结果差异及策略转换的结构性变化。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 提示注入 6 篇

2605.28999 2026-05-29 cs.CR cs.AI cs.CL cs.LG 82%

Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening

测量基于LLM的简历筛选中真实世界的提示注入攻击

Mohan Zhang, Yuqi Jia, Zhen Tan, Steven Jiang, Neil Zhenqiang Gong, Tianlong Chen, Dawn Song

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Duke University(杜克大学) Arizona State University(亚利桑那州立大学) hireEZ University of California, Berkeley(加州大学伯克利分校)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究首次系统性地分析了基于LLM的简历筛选应用中的提示注入攻击,通过设计专用检测器对约20万份真实简历进行测量,发现约1%的简历包含隐藏的提示注入,且近年来其流行度显著增加。

Comments Published in USENIX Security Symposium 2026; Code and artifacts are available at https://github.com/UNITES-Lab/resume-injection-measurement

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00991 2026-05-29 cs.AI cs.PL 70%

Tracking Capabilities for Safer Agents

更安全智能体的追踪能力

Martin Odersky, Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham

机构 * EPFL(苏黎世联邦理工学院)

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出通过Scala 3的捕获检查类型系统静态追踪能力,构建基于编程语言的智能体安全约束,防止信息泄露和恶意副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29737 2026-05-29 cs.CR cs.CL cs.SE 57%

Minimal Prompt Perturbations Lead to Code Vulnerabilities: Prompt Fragility and Hidden-State Signals in Coding LLMs

最小提示扰动导致代码漏洞:编码大语言模型中的提示脆弱性和隐藏状态信号

Alexander Sternfeld, Andrei Kucharavy, Ljiljana Dolamic

机构 * IEM, HES-SO, Le Foyer, Techno-Pôle 1, Sierre, Switzerland(瑞士苏黎世联邦理工学院(HES-SO)技术园区1号,西尔尔) Cyber-Defence Campus, armasuisse Science and Technology, Thun, Switzerland(瑞士图恩 Cyber-Defence 营地,armasuisse 科学与技术)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 本文通过token级突变实验,发现微小提示扰动(如单字符变化)即可使LLM生成代码从安全变为脆弱,并利用隐藏状态分析揭示输入处理漏洞比安全默认值漏洞更可预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26506 2026-05-29 cs.CL cs.CR 57%

SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts

SafeReview: 防御基于LLM的评审系统免受对抗性隐藏提示攻击

Yuan Xin, Yixuan Weng, Minjun Zhu, Ying Ling, Chengwei Qin, Michael Backes, Yue Zhang, Linyi Yang

机构 * CISPA Westlake University(西交利物浦大学) Southern University of Science and Technology(南方科技大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 提出SafeReview,一种共进化对抗训练框架,通过联合训练生成器和防御者模型,增强基于LLM的同行评审系统对对抗性隐藏提示的鲁棒性。

Comments 17 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29565 2026-05-29 cs.CV cs.RO 50%

From General Vision to Reliable Traversability Estimation: Adapting Vision Foundation Models for Unstructured Outdoor Environments

从通用视觉到可靠的可通行性估计:适应视觉基础模型用于非结构化户外环境

Ji-Hoon Hwang, Jisung Bae, Dong-Wook Kim, Yeonkyu Lee, Seung-Woo Seo

专题命中 提示注入 :safety(abstract)

AI总结 提出ViTA框架,通过可学习提示、视角多样化训练和几何知识蒸馏,将视觉基础模型适应于非结构化户外环境的可靠可通行性估计,显著降低误报并提升跨域泛化。

Comments 8 pages, 5figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28017 2026-05-29 cs.CR cs.IR 50%

Can It Reach the Generator? Investigating the Survival of Prompt-Injection Attacks in Realistic RAG Settings

它能到达生成器吗?探究真实RAG设置中提示注入攻击的存活情况

Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文在真实的三阶段RAG流水线(检索器→LLM重排序器→LLM生成器)中重新评估了七种生成式引擎优化(GEO)攻击,发现基于梯度和指令覆盖的攻击在到达生成器前大多失效,仅LLM驱动的提示注入保持端到端有效,且所有攻击易被轻量级防护检测。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 6 篇

2605.30353 2026-05-29 cs.AI astro-ph.CO cs.HC cs.SE 57%

Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software

物理学就是一切?物理学家监督人工智能开发科学软件的案例研究

Nhat-Minh Nguyen

机构 * Kavli IPMU (WPI), UTIAS, The University of Tokyo(Kavli研究所(WPI)、UTIAS、东京大学) Center for Data-Driven Discovery(数据驱动发现中心) Institute For Interdisciplinary Research in Science(科学跨学科研究中心)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 通过一个物理学家监督AI编码代理开发可微扰动理论模块的案例,研究AI代理在科学软件开发中的可靠性,发现监督设计比模型能力更能决定输出可信度。

Comments 10 pages, 2 figures, 2 tables, 1 physicist and a few AI agents. Accepted by ICML 2026 AI for Science Workshop. Code and development log are available at this repo: https://github.com/MinhMPA/clax-pt

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29791 2026-05-29 cs.CL 57%

ActTraitBench: Quantifying the Knowledge-Decision Gap in Large Language Models via Human-Grounded Behavioral Validation

ActTraitBench: 通过人类行为验证量化大型语言模型中的知识-决策差距

Yutong Yang, Chenxi Miao, Weikang Li, Yunfang Wu

机构 * Peking University(北京大学) Baidu Inc(百度公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出ActTraitBench框架,基于人类数据建立心理测量方面与行为范式的一一映射,并通过分位数映射校准LLM评分分布,揭示LLM在自我报告与行为决策之间的知识-决策差距,并引入CoCA干预来缓解该差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29715 2026-05-29 cs.CL 57%

User-Aware Active Knowledge Acquisition for Emotional Support Dialogue

面向情感支持对话的用户感知主动知识获取

Mufan Xu, Kehai Chen, Jiahao Hu, Xinchao Xu, Muyun Yang, Tiejun Zhao, Min Zhang

机构 * Harbin Institute of Technology, China(哈尔滨工业大学) Baidu Inc., Beijing, China(百度公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出用户感知主动知识获取(UKA)框架,通过理论心智不确定性估计和主动学习,在情感支持对话中高效获取用户对齐的对话知识,提升对话质量和用户对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29615 2026-05-29 cs.CV cs.CL 57%

DiffSpot: Can VLMs Spot Fine-Grained Visual Differences in Web Interfaces?

DiffSpot:VLM能发现网页界面中的细微视觉差异吗?

Linhao Zhang, Aiwei Liu, Yuan Liu, Xiao Zhou

机构 * WeChat AI, Tencent Inc(腾讯公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出DiffSpot基准,通过CSS属性突变生成可控图像对,评估视觉语言模型在网页界面中检测细微视觉差异的能力,发现最佳模型仅识别40.7%的真实变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29139 2026-05-29 stat.ML cs.LG 57%

Anytime-Valid Federated Conformal RAG for LLM Swarms

面向LLM群体的任意有效联邦共形RAG

Prasanjit Dubey, Xiaoming Huo

机构 * H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H.米尔顿·斯图尔特工业与系统工程学院,佐治亚理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出Anytime-FC-RAG,通过可累积的逐步校准偏差预算和截断投注e过程,将联邦共形RAG扩展到任意停止时间均有效的序贯覆盖,并保证时间均匀报警有效性、Hoeffding拼接累积误覆盖包络及自适应控制下的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08064 2026-05-29 cs.CL 57%

Calibration Is Not Enough: Evaluating Confidence Estimation Under Language Variations

校准还不够:评估语言变化下的置信度估计

Yuxi Xia, Dennis Ulmer, Terra Blevins, Yihong Liu, Hinrich Schütze, Benjamin Roth

机构 * Faculty of Computer Science, UniVie Doctoral School Computer Science(计算机科学系,维也纳大学计算机科学博士学院) Faculty of Philological and Cultural Studies, University of Vienna, Austria(文学与文化研究系,维也纳大学,奥地利) ILLC, University of Amsterdam, Netherlands(阿姆斯特丹大学ILLC,荷兰) Khoury College of Computer Sciences, Northeastern University, USA(东北大学计算机科学学院,美国) LMU Munich, Munich Center for Machine Learning (MCML), Germany(慕尼黑大学,慕尼黑机器学习中心(MCML),德国)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出一个基于鲁棒性、稳定性和敏感性的新评估框架,揭示现有置信度估计方法在区分语义不同答案方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 3 篇

2605.30289 2026-05-29 cs.LG stat.AP stat.ML 79%

Statistical Embeddings for Similarity, Retrieval, and Interpretable Alignment of Numeric Tabular Datasets

用于数值表格数据集的相似性、检索和可解释对齐的统计嵌入

M. Ross Kunz, John Merickel, Keith Wilson

机构 * Idaho National Laboratory(爱达荷国家实验室)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 提出一种通过结构化探索性数据分析描述符、句子变换器嵌入和典型相关分析(CCA)来表征和比较数值表格数据集的方法,实现跨数据集的相似性检索和可解释变量级对齐,并支持差分隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28975 2026-05-29 cs.LG 79%

A Training-Time Diagnostic for Generalization via the Log-Alignment Ratio

基于对数对齐比率的训练时泛化诊断

Ali Shehper, Ashish Vaswani

机构 * Essential AI

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 提出对数对齐比率(LAR)作为参数-激活对齐的度量,通过捕捉训练中权重谱与激活谱的扩散来跟踪记忆与泛化的转换,并在grokking和语言模型预训练中预测泛化差距。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29202 2026-05-29 cs.LG 57%

Auditing Training Data in Generative Music Models via Black-Box Membership Inference

通过黑盒成员推断审计生成音乐模型中的训练数据

Yi Chen Liu, Jiawei Yu, Kexin Cao, Syed Irfan Ali Meerza, Trishika Movva, Jian Liu

机构 * University of Georgia(佐治亚大学) Independent Researcher(独立研究者) University of Tennessee(田纳西大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种黑盒成员推断方法,通过比较候选音频与模型基于其描述生成输出的语义对齐程度,并训练音乐审计器分类成员身份,实现对生成音乐模型训练数据的高精度审计。

Comments The paper has been accepted for presentation at the workshop ArtSec 2026: Workshop on Artwork Security and Provenance in the Age of AI

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 43 篇

2605.29224 2026-05-29 cs.CL cs.AI cs.CR 88%

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

相关性即漏洞:网络检索如何削弱LLM智能体的安全对齐

Aditya Nawal, Manit Baser, Mohan Gurusamy

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AgentREVEAL框架,分析检索集成方式和内容属性如何导致LLM智能体安全退化,发现相关性是共同激活条件,并引入HarmURLBench基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29667 2026-05-29 cs.CL 83%

Beyond English and Evasion: A Human-Annotated Multi-Domain Benchmark for High-Stakes LLM Safety Evaluation in Chinese

超越英语与规避:用于高风险LLM中文安全评估的人工标注多领域基准

Wajdi Zaghouani, Kholoud K. Aldous, Yicheng Gao

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 针对LLM在中文环境下安全系统失效的问题,构建了包含1,897个对抗性提示的人工标注基准ChiSafe-PAS,覆盖四个高风险领域,并提供完整标注以评估模型安全对齐。

Journal ref Proceedings of The fourth international workshop on the role of resources in the age of large language models RESOURCEFUL-2026 at LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29396 2026-05-29 cs.AI 83%

Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization

对齐但脆弱:通过零阶优化增强LLM安全鲁棒性

Zhihao Liu, Yifan Wu, Jian Lou, Di Wang, Yuxi Zhou, Yuke Hu

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技园区(滨江)区块链与数据安全研究院) Sun Yat-sen University(中山大学) KAUST(卡塔尔大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对大语言模型安全对齐后易受轻量级后处理(如参数噪声、激活噪声或量化)影响的问题,提出基于零阶优化的混合框架,通过先标准一阶安全对齐再零阶精炼提升鲁棒性,并利用扰动评估估计层鲁棒性敏感性以高效聚焦关键层更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28825 2026-05-29 cs.CL 81%

MechELK: A Mechanistic Interpretability Framework for Eliciting Latent Knowledge in Large Language Models

MechELK:一种用于激发大型语言模型中潜在知识的机制可解释性框架

Ji-jun Park, Soo-joon Choi, Jiwon Jeong, Taeyang Yoon, Ju-Wan Lee

机构 * Dongguk University(东国大学)

专题命中 安全评测 :alignment(abstract,abstract_cn);safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 提出MechELK框架,通过定位、验证和激发三个阶段,利用稀疏自编码器特征分析和因果探测等方法,从大型语言模型中提取隐藏知识,在TruthfulQA等基准上平均激发准确率达84.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28830 2026-05-29 cs.CL cs.AI cs.SE 81%

Benchmarking Open-Source Safety Guard Models: A Comprehensive Evaluation

开源安全防护模型基准测试:全面评估

Reetu Raj Harsh, Bhaskarjit Sarmah, Stefano Pasquali

机构 * Domyn

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究对14个开源安全防护模型在8个NIST AI风险框架安全类别上进行全面评估,发现召回率是关键指标,且模型大小与安全检测性能不相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26954 2026-05-29 cs.CL 79%

AlbanianLLMSafety: A Safety Evaluation Dataset for Large Language Models in Albanian

AlbanianLLMSafety:面向阿尔巴尼亚语大语言模型的安全评估数据集

Wajdi Zaghouani, Kholoud K. Aldous, Isra Fejzullaj

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对低资源语言阿尔巴尼亚语,构建了首个公开的安全评估数据集,包含11个安全类别的2951条提示,以填补安全评估基础设施的空白。

Comments Accepted at SIGUL2026 Workshop co-located with LREC2026

Journal ref In Proceedings of the SIGUL2026 Workshop co-located with LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26947 2026-05-29 cs.CL 79%

KZ-SafetyPrompts: A Kazakh Safety Evaluation Prompt Dataset for Large Language Models

KZ-SafetyPrompts:用于大型语言模型的哈萨克语安全评估提示数据集

Wajdi Zaghouani, Shimaa Amer Ibrahim, Aruzhan Muratbek, Olzhasbek Zhakenov, Adiya Akhmetzhanova

机构 * Northwestern University in Qatar(卡塔尔西北大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对哈萨克语在大型语言模型安全评估中资源不足的问题,构建了一个包含11个风险类别、5717条原生哈萨克语提示的数据集,并基于GPT-4o基线测试发现跨类别拒绝率差异显著,揭示了仅英语评估无法捕获的类别特定安全漏洞。

Comments Accepted at the SIGUL2026 Workshop co-located with LREC2026

Journal ref In Proceedings of the SIGUL2026 Workshop co-located with LREC 2026, Palma de Mallorca, Spain, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29340 2026-05-29 cs.CL 79%

A Study on Question-Answer Dataset for LLM Safety Evaluation with a Focus on Illegal Activities

面向LLM安全评估的问答数据集研究:聚焦非法活动

Kenji Imamura, Masao Ideuchi, Atsushi Fujita

机构 * National Institute of Information and Communications Technology(日本信息与通信技术研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 本文通过人工分析AnswerCarefully数据集,提出额外信息、问答示例创建方法和评估准则,用于评估LLM在非法活动方面的安全性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏