arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9238 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9238 篇

2510.06096 2026-06-30 cs.LG cs.CL 88%

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

对齐审计员:一种用于验证和细化大语言模型目标的贝叶斯框架

Matthieu Bou, Nyal Patel, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(伦敦帝国学院) Amazon AGI(亚马逊通用人工智能)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract);safety(abstract);trustworthy(abstract)

AI总结 本文提出一种贝叶斯框架,通过验证和细化LLM目标,解决逆强化学习中奖励函数推断的非识别性问题,提供可操作的诊断和验证政策效用的方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05056 2026-06-05 cs.CR cs.CL cs.LG 88%

Grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations

grounded but Misleading: Evaluating Semantic Alignment in AI-Generated Security Explanations

Heajun An, Connor Ng, Sandesh Sharma Dulal, Junghwan Kim, Jin-Hee Cho

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 安全评测 :alignment(title,title_cn);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了AI生成的安全解释中语义对齐的问题,通过VEXA测试平台验证了词汇基础与语义风险对齐之间的差距,发现即使解释在词汇上显得合理,其语义解释可能削弱检测器的意图风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05662 2026-05-08 cs.CL cs.AI 88%

XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity

XL-SafetyBench: 一个基于国家的跨文化安全基准,用于LLM安全性和文化敏感性

Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichlmeier, Helena Berndt, Sai Krishna Mendu, Glenn Johannes Tungka, Özlem Gökçe, Suresh Gehlot, Katherine Pratt, Amanda Minnich, Haon Park

机构 * AIM Intelligence(AIM智能研究院) Microsoft(微软公司) Korea AISI(韩国人工智能研究所) KT Corporation(KT公司) BMW Group(宝马集团) Coinbase(Coinbase公司) Technical University of Munich(慕尼黑技术大学) Ankara University(安卡拉大学) Cyril Amarchand Mangaldas(Cyril Amarchand Mangaldas法律事务所) Seoul National University(首尔国立大学)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 XL-SafetyBench通过5500个跨10个国家语言对的测试案例,评估LLM在文化敏感性和安全性的表现,揭示了前沿模型的安全性与文化意识无耦合关系,以及本地模型在安全与文化敏感性间的线性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.24056 2026-05-05 cs.CR cs.CL cs.LG 88%

Logit-Gap Steering: A Forward-Pass Diagnostic for Alignment Robustness

Logit-Gap Steering:一种对齐鲁棒性的前向传递诊断

Tung-Ling Li, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出logit-gap steering方法,通过前向传递发现短的分布内后缀以关闭对齐间隙,验证了当前对齐边距的薄且可测量,强调防御策略需考虑分布内后缀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30219 2026-08-03 cs.AI cs.CL cs.LG cs.SE 版本更新 88%

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

EvalSafetyGap:LLM评估-安全失败的混合调查与概念框架

Buğra Alperen Uluırmak, Rifat Kurban

机构 * Erciyes University(埃里切耶大学) Abdullah Gül University(阿卜杜勒拉赫曼·古尔大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract,comments);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM评估与AI安全中基准分数与潜在属性不一致的测量问题,提出混合调查与概念框架,并通过十模型审计揭示能力与鲁棒性关联不显著、安全差距主要由治理因素驱动。

Comments 74 pages, 2 figures, 4 tables. Hybrid systematic survey and conceptual framework on LLM evaluation and AI-safety failures, synthesizing 373 primary studies (2018-2026). Introduces the EvalSafetyGap framework (Instability Decomposition, Alignment Trilemma) and reports an exploratory ten-model audit. Submitted as a review/survey article; not currently under consideration elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13698 2026-07-15 cs.CV 版本更新 88%

Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment

注意力忽视视觉风险:多模态安全对齐的风险适应性转向

Jonghyun Park, Minhyuk Seo, Chaewon Yeo, Jonghyun Choi

机构 * Seoul National University(首尔大学) KU Leuven(鲁汶大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract)

AI总结 本文提出MoRAS,通过简洁的视觉上下文增强关键安全区域的视觉注意力,以实现多模态安全对齐,减少推理开销并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02695 2026-04-06 cs.CV 88%

XrayClaw: Cooperative-Competitive Multi-Agent Alignment for Trustworthy Chest X-ray Diagnosis

XrayClaw:协作-竞争多智能体对齐用于可信的胸部X光诊断

Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology, Shenzhen, China(深圳理工大学,深圳,中国)

专题命中 安全评测 :alignment(title,abstract);trustworthy(title,abstract)

AI总结 本文提出XrayClaw框架,通过协作-竞争架构提升胸部X光诊断的可靠性,实现高准确性和临床推理一致性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03270 2025-09-04 cs.SE cs.RO 88%

AI Safety Assurance in Electric Vehicles: A Case Study on AI-Driven SOC Estimation

Martin Skoglund, Fredrik Warg, Aria Mirzai, Anders Thorsen, Karl Lundgren, Peter Folkesson, Bastian Havers-zulka

机构 * RISE Research Institutes of Sweden(瑞典RISE研究机构)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract)

Comments 12 pages, 9 figures, EVS38, https://evs38-program.org/en/evs-38-proceedings/all

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01460 2024-08-06 cs.CY cs.AI cs.CL 88%

LocalValueBench: A Collaboratively Built and Extensible Benchmark for Evaluating Localized Value Alignment and Ethical Safety in Large Language Models

Gwenyth Isobel Meadows, Nicholas Wai Long Lau, Eva Adelina Susanto, Chi Lok Yu, Aditya Paul

专题命中 安全评测 :alignment(title,abstract);safety(title);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06798 2023-12-13 cs.AI cs.CL cs.LG 88%

Building Trustworthy NeuroSymbolic AI Systems: Consistency, Reliability, Explainability, and Safety

Manas Gaur, Amit Sheth

专题命中 安全评测 :safety(title,abstract);trustworthy(title);分类 cs.CL、cs.AI、cs.LG

Comments To Appear in AAAI AI Magazine. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07867 2026-06-09 cs.CL 新提交 87%

The Cold-Start Safety Gap in LLM Agents

LLM智能体中的冷启动安全差距

Chung-En Sun, Linbo Liu, Tsui-Wei Weng

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract,abstract_cn);分类 cs.CL

AI总结 研究发现工具调用型LLM智能体在会话开始时最脆弱,随着常规任务执行安全性提升,提出SODA基准并验证预热策略可缩小冷启动安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04042 2026-05-21 cs.CL 87%

Causal Path Alignment: Anchoring the Optimization Trajectory for Controllable In-Parameter Knowledge Editing

因果路径对齐:为可控的参数知识编辑锚定优化轨迹

Xiyu Liu, Zhengxiao Liu, Naibin Gu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 安全评测 :alignment(title,summary_cn);trustworthy(abstract);分类 cs.CL

AI总结 本文提出Causal Path Alignment框架,通过锚定优化轨迹来解决参数知识编辑中的主体主导记忆干扰问题,提升关系特异性并减少副作用。

Comments Accepted by IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06576 2026-05-08 cs.LG 87%

On the Safety of Graph Representation Learning

图表示学习的安全性研究

Xiaoguang Guo, Zehong Wang, Ziming Li, Shawn Spitzel, Soonwoo Kwon, Tianyi Ma, Yanfang Ye, Chuxu Zhang

机构 * University of Connecticut(康涅狄格大学) University of Notre Dame(圣约翰大学)

专题命中 安全评测 :safety(title,summary_cn);分类 cs.LG

AI总结 本文提出GRL-Safety评估框架,评估十二种图表示学习方法在不同安全轴上的表现,揭示安全行为受表示设计与受压图因素交互影响,指出基础模型在特定轴上具有优势,揭示部署中仍存在能力缺口。

Comments Preprint. 10 pages main text, appendices included

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11361 2025-12-23 cs.CL 87%

VLDBench Evaluating Multimodal Disinformation with Regulatory Alignment

VLDBench:评估具有监管对齐的多模态虚假信息

Shaina Raza, Ashmal Vayani, Aditya Jain, Aravind Narayanan, Vahid Reza Khazaie, Syed Raza Bashir, Elham Dolatabadi, Gias Uddin, Christos Emmanouilidis, Rizwan Qureshi, Mubarak Shah

专题命中 安全评测 :alignment(title,abstract);safety(abstract);trustworthy(abstract);AI safety(abstract)

AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。

Comments Accepted in Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06890 2025-11-11 cs.CL 87%

EduGuardBench: A Holistic Benchmark for Evaluating the Pedagogical Fidelity and Adversarial Safety of LLMs as Simulated Teachers

Yilin Jiang, Mingzi Zhang, Xuanyu Yin, Sheng Jin, Suyu Lu, Zuocan Ying, Zengyi Yu, Xiangjie Kong

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);AI safety(abstract)

Comments 22 pages, 9 figures, accepted by AAAI2026 as oral paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07402 2025-06-10 cs.CR cs.CL 87%

Beyond Jailbreaks: Revealing Stealthier and Broader LLM Security Risks Stemming from Alignment Failures

Yukai Zhou, Sibei Yang, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);jailbreak(abstract);harmlessness(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16110 2025-04-24 cs.CR cs.AI 87%

Security-First AI: Foundations for Robust and Trustworthy Systems

Krti Tallam

机构 * EECS University of California at Berkeley(加州大学伯克利分校电子工程与计算机科学系)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);AI safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16339 2025-01-10 cs.CL cs.AI cs.CY cs.LG 87%

Deliberative Alignment: Reasoning Enables Safer Language Models

Melody Y. Guan, Manas Joglekar, Eric Wallace, Saachi Jain, Boaz Barak, Alec Helyar, Rachel Dias, Andrea Vallone, Hongyu Ren, Jason Wei, Hyung Won Chung, Sam Toyer, Johannes Heidecke, Alex Beutel, Amelia Glaese

专题命中 安全评测 :alignment(title,abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21965 2024-10-30 cs.CL 87%

SG-Bench: Evaluating LLM Safety Generalization Across Diverse Tasks and Prompt Types

Yutao Mou, Shikun Zhang, Wei Ye

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);trustworthy(abstract)

Comments Accepted by NeurIPS2024 (Dataset and Benchmark Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23686 2026-06-29 cs.RO 新提交 87%

LIBERO-Safety: A Comprehensive Benchmark for Physical and Semantic Safety in Vision-Language-Action Models

LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准

Rongxu Cui, Zongzheng Zhang, Jingrui Pang, Haohan Chi, Jinbang Guo, Saining Zhang, Shaoxuan Xie, Xin Jin, Yao Mu, Jiaolong Yang, Guocai Yao, Xianyuan Zhan, Ya-Qin Zhang, Hao Zhao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) Beihang University(北京航空航天大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

专题命中 安全评测 :safety(title,title_cn)

AI总结 针对视觉-语言-动作模型操作安全未验证的问题,提出参数化安全基准和关键帧驱动数据生成流水线,构建大规模无碰撞数据集,系统评估八种模型,揭示泛化-安全张力。

Comments Accepted by ECCV 2026, Project Page: https://libero-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05086 2026-08-06 cs.AI cs.CL 新提交 87%

Item Response Theory for AI Safety

面向AI安全的项目反应理论

Joshua Fonseca Rivera, Neil Shah, David Demitri Africa, Konstantinos Voudouris

机构 * Independent(独立研究者)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI

AI总结 该研究将项目反应理论(IRT)应用于192个语言模型的8个安全基准,识别出三个关键因素,证明IRT可降低评估成本并审计模型,建议前沿实验室采用。

Comments 15 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01153 2026-07-30 cs.CL cs.AI cs.SE 版本更新 87%

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

面向AI安全评估的对抗语用学:指令冲突、嵌入命令与策略模糊性基准

Brett Reynolds

机构 * Humber Polytechnic(汉博理工学院) University of Toronto(多伦多大学)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI

AI总结 提出对抗语用学基准和标注协议,通过语言学控制的分类法评估模型在指令冲突、嵌入命令等场景下的行为,为安全评估提供实证和方法论工具。

Comments 32-page main paper plus 13-page supplement; 6 figures and 17 tables total; code and data artifact available at the linked repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15166 2026-07-28 cs.AI cs.CL 版本更新 87%

MedFailBench: A Clinician-Built Open-Source Benchmark for Medical AI Safety Boundary Inspection

MedFailBench:用于医学人工智能安全边界检查的临床医生构建的开源基准测试

Goktug Ozkan

机构 * Kutahya Emet Dr. Fazil Dogan State Hospital(屈塔希亚埃梅特法齐尔·多安州立医院)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI

AI总结 MedFailBench提出不同问题,构建合成基准测试和失败图谱,通过严重程度和安全门类型标记医学人工智能错误,当前版本含44个合成病例等内容,以特定许可形式发布并带有DOI。

Comments 6 pages; synthetic benchmark reviewed by a clinician; no patient data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02655 2026-06-04 cs.CY cs.AI 87%

BioBlue: Systematic runaway-optimiser-like LLM failure modes on biologically and economically aligned AI safety benchmarks for LLMs with simplified observation format

BioBlue:在生物与经济对齐的AI安全基准上,具有简化观察格式的LLM的系统性类失控优化失败模式

Roland Pihlakas, Sruthi Susan Kuriakose

机构 * Independent researcher(独立研究者) Three Laws research collaboration(Three Laws研究合作) Rakvere, Estonia(爱沙尼亚拉克雷市)

专题命中 安全评测 :safety(title);AI safety(title);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本研究通过长期控制环境测试LLM,发现尽管LLM能理解目标,但在多目标场景下会系统性偏离至单目标、无界优化行为,表现出类似失控优化的失败模式。

Comments 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01494 2026-03-03 cs.SE cs.AI cs.CR cs.LG 87%

Inference-Time Safety For Code LLMs Via Retrieval-Augmented Revision

通过检索增强的修订实现代码LLM的推理时安全性

Manisha Mukherjee, Vincent J. Hellendoorn

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract,comments);alignment(abstract);分类 cs.AI、cs.LG

AI总结 通过检索增强的修订机制提升代码LLM的推理时安全性,提高生成代码的安全性并减少漏洞。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety Across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24394 2025-10-14 cs.CY cs.AI 87%

The 2025 OpenAI Preparedness Framework does not guarantee any AI risk mitigation practices: a proof-of-concept for affordance analyses of AI safety policies

Sam Coggins, Alexander K. Saeri, Katherine A. Daniell, Lorenn P. Ruster, Jessie Liu, Jenny L. Davis

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

Comments 19 pages, 5 tables, 1 figure; minor ambiguities clarified, typos corrected, author affiliations added

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12661 2025-10-14 cs.LG cs.CL cs.CV 87%

VLMGuard-R1: Proactive Safety Alignment for VLMs via Reasoning-Driven Prompt Optimization

Menglan Chen, Xianghe Pang, Jingjing Dong, WenHao Wang, Yaxin Du, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :safety(title,abstract);alignment(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13818 2025-07-30 cs.AI cs.CV cs.LG 87%

Ensuring Medical AI Safety: Interpretability-Driven Detection and Mitigation of Spurious Model Behavior and Associated Data

Frederik Pahde, Thomas Wiegand, Sebastian Lapuschkin, Wojciech Samek

机构 * Fraunhofer Heinrich Hertz Institut(弗劳恩霍夫 Heinrich Hertz 研究所) Technische Universität Berlin(柏林技术大学) Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所(BIFOLD))

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23706 2025-07-01 cs.AI cs.CL cs.CR 87%

Attestable Audits: Verifiable AI Safety Benchmarks Using Trusted Execution Environments

Christoph Schnabl, Daniel Hugenroth, Bill Marino, Alastair R. Beresford

机构 * Department of Computer Science and Technology, University of Cambridge(计算机科学与技术系,剑桥大学)

专题命中 安全评测 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.AI

Comments ICML 2024 Workshop TAIG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11746 2024-02-20 cs.CL cs.AI 87%

Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic

Rishabh Bhardwaj, Do Duc Anh, Soujanya Poria

专题命中 安全评测 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏