Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons
Jianhui Chen, Xiaozhi Wang, Zijun Yao, Yushi Bai, Lei Hou, Juanzi Li
机构
*
Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist)
;
Shenzhen International Graduate School(深圳国际研究生院)
;
KIRC, Institute for Artificial Intelligence, Tsinghua University(人工智能研究院,清华大学)
Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model
深度对齐但不确定性依然存在:通过将不安全行为归因于基础模型来改进推理时间的安全性
Pankayaraj Pathmanathan, Furong Huang
机构
*
University of Maryland College Park(马里兰大学学院市)
机构
*
MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学)
;
Nanyang Technological University(南洋理工大学)
;
National University of Singapore(新加坡国立大学)
;
Tianjin University(天津大学)
SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration
SFCoT:通过主动安全评估和校准实现更安全的推理链
Yu Pan, Wenlong Yu, Tiejun Wu, Xiaohu Ye, Qiannan Si, Guangquan Xu, Bin Wu
机构
*
Department College of Intelligence and Computing(智能与计算学院)
;
Tianjin University(天津大学)
;
NSFOCUS Technologies Group Co., Ltd.(NSFOCUS技术集团有限公司)
;
College of Management and Economics(管理与经济学院)
;
School of Cyber Security(网络安全学院)
Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy
Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones
机构
*
Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系)
;
University of Oxford(牛津大学)
;
Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托)
;
OATML, Department of Computer Science(OATML,计算机科学系)
SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement
SAHOO:递归自我改进中高阶优化目标的安全保障
Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary
机构
*
MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学)
;
AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务)
;
Google, USA(谷歌)
;
Stanford University(斯坦福大学)
;
Northeastern University, Seattle, WA, USA(东北大学)
Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities
为何人工智能安全需要不确定性、不完全偏好和非阿基米德效用
Alessio Benavoli, Alessandro Facchini, Marco Zaffalon
机构
*
School of Computer Science and Statistics, Trinity College Dublin(特里尼蒂大学计算机科学与统计学学院)
;
Trinity Quantum Alliance, Trinity College Dublin(特里尼蒂量子联盟)
;
Management in Networked and Digital Societies (MINDS) Department, Kozminski University(科津斯基大学网络化与数字化社会管理系)
SafeLLM: Extraction as a Hallucination-Resistant Alternative to Rewriting in Safety-Critical Settings
SafeLLM: 在安全关键场景中,提取作为重写的抗幻觉替代方案
Julia Ive, Felix Jozsa, Evridiki Georgaki, Nabeel Sheikh, Emma Cattell, Nick Jackson, Paulina Bondaronek, Ciaran Scott Hill, Richard Dobson
机构
*
Institute of Health Informatics, University College London(伦敦大学学院健康信息学研究所)
;
National Hospital for Neurology and Neurosurgery(国家神经内科与神经外科医院)
;
Somerset NHS Foundation Trust(萨默塞特NHS基金会信托)
;
King's College Hospital(国王学院医院)
;
King's College London(伦敦国王学院)
Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking
评估大语言模型中的AI对齐:通过75个模型的人类基准测试分析价值优先级
Gabriel Rongyang Lau, Wei Yan Low, Seow Min Koh, Fiona Fui-Hoon Nah, Andree Hartanto
机构
*
School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院)
;
Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目)
;
Faculty of Arts and Social Sciences, National University of Singapore(新加坡国立大学人文与社会科学学院)
;
School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息学院)
;
School of Social Sciences, Singapore Management University(新加坡管理学院社会科学学院)