Internalizing Safety Understanding in Large Reasoning Models via Verification
通过验证内部化安全理解以提升大推理模型
Yi Zhang, Yuxin Chen, Leheng Sheng, Dongcheng Zhang, Chaochao Lu, Xiang Wang, An Zhang
机构
*
National University of Singapore(国立新加坡大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
机构
*
Beihang University(北航)
;
Beijing Institute of Technology(北京理工大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Peking University(北京大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
A2D: Any-Order, Any-Step Safety Alignment for Diffusion Language Models
A2D: 任意顺序、任意步长的安全对齐用于扩散语言模型
Wonje Jeung, Sangyeon Yoon, Yoonjun Cho, Dongjae Jeon, Sangwoo Shin, Hyesoo Hong, Albert No
机构
*
Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学)
;
Department of Computer Science and Engineering, Yonsei University(计算机科学与工程系,延世大学)
Light Alignment Improves LLM Safety via Model Self-Reflection with a Single Neuron
通过单个神经元的模型自反进行轻量级对齐以提升大语言模型的安全性
Sicheng Shen, Mingyang Lv, Han Shen, Jialin Wu, Binghao Wang, Zhou Yang, Guobin Shen, Dongcheng Zhao, Feifei Zhao, Yi Zeng
机构
*
Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院)
;
Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室)
;
Ant Group Co., Ltd.(蚂蚁集团有限公司)
;
BrainCog Lab., CASIA(CASIA脑认知实验室)
;
Zhongguancun Academy(中关村学院)