DoubtProbe: Black-Box Jailbreak Defense via Structural Verification and Semantic Auditing
DoubtProbe:通过结构验证与语义审计的黑盒越狱防御
Xuanyu Yin, Yilin Jiang, Jun Zhou, Kai Chen, Zhengfu Cao, Xiaolei Dong
机构
*
East China Normal University(东华大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
机构
*
Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉斯·吉万拉尔·桑格维工程学院)
;
King’s College London(伦敦国王学院)
;
Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)
Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards
多模态大语言模型的演进安全态势:新兴威胁与防护措施综述
Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang
机构
*
University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
;
NVIDIA(英伟达公司)
;
Penn State University(宾夕法尼亚州立大学)
;
Columbia University(哥伦比亚大学)
;
University of Missouri-Kansas City(密苏里大学堪萨斯分校)
;
Florida State University(佛罗里达州立大学)
;
Auburn University(奥本大学)
Synthetic Persona Pretraining: Alignment from Token Zero
合成角色预训练:从零开始的对齐
Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West
机构
*
The Hong Kong University of Technology and Science (Guangzhou)(香港科技与应用科技大学(广州))
;
East China Normal University(华东师范大学)
;
Shanghai Qi Zhi Institute(上海启智研究院)
;
Wuhan University(武汉大学)
;
Institute of Deep Perception Technology, JITRI(视觉感知技术研究院,JITRI)
;
CAIR, Hong Kong Institute of Science and Innovation (HKISI)(创新科技研究院,香港科学与创新研究院(HKISI))
;
MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)
Ge Shi, Jun Yin, Donglin Xie, Fangyi Liu, Yucan Li, Menglin Liu
机构
*
University of California, Davis(加州大学戴维斯分校)
;
The Renmin University of China(中国人民大学)
;
Independent Researcher(独立研究员)
;
Nankai University(南开大学)
;
Cornell University(康奈尔大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
One Jailbreak, Many Tongues: Learning Language-Insensitive Intention Representations for Multilingual Jailbreak Detection
一次越狱,多种语言:学习语言无关的意图表示用于多语言越狱检测
Shuyu Jiang, Kaiyu Xu, Xingshu Chen, Hao Ren, Rui Tang, Yi Zhang, Tianwei Zhang, Hongwei Li
机构
*
School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院)
;
School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)
;
School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)