Self-Guided Adaptive Safety Alignment: Synthesizing and Internalizing Guidelines in Reasoning Models
自引导防御:通过合成指南实现推理模型的自适应安全对齐
Yuhang Wang, Yanxu Zhu, Jiaming Zhang, Dongyuan Lu, Jitao Sang
机构
*
Beijing Key Lab of Traffic Data Analysis and Mining(北京交通大数据分析与挖掘重点实验室)
;
Beijing Jiaotong University(北京交通大学)
;
School of Information Technology and Management(信息科技与管理学院)
;
University of International Business and Economics(国际经济贸易大学)
JigShape: Evaluating Visual-Geometric Reasoning in VLMs through Jigsaw Puzzles
JigShape:通过拼图任务评估视觉语言模型的视觉几何推理能力
Shawn Li, Wei Yang, Jike Zhong, Jiate Li, Jiawei Yang, You Qin, Ryan Rossi, Franck Dernoncourt, Roger Zimmermann, Yue Wang, Zhengzhong Tu, Vicente Ordonez, Mohit Bansal, Yue Zhao
机构
*
University of Southern California(南加州大学)
;
National University of Singapore(新加坡国立大学)
;
Adobe Research(奥多比研究院)
;
Texas A&M University(德克萨斯农工大学)
;
Rice University(莱斯大学)
;
The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
机构
*
Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)
;
Tough Cyberphysical AI Research Center, Tohoku University(东北大学 Tough 跨物理AI研究中心)
;
RWTH Aachen University(亚琛工业大学)