SteeringSafety: Benchmarking Representation Steering in LLMs Across Safety Perspectives
SteeringSafety:针对大语言模型在多安全视角下的表征引导基准测试
Vincent Siu, Nicholas Crispino, David Park, Nathan W. Henry, Zhun Wang, Yang Liu, Dawn Song, Chenguang Wang
机构
*
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Washington University in St. Louis(华盛顿大学圣路易斯分校)
;
University of California, Berkeley(加州大学伯克利分校)
CommentsAccepted manuscript: Workshop on Emerging Behaviors in Embodied AI for Achieving Robust Autonomy as part of European Conference on Computer Vision (ECCV) 2026
机构
*
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
Heriot-Watt University(赫瑞瓦特大学)
;
Southern University of Science and Technology(南方科技大学)
;
University of California, San Diego(加利福尼亚大学圣迭戈分校)
;
Northeastern University(东北大学)
Grounding Large Language Models as Generalizable Policies in Network Control
大语言模型作为网络优化的通用策略
Duo Wu, Linjia Kang, Zhimin Wang, Fangxin Wang, Wei Zhang, Chongbo Sun, Xuefeng Tao, Wei Yang, Le Zhang, Wenwu Zhu, Peng Cui, Zhi Wang
机构
*
Bytedance(字节跳动)
;
Shenzhen International Graduate School(深圳国际研究生院)
;
Tsinghua University(清华大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Department of Computer Science and Technology(计算机科学与技术系)