Elizabeth Hilliard, Akshaya Jagadeesh, Alex Cook, Steele Billings, Nicholas Skytland, Alicia Llewellyn, Jackson Paull, Nathan Paull, Nolan Kurylo, Keatra Nesbitt, Robert Gruenewald, Anthony Jantzi, Omar Chavez
Super Co-alignment of Human and AI for Sustainable Symbiotic Society
Yi Zeng, Feifei Zhao, Yuwei Wang, Enmeng Lu, Yaodong Yang, Lei Wang, Chao Liu, Yitao Liang, Dongcheng Zhao, Bing Han, Haibo Tong, Yao Liang, Dongqi Liang, Kang Sun, Boyuan Chen, Jinyu Fan
机构
*
Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐关键实验室)
;
Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院)
;
Brain-inspired Cognitive AI Lab(脑启发认知人工智能实验室)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Wenge Technology Co., Ltd.(Wenger 技术有限公司)
;
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
Long-term AI(长期人工智能)
;
State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(北京师范大学认知神经科学与学习国家重点实验室)
LLMs Lost in Translation: M-ALERT uncovers Cross-Linguistic Safety Inconsistencies
Felix Friedrich, Simone Tedeschi, Patrick Schramowski, Manuel Brack, Roberto Navigli, Huu Nguyen, Bo Li, Kristian Kersting
机构
*
TU Darmstadt(图宾根大学)
;
Sapienza University of Rome(罗马萨皮恩扎大学)
;
DFKI(德意志联邦防务研究院)
;
CERTAIN(CERTAIN公司)
;
University of Chicago(芝加哥大学)
;
UIUC(伊利诺伊大学香槟分校)
Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation
Ning Wang, Zihan Yan, Weiyang Li, Chuan Ma, He Chen, Tao Xiang
机构
*
College of computer science, Chongqing University(重庆大学计算机学院)
;
Department of Information Engineering, The Chinese University of Hong Kong(香港中文大学信息工程系)
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)
;
Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学)
;
Shanghai Key Laboratory of Multi. Info. Processing, East China Normal University(上海多信息处理重点实验室,华东师范大学)
;
Kuaishou-Inc(快手公司)
BEYOND DIALOGUE: A Profile-Dialogue Alignment Framework Towards General Role-Playing Language Model
Yeyong Yu, Runsheng Yu, Haojie Wei, Zhanqiu Zhang, Quan Qian
机构
*
School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院)
;
LIGHTSPEED
;
The Hong Kong University of Science and Technology(香港科技大学)
Establishing Trustworthy LLM Evaluation via Shortcut Neuron Analysis
Kejian Zhu, Shangqing Tu, Zhuoran Jin, Lei Hou, Juanzi Li, Jun Zhao
机构
*
The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)
;
Tsinghua University(清华大学)