TANDEM: Temporal-Aware Neural Detection for Multimodal Hate Speech
TANDEM: 面向多模态仇恨言论的时间感知神经检测
Girish A. Koushik, Helen Treharne, Diptesh Kanojia
机构
*
Nature-Inspired Computing & Engineering, University of Surrey(Surrey大学自然启发计算与工程系)
;
Surrey Centre for Cyber Security, University of Surrey(Surrey大学网络安全中心)
Large-Scale ChatBot Validation Through Customer Digital Twin Simulations
基于客户数字孪生模拟的大规模聊天机器人验证
Cristovao Iglesias, Devesh Batra, Alankar Atreya, Stefan Wagner, Robert Hankache, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi
State-Dependent Safety Failures in Multi-Turn Language Model Interaction
多轮语言模型交互中的状态依赖性安全故障
Pengcheng Li, Jie Zhang, Tianwei Zhang, Han Qiu, Zhang kejun, Weiming Zhang, Nenghai Yu, Wenbo Zhou
机构
*
School of Cyber Science and Technology, University of Science and Technology of China, China(中国科学技术大学信息科学与技术学院)
;
Nanyang Technological University, Singapore(南洋理工大学)
;
Tsinghua University, Beijing, China(清华大学)
;
Beijing Electronic Science and Technology Institute, Beijing, China(北京电子科技研究所)
The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure
能力悖论:更聪明的审计员如何使多智能体系统更不安全
Qiqi Liu, Runhan Song, Shilin Ye
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)
;
Henan Yinzhu Safety Technology Co., Ltd.(河南亿众安全技术有限公司)
;
Harbin Institute of Technology, Faculty of Computing(哈尔滨工业大学计算机学院)
GPT-Red: Automated Red Teaming via Self-Play at Scale
GPT-Red:基于大规模自博弈的自动化红队测试
Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen
CommentsPreprint; suitable for AI, decision sciences, and prescriptive analytics. Short versions published in Wharton Sports Analytics Journal Fall 2025 (AI Feature Spotlight) and accepted to AAAI Bridge on LM Reasoning 2026
Conformal Changepoint Localization and Root Cause Analysis with Corrupted Observations
含损坏观测值的保序变点定位与根因分析
Seunghun Yu, Meiyi Zhu, Petar Popovski, Joonhyuk Kang, Osvaldo Simeone
机构
*
Korea Advanced Institute of Science and Technology(韩国科学技术院)
;
King’s College London(伦敦国王学院)
;
Aalborg University(奥尔堡大学)
;
Northeastern University London(伦敦东北大学)
MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications
MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估
Praveenkumar Kanithi, Clément Christophe, Marco AF Pimentel, Tathagata Raha, Prateek Munjal, Nada Saadi, Hamza A Javed, Svetlana Maslenkova, Nasir Hayat, Ronnie Rajan, Shadab Khan