XL-SafetyBench: A Country-Grounded Cross-Cultural Benchmark for LLM Safety and Cultural Sensitivity
XL-SafetyBench: 一个基于国家的跨文化安全基准,用于LLM安全性和文化敏感性
Dasol Choi, Eugenia Kim, Jaewon Noh, Sang Seo, Eunmi Kim, Myunggyo Oh, Yunjin Park, Brigitta Jesica Kartono, Josef Pichlmeier, Helena Berndt, Sai Krishna Mendu, Glenn Johannes Tungka, Özlem Gökçe, Suresh Gehlot, Katherine Pratt, Amanda Minnich, Haon Park
机构
*
AIM Intelligence(AIM智能研究院)
;
Microsoft(微软公司)
;
Korea AISI(韩国人工智能研究所)
;
KT Corporation(KT公司)
;
BMW Group(宝马集团)
;
Coinbase(Coinbase公司)
;
Technical University of Munich(慕尼黑技术大学)
;
Ankara University(安卡拉大学)
;
Cyril Amarchand Mangaldas(Cyril Amarchand Mangaldas法律事务所)
;
Seoul National University(首尔国立大学)
机构
*
Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学)
;
Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学)
;
Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)
LoopTrap: Termination Poisoning Attacks on LLM Agents
LoopTrap: 对 LLM agent 的终止污染攻击
Huiyu Xu, Zhibo Wang, Wenhui Zhang, Ziqi Zhu, Yaopeng Wang, Kui Ren, Chun Chen
机构
*
The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室)
;
Zhejiang University(浙江大学)
;
School of Cyber Science and Engineering(网络安全与工程学院)
;
Southeast University(东南大学)
Comments6 pages, 11 figures, Accepted and presented at the 2nd International Conference on Emerging Computational Intelligence (ICECI 2026), IEEE. Published in conference proceedings. To appear in IEEE Xplore
When No Benchmark Exists: Validating Comparative LLM Safety Scoring Without Ground-Truth Labels
在没有基准的情况下:在无标签的情况下验证比较LLM安全性评分
Sushant Gautam, Finn Schwall, Annika Willoch Olstad, Fernando Vallecillos Ruiz, Birk Torpmann-Hagen, Sunniva Maria Stordal Bjørklund, Leon Moonen, Klas Pettersen, Michael A. Riegler
机构
*
Simula Metropolitan Center for Digital Engineering(Simula 数字工程中心)
;
Oslo Metropolitan University(奥斯陆 Metropolitan 大学)
;
University of Oslo(奥斯陆大学)
;
Simula Research Laboratory(Simula 研究实验室)
;
Norwegian Directorate of Health(挪威健康 Directorate)
GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment
GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估
Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx
Comments14 pages of main content, 3 figures, 4 tables, 9 appendices. This paper has been submitted to the Becker Friedman Institute 2026 AI in Social Sciences conference for peer review
Detecting Time Series Anomalies Like an Expert: A Multi-Agent LLM Framework with Specialized Analyzers
像专家一样检测时间序列异常:一种多智能体LLM框架与专用分析器
Hyeongwon Kang, Jeongseob Kim, Jinwoo Park, Pilsung Kang
机构
*
Department of Industrial and Management Engineering(工业与管理工程系)
;
Korea University(韩国大学)
;
Department of Industrial Engineering(工业工程系)
;
Seoul National University(首尔国立大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
DeEscalWild: A Real-World Benchmark for Automated De-Escalation Training with SLMs
DeEscalWild:一个用于自动缓和训练的现实世界基准数据集
Md Hasebul Hasan, Krity Haque Charu, Eshwara Prasad Sridhar, Shuchisnigdha Deb, Mohammad A. Islam
机构
*
Department of Computer Science and Engineering(计算机科学与工程系)
;
Department of Industrial, Manufacturing, and Systems Engineering(工业、制造与系统工程系)
;
University of Texas at Arlington(德克萨斯大学阿灵顿分校)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)