Following the Whispers of Values: Unraveling Neural Mechanisms Behind Value-Oriented Behaviors in LLMs
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
机构 * University of Oklahoma(俄克拉荷马大学) ; Stanford University(斯坦福大学) ; School of Electrical and Computer Engineering, Oklahoma State University(电气与计算机工程学院,俄克拉荷马州立大学) ; University of Glasgow(格拉斯哥大学)
专题命中 安全评测 :RLHF(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments Submitted to IEEE Transactions on Artificial Intelligence
机构 * Tradeweb Markets ; Western University(西方大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY、cs.LG
Comments 20 pages, 2 figures
Journal ref Wiley Interdisciplinary Reviews: Data Mining and Knowledge Discovery 15 (2025) e70011
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments 25 pages, 6 figures, 8 supplementary figures
Journal ref eBioMedicine(2025), Volume 114, 105642
专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments 12 pages, 5 figures, accepted at PAKDD 2025
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
Comments 12 pages, 12 figures
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments 21 pages, 1 table
专题命中 安全评测 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments Accepted to COLING 2025. The code and dataset are made public at https://github.com/ShujinWu-0814/ALOE
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments Published in ML4H Findings 2024, 4 pages
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments 78 pages, 7 figures, 2 tables
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments 17 pages, 9 figures
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Doctoral thesis
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY、cs.LG
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments Technical Paper
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Journal ref Int. J. Med. Inform.185 (2024)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Submitted to Information Science Journal
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Transactions on Machine Learning Research (TMLR), 2024
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY、cs.LG
Comments 14 pages, 2 figures, submitted to ACM Conference on Fairness, Accountability, and Transparency 2024 (ACM FAccT '24)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments AI deception, Large Language Models, ChatGPT
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.LG
Comments ICLR 2024 Camera Ready
专题命中 安全评测 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI