A Criminology of Machines
机构 * Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments This pre-print is also available at CrimRxiv with DOI: https://doi.org/10.21428/cb6ab371.e3354ce1
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Fondazione Bruno Kessler(布鲁诺·科斯勒基金会)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments This pre-print is also available at CrimRxiv with DOI: https://doi.org/10.21428/cb6ab371.e3354ce1
机构 * University of the Basque Country(巴斯克大学) ; Lebanese International University (LIU)(黎巴嫩国际大学) ; The International University of Beirut(贝鲁特国际大学) ; IKERBASQUE
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
机构 * BNRIST, Tsinghua University(北京理工大学、清华大学) ; Independent Researcher(独立研究者)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Carnegie Mellon University(卡内基梅隆大学) ; Squirrel Ai Learning
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
机构 * University of Calabria(卡利博利亚大学)
专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Journal ref Cantini, R., Orsino, A., Ruggiero, M., Talia, D. Benchmarking adversarial robustness to bias elicitation in large language models: scalable automated assessment with LLM-as-a-judge. Mach Learn 114, 249 (2025)
机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(人工智能通用基础理论国家重点实验室,智能科学与技术学院,北京大学) ; Yuanpei College, Peking University(元培学院,北京大学) ; School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) ; Key Laboratory of Machine Perception (Ministry of Education), Peking University(机器感知重点实验室(教育部),北京大学) ; PKU-Wuhan Institute for Artificial Intelligence(北京大学-武汉人工智能研究院)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments ACL 2025 Main
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments Topic and scope refinement
机构 * MIT Media Lab(麻省理工学院媒体实验室)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments PhD thesis
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments This is a chapter intended for publication in a forthcoming edited volume. It is the version of the author's manuscript prior to acceptance for publication and has not undergone editorial and/or peer review on behalf of the Publisher
机构 * Department of Electrical and Electronic Engineering(电子与电气工程系) ; The Hong Kong Polytechnic University(香港理工大学) ; School of Electronics and Information(电子与信息学院) ; Northwestern Polytechnical University(西北工业大学)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
机构 * Queen’s University Vector Institute(女王大学向量研究所) ; SigmaRed Tech.(SigmaRed科技公司) ; Ernst & Young(埃森哲) ; Monark Health(Monark健康)
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments 16 pages, 2 figures
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments This article is a preprint and has not been peer-reviewed. The postprint has been accepted for publication in AI and Ethics. Please cite the final version of the article once it is published
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI
Comments 14 pages
Journal ref World Journal of Advanced Engineering Technology and Sciences, 2023, 10(2), 283-296
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
Comments AI Governance Workshop at the 2024 International Joint Conference on Artificial Intelligence (IJCAI)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
Comments 16 pages, work in progress
专题命中 AI治理与伦理 :alignment(abstract);red teaming(abstract);分类 cs.CL、cs.AI
Comments Five appendix
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
Comments 8 pages
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
Journal ref AI and Ethics 2023
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.CY
Comments As part of a series on Dailynous : "Philosophers on next-generation large language models"
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
Comments 26 pages, 12 figures
Journal ref AI and Ethics (2023)
专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
Comments 120 pages