Integrating Emotional and Linguistic Models for Ethical Compliance in Large Language Models
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
Comments 29 pages, 10 tables, 6 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
Comments 29 pages, 10 tables, 6 figures
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accpeted by LREC-COLING 2024 main conference, long paper
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
Journal ref David C. Wyld et al. (Eds): NBIoT, MLCL, NMCO, ARIN, CSITA, ISPR, NATAP-2024. pp. 153-173, 2024. CS & IT - CSCP 2024
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
Journal ref IEEE Access 2024
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY、cs.LG
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY、cs.LG
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG
Journal ref ICSE-SEIS 2024
专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY、cs.LG
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
Comments 15 pages, 4 figures, International Conference on Software Business
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted as Oral at the AAAI 2nd Workshop on Sustainable AI
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY、cs.LG
Comments 10 pages + references, 1 figure, accepted at NeurIPS 2023 Workshop on Regulatable ML as oral presentation
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY、cs.LG
Comments 35 pages, 18 figures, 32 tables. This work is an extended version of our paper (arXiv:2310.04955). Code will be released at https://github.com/jiazhi412/strong_attribute_bias
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY
Comments Presented at NeurIPS 2023 Moral Pyschology and Moral Philosophy workshop
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.LG
Comments 8 pages, 4 figures
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG
Comments 15 pages
Journal ref International Journal on Cybernetics & Informatics (IJCI) Vol.12, No.6, December 2023
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
Comments 21 pages, 1 figure
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY
Comments 7 pages, 1 table