LLM Unlearning via Loss Adjustment with Only Forget Data
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Paper under review
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Paper under review
专题命中 AI治理与伦理 :safety(abstract);trustworthy(abstract)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted in ICPR 2024
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Updated with fine-tuned model results to match CoLM accepted camera-ready version
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Accepted at Artificial Intelligence, Ethics, and Society 2024
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 28 pages, 5 figures
专题命中 AI治理与伦理 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by ACL 2024 findings, this is the camera-ready version; 21 pages, 22 figures
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Findings of ACL 2024
专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 10 pages
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG
专题命中 AI治理与伦理 :RLHF(abstract);分类 cs.AI、cs.CY、cs.LG
Comments TACL 2024. Presented at ACL 2024. 12 pages
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Accepted by ICLR 2024
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 8 pages, 4 tables, 2 figures
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Northwestern Journal of Technology and Intellectual Property, Volume 20, Issue 3, 2023
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Code and models are available at https://github.com/ZrrSkywalker/LLaMA-Adapter
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Published at NeurIPS 2022
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 30 pages, 10 figures, 5 tables. Website: https://sites.google.com/view/robots-enact-stereotypes . Published in the 2022 ACM Conference on Fairness, Accountability, and Transparency (FAccT 22), June 21-24, 2022, Seoul, Republic of Korea. ACM, DOI: https://doi.org/10.1145/3531146.3533138 . FAccT22 Submission dates: Abstract Dec 13, 2021; Submitted Jan 22, 2022; Accepted Apr 7, 2022
Journal ref In 2022 ACM Conference on Fairness, Accountability, and Transparency (FAccT 22). ACM, New York, NY, USA, 743-756
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Published in FAccT 2022
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 39 Pages
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
Comments AISTATS 2022. Code is released at https://github.com/JFChi/Return-Parity-MDP
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments published in Journal of Artificial Intelligence Research, 71: 431-478, July 2021