Diffusion Theory as a Scalpel: Detecting and Purifying Poisonous Dimensions in Pre-trained Language Models Caused by Backdoor or Bias
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL
Comments Accepted by Findings of ACL 2023
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL
Comments Accepted by Findings of ACL 2023
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
Comments 6 pages, 5 figures,1 table, manuscript created for consideration at IEEE IV 2023 conference
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
Journal ref Machine Learning (2022) 1-18
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
Comments Version 1 presented at Causal Inference Challenges in Sequential Decision Making: Bridging Theory and Practice (2021), a NeurIPS 2021 Workshop; Version 2 presented at the 2nd ACM Symposium on Computer Science and Law (2022) (DOI: https://dl.acm.org/doi/10.1145/3511265.3550439)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
Comments Comments were integrated into the paper from all peer reviewers. Am happy to provide a copied history of comments if useful
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
Comments Accepted by CIKM 2022
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
Comments 28 pages; 3 Tables; 21 Figures
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
Comments AdvML Frontiers 2022 @ ICML 2022 workshop
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI
Comments 44 pages, 17 figures, the draft of a paper on International Journal of Human-Computer Interaction
Journal ref International Journal of Human-Computer Interaction, 2022
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
Comments 11 pages, accepted by ACL 2022 main conference
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
Comments 7 pages, 1 figure, Published at ML Evaluation Standards Workshop at ICLR 2022. arXiv admin note: substantial text overlap with arXiv:1905.06289
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
Comments 8 pages, 6 figures
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.LG
Journal ref International Workshop on Equitable Data and Technology (FairWare 2022 ), May 9, 2022, Pittsburgh, PA, USA
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG
Comments 18 pages, 10 figures, 2 tables, submitted to Physical Review
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
Comments 60 pages, 7 boxes, 2 figures, 2 annexes, submitted for Eds M. Raska, Z. Stanley-Lockman, & R. Bitzinger. AI Governance for National Security and Defence: Assessing Military AI Strategic Perspectives. Routledge
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
Comments In Proceedings of the AAAI 2022 Conference
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
Journal ref SN Computer Science, 2022
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
Journal ref AI & Soc (2022)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
Comments 42 pages, 13 figures, accepted for publication in Nature Scientific Reports
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
Comments Accepted at Workshop on Insights from Negative Results in NLP 2021
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG