Learning to be Safe: Deep RL with a Safety Critic
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments In submission, 16 pages (including appendix)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments In submission, 16 pages (including appendix)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments Accepted at IROS2020. Project site: https://denkiwakame.github.io/l2b/
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
Comments Accepted by Information and Software Technology. arXiv admin note: substantial text overlap with arXiv:1908.06540
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
Comments 9 pages
Journal ref IAES International Journal of Artificial Intelligence (IJ-AI) Vol. 9, No. 3, September 2020, pp. 439~447, ISSN: 2252-8938, DOI: 10.11591/ijai.v9.i3.pp439-447
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments Accepted to the 37th International Conference on Machine Learning (ICML 2020)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments 6 pages, 7 figure, 1 table
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments Extended version (12 Pages), Short version submitted to Learning for Dynamics & Control (L4DC) 2020 Conference
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments Accepted at Safe AI workshop at AAAI 2020
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
专题命中 安全训练 :trustworthy(title,abstract);分类 cs.CY
Comments Position paper, accepted by The 1st Workshop on Distributed Ledger of Things (DLoT 2018), co-located with EAI Mobiquitous 2018. Nov. 5, 2018, New York, NY, USA
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
Comments 12 pages, 7 figures
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
Comments Accepted by International Conference on Computer Aided Verification (CAV) 2018
专题命中 安全训练 :safety(title,abstract);分类 cs.CY
Comments Big Data, 2017
专题命中 安全训练 :alignment(title,abstract)
Comments Bidirectional Human-AI Alignment (Bi-Align) Workshop @ ICLR 2025
专题命中 安全训练 :safety(title,abstract)
Comments 7 Pages, accepted for Safety of Industrial Automated Systems, SIAS 2024
低宜人性人格条件化用于安全的大语言模型微调
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 针对温暖微调降低大语言模型安全性的问题,提出基于低宜人性人格的改写流水线,在保持对话温暖的同时降低越狱成功率与有害输出率。
Comments 9 pages, 8 tables, 5 figures
语义自验证的NP难下界复杂度
机构 * University of Cambridge(剑桥大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 本文证明语义自验证问题在特定框架下为NP完全,通过将3SAT问题归约到SSV,揭示了即使简化形式的语义自验证也面临计算障碍,对AI安全和公平性方法有重要影响。
Comments EACL 2026
机构 * OpenAI
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
机构 * University of Arizona(亚利桑那大学)
专题命中 安全训练 :safety(abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI、cs.LG
机构 * IBM T.J. Watson Research Center(IBM T.J. Watson研究院)
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
机构 * University of Pennsylvania(宾夕法尼亚大学) ; NASA Ames and CMU(NASA阿姆斯特朗研究中心和卡内基梅隆大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cornell University(康奈尔大学) ; Penn(宾夕法尼亚大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; CMU(卡内基梅隆大学)
专题命中 安全训练 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI、cs.CY
专题命中 安全训练 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 安全训练 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI、cs.LG
Comments v2 with fixed formatting for URLs and hyperlinks
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments ICML 2024 NextGenAISafety workshop version with links to implementation and dataset
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments 13 pages, 2 figures
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI知识蒸馏中的可靠性-安全性权衡:一种重整化群方法
专题命中 安全训练 :safety(title,abstract)
AI总结 该研究基于统计力学构建知识蒸馏的粗粒化模型,以参数K表征危险辨别能力,揭示了AI蒸馏中可靠性与安全性的权衡关系,为多代蒸馏提供了可检验的标度预测。