CORAL: Learning Consistent Representations across Multi-step Training with Lighter Speculative Drafter
机构 * AI Lab, Lenovo Research(联想研究院人工智能实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACL 2025 main conference
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * AI Lab, Lenovo Research(联想研究院人工智能实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACL 2025 main conference
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ICML 2025. Code and dataset are available at: https://github.com/AIDC-AI/Parrot
机构 * Georgia State University(佐治亚州立大学) ; University of Georgia(佐治亚大学) ; Microsoft(微软) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
机构 * Department of Electrical and Computer Engineering, University of Southern California(电气与计算机工程系,南加州大学) ; Department of Radiology and Imaging Sciences, University of Utah(放射学与影像科学系,犹他大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
Comments 24 Pages, 9 figures, The Thirteenth International Conference on Learning Representations (ICLR) 2025
机构 * Shanghai Jiao Tong University(上海交通大学) ; Meituan(美团)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Under Review
专题命中 安全评测 :alignment(abstract);safety(abstract)
机构 * Amara Tariq, Ph.D(博士) ; Rimita Lahiri, Ph.D(博士) ; Charles Kahn, M.D(医学博士) ; Imon Banerjee, Ph.D(博士)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 15 pages, 2, tables, 3 figures
机构 * Computer Science and Engineering University at Buffalo(计算机科学与工程大学布法罗分校)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 5 Pages, 8 Figures
Journal ref IEEE Access (2023)
机构 * Aizierjiang Aiersilan(独立研究者)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments We are excited to announce that this paper has been accepted for oral presentation at the AAAI 2025 Main Conference. We are grateful for the insightful feedback from the reviewers and look forward to contributing to the discussions at AAAI
机构 * Department of Computer Science, University of Maryland, College Park, Maryland, USA(计算机科学系,马里兰大学,College Park,马里兰,美国)
专题命中 安全评测 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 12 pages, 1 figure, 3 tables
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Kun Jiang, Mengmeng Yang and Diange Yang are Corresponding Author. The main paper and supplementary material are both included here, total 23 pages (main paper is 10 pages and supplementary material is 13 pages), total 17 figures (6 figures in main paper and 11 figures in supplementary material), this paper is Accepted to CVPR WDFM-AD Workshop 2025, The code will be available at https://Ankit-Zefan.github.io/CleanMap/
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 8 pages
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 22 pages, 3 figures, code link: https://github.com/ChicagoHAI/HypoEval-Gen
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 2024 IEEE International Conference on Big Data (BigData)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2025
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to SALMA Workshop ICASSP 2025
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Extension of our SIGMOD 2025 paper. Please refer to source code available at: https://github.com/weAIDB/CrackSQL
专题命中 安全评测 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 6 pages, 2 figures, 1 tables. AI for Public Missions (AIPM) Workshop at the 39th AAAI Conference on Artificial Intelligence (AAAI 2025)
专题命中 安全评测 :jailbreak(abstract);trustworthy(abstract)
专题命中 安全评测 :harmlessness(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Please visit https://llm-catastrophic-risks.github.io for a quick tour of our research. Our code is available at https://github.com/pillowsofwind/LLM-CBRN-Risks
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 25 pages, 8 figures, 4 tables; appeared in ADI (March 2025)
Journal ref ADI 2, 15-39 (2025)
专题命中 安全评测 :safety(abstract);jailbreak(abstract)
Comments 45 pages, 5 figures, 18 tables
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 32 pages, 5 figures, 4 tables
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG