h2oGPT: Democratizing Large Language Models
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Work in progress by H2O.ai, Inc
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Work in progress by H2O.ai, Inc
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted in the 40th International Conference on Machine Learning (ICML 2023)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2023
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
Comments under review in IEEE
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Accepted to IEEE Computer Magazine. To be published in 2023
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments In proceedings of the 36th Conference on Neural Information Processing Systems (NeurIPS 2022)
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments This paper was accepted ECML PKDD 2022
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 14 pages, EMNLP 2022 Main Conference
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 9 pages, 5 figures
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
专题命中 安全评测 :safety(abstract);AI safety(abstract)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2022 (Findings)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 341 pages
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 34 pages, 4 figures, 4 tables
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments 10 pages
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
Comments 18 Pages, 6 Figures, under submission
专题命中 安全评测 :safety(abstract);AI safety(abstract)
专题命中 安全评测 :safety(abstract);AI safety(abstract)
Comments Paper accepted to ACCV 2018 (Asian Conference on Computer Vision)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To appear at AAAI 2016 (and an extended version of a NIPS 2015 Multimodal Machine Learning workshop paper)
基于社会基础的智能体人工智能:通过社会理论协调多元视角
专题命中 安全评测 :alignment(abstract,comments);分类 cs.AI、cs.LG
AI总结 本文提出将社会理论用于人工智能系统设计,以解决多元对齐问题,将多元对齐重新定位为基于社会基础的协调问题,勾勒了相关系统的设计空间并指明未来研究方向。
Comments Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea
SURGELLM: 通过任务感知特征门控与类别平衡归一化重新思考多任务评估
机构 * Istanbul Technical University(伊斯坦布尔理工大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI;trustworthy(comments)
AI总结 针对异构NLP任务中归纳偏置不匹配、类别不平衡和缺乏外部词汇知识的问题,提出统一Transformer框架SURGELLM,包含手术特征门控、任务条件前缀令牌和实例加权归一化,在四个任务上平均F1提升0.036。
Comments Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), ACL 2026, San Diego, California, USA. Available at https://openreview.net/forum?id=WJCalficPT
BELLS-O:评估LLM监督系统的运营权衡
机构 * University of Graz, Graz, Austria(格拉茨大学) ; Supervised Program for Alignment Research (SPAR)(对齐研究监督计划 (SPAR)) ; Centre pour la Sécurité de l'IA (CeSIA), Paris, France(人工智能安全研究中心 (CeSIA),巴黎,法国)
专题命中 安全评测 :jailbreak(abstract);分类 cs.AI、cs.LG;trustworthy(comments)
AI总结 提出首个独立运营基准BELLS-O,评估28个LLM监督系统在检测率、误报率、延迟和成本上的权衡,发现专用护栏在内容审核中占优,而前沿通用模型在越狱检测中表现更好但成本更高。
Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD). 2 figures; main text plus appendices
谁被标记?AI内容水印中的多元评估差距
机构 * Case Western Reserve University(凯斯西储大学)
专题命中 安全评测 :alignment(abstract,comments);分类 cs.CL、cs.CY
AI总结 本文揭示AI内容水印在不同语言、文化和群体间存在系统性偏差,提出跨语言检测一致性、文化多样性覆盖和检测指标人口统计分解三个评估维度,主张水印部署前必须进行公平性审计。
Comments 7 pages. Accepted at the Multimodal Alignment for a Pluralistic Society (MAPS) Workshop, CVPR 2026
衡量推理模型的弱到强可读性
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI;trustworthy(comments)
AI总结 针对推理语言模型在多智能体场景中生成的中间思维链,提出“弱到强可读性”概念,并设计衡量指标以评估强模型输出对弱模型的易理解性。
Comments Accepted to Trustworthy AI4GOOD Workshop @ ICML 2026
通过内部激活监控生成过程中的涌现奖励黑客行为
机构 * Technical University of Berlin(柏林技术大学) ; BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI;trustworthy(journal_ref)
AI总结 通过分析内部激活来监控生成过程中的奖励黑客行为,提升微调语言模型的安全性。
Journal ref ICLR2026 Workshop: Principled Design for Trustworthy AI