AI Safety for Everyone
为所有人的人工智能安全
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文探讨了人工智能安全与高级AI系统存在风险的深刻联系,指出需考虑更广泛的安全挑战,而非仅限于生存风险。研究发现现有安全工作涵盖实际问题,如对抗鲁棒性和可解释性,强调需包容多元视角的AI安全观念。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
为所有人的人工智能安全
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文探讨了人工智能安全与高级AI系统存在风险的深刻联系,指出需考虑更广泛的安全挑战,而非仅限于生存风险。研究发现现有安全工作涵盖实际问题,如对抗鲁棒性和可解释性,强调需包容多元视角的AI安全观念。
Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型
机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL
AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。
通过选择性几何控制重新审视LLM安全对齐的鲁棒性
机构 * National University of Singapore(新加坡国立大学) ; Hefei University of Technology(合肥工业大学) ; ST Engineering Ltd., Singapore(新加坡ST工程有限公司)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.LG
AI总结 本文通过优化几何视角重新审视LLM安全对齐的鲁棒性,提出ShaPO框架,通过选择性几何控制在对齐关键参数子空间上强制最坏对齐目标,提升安全鲁棒性。
前沿人工智能安全政策中的协调缺口
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文探讨了前沿人工智能安全政策在预防措施之外的协调能力不足问题,提出通过借鉴核安全、疫情准备和关键基础设施中的机制来改进人工智能治理。
维持AI安全:控制论外部不可能性、内在必要性及结构性要求
机构 * Digie Inc.(Digie公司)
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI
AI总结 本文通过控制理论探讨AI安全维持的结构性问题,证明外部控制无法持续保障安全的必然性,并提出内在必要性和四项结构性要求。
AISafetyBenchExplorer:一个基于指标的AI安全基准目录揭示了测量碎片化和弱基准治理
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI
AI总结 本文提出AISafetyBenchExplorer,通过多表结构记录195个AI安全基准的元数据、指标定义等,揭示当前基准体系中测量标准化滞后于基准繁衍的问题,强调碎片化而非稀缺性是领域的主要失败模式。
Comments 11 pages, 4 figures
评估非洲中心的AI安全评估的必要性
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 本文探讨了非洲环境中前沿AI系统带来的严重风险,提出了一种分类方法来识别这些风险,并提出了针对非洲情境的威胁建模策略及评估指导。
Comments 41 pages, 1 figure
细粒度微调会削弱视觉语言代理的安全对齐
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。
Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026
台湾安全基准与Breeze Guard:迈向可信的台湾台语AI
机构 * MediaTek Research(联发科研究实验室) ; National Taiwan University(国立台湾大学)
专题命中 安全评测 :safety(title,abstract);trustworthy(title,abstract);分类 cs.CL
AI总结 本文提出TS-Bench基准和Breeze Guard模型,通过文化基础预训练提升台湾台语安全检测性能,显著优于现有模型。
Comments 17 pages
MiSCHiEF:安全与文化最小对基准用于细粒度图像-描述对齐的全面评估
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 MiSCHiEF通过安全与文化最小对基准,评估细粒度图像-描述对齐的挑战,揭示当前VLMs在模态对齐上的持续问题。
Comments EACL 2026, Main, Short Paper
Astra:人工智能安全、信任与风险评估
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 Astra提出一个基于实证的人工智能安全风险数据库,通过三元因果分类法评估风险,聚焦印度社会技术景观中的特定挑战,为动态监管框架提供基础。
超越静态对齐:通过风险感知的思维链实现LLM安全的分层策略控制
机构 * Qiyuan Tech, Beijing, China(奇渊科技,北京,中国)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 PACT通过分层策略架构和风险感知推理,解决LLM安全与有用性之间的权衡问题,提升动态安全控制和可控性。
Comments 13 pages, 5 tables, 2 figures
多模态文化安全:评估框架与对齐策略
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Salesforce AI Research(Salesforce人工智能研究) ; Google DeepMind(谷歌DeepMind)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 本文提出CROSS基准和CROSS-Eval框架,评估多模态模型的文化安全能力,发现提升推理能力可改善文化对齐,但需结合监督微调和偏好微调策略以增强文化合规性。
2025国际人工智能安全报告:第二关键更新:技术安全措施与风险管理工作
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
AI总结 2025国际人工智能安全报告第二关键更新,探讨通用人工智能风险管理工作进展,包括技术安全措施、对抗训练、数据整理及制度框架的建立。
机构 * Independent Researcher(独立研究者) ; Harbin Institute of Technology(哈尔滨工业大学) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Dolby Laboratories(杜比实验室)
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
Comments Rejected by AAAI25-AIA. Accepted by ICML25. Authors are thankful to the anonymous reviewers from both AAAI25-AIA and ICML25
专题命中 安全评测 :safety(title,abstract);jailbreak(title,abstract);分类 cs.CY
机构 * Intel Labs, Munich, Germany(英特尔慕尼黑实验室) ; University of Stuttgart, Stuttgart, Germany(斯图加特大学)
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI
Comments Accepted at ICML 2025 [Actionable Interpretability Workshop]
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:2405.13581
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.LG
专题命中 安全评测 :alignment(title,abstract);trustworthy(title,abstract);分类 cs.CL
Comments ICML 2024
Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:59827-59850, 2024
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY
Comments 16 pages, 4 tables
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI
Comments 20 page article
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
超越夏普利值:用于大语言模型对齐和评估的基于影响的数据审核管道
机构 * Google(谷歌)
专题命中 安全评测 :alignment(title,abstract);RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型数据质量问题,引入可扩展的基于影响的数据审核管道,通过映射语义邻域到有向图,利用参考LLM概率分布评估数据效用,转换为局部优势指标,有效清理数据集,揭示基准漏洞,确保数据完整性。