When Safe Unimodal Inputs Collide: Optimizing Reasoning Chains for Cross-Modal Safety in Multimodal Large Language Models
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CY
机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, Strasbourg, France(斯特拉斯堡大学,法国国家科学研究中心,法国国家卫生研究院,ICube,UMR7357,斯特拉斯堡,法国) ; Fondazione Policlinico Universitario A. Gemelli IRCCS, Università Cattolica del Sacro Cuore, Rome, Italy(A. Gemelli IRCCS大学医院,罗马,意大利) ; CAMP, Technische Universität München, Munich, Germany(慕尼黑技术大学,德国) ; Institute of Image-Guided Surgery, IHU Strasbourg, Strasbourg, France(影像引导手术研究所,斯特拉斯堡,法国)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
机构 * Georgia Tech(佐治亚理工学院) ; Mila ; UC Berkeley(加州大学伯克利分校) ; Stanford(斯坦福大学) ; MBZUAI(穆桑大学人工智能研究所) ; McGill(麦吉尔大学)
专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
Comments 16 pages, 10 figures
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CY
Comments 75 pages, 41 tables/figures
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI
Comments Extended version of paper accepted to AAAI 2025. 14 pages, 6 figures
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.CL
Comments NeurIPS 2024 Camera Ready. First two authors contributed equally. Third and fourth authors contributed equally
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.CL
Comments The method used in the paper has obvious problems and ambiguities. The security enhancement method we used cannot be considered distillation, but it is described as distillation in the paper, and the experiment lacks comparison and baseline, which has been criticized by many peers. In order to avoid further dissemination, we have decided to withdraw the paper
专题命中 安全训练 :safety(title,abstract);DPO(abstract);分类 cs.CL
Comments 18 pages
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.CL
Comments 17 pages, 8 figures, 2 tables
专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.AI
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG
Comments ICML 2024
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL
专题命中 安全训练 :safety(title,abstract);harmlessness(abstract);分类 cs.CL
专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL
专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI
摩擦性政策优化用于大语言模型:认知干预、风险敏感控制与反思对齐
机构 * Brandeis University(布拉德雷大学) ; Colorado State University(科罗拉多州立大学)
专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出摩擦性政策优化框架,通过干预管理认知与规范风险,引入摩擦干预分类和统一方法,提升模型的认知能力与对齐性。
Comments Frictive Policy Optimization; epistemic alignment; risk-sensitive control; LLM alignment; clarification and refusal; preference learning; trust regions; dialogue agents
专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY、cs.LG
Comments Pluralistic Alignment Workshop at NeurIPS 2024
机构 * Yang Li Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所、中国科学院大学) ; Qiang Sheng Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所) ; Yehan Yang Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所) ; Xueyao Zhang The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Juan Cao Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所、中国科学院大学)
专题命中 安全训练 :alignment(abstract);DPO(abstract);safety(abstract);harmlessness(abstract)
Comments NeurIPS 2025 Accepted Paper
条件 regime 验证:安全分类器适配与监控的正确性估计
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。
Comments 16 pages including technical appendix, 6 figures
SteeringSafety:针对大语言模型在多安全视角下的表征引导基准测试
机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Washington University in St. Louis(华盛顿大学圣路易斯分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究推出SteeringSafety基准,测试DIM等引导方法在3款大模型的9种安全视角表现,发现方法与模型、视角的匹配影响性能,且存在多视角纠缠问题,需多安全角度评估引导方法。
Comments Accepted at ICML 2026
RedDiffuser:通过强化扩散审计多模态安全故障
机构 * Fudan University(复旦大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract)
AI总结 研究多模态系统在有害上下文暴露下的安全审计,提出RedDiffuser框架通过扩散模型生成视觉输入,揭示隐藏的安全漏洞,实验显示VLMs在部分有毒文本与视觉上下文结合时存在广泛安全问题。
机构 * Georgia State University(佐治亚州立大学) ; Morehouse School of Medicine(莫尔豪斯医学院)
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
Journal ref JMIR Cancer 2026;12:e82971
Mask2Shield:增强大语言模型抵御神经元剪枝攻击的安全性
专题命中 安全训练 :safety(title,abstract);alignment(abstract)
AI总结 研究针对大语言模型神经元剪枝攻击问题,提出Mask2Shield方法,通过掩码前向对齐训练模型,减少对可移除安全神经元集的依赖,降低针对性剪枝攻击成功率,同时保持能力基准。