Superficial Safety Alignment Hypothesis
表面安全对齐假说
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出表面安全对齐假说,认为安全对齐通过让模型选择正确推理方向来实现,识别出四种关键组件以建立安全防护。
Comments ICLR 2026
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
表面安全对齐假说
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出表面安全对齐假说,认为安全对齐通过让模型选择正确推理方向来实现,识别出四种关键组件以建立安全防护。
Comments ICLR 2026
OffTopicEval: 当大语言模型进入错误的聊天时,几乎总是!
机构 * Nanyang Technological University(南洋理工大学) ; Walled AI Labs(Walled AI实验室) ; Infocomm Media Development Authority, Singapore(新加坡信息通信媒体发展局) ; Lambda Labs(Lambda实验室)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文提出OffTopicEval评估套件,用于衡量大语言模型在特定任务中的操作安全性,发现所有模型在操作安全方面均表现不佳,通过提示基于的引导方法显著提升模型对无关查询的拒绝能力。
从用户交互对齐语言模型
机构 * ETH Zurich(苏黎世联邦理工学院) ; MIT(麻省理工学院) ; University of Zurich(苏黎世大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出通过自蒸馏直接从用户交互学习的方法,利用用户反馈调整模型行为,提升对齐和指令遵循能力,同时实现个性化和持续适应。
通过测试和静态分析反馈帮助LLM提升代码生成
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出利用测试和静态分析评估和指导通用开源LLM生成代码的质量及自我改进,发现生成代码常存在错误和安全问题,但提供反馈后能有效修复代码缺陷。
Journal ref Discover Artificial Intelligence, 2026
自适应视觉-语言模型路由用于计算机使用代理
机构 * vLLM Semantic Router Project(vLLM语义路由项目) ; MBZUAI ; McGill University(麦吉尔大学) ; AMD ; Red Hat(红帽公司)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 本文提出自适应VLM路由框架,通过动态选择模型降低推理成本,同时保持可靠性。在ScreenSpot-Pro数据集和OpenClaw基准测试中,AVR实现了高达78%的推理成本降低,并结合视觉困惑代理机制提升安全性。
Surg-R1:一种用于可扩展且可解释的外科决策支持的分层推理基础模型,具有多中心临床验证
专题命中 安全训练 :safety(abstract)
AI总结 Surg-R1通过四阶段流水线训练的分层推理模型,在多中心临床验证中实现了更高的准确率和可解释性,优于现有模型。
一种结合归纳推理与演绎推理的神经符号框架用于自动驾驶规划
机构 * Clemson University(克莱姆森大学)
专题命中 安全训练 :safety(abstract)
AI总结 本文提出一种神经符号框架,结合归纳与演绎推理提升自动驾驶规划的透明性和安全性,在nuScenes基准中优于现有方法。
Comments Under review. 16 pages, 2 figures