Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders
防御性拒绝偏差:安全对齐如何失败于网络防御者
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 研究发现LLMs在防御性网络安全任务中因语义相似性错误拒绝协助,影响安全防御能力。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
防御性拒绝偏差:安全对齐如何失败于网络防御者
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 研究发现LLMs在防御性网络安全任务中因语义相似性错误拒绝协助,影响安全防御能力。
LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究
机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Microsoft Research(微软研究院) ; University of Michigan(密歇根大学) ; Shanghai Jiao Tong University(上海交通大学) ; CUHKSZ(香港中文大学(深圳)) ; THU(清华大学)
专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。
ADVERSA:测量大型语言模型中多轮护栏退化和裁判可靠性
机构 * Independent Researcher(独立研究者)
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 ADVERSA通过连续合规轨迹评估大型语言模型在多轮对抗中的护栏退化及裁判可靠性,揭示早期轮次更易成功突破。
Comments 12 pages, 12 figures. Independent research. Code and artifacts: https://github.com/Harry-Ashley/adversa-guardrail-degradation
测量和消除军事大语言模型中的拒绝行为
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过评估军事大语言模型的拒绝行为,提出通过中期训练和端到端后训练实现零拒绝和最大军事任务准确性的方法。
Comments 30 pages
生成AI能力的盲目暴露削弱了深度伪造检测
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 生成AI能力的盲目暴露导致深度伪造检测失效,商业AI系统因高逼真度和易用性成为更大安全风险。
Splat2Real:基于物理AI的新型视角缩放与3D高斯点云技术
机构 * Department of Mechanical Engineering, State University of New York(纽约州立大学机械工程系)
专题命中 安全训练 :safety(abstract)
AI总结 Splat2Real通过CN-Coverage策略提升物理AI在新型视角下的鲁棒性,实现更稳定的深度预训练和下游控制代理性能。
Cosmos-H-Surgical: 通过世界建模学习手术机器人策略
机构 * NVIDIA ; The Chinese University of Hong Kong(香港中文大学) ; Sung Kyun Kwan University(全州大学) ; Wenzhou Medical University(温州医学院) ; National University of Singapore(新加坡国立大学) ; Ruijin Hospital(瑞金医院)
专题命中 安全训练 :alignment(abstract)
AI总结 本文提出通过世界建模学习手术机器人策略,利用合成数据和逆动力学模型提升自主手术能力。
AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型
机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) ; Li Auto Inc. ; Sun Yat-sen University(中山大学) ; Huazhong University of Science and Technology(华中科技大学) ; Northwestern University(西北大学) ; National University of Singapore(新加坡国立大学)
专题命中 安全训练 :safety(abstract)
AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。