arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-04 至 2026-05-04 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2506.00166 2026-05-04 cs.LG cs.AI cs.CL 90%

Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment

解耦安全适配器实现高效的防护措施和灵活的推理时对齐

Kundan Krishna, Joseph Y Cheng, Charles Maalouf, Leon A Gatys

机构 * Apple(苹果公司)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出解耦安全适配器框架,通过分离安全计算与任务优化基础模型,提升推理效率和开发灵活性,实验证明其在 hate speech 分类等任务中显著优于传统模型。

Comments ICLR 2026 Workshop: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18280 2026-05-04 cs.LG cs.AI cs.CL 82%

Detection Is Cheap, Routing Is Learned: Why Refusal-Based Alignment Evaluation Fails

检测成本低,路由是学习的:为何基于拒绝的对齐评估失败

Gregory N. Frank

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究指出现有对齐评估忽视路由层,通过政治审查实验发现检测准确率不具诊断性,路由机制因模型和实验室而异,拒绝不再是主要审查机制,需采用检测-路由-生成三阶段框架。

Comments Code and data: https://github.com/gregfrank/routing-is-learned

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00081 2026-05-04 cs.CR cs.LO 82%

Alignment Contracts for Agentic Security Systems

代理安全系统的对齐契约

Isaac David, Marco Guarnieri, Arthur Gervais

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 本文提出对齐契约框架,用于规范和强制执行可观测效果的行为约束,通过有限轨迹语义和模块化合同工程规则,确保安全系统的边界控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16345 2026-05-04 cs.HC cs.AI 70%

Bridging the Experimental Last Mile: Digitizing Laboratory Know-How for Safe AI-Assisted Support

弥合实验最后一公里:数字化实验室知识以实现安全的人工智能辅助支持

Akira Miura, Yuki Sasahara, Momoka Demura, Yuji Masubuchi, Tetsuya Asai, Chikahiko Mitsui

机构 * Division of Applied Chemistry, Faculty of Engineering, Hokkaido University(北海道大学工学部应用化学科) Graduate School of Chemical Sciences and Engineering, Hokkaido University(北海道大学研究生院化学科学和工程学系) Graduate School of Information Science and Technology, Hokkaido University(北海道大学研究生院信息科学和技术学系) Quantum Nexus, Inc.

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种结合视频、多模态AI和检索增强生成的AI助手,通过提取实验室特定知识来提升实验安全性,经评估显示其在指导和安全方面具有实用性。

Comments 32 pages in total (main 13 pages, appendix 19 pages), 2 main figures, 1 main table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00012 2026-05-04 cs.IR cs.AI cs.CL 62%

Exploring LLM biases to manipulate AI search overview

探索LLM偏见以操控AI搜索概述

Roman Smirnov

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探索LLM偏见在AI搜索概述系统中的影响,通过强化学习优化搜索片段内容以操控结果,并发现偏见驱动相对优势而非绝对优势。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏