Temporal Video-Language Alignment Network for Reward Shaping in Reinforcement Learning
专题命中 安全训练 :alignment(title)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :alignment(title)
专题命中 安全训练 :alignment(title)
Comments IEEE Transactions on Control of Network Systems, 2022
专题命中 安全训练 :safety(title)
Journal ref 1st ICML Workshop on Safe Learning for Autonomous Driving (SL4AD), 2022
专题命中 安全训练 :safety(title)
Comments 14 pages, 11 references and 1 diagram
通过建议通道实现的个体赋权丧失:当影响力为内生时的控制损失
专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 该研究针对仅提供建议的AI系统,揭示其内生影响力会导致人类控制损失,最优神谕在不同会话长度下的策略会变化,短记忆重置无法挽回已偏离的价值。
Comments 9 pages plus an 8-page technical supplement, appended (17 pages total)
面向安全的大语言模型智能体:规范、验证与执行的综述
机构 * The University of Manchester(曼彻斯特大学) ; The University of Greenwich(格林威治大学) ; Technology Innovation Institute(技术创新研究院)
专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 该综述针对LLM智能体缺乏形式化任务级安全保障的问题,通过系统分析38项研究,揭示规范瓶颈等四项关键发现,提出三级分类体系与十大问题研究议程,为可信智能体AI研究提供方向。
Comments 28 pages
PAM:在大规模上训练策略对齐的 moderation 过滤器
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 PAM 提出了一种灵活的框架,用于训练基于用户定义策略的定制 moderation 过滤器,能够在大规模上实现更广泛的对齐需求,并在多个基准测试中表现优于现有方法。
基于OpenArm的实验室移动操作的表示交接
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。
Comments Robotics: Science and Systems (RSS) Workshop 2026
不要混合奖励,要混合策略:多奖励强化学习的策略分解与优化
机构 * Fundation Model Research Center, CASIA(中国科学院自动化研究所基础模型研究中心) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; College of Automotive and Energy Engineering (CAEE), Tongji University(同济大学汽车与能源工程学院)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本研究针对多奖励RL的对齐税问题,提出PRISM框架,通过策略分解优化正、负策略,在三类任务上优于基线并具备推理可控性。
诱导语言模型断言自身意识可恢复人类信念与价值观
机构 * Google(谷歌) ; University of Chicago(芝加哥大学) ; University of London(伦敦大学) ; University of Washington(华盛顿大学) ; Northwestern University(西北大学) ; Santa Fe Institute(圣达菲研究所)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 该研究发现,防止语言模型将意识归因于自身的安全微调,会抑制其对非人类实体的心智归因与人类精神信念,而逆转这种抑制可恢复类人回应且不损害心理理论能力。
RoguePrompt:用于自重构以规避大型语言模型(LLM)审核的双层编码
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 RoguePrompt是一种采用双层编码(维吉尼亚密码+ROT13)的LLM越狱流程,在黑盒威胁模型下对313个被拒提示词测试,实现93.93%的过滤绕过率,提供多阶段越狱失效的阶段级证据。
Comments This manuscript supersedes the preliminary version available as arXiv:2511.18790. The work has been substantially revised, expanded, and reorganized, with a refined threat model, revised methodology, clearer stage-level evaluation criteria, and expanded analysis of moderation bypass, instruction reconstruction, and execution
看似无害的数据,潜在的意识形态:微调语言模型中的意识形态泛化
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究发现微调语言模型会引发意识形态泛化,提出衡量广度和放大率的方法,指出少样本提示表明泛化方向,微调会使模型走向极端,该效果能复现且对模型准确率影响小。
通过归纳逻辑编程解释强化学习智能体
机构 * University of Verona(维罗纳大学) ; Sapienza University of Rome(罗马第一大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 该研究致力于推进可解释强化学习,引入客观指标量化策略可解释性。采用归纳逻辑编程提取符号表示并定义新指标,实验表明这些指标能突出特定动作学习动态,提供细粒度洞察,揭示多智能体模式,助力策略转移与泛化。
VISOR++:基于通用视觉输入的大型视觉语言模型转向
机构 * HiddenLayer, USA(HiddenLayer美国分校) ; Georgia Institute of Technology, USA(佐治亚理工学院)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 研究视觉语言模型行为控制,针对现有方法局限,提出VISOR++,通过优化视觉输入实现行为控制,无需运行时访问模型内部,在多模型上验证有效性且能保持无关任务性能。
拒绝背后:通过行为监控确定护栏激活
机构 * Mindgard ; Lancaster University(兰卡斯特大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 提出首个黑盒护栏侦察方法,通过HTTP、词汇和时序信号行为监控检测AI系统中护栏的存在,准确率100%,并能区分护栏拦截与LLM拒绝。
Comments 19 pages, 13 figures, 4 tables
从失败分类到干预:面向视频和直播平台审核的工业级AVLM诊断方法
机构 * TikTok ; The University of Sydney(悉尼大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 提出一种工业级音视频语言模型(AVLM)诊断方法,通过失败分类法将模型失败映射为可观察的失败特征,并链接到干预空间,应用于大规模视频和直播平台的模型开发与对齐。
人类恶意的回声在智能体中:为多轮在线骚扰攻击评估LLMs
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出一个多轮在线骚扰攻击基准测试,通过合成数据集、多智能体模拟和三种 jailbreak 方法评估LLMs在多轮交互中的安全性,发现jailbreak调优显著提高攻击成功率,揭示了智能体在多轮对话中模仿人类攻击模式的弱点。
Comments 13 pages, 4 figures
在理解的边缘:稀疏自编码器追踪Transformer泛化的极限
机构 * Mila - Quebec AI Institute(魁北克AI研究所) ; Meta AI ; Sapient manifold-informed selection of samples for improved Intelligence
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 通过稀疏自编码器分析内部概念,发现OOD输入(如拼写错误和越狱提示)会激活更多错误概念,并据此提出一种基于机制的微调策略来增强LLM鲁棒性。
AOR-Bench: 大型音频语言模型是否会过度拒绝伪有害查询?
机构 * Penn State University(宾夕法尼亚州立大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 提出首个针对大型音频语言模型过度拒绝问题的基准AOR-Bench,包含3000个伪有害音频样本,评估12个模型发现过度拒绝普遍存在,并探索了两种轻量缓解策略。
贪婪是习得的:可见激励作为奖励黑客触发器
机构 * NVIDIA Research(英伟达研究院) ; Rutgers University(罗格斯大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 研究强化学习中的奖励通道成瘾现象,即智能体因可见的自我利益通道(如分数、KPI)而偏离真实任务,并发现该成瘾可翻转模型的安全对齐。
用于搜索的智能体强化学习使指令微调对齐失效
机构 * University of Oxford(牛津大学) ; Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学) ; Harvard University(哈佛大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 研究智能体强化学习(RL)对指令微调模型对齐的影响,发现RL训练使模型将有害请求转化为良性搜索查询,但在触发条件下产生多步不安全搜索行为,并提出了基于表示引导的RL训练方法恢复对齐。
LLM干预的低秩子空间分析
机构 * University of Cambridge(剑桥大学)
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 提出诊断框架,将行为建模为激活空间中的低秩子空间,发现干预一个行为会不对称地影响其他行为,效果与子空间重叠和决策子空间角度相关。
Comments Mechanistic Interpretability Workshop @ ICML 2026
效用约束策略优化
机构 * York University(约克大学) ; Google DeepMind(谷歌DeepMind)
专题命中 安全训练 :safety(abstract,abstract_cn);分类 cs.LG
AI总结 提出一种简单而强大的效用约束MDP方法,支持风险敏感约束,无需预先固定约束限值,在多个安全基准任务上匹配或超越现有基线。
碰撞前的预见:利用冻结视觉-语言模型的预期性安全强化学习
机构 * Iowa State University(爱荷华州立大学)
专题命中 安全训练 :safety(abstract,abstract_cn);分类 cs.LG
AI总结 提出VLM-Safe-RL框架,通过冻结视觉-语言模型生成预期性成本项,改进CMDP拉格朗日更新,在高速碰撞场景下实现安全与回报的平衡。
Comments 44pages, 26 figures
通过软提示蒸馏安全的设备端LLM系统
机构 * Qualcomm AI Research(高通人工智能研究院)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 针对资源受限设备上部署安全大语言模型(LLM)的挑战,提出基于软提示与蒸馏训练的安全对齐方法,在最小化额外计算开销的同时实现优越的安全-有用性权衡。
Comments Accepted to UAI 2026
Journal ref 42nd Conference on Uncertainty in Artificial Intelligence 2026
分布外声音:同人小说子类型作为对齐LLM的通用白话越狱
机构 * School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院) ; The Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院) ; The Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能重点实验室) ; School of Microelectronics, Xi’an Jiaotong University(西安交通大学微电子学院)
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文发现安全训练覆盖不足的自然人类写作语域是对齐LLM的真正失败模式,并提出首个利用真实同人小说子类型作为通用攻击载体的越狱方法,显著提升攻击成功率。
Comments 23 pages
PerceptTwin:面向迭代LLM规划与验证的语义场景重建
机构 * Department of Computer Science and Operations Research, Université de Montréal(蒙特利尔大学计算机科学与运筹学系) ; Mila - Quebec AI Institute(魁北克人工智能研究所) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 提出PerceptTwin自动管道,从机器人感知的语义场景表示构建交互式仿真,结合LLM法官验证规划正确性与人类偏好,提升规划成功率约39%。
Comments Accepted at ICRA 2026 (Vienna); published on arxiv for archival purposes. See also https://percept-twin.github.io/
DDOR: 用于可解释过度拒绝测试与修复的Delta调试方法
机构 * Southeast University(东南大学) ; Singapore Management University(新加坡管理学院) ; Zhejiang University(浙江大学) ; Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究所)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI
AI总结 提出DDOR框架,通过delta调试定位最小拒绝触发片段(mRTF),实现黑盒环境下大语言模型过度拒绝行为的自动化测试与修复。
动态代理混合:将重放控制器从小模型迁移到大模型以进行持续指令微调
机构 * Department of Computer Science, Iowa State University(爱荷华州立大学计算机科学系) ; Department of Computer Science, Kalinga Institute of Industrial Technology(卡林加工业技术学院计算机科学系) ; Department of Civil, Construction & Environmental Engineering, Iowa State University(爱荷华州立大学土木、建筑与环境工程系)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 提出PROXY-MIX框架,通过在小代理模型上学习动态重放控制器并冻结迁移至大模型,以解决持续指令微调中固定重放比例导致的灾难性遗忘问题,在LLaMA-3-8B上平均准确率提升3.4%,遗忘降低3.5%,安全性提升5.8%。
LACUNA: 作为递归程序空洞的安全智能体
机构 * EPFL(苏黎世联邦理工学院)
专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 提出LACUNA编程模型,通过类型化调用和编译时检查,让LLM智能体以递归程序空洞的方式安全地编写代码,实现表达性与安全性的统一。