LatentGuard: Efficient and Inspectable Latent Reasoning for LLM Safeguards
LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
LatentGuard:面向大语言模型安全防护的高效可检查潜在推理方法
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 LatentGuard是将连续潜在推理引入防护模型的高效可检查框架,其8B参数版本在提升安全判定性能的同时大幅降低推理成本,还具备良好的审计效用,为可部署的LLM安全防护提供了可行路径。
onepot-Bench 0:面向实验室实际场景的计算机化学基准测试
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本研究推出专有基准测试onepot-Bench 0,通过三个互补评估衡量语言模型在湿实验室合成化学场景下的基础能力、可靠性等,弥补现有评估的不足。
利用视觉语言模型推进Web规模搜索的相关性测量
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 本研究提出基于VLM的自动化相关性评估流水线,部署于Pinterest搜索A/B实验,验证其与人工标注一致性,提升评估效率,降低MDEs,助力优化搜索体验。
Comments RecSys'26 Industry track
面向通用搜索智能体的跨域混合在线策略蒸馏
机构 * Yuanbao Team, Tencent Shanghai Innovation Institute(腾讯上海研究院元宝团队)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 本研究提出基于混元3架构的元宝搜索智能体训练框架,通过跨域混合在线策略蒸馏联合优化搜索专业化与通用能力,缓解对齐损耗,在现实搜索场景中实现两者的良好平衡。
AiFlow:面向流式大语言模型应用的带界背压令牌原生反应式编排框架
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对现有流式LLM工作流编排的背压等管理缺陷,提出AiFlow令牌原生反应式编排模型,经实验验证可降低应用TTFPT并控制队列深度。
Comments 24 pages, 5 figures, 12 tables, 1 algorithm, and 1 code listing. Public implementation: https://github.com/ModelEngine-Group/fit-framework
LM-mixup:基于语言模型的混合文本数据增强方法
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; BIAI, ZJUT & D5Data.ai(BIAI、ZJUT及D5Data.ai)
专题命中 安全训练 :alignment(abstract);分类 cs.CL
AI总结 本文提出LM-Mixup方法,通过构建MIXTURE数据集并结合监督微调与GRPO强化学习,仅用3%的蒸馏数据即可高效增强低质量指令跟随数据,提升LLMs的指令微调效率与性能。
Comments COLM 2026
将大型语言模型中的知识蒸馏为用于自主网络操作的轻量级强化学习智能体
机构 * Royal Military College of Canada(加拿大皇家军事学院) ; Defence Research and Development Canada(加拿大国防研究与发展部) ; Polytechnique Montreal(蒙特利尔理工学院)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 该研究针对自主网络操作中强化学习智能体训练不稳定的问题,通过提示工程证明80亿参数网络安全LLM性能优于基线RL智能体,再经在线策略蒸馏将其防御知识迁移至仅64910参数的轻量级RL智能体,为前沿网络安全模型的实用化提供了可行方案。
现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持
机构 * Atman Labs(阿特曼实验室) ; Oxford University Hospitals(牛津大学医院) ; University of Oxford(牛津大学) ; NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) ; Imperial College London(伦敦帝国理工学院) ; Technical University of Munich(慕尼黑工业大学) ; Massachusetts General Hospital(麻省总医院) ; Mass General Brigham(麻省总医院布里格姆医疗系统) ; Harvard Medical School(哈佛医学院) ; Barts Health NHS Trust(巴特保健国民保健信托基金会) ; the University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。
Comments 3 figures
基于因子化转移效应的潜在动作在智能体模糊性下的研究
机构 * Brown University(布朗大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 针对多物体或干扰场景中动作源模糊问题,提出观测转移因子化(OTF)方法,将转移分解为稀疏的观测转移基元,并构建OTF-LAM模型,在逆向前向动力学框架下抽象出动作潜变量,实现零样本迁移和下游策略学习。
Comments Project Page: https://hazel-heejeong-nam.github.io/LAM/
可证明自身利用行为的智能体:用于安全利用对手的置信度调度受限响应
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究提出CS-RNR方法,通过置信序列跟踪对手行动频率,生成可自我审计的安全利用策略,在Leduc等博弈中实现远超基准的收益且符合预算要求。
Comments 21 pages, 5 figures
旧技巧,新模型:简单图像变换如何破解基于现代AI的内容审核
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究通过黑盒评估发现,商用多模态图像审核API可被简单图像变换绕过,且不同服务稳健性差异大,表明这类API无法单独作为可靠安全过滤器,需结合分层审核管道部署。
选择 moderation 的位置与方式:过滤点与响应重写的端到端权衡
机构 * Microsoft Responsible AI(微软负责任人工智能部门) ; Goodfire(古德法尔公司)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 该研究针对内容审核部署中的过滤点与响应方式,对比不同方案的有用性、有害暴露等指标,发现响应重写可平衡流量恢复与安全,支持按部署约束选择审核配置。
功能缓存嫁接:具身智能体的鲁棒且快速代码策略合成
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 提出FCGraft框架,通过维护函数级验证代码骨架及其键值缓存,对新任务进行缓存嫁接(拼接和修补),减少预填充计算并复用验证结构,实现更鲁棒和快速的策略合成。
Comments Accepted at ICML 2026
危害并非普遍存在:迫切需要针对特定社区的毒性检测
机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) ; Microsoft Paris, France(法国巴黎微软)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。
Comments 18 pages, under review
多智能体大语言模型系统中分布式后门的早期检测:一项特征研究
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究多智能体大语言模型系统中分布式后门早期检测,构建分层多智能体系统实例,通过记录片段注入及载荷组装执行时间来检测。前缀检测器能较早标记多数成功攻击,部分检测器依赖表面线索,微调模型可减少线索去除后的损失。
NEXT:通过视觉语言模型进行推理驱动的视频推荐
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。
Comments 13 pages, 2 figures, 5 tables
通过物理感知策略蒸馏实现可解释强化学习
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究针对安全关键领域中深度强化学习的黑箱问题,利用策略蒸馏框架,以高性能TD3为教师模型,基于浅层决策树生成可解释学生代理,通过特定方法生成数据集,实现性能与教师相当并保持系统稳定性和可解释性。
Comments 6 pages, 7 figures
用于大语言模型代理中污点限制的代理权限策略代数
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。
Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure
使用后继表示的约束强化学习
机构 * Technical University of Darmstadt (TU Darmstadt)(达姆施塔特工业大学) ; Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心) ; Fraunhofer Institute for Integrated Circuits IIS, Fraunhofer IIS(弗劳恩霍夫集成电路研究所IIS) ; University of Technology Nuremberg (UTN)(纽伦堡工业大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究针对现实世界强化学习中策略难适应成本函数变化的问题,提出SafeDSR方法,通过引入可学习权重矩阵扩展深度后继表示到约束强化学习,能快速重训策略,在二维导航环境展示竞争力与灵活性。
Comments published in Transactions for Machine Learning Research 2026
Journal ref Michael Girstl, Alexander Mattick, & Christopher Mutschler (2026). Constrained Reinforcement Learning Using Successor Representations. Transactions on Machine Learning Research
建筑环境中人工智能代理社会的宪法治理:一项研究议程
专题命中 安全训练 :safety(abstract);分类 cs.CY
AI总结 本文针对建筑环境中人工智能代理社会的治理提出研究议程,围绕深度不确定性下改造的机制设计、建筑运营中代理的物理信息验证、冲击下城市基础设施的抗脆弱协调三个问题,借鉴多代理系统研究成果,阐述基础、识别问题并概述相关要求。
Comments 23 pages, 2 figures. Supplementary material is included in the same PDF
关键基础设施中智能体人工智能系统的去中心化粒度访问控制
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究关键基础设施中智能体人工智能系统的安全挑战,提出去中心化多层访问控制架构,含复合身份模型等四项创新,基于OWASP威胁分类法设计,经云提供商生产验证,能有效实施粒度访问控制并防止特权升级。
Comments 7 pages, 9 figures, 7 tables
最优奖励塑造:自动驾驶汽车停车案例研究
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 研究非完整约束下无模型强化学习奖励函数设计难题,提出含覆盖门控对齐反馈等的参数化奖励塑造框架,通过联合元优化及基于代理的贝叶斯优化,优化后的深度Q网络代理在停车任务中表现出色。
Comments 12 pages, 8 figures. Includes supplementary video demonstration and open-source code link
安全的上下文强化学习
机构 * University of Virginia(弗吉尼亚大学) ; Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 提出SCARED方法,在无参数更新的上下文强化学习适应过程中,通过精确惩罚对偶法在约束马尔可夫决策过程框架下保证安全,实现奖励最大化与成本约束。
Comments ICML 2026
基于推理的防护栏何时效率不高?ResponseGuard:用于实时审核的快速视觉语言防护工具
机构 * POSTECH(浦项科技大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究视觉语言防护栏筛查回复是否需推理,提出无链式推理的ResponseGuard,通过对请求、回复和图像的单一合并表示一次前向传递读取有害裁决,在回复有害性检测上优于基于推理的防护栏,且时间成本低,还发现了差距原因及推理防护栏注意力问题。
Comments 8 pages, 6 figures, 3 tables. Project page: https://ndb796.github.io/ResponseGuard ; Code: https://github.com/ndb796/ResponseGuard
GuardianAgentBench:智能体何处失败及如何防范
机构 * Vectara, Inc.(Vectara公司) ; Anthropic(Anthropic公司) ; OpenAI(OpenAI公司) ; Google DeepMind(谷歌DeepMind) ; DeepSeek-AI(DeepSeek人工智能公司)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。
使用多智能体强化学习解决空中走廊降级监视下的冲突
机构 * College of Aeronautics and Engineering(航空与工程学院) ; Center for Advanced Air Mobility(先进空中交通中心)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究针对空中走廊降级监视下的冲突解决问题,开发基于深度Q网络的多智能体强化学习框架,为两类飞机训练策略,经模拟评估策略效果,揭示安全与走廊容量权衡,支持相关冲突解决策略评估。
自主拓扑变异:具有能力、状态和影子不变量的多智能体大语言模型系统的安全运行时重组
机构 * Toga Networks (Huawei)(托加网络(华为))
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究多智能体大语言模型系统运行时无自我重组机制的问题,提出自主拓扑变异(ATM)机制,结合遥测驱动过载检测与安全不变量,经实验验证可提升任务成功率、减少隐私内存暴露并降低延迟,且相关内容已开源。
Comments 9 pages, 5 tables. Code and benchmark harness available at https://github.com/sidikbro/jiuwen_atm
鲁棒评论家:防御大语言模型免受多轮攻击
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究针对大语言模型在多轮攻击下的安全问题,提出对话评论家引导采样(DCGS)框架,通过推断用户意图、建模为马尔可夫决策过程并学习价值和遗憾评论家来生成回复,在多个数据集上评估优于基线和前沿模型,还能迁移提升模型鲁棒性。
基于控制障碍函数层的高维安全最优反馈控制的端到端学习
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究在硬安全约束下高维半全局反馈控制器的学习问题,结合算子分裂与无雅可比反向传播方法,实现可扩展端到端训练并保持安全保证,证明该方法在高维多智能体非线性控制问题上的有效性。
编译,然后分页:用于过程性语言模型代理的可执行标准操作程序和能力门控运行时
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The University of Hong Kong(香港大学) ; Zhejiang Normal University(浙江师范大学) ; Research Institute for Generative AI, The Hong Kong Polytechnic University(香港理工大学生成式人工智能研究所)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究针对企业代理遵循SOP的问题,将SOP约束编译成可执行伪代码,用程序引导堆栈机运行,通过实验表明编译文本有益,运行时指导受能力门控,给出编译后经模型级纪律检查再启用活动框架分页的实际指导。
Comments 9 pages, 3 figures, 5 tables