Learning over Forward-Invariant Policy Classes: Reinforcement Learning without Safety Concerns
在前向不变策略类中学习:无安全顾虑的强化学习
专题命中 安全训练 :safety(title,abstract)
AI总结 本文提出了一种基于前向不变性诱导的动作空间设计的安全强化学习框架,通过构造有限可接受动作集,确保策略安全性和性能优化分离,验证了在四旋翼飞行器悬停调节中的有效性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
在前向不变策略类中学习:无安全顾虑的强化学习
专题命中 安全训练 :safety(title,abstract)
AI总结 本文提出了一种基于前向不变性诱导的动作空间设计的安全强化学习框架,通过构造有限可接受动作集,确保策略安全性和性能优化分离,验证了在四旋翼飞行器悬停调节中的有效性。
是什么驱动了表示引导?对引导拒绝的机制性案例研究
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过机制性案例分析,探讨引导向量如何通过注意力机制影响模型输出,揭示引导向量主要作用于OV电路而非QK电路,并发现引导向量可被稀疏化而不影响性能。
Comments 9 pages + appendix, 7 figures
QaRL:基于回放对齐的量化感知强化学习用于在训练-推理不匹配下的快速稳定训练
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; City University of Hong Kong(香港城市大学) ; Zhejiang University(浙江大学)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出QaRL,通过对齐训练和回放的量化过程,解决训练-推理不匹配问题,提升训练效率和稳定性,同时保持低比特吞吐量优势。
从辩论到决策:用于安全多智能体辩论的符合社会选择
机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) ; HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰科技中心,中国)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出Conformal Social Choice方法,通过后处理层将辩论输出转化为校准的行动与升级决策,确保正确答案的概率覆盖,提升多智能体辩论的安全性。
Reason-SVG:通过强化学习增强向量图形生成的结构化推理
机构 * Beihang University(北京航空航天大学) ; The University of Hong Kong(香港大学)
专题命中 安全训练 :alignment(abstract)
AI总结 Reason-SVG通过引入Drawing-with-Thought范式和混合奖励机制,提升大语言模型生成高质量SVG的能力,实现结构化推理与视觉一致性。
Comments Accepted by CVPR 2026. 16 pages, 7 figures