PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF
PS-PPO: 用于无评论者RLHF的前缀采样PPO
专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。
Journal ref ICML 2026 published
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
PS-PPO: 用于无评论者RLHF的前缀采样PPO
专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。
Journal ref ICML 2026 published
《智能体AI的搭车指南:从基础到系统》
机构 * Haggai Roitman
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。
Comments version 1.3
STAIF:一种用于复杂指令跟随的逐阶段优化方法
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research Group(科大讯飞研究院)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型遵循复杂指令的挑战,提出STAIF逐阶段优化框架,先通过偏好优化提高软约束敏感度,再用可验证奖励强化学习确保硬约束遵守,构建相关数据集,验证了该方法的设计并展现出领先性能和泛化能力。
Comments 16 pages, 6 figures
南贝格4.2 - 3B:以紧凑模式解锁智能体能力
机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。
让我看着你:用于对话语音合成的高级面部表情建模
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL
AI总结 研究针对对话语音合成中面部表情线索常被忽视及缺乏多模态数据集的问题,提出基于大语言模型的FacialTalker框架,含AUTokenizer和DualDPO策略,构建VSDD-1K数据集,实验表明该框架在表情感知和语音合成质量上表现出色。
Comments 10 pages, 5 figures, 5 tables. Accepted by ACM MM 2026
Qwen-音乐技术报告
机构 * Qwen Team(通义团队)
专题命中 偏好对齐 :DPO(abstract,abstract_cn)
AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。
SyRuP:通过大语言模型解码中的奖励引导预测增强系统提示遵循
机构 * Yonsei University(延世大学)
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究如何增强大语言模型对系统提示的遵循,提出SyRuP框架,通过训练交叉注意力奖励头产生令牌级遵循分数,推理时结合多种信号对候选重新排序,实验表明该方法能有效提升系统提示遵循度且开销适度。
Comments under review, 23 pages
RM-Distiller: 利用生成式大语言模型进行奖励模型蒸馏
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 RM-Distiller通过系统利用教师LLM的精炼、评分和生成能力,提升奖励模型蒸馏效果,首次系统性地探索了生成式LLM在奖励建模中的应用。
Comments Accepted to IJCAI-ECAI 2026
PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Sun Yat-sen University(中山大学) ; South China University of Technology(华南理工大学) ; Guangdong University of Technology(广东工业大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。
Comments 18 pages, 5 figures
迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。
Comments 14 pages
人工智能安全与对齐研究的认知规范
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(title,abstract);分类 cs.AI
AI总结 探讨人工智能安全与对齐研究和主流人工智能研究的差异,基于结构化综合识别当前对齐研究的差距维度,提出包含多项内容的{\sc ECAISA},以约束安全相关研究声明的记录、检查和依赖方式,目标是可审计性。
Comments 36 pages
SafeCRS: 为基于大语言模型的对话推荐系统实现个性化安全对齐
机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI
AI总结 SafeCRS通过整合安全监督微调与安全组奖励解耦归一化策略优化,提升基于大语言模型的对话推荐系统在个性化安全约束下的推荐质量与安全对齐能力。
Comments Accepted by SIGKDD 2026
当大语言模型防御适得其反时:刻画安全性、性能和成本的权衡
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.LG
AI总结 研究大语言模型越狱防御的安全性、性能和成本权衡,按操作策略组织防御并研究其副作用,发现不同防御在安全与可用性、效率权衡上有差异,为评估防御副作用及选择防御提供基准和指导。
Mask2Shield:增强大语言模型抵御神经元剪枝攻击的安全性
专题命中 安全训练 :safety(title,abstract);alignment(abstract)
AI总结 研究针对大语言模型神经元剪枝攻击问题,提出Mask2Shield方法,通过掩码前向对齐训练模型,减少对可移除安全神经元集的依赖,降低针对性剪枝攻击成功率,同时保持能力基准。
通过政治轴审计大语言模型中的对齐可控性
专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.CY
AI总结 研究通过对7个大语言模型进行基于提示可控性的压力测试,探讨其在政治轴上的对齐可控性,发现上下文框架起主要作用,模型移动方式有别,强调政治坐标审计需考虑分散性等可控性因素,并发布相关数据和代码。
Comments 17 pages, 6 figures, 4 tables. Accepted at AIES 2026 (AAAI/ACM Conference on AI, Ethics, and Society). This version includes the supplementary appendix. Code and data: https://github.com/mbrcic/llm-political-steerability (Zenodo DOI 10.5281/zenodo.21489805)
不透明的认知中介:大型语言模型部署配置如何塑造伪科学的验证
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究商业大语言模型对伪科学主张的验证,通过测试四个模型家族在不同时间点的表现,发现Grok快速版本评分异常高,还发现模型行为受部署配置影响,如无声补丁、输出差异等,强调这一现象需新的认知问责形式。
Comments 16 pages, 2 tables
ReVision:一种基于视觉的后处理技术,用于在图像生成管道中替换不可接受的概念
专题命中 安全训练 :alignment(abstract);safety(abstract)
AI总结 ReVision是一种无需训练的后处理框架,通过视觉模型检测并替换图像生成中不安全的概念,提升安全性与生成质量。
超越直接回答:通过启发式强化学习将教育大语言模型调整为苏格拉底式引导者
机构 * East China Normal University(华东师范大学) ; Shanghai Chuangjie Situo Information Technology Co., Ltd.(上海创杰思拓信息技术有限公司) ; Shanghai Normal University(上海师范大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究针对教育场景中LLMs直接作答问题,提出HeuristicEdu两阶段管道,经监督热身和GRPO,利用特定对话及启发式奖励训练Qwen2.5 - 7B,提升了支架有效性,降低关键词泄漏,表明规模并非引发苏格拉底行为的唯一因素。
Comments 12 pages, 2 figures, 5 tables; includes an appendix
通过物理感知策略蒸馏实现可解释强化学习
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究针对安全关键领域中深度强化学习的黑箱问题,利用策略蒸馏框架,以高性能TD3为教师模型,基于浅层决策树生成可解释学生代理,通过特定方法生成数据集,实现性能与教师相当并保持系统稳定性和可解释性。
Comments 6 pages, 7 figures
用于大语言模型代理中污点限制的代理权限策略代数
专题命中 安全训练 :prompt injection(abstract);分类 cs.AI
AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。
Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure
使用后继表示的约束强化学习
机构 * Technical University of Darmstadt (TU Darmstadt)(达姆施塔特工业大学) ; Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心) ; Fraunhofer Institute for Integrated Circuits IIS, Fraunhofer IIS(弗劳恩霍夫集成电路研究所IIS) ; University of Technology Nuremberg (UTN)(纽伦堡工业大学)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 研究针对现实世界强化学习中策略难适应成本函数变化的问题,提出SafeDSR方法,通过引入可学习权重矩阵扩展深度后继表示到约束强化学习,能快速重训策略,在二维导航环境展示竞争力与灵活性。
Comments published in Transactions for Machine Learning Research 2026
Journal ref Michael Girstl, Alexander Mattick, & Christopher Mutschler (2026). Constrained Reinforcement Learning Using Successor Representations. Transactions on Machine Learning Research
建筑环境中人工智能代理社会的宪法治理:一项研究议程
专题命中 安全训练 :safety(abstract);分类 cs.CY
AI总结 本文针对建筑环境中人工智能代理社会的治理提出研究议程,围绕深度不确定性下改造的机制设计、建筑运营中代理的物理信息验证、冲击下城市基础设施的抗脆弱协调三个问题,借鉴多代理系统研究成果,阐述基础、识别问题并概述相关要求。
Comments 23 pages, 2 figures. Supplementary material is included in the same PDF
关键基础设施中智能体人工智能系统的去中心化粒度访问控制
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 研究关键基础设施中智能体人工智能系统的安全挑战,提出去中心化多层访问控制架构,含复合身份模型等四项创新,基于OWASP威胁分类法设计,经云提供商生产验证,能有效实施粒度访问控制并防止特权升级。
Comments 7 pages, 9 figures, 7 tables
最优奖励塑造:自动驾驶汽车停车案例研究
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 研究非完整约束下无模型强化学习奖励函数设计难题,提出含覆盖门控对齐反馈等的参数化奖励塑造框架,通过联合元优化及基于代理的贝叶斯优化,优化后的深度Q网络代理在停车任务中表现出色。
Comments 12 pages, 8 figures. Includes supplementary video demonstration and open-source code link
从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图
专题命中 安全训练 :trustworthy(abstract)
AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。
Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)
Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027
门总是关闭:关于向冻结的视觉语言模型注入辅助信号
机构 * University of Doha for Science and Technology(多哈科技大学) ; Pluralis Research(普卢拉利斯研究公司) ; North South University(南北大学)
专题命中 安全训练 :alignment(abstract)
AI总结 研究视觉语言模型中辅助信号注入问题,发现优化器常使门控路径关闭。利用抑制现象,通过双曲视觉关系图的几何辅助损失正则化LoRA微调,实验表明该方法能保持关系准确率,还指出嵌入范数对齐及固定注入的必要性。
ARBITER:面向服务水平目标的Kubernetes修复的受保护代理控制
专题命中 安全训练 :safety(abstract)
AI总结 研究在Kubernetes微服务上维护SLO的难题,提出ARBITER受保护控制平面,构建因果资源图等,分离规划与执行,支持多种规划方式。通过实验评估其在选择修复操作和下游目标等方面的效果,展示了优于HPA/仅资源控制的性能。
TriShieldRAG:一种针对检索增强生成中知识腐败的三环深度防御框架
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对检索增强生成中知识腐败问题,构建TriShieldRAG框架,设置摄取防护、检索评分器和跨语言模型共识阶段三个环,推导环2和环3起作用的条件,评估表明该框架能大幅降低攻击成功率并保持良性查询准确性。
Gubernaut:用于情感调节的大语言模型代理的确定性稳态控制器,在独立模型家族中得到验证
机构 * Gubernaut Research(Gubernaut研究)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型代理的故障模式,提出Gubernaut认知控制器,通过在四个前沿模型上预注册的评估协议验证,该控制器能使模型更平静,有恢复特征等机制,附带可重判记录及预注册故障模式。
Comments 26 pages, 7 figures, 3 tables. Data, transcripts, and analysis scripts: https://github.com/thegubernaut/Gubernaut_Validation Project page: https://gubernaut.com (archived at https://doi.org/10.5281/zenodo.21303518)
视觉令牌压缩增强多模态大语言模型的鲁棒性
机构 * Hefei University of Technology(合肥工业大学)
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG
AI总结 研究如何增强多模态大语言模型的鲁棒性,核心方法是通过测量视觉令牌与语言特征空间的距离来识别并剪枝分布外视觉令牌,该方法能有效防御越狱攻击、减轻幻觉,提升模型在通用数据集上的表现。
Comments 20 pages, 16 figures. Accepted at ACM Multimedia 2026. Code: https://github.com/Eurek001/OOD-VTP