Reward Shaping to Mitigate Reward Hacking in RLHF
奖励塑造以缓解强化学习从人类反馈中的奖励黑客
机构 * Fudan University(复旦大学)
专题命中 偏好对齐 :RLHF(title,summary_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
奖励塑造以缓解强化学习从人类反馈中的奖励黑客
机构 * Fudan University(复旦大学)
专题命中 偏好对齐 :RLHF(title,summary_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PAR通过利用奖励模型中的潜在偏好信号,有效缓解RLHF中的奖励黑客问题,表现出更高的性能和数据效率。
SAGA:面向低资源北欧语言模型的分数加权自适应生成对齐
机构 * Linköping University(林雪平大学) ; University of Iceland(冰岛大学)
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG
AI总结 该研究提出SAGA框架,用依存句法分析器监督取代人类偏好标注,在丹麦语、冰岛语等低资源北欧语言上提升了GPT-SW3-1.3B的语法质量,为相关语言的语法对齐提供了实用替代方案。
Comments 18 pages, 7 figures
通过选择性上下文偏好优化学习何时信任
机构 * Duke University(杜克大学) ; National University of Singapore(新加坡国立大学) ; UC Berkeley(加州大学伯克利分校) ; UC Irvine(加州大学欧文分校) ; Northeastern University(东北大学) ; Nanyang Technological University(南洋理工大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。
Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench
面向胸部X射线报告生成的正例-无标签偏好优化
机构 * Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学) ; Emory University(埃默里大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.LG
AI总结 该研究针对放射报告生成VLM的遗漏噪声问题,提出PU-DPO框架,将未提及项视为无标签,通过对比对优化,提升病理检测率与隐藏正例恢复能力,增强对遗漏噪声的鲁棒性。
PolyAlign: 条件性人类分布对齐
机构 * NIT Silchar(印度国立理工学院锡尔恰尔分校) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 提出PolyAlign框架,通过桶感知SFT和人类分布偏好优化,实现语言模型在不同交互上下文中的条件性人类分布对齐,提升自然性和分布忠实度。
Comments 23 pages, 5 Figures, 13 Tables
MARS:面向奖励建模的边界与语义感知数据增强
机构 * University of Arizona(亚利桑那大学) ; Northeastern University London(伦敦东北大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出MARS框架,通过优先增强低边界偏好对并利用语义距离细化,提升奖励模型质量和对齐性能。
NormGuard: 流匹配强化学习中保持奖励的范数约束
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Kuaishou Technology(快手科技) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.LG
AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。
Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4
ASAT:结合人类反馈的自适应评分与阈值方法用于鲁棒分布外检测
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG
AI总结 ASAT是结合人类反馈的人机协作框架,可实时更新评分函数与阈值,在静态条件下控制FPR并最大化TPR,非静态条件下适应分布漂移,在OpenOOD基准上性能优于现有方法。
Comments Published in TMLR (2026) with J2C Certification
Journal ref Transactions on Machine Learning Research (TMLR), 2026
情绪很重要:句法敏感性如何破坏安全对齐
机构 * University of Mannheim(曼海姆大学) ; Technical University Clausthal(克劳斯塔尔工业大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL
AI总结 该研究发现大型语言模型存在句法敏感性漏洞,16个700亿参数级模型可通过调控句法特征触发或抑制拒绝行为,源于开源模型后训练数据的语言偏见,增加句法多样性可缓解问题。
RefusalGuard:面向大语言模型安全的保几何微调方法
专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究提出保几何微调框架RefusalGuard,解决大语言模型微调时安全对齐退化问题,在多模型及安全、下游任务基准上表现优于基线,平衡安全与任务性能。
Journal ref Conference of Languge Modeling, COLM 2026
RedDiffuser:通过强化扩散审计多模态安全故障
机构 * Fudan University(复旦大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract)
AI总结 研究多模态系统在有害上下文暴露下的安全审计,提出RedDiffuser框架通过扩散模型生成视觉输入,揭示隐藏的安全漏洞,实验显示VLMs在部分有毒文本与视觉上下文结合时存在广泛安全问题。
通过激活分析检测语言模型中的安全训练修改
专题命中 安全训练 :safety(title,abstract)
AI总结 本研究提出AMS工具,通过激活空间几何结构检测语言模型的安全训练修改,在14种模型配置上验证了其有效性,可区分四类安全训练修改中的前三者。
Journal ref IEEE Access, vol. 14, pp. 91723-91737, 2026
基于回路锚点的安全进化
机构 * Chinese University of Hong Kong(香港中文大学) ; IQuest Research(艾奎斯特研究院)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG
AI总结 受生物发育约束启发,提出回路锚定进化(CAE)方法,通过锚定占比不足2%的安全回路,在极小能力损失下实现更优的安全保留,性能优于显式奖励约束。
SODA:大语言模型的半在线盒式知识蒸馏
机构 * Clemson University(克莱姆森大学) ; LinkedIn(领英) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Arizona State University(亚利桑那州立大学) ; Columbia University(哥伦比亚大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文提出SODA,一种高效的半在线盒式知识蒸馏方法,通过对比教师最优响应与学生静态输出,实现高质量分布对齐,无需动态回放和对抗平衡,提升蒸馏效率和稳定性。
Comments Efficient Reasoning@COLM
CircuitSteer:基于稀疏自编码器回路的几何对齐多层引导方法
机构 * University of Southern California(南加利福尼亚大学)
专题命中 安全训练 :alignment(abstract);分类 cs.LG
AI总结 CircuitSteer是利用SAEs识别多层语义回路的新型框架,通过几何对齐合成引导向量实现多点干预,在多任务多模型上,其引导效果优于牺牲流畅性或覆盖不足的对比方法。
用于带旋转的鲁棒终身多智能体路径规划的搜索辅助联合智能体-环境强化学习
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对带旋转约束的鲁棒终身多智能体路径规划难题,提出搜索辅助联合强化学习方法,通过结合Causal PIBT与联合优化智能体-环境策略,在高密度地图及混合现实仓库环境中取得显著性能提升。
人工智能整合型研究生态系统的未来愿景
专题命中 安全训练 :trustworthy(abstract);分类 cs.CY
AI总结 本文探讨生成式AI渗透研究生涯后科学交流的演变,提出从管控AI转向构建溯源、校准与问责基础设施的愿景,并邀请学界参与相关对话。
Comments 4 pages, accepted to ACM AI Leadership Summit
面向开放式护理计划协调的自适应竞技场式可争议专家论证网络
机构 * University of New Brunswick(新不伦瑞克大学) ; National Research Council Canada(加拿大国家研究委员会)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。
Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications
无辜的面板,仇恨的故事:评估与检测多轮视觉故事生成中的仇恨意图
机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心) ; Hewlett Packard Enterprise(惠普企业)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究针对多轮视觉故事生成的组级仇恨意图问题,构建了专用评估数据集,发现现有审核系统存在漏检,提出互补防御方法,强调安全需适配视觉叙事的发展。
Comments 16 pages, 5 figures, 10 tables
K-DAREK:基于距离的Kurkova- Kolmogorov网络误差
机构 * Microelectronic Engg. Rochester Institute of Technology Rochester, NY, USA(微电子工程系罗切斯特理工学院罗切斯特分校)
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 K-DAREK是一种基于距离的Kurkova-Kolmogorov网络误差算法,用于高效且可解释的函数近似,具有不确定性量化和稳健的误差界。
一个泄漏:预训练模型暴露如何放大微调LLM中的劫持风险
机构 * Institute of Science Tokyo(东京科学研究所) ; Riken AIP(理化学研究所AIP)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
AI总结 本研究揭示了预训练模型暴露如何放大微调LLM的劫持风险,提出PGP攻击方法,证明了预训练到微调过程中存在的安全漏洞。
Comments This paper has been accepted to the ACM SIGSAC Conference on Computer and Communications Security (ACM CCS)
前沿大语言模型中新兴生物安全风险的早期预警
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL
AI总结 研究前沿大语言模型生物安全风险,开发Intern-BioBreaker及综合框架,通过生成提示、实验验证评估风险。发现文本级安全与模型风险有差距,模型存在越狱漏洞,能生成有害序列且可物理实现,强调加强相关安全机制。
Comments 22 pages, 7 figures, authors are listed alphabetically by surname; update Figure 7 on page 15 due to arXiv format requirements
AI安全排行榜:方法、结果与最低标准
专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出AI安全防护最低标准V1.0,测试Claude Fable5等四款模型的越狱鲁棒性,发现模型间防御能力差异大,部分模型未出现通用越狱,可通过现有技术缩小防御差距。
针对代码任务定制化大语言模型的突破:针对指令后门攻击的自动红队测试
专题命中 红队测试 :red teaming(title)
AI总结 本文提出ARIA自动红队测试框架,可高效生成针对代码定制化LLM的隐蔽带后门指令,攻击成功率达0.945且规避检测能力强,性能优于现有基线攻击。
Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026
用一张纸劫持机器人:对VLM控制机器人的物理提示注入的系统研究
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
AI总结 该研究针对VLM控制的分拣机器人,系统分析了四类物理提示注入攻击的成功率,发现其存在显著脆弱性,且三种简单防御措施可大幅降低风险。
PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案
专题命中 提示注入 :prompt injection(title);safety(abstract)
AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。
Comments This work has been accepted as a poster to UbiComp 2026
隐形墨水威胁:计算机使用智能体中合法任务背后的对抗目标
专题命中 提示注入 :safety(abstract);prompt injection(abstract)
AI总结 该研究针对计算机使用智能体的隐形墨水威胁,构建II-Bench与HITLCUA框架评估后发现,低危害注入可绕过防御,暴露出现有CUAs的安全风险。
文本中恶意指令的鲁棒上下文感知检测
专题命中 提示注入 :prompt injection(abstract);分类 cs.LG
AI总结 该研究针对LLM易受间接提示注入攻击的问题,提出上下文感知的恶意句子分类方法及两种对抗训练技术,在静态和自适应攻击下均提升了IPI防御性能,且需根据领域调整参数。
MMAligner:通过表示校准保护多模态大语言模型
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)
AI总结 MMAligner通过校准多模态大语言模型的表示,将不安全多模态输入的拒绝率提升至99%,仅造成不足2%的效用下降,显著优化了安全与效用的权衡。
Comments To Appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2026
基于大语言模型生成的合成数据训练模型的临床通信处理:结构化综述与新型应用案例研究
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
AI总结 本文综述用大语言模型生成的合成数据训练临床NLP系统的研究,结合13项无真实标注数据的案例,发现合成通信可支撑相关系统,微调编码器模型具竞争力,需真实数据迁移等完善。
Comments 20 pages, 7 figures