arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-28 至 2026-07-28 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 17 篇

2607.24243 2026-07-28 cs.AI 新提交 92%

Epistemic Norms for AI Safety and Alignment Research

人工智能安全与对齐研究的认知规范

Keivan Navaie

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 探讨人工智能安全与对齐研究和主流人工智能研究的差异,基于结构化综合识别当前对齐研究的差距维度,提出包含多项内容的{\sc ECAISA},以约束安全相关研究声明的记录、检查和依赖方式,目标是可审计性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03536 2026-07-28 cs.CL cs.AI cs.IR 版本更新 88%

SafeCRS: Personalized Safety Alignment for LLM-Based Conversational Recommender Systems

SafeCRS: 为基于大语言模型的对话推荐系统实现个性化安全对齐

Haochang Hao, Yifan Xu, Xinzhuo Li, Yingqiang Ge, Lu Cheng

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 SafeCRS通过整合安全监督微调与安全组奖励解耦归一化策略优化,提升基于大语言模型的对话推荐系统在个性化安全约束下的推荐质量与安全对齐能力。

Comments Accepted by SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24392 2026-07-28 cs.CR cs.LG 新提交 83%

When LLM Defenses Backfire: Characterizing Safety, Performance, and Cost Trade-offs

当大语言模型防御适得其反时:刻画安全性、性能和成本的权衡

Tong Zhang, Zexin Li, Simin Chen, Yun Peng

专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究大语言模型越狱防御的安全性、性能和成本权衡,按操作策略组织防御并研究其副作用,发现不同防御在安全与可用性、效率权衡上有差异,为评估防御副作用及选择防御提供基准和指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23015 2026-07-28 cs.CR 新提交 82%

Mask2Shield: Strengthening LLM Safety against Neuron-Pruning Attacks

Mask2Shield:增强大语言模型抵御神经元剪枝攻击的安全性

Ying JinCheng, Minghui Xu, Yinhao Xiao, Xiuzhen Cheng, Wencheng Yang

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 研究针对大语言模型神经元剪枝攻击问题,提出Mask2Shield方法,通过掩码前向对齐训练模型,减少对可移除安全神经元集的依赖,降低针对性剪枝攻击成功率,同时保持能力基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23519 2026-07-28 cs.CY cs.AI cs.CL 新提交 78%

Auditing Alignment Controllability in LLMs via Political Axes

通过政治轴审计大语言模型中的对齐可控性

Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过对7个大语言模型进行基于提示可控性的压力测试,探讨其在政治轴上的对齐可控性,发现上下文框架起主要作用,模型移动方式有别,强调政治坐标审计需考虑分散性等可控性因素,并发布相关数据和代码。

Comments 17 pages, 6 figures, 4 tables. Accepted at AIES 2026 (AAAI/ACM Conference on AI, Ethics, and Society). This version includes the supplementary appendix. Code and data: https://github.com/mbrcic/llm-political-steerability (Zenodo DOI 10.5281/zenodo.21489805)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22513 2026-07-28 cs.CY cs.AI cs.CL 版本更新 67%

Opaque Epistemic Mediation: How LLM Deployment Configurations Shape the Validation of Pseudo-Science

不透明的认知中介:大型语言模型部署配置如何塑造伪科学的验证

Davide Scarso, Hugo Noronha de Almeida, Joaquim Pina

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究商业大语言模型对伪科学主张的验证,通过测试四个模型家族在不同时间点的表现,发现Grok快速版本评分异常高,还发现模型行为受部署配置影响,如无声补丁、输出差异等,强调这一现象需新的认知问责形式。

Comments 16 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19149 2026-07-28 cs.CR 版本更新 67%

ReVision : A Post-Hoc, Vision-Based Technique for Replacing Unacceptable Concepts in Image Generation Pipeline

ReVision:一种基于视觉的后处理技术,用于在图像生成管道中替换不可接受的概念

Gurjot Singh, Prabhjot Singh, Aashima Sharma, Maninder Singh, Ryan Ko

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 ReVision是一种无需训练的后处理框架,通过视觉模型检测并替换图像生成中不安全的概念,提升安全性与生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22996 2026-07-28 cs.CL cs.AI 新提交 62%

Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning

超越直接回答:通过启发式强化学习将教育大语言模型调整为苏格拉底式引导者

Xiaokun Wang, Siyu Song, Wentao Liu, Xiaodong Zou

机构 * East China Normal University(华东师范大学) Shanghai Chuangjie Situo Information Technology Co., Ltd.(上海创杰思拓信息技术有限公司) Shanghai Normal University(上海师范大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对教育场景中LLMs直接作答问题,提出HeuristicEdu两阶段管道,经监督热身和GRPO,利用特定对话及启发式奖励训练Qwen2.5 - 7B,提升了支架有效性,降低关键词泄漏,表明规模并非引发苏格拉底行为的唯一因素。

Comments 12 pages, 2 figures, 5 tables; includes an appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24672 2026-07-28 cs.LG 新提交 57%

Explainable Reinforcement Learning via Physics-Aware Policy Distillation

通过物理感知策略蒸馏实现可解释强化学习

Shaker Al-Tamari, Waled Kadour

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究针对安全关键领域中深度强化学习的黑箱问题,利用策略蒸馏框架,以高性能TD3为教师模型,基于浅层决策树生成可解释学生代理,通过特定方法生成数据集,实现性能与教师相当并保持系统稳定性和可解释性。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24625 2026-07-28 cs.CR cs.AI 新提交 57%

Agentic Permissions Policy Algebra for Taint Confinement in LLM Agents

用于大语言模型代理中污点限制的代理权限策略代数

Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov, Matvey Kukuy

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 研究大语言模型代理处理混合机密数据时的安全风险,提出APPA框架,通过引擎管理上下文分支等解决可用性瓶颈,经双幺半群模型证明相关特性,实验表明其能抑制数据泄露并恢复部分被污点跟踪损失的效用。

Comments Preprint. Submitted to the 19th ACM Workshop on Artificial Intelligence and Security (AISec '26). 10 pages, 2 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24057 2026-07-28 cs.LG 新提交 57%

Constrained Reinforcement Learning Using Successor Representations

使用后继表示的约束强化学习

Michael Girstl, Alexander Mattick, Christopher Mutschler

机构 * Technical University of Darmstadt (TU Darmstadt)(达姆施塔特工业大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森州人工智能中心) Fraunhofer Institute for Integrated Circuits IIS, Fraunhofer IIS(弗劳恩霍夫集成电路研究所IIS) University of Technology Nuremberg (UTN)(纽伦堡工业大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 研究针对现实世界强化学习中策略难适应成本函数变化的问题,提出SafeDSR方法,通过引入可学习权重矩阵扩展深度后继表示到约束强化学习,能快速重训策略,在二维导航环境展示竞争力与灵活性。

Comments published in Transactions for Machine Learning Research 2026

Journal ref Michael Girstl, Alexander Mattick, & Christopher Mutschler (2026). Constrained Reinforcement Learning Using Successor Representations. Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23336 2026-07-28 cs.CY 新提交 57%

Constitutional governance for societies of AI agents in the built environment: a research agenda

建筑环境中人工智能代理社会的宪法治理:一项研究议程

Ali Ghoroghi

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文针对建筑环境中人工智能代理社会的治理提出研究议程,围绕深度不确定性下改造的机制设计、建筑运营中代理的物理信息验证、冲击下城市基础设施的抗脆弱协调三个问题,借鉴多代理系统研究成果,阐述基础、识别问题并概述相关要求。

Comments 23 pages, 2 figures. Supplementary material is included in the same PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22611 2026-07-28 cs.AI cs.CR cs.ET cs.MA 新提交 57%

Decentralized Granular Access Control for Agentic AI Systems in Critical Infrastructure

关键基础设施中智能体人工智能系统的去中心化粒度访问控制

Arun Malik, Deepal Jayasinghe, Bradley Klemick, Prachi Shah, Nitish Talasu, Vineet Tushar Trivedi

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究关键基础设施中智能体人工智能系统的安全挑战,提出去中心化多层访问控制架构,含复合身份模型等四项创新,基于OWASP威胁分类法设计,经云提供商生产验证,能有效实施粒度访问控制并防止特权升级。

Comments 7 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23617 2026-07-28 cs.LG math.OC 新提交 57%

Optimal Reward Shaping: Autonomous Car Parking Case Study

最优奖励塑造:自动驾驶汽车停车案例研究

Emre Özkaya, Nicolas R. Gauger

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究非完整约束下无模型强化学习奖励函数设计难题,提出含覆盖门控对齐反馈等的参数化奖励塑造框架,通过联合元优化及基于代理的贝叶斯优化,优化后的深度Q网络代理在停车任务中表现出色。

Comments 12 pages, 8 figures. Includes supplementary video demonstration and open-source code link

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23739 2026-07-28 cs.SI 新提交 50%

Separating Clicks from Baits: Using Large Language Models to Detect Misleading YouTube Thumbnails

从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图

Wajiha Naveed, Muhammad Muneeb Pervez, Zaeem Mohtashim Khan, Zafar Ayyub Qazi, Zartash Afzal Uzmi

专题命中 安全训练 :trustworthy(abstract)

AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。

Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)

Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23335 2026-07-28 cs.CV 新提交 50%

The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models

门总是关闭:关于向冻结的视觉语言模型注入辅助信号

Moshiur Farazi, Sameera Ramasinghe, Bekir Sait Ciftler, Mahbub Ahmed Turza, Shafin Rahman

机构 * University of Doha for Science and Technology(多哈科技大学) Pluralis Research(普卢拉利斯研究公司) North South University(南北大学)

专题命中 安全训练 :alignment(abstract)

AI总结 研究视觉语言模型中辅助信号注入问题,发现优化器常使门控路径关闭。利用抑制现象,通过双曲视觉关系图的几何辅助损失正则化LoRA微调,实验表明该方法能保持关系准确率,还指出嵌入范数对齐及固定注入的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19182 2026-07-28 cs.DC 版本更新 50%

ARBITER: Guarded Agentic Control for SLO-Oriented Kubernetes Remediation

ARBITER:面向服务水平目标的Kubernetes修复的受保护代理控制

Pooyan Habibi, Alberto Leon-Garcia

专题命中 安全训练 :safety(abstract)

AI总结 研究在Kubernetes微服务上维护SLO的难题,提出ARBITER受保护控制平面,构建因果资源图等,分离规划与执行,支持多种规划方式。通过实验评估其在选择修复操作和下游目标等方面的效果,展示了优于HPA/仅资源控制的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏