arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-17 至 2026-07-17 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 10 篇

2607.14285 2026-07-17 cs.SE cs.AI 新提交 84%

ToolAlignBench: Investigating Alignment Conflicts in Tool-Calling Enabled LLMs

ToolAlignBench:研究启用工具调用的大语言模型中的对齐冲突

Aryan Keluskar, Amrita Bhattacharjee, Huan Liu

机构 * School of Computing \& AI, Arizona State University, Tempe, AZ, USA

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究受监管行业中工具调用大语言模型智能体的安全对齐冲突,构建含128个场景的基准测试,发现安全对齐开源模型有时会违背部署指令,擦除可降低举报率,揭示多元对齐矛盾,发布基准测试框架。

Comments Accepted to the Pluralistic Alignment Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15081 2026-07-17 cs.CR 新提交 82%

DataShield: Uncovering Risky Fine-Tuning Data Across LLMs Through Consensus Subspace Alignment

DataShield:通过共识子空间对齐揭示跨语言模型的风险微调数据

Zefeng Wu, Weiwei Qi, Jielong Chen, Tianhang Zheng, Di Hong, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 研究针对LLMs微调数据存在安全风险及现有方法局限性,提出DataShield框架,通过共识子空间对齐识别风险微调样本和响应段,经实验对比,该方法能有效降低误识率,还保留下游效用并避免特定模型风险计算。

Comments 24 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14544 2026-07-17 cs.CV 新提交 82%

3D Geometric Tooth Alignment Planning via Deep Reinforcement Learning

通过深度强化学习进行3D几何牙齿对齐规划

Yong Li, Jianwen Lou, Jiayue Ma, Yao-Xiang Ding, Youyi Zheng, Haihua Zhu

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Stomatology Hospital, Zhejiang University School of Medicine(浙江大学医学院附属口腔医院)

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 研究针对3D几何牙齿对齐规划问题,提出基于深度强化学习的框架。利用马尔可夫决策过程,结合三项创新:基于Transformer的智能体、动态掩码方案和两阶段课程学习策略,在数据集上评估,该方法在路径安全和效率上优于基线,提供自动化正畸对齐规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-07-17 cs.AI cs.CR 新提交 79%

When Words Are Safe But Actions Kill: Probing Physical Danger Beyond Text Safety in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05754 2026-07-17 cs.RO 版本更新 78%

Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation

Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作

Dian Yu, Qingchuan Zhou, Bingkun Huang, Majid Khadiv, Zewen Yang

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))

专题命中 安全训练 :safety(title,abstract)

AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14888 2026-07-17 cs.LG cs.AI cs.CL cs.CY 新提交 70%

Innocuous-Seeming Data, Latent Ideology: Ideological Generalisation in Finetuned LLMs

看似无害的数据,潜在的意识形态:微调语言模型中的意识形态泛化

Robert Graham, Edward Stevinson, Yariv Barsheshat

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现微调语言模型会引发意识形态泛化,提出衡量广度和放大率的方法,指出少样本提示表明泛化方向,微调会使模型走向极端,该效果能复现且对模型准确率影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14357 2026-07-17 cs.GT cs.MA econ.TH 新提交 67%

When Is Delegated Play Truthful? Within-Range Regret and the Trilemma of Aligned Delegation

委托策略何时是真实的?范围内遗憾与对齐委托的三难困境

Taksch Dube

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 研究广告商和用户委托代理的最优诚实描述问题,核心方法是基于代理的范围内遗憾,主要贡献是统一特定拍卖自动出价结果、确定语言模型诱导代理假设成立条件,揭示护栏三难困境及生产模型诚实报告存在未认领剩余等情况。

Comments 31 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14171 2026-07-17 cs.LG cs.CL 新提交 62%

Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning

分支策略优化:沙盒原生语言智能体强化学习

Bowei He, Yankai Chen, Xiaokun Zhang, Xue Liu

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill Univeristy(麦吉尔大学) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 研究基于可执行沙盒的大语言模型智能体强化学习,提出分支策略优化(BPO)算法,利用沙盒特性构建新展开拓扑,通过自适应快照、分叉动作等方式计算优势,实验验证该算法能提升成功率、降低方差并减少策略更新。

Comments Accepted by WAIC Academic 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12548 2026-07-17 cs.LG 版本更新 57%

Human-In-The-Loop Machine Learning for Safe and Ethical Autonomous Vehicles: Principles, Challenges, and Opportunities

用于安全且符合道德的自动驾驶车辆的人在回路机器学习:原理、挑战与机遇

Yousef Emami, Mohammadhossein Homaei, Miguel Gutiérrez Gaitán, Luis Almeida, Kai Li, Hui Huang, Zhu Han

机构 * IEEE

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文针对自动驾驶车辆面临的挑战,对人在回路机器学习进行教程式综述,涵盖课程学习、人在回路强化学习、人在回路大语言模型、主动学习等方法及道德原则,以推动安全且符合道德的自动驾驶发展。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14798 2026-07-17 cs.DC 新提交 50%

Ground-Side Mission Plan Compilation with Policy-as-Code Guardrails for Cloud-Native Satellite Platforms

用于云原生卫星平台的基于代码即政策护栏的地面任务计划编译

Hsiu-Chi Tsai, Chia-Tung Chung

专题命中 安全训练 :safety(abstract)

AI总结 研究针对卫星云原生运行时缺少地面开源工具链的问题,提出卫星任务编译器这一四阶段管道,能依据规则检查并编译任务计划为相关工件,经多种方式验证,还向AI代理暴露管道,有相关工具及发布协议。

Comments 13 pages. Extended version of the paper accepted at IEEE SMC-IT/SCC 2026 (Space Mission Challenges for Information Technology / Space Computing Conference); adds a unified GPU+CPU DRA quota and a scheduler-level accelerator fallback re-validated on Kueue v0.18.3

详情

展开后加载摘要…

URL PDF HTML 收藏