arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-01 至 2026-07-01 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 17 篇

2605.09045 2026-07-01 cs.AI cs.CR cs.SE 版本更新 91%

Containment Verification: AI Safety Guarantees Independent of Alignment

包含性验证:与对齐无关的AI安全保证

Royce Moon, Lav R. Varshney

机构 * AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(title);分类 cs.AI

AI总结 本文提出包含性验证,通过代理框架本身提供安全保证。通过前向模拟细化和Dafny机制化,证明了在模型类型动作边界内对所有AI输出的边界策略强制性,首次实现了代理框架的演绎形式验证。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22686 2026-07-01 cs.CR cs.AI cs.LG 新提交 84%

The Geometry of Refusal: Linear Instability in Safety-Aligned LLMs

拒绝的几何:安全对齐大语言模型中的线性不稳定性

Shivam Ratnakar, Kartikeya Vats

机构 * University of Southern California(南加州大学) Independent Researcher(独立研究员)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

AI总结 研究通过对比安全与不安全系统提示的隐藏状态,提出对比逻辑操控(CLS)框架,揭示安全对齐的线性脆弱性,并证明逻辑级干预比隐藏状态方法更有效,同时可实现双向控制。

Comments Accepted at TrustNLP 2026 (Sixth Workshop on Trustworthy Natural Language Processing, ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12557 2026-07-01 cs.LG cs.AI 版本更新 81%

TraCeS: Learning Per-Timestep Constraint-Violation Credit from Sparse Trajectory-Level Labels

TraCeS: 从稀疏轨迹级标签学习每时间步约束违反信用

Siow Meng Low, Ze Gong, Akshat Kumar

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出TraCeS方法,通过稀疏轨迹级标签学习每时间步的约束违反信用,用于强化学习中的安全约束优化,无需已知成本函数或阈值,在连续控制基准上提升约束满足和反馈效率。

Comments Accepted at ICML 2026. Code available at https://github.com/siowmeng/TraCeS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31963 2026-07-01 cs.LG cs.CL stat.ML 新提交 62%

Signed-Permutation Coordinate Transport for RMSNorm Transformers

RMSNorm Transformer的有符号排列坐标传输

John Sweeney

机构 * Sideplane AI

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对RMSNorm模型,提出有符号排列坐标传输方法,解决排列对齐不完整问题,在跨运行坐标恢复、工具迁移和训练状态保持上显著优于纯排列方法。

Comments 31 pages, 2 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30788 2026-07-01 cs.LG cs.CL cs.CR 新提交 62%

Revocable Learned State via Process Sidecars

通过过程侧边栏实现可撤销的学习记忆

John Sweeney

机构 * Sideplane AI

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 提出过程侧边栏方法,通过两系数编辑族修正安全训练后的记忆方向,实现记忆撤销,理论证明其二阶精度优于任务算术编辑。

Comments 23 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30931 2026-07-01 cs.AI cs.LG cs.MA math.OC math.PR 新提交 62%

RoPoLL: Robust Panel of LLM Judges

RoPoLL: 鲁棒的LLM评审团

Anish Acharya, Kris W Pan, Brian Verkhovsky

机构 * Amazon Web Services(亚马逊云服务)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM评审团在污染数据下偏差无界的问题,提出RoPoLL,用几何中位数聚合替代均值,实现最优鲁棒性,在多种偏差攻击下显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12893 2026-07-01 cs.CV cs.AI cs.LG cs.NE stat.ML 版本更新 62%

Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models

文本到图像模型强化学习后训练的有限差分流优化

David McAllister, Miika Aittala, Tero Karras, Janne Hellsten, Angjoo Kanazawa, Timo Aila, Samuli Laine

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。

Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31748 2026-07-01 cs.LG 新提交 57%

Addressing Over-Refusal in LLMs with Competing Rewards

用竞争奖励解决大语言模型中的过度拒绝问题

Taeyoun Kim, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) SynthLabs

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出SEAR方法,通过对抗优化和过程奖励,让模型在推理中探索有害思路但最终输出安全答案,从而缓解安全训练导致的过度拒绝问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31635 2026-07-01 eess.SY cs.AI cs.MA cs.SY 新提交 57%

A Tutorial on Autonomous Fault-Tolerant Control Using Knowledge-Grounded LLM Agents

基于知识接地LLM代理的自主容错控制教程

Javal Vyas, Milapji Singh Gill, Artan Markaj, Felix Gehlhoff, Mehmet Mercangöz

机构 * Autonomous Industrial Systems Laboratory, Imperial College London(帝国理工学院自主工业系统实验室) Institute of Automation Technology, Helmut Schmidt University(赫尔穆特·施密特大学自动化技术研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出利用LLM代理作为约束监督规划器,通过外部验证器确保安全,辅助过程工厂故障恢复决策,并提供了可执行的Python环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31307 2026-07-01 cs.CL 新提交 57%

When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue

当数据库失败时:提示LLM对话代理在任务导向对话中安全恢复

Mohammad Alijanpour Shalmani, Alale Rezvani Boroujeni, Jiann Shiun Yuan

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院) Department of Marketing, University of Central Florida(中佛罗里达大学市场营销系)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 针对任务导向对话中后端数据库失败导致LLM产生不安全响应的问题,提出基于提示的轻量级恢复策略,无需重训练即可将幻觉率降低42-50%。

Comments Accepted at SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31023 2026-07-01 cs.CR cs.LG 新提交 57%

Certified Speculative Execution for Untrusted AI Agents

不可信AI代理的认证推测执行

Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

机构 * School of Engineering, Institute of Science Tokyo, Japan(东京科学大学工学院) College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院) Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电气与计算机工程系)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出证书门控前缀接受(CGPA)方法,通过可信验证器、保形校准值边界和求解器延迟机制,实现安全、遗憾和速度的解耦,将不可信AI代理的违规率降至零。

Comments 15 pages, 2 figures, 24 tables. Includes a technical appendix (full proofs and all supplementary tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30973 2026-07-01 cs.CL 新提交 57%

From Propositional to Perceptual Asymmetry: Extending Frictive Policy Optimization to Asymmetric Partial Information Dialogue

从命题不对称到感知不对称:将摩擦策略优化扩展到非对称部分信息对话

Yifan Zhu, Kyeongmin Rim, James Pustejovsky

机构 * Brandeis University(布兰迪斯大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 将摩擦策略优化从共享感知场景扩展到感知不对称场景,通过跨语料库分析和LLM探测验证,发现摩擦函数仅在参与者信息视野内有效,并提出标注改进。

Comments 11 pages. To appear in Proceedings of SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30877 2026-07-01 eess.SY cs.LG cs.SY 新提交 57%

A Systematic Approach to Multi-Agent AI from Advanced Regulatory Control Theory: Safe and Auditable LLM Operator Agents for Process Control

基于先进调节控制理论的多智能体AI系统化方法:用于过程控制的安全且可审计的LLM操作员智能体

Idelfonso B. R. Nogueira, Sigurd Skogestad

机构 * Norwegian University of Science and Technology (NTNU)(挪威科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出将先进调节控制理论映射为多智能体系统,每个反馈回路对应一个专业LLM操作员智能体,通过确定性或LLM编排器解决约束冲突,在奶牛场通风案例中实现可审计轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31732 2026-07-01 cs.CV 新提交 50%

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31572 2026-07-01 cs.SE 新提交 50%

FormIDEAble: Safe and Socially-aware Autonomous Systems

FormIDEAble:安全且具有社会感知能力的自主系统

Livia Lestingi, Amel Bennaceur, Marcello M. Bersani, Carlos Gavidia-Calderon, Anastasia Kordoni, Mark Levine, Bashar Nuseibeh, Matteo Rossi

专题命中 安全训练 :safety(abstract)

AI总结 提出FormIDEAble方法,通过带代价的马尔可夫决策过程建模人机协作,将决策形式化为代价有界可达性问题,在保证安全的同时实现社会感知策略合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31056 2026-07-01 eess.SY cs.SY 新提交 50%

A Simplex-Inspired Architecture for Integrating Quantum Capabilities into Cyber-Physical Systems

一种受单纯形启发的架构,用于将量子能力集成到信息物理系统中

Tamim Ahmed, Dacheng Shen, Mengyu Liu, Monowar Hasan

专题命中 安全训练 :safety(abstract)

AI总结 提出基于单纯形架构的混合经典-量子系统辨识框架,结合量子辅助希尔伯特空间高斯过程回归与经典高斯过程回归,通过运行时监控实现性能与安全性的可控权衡。

Comments Poster presented at the 2nd Workshop on HPC/AI Integration with Quantum Computing/Networking 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15614 2026-07-01 cs.RO 版本更新 50%

AION: Aerial Indoor Object-Goal Navigation Using Dual-Policy Reinforcement Learning

AION: 基于双策略强化学习的空中室内目标导航

Zichen Yan, Yuchen Hou, Shenao Wang, Yichao Gao, Rui Huang, Lin Zhao

机构 * Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系)

专题命中 安全训练 :safety(abstract)

AI总结 提出AION,一种端到端双策略强化学习框架,解耦探索与目标到达行为,用于视觉空中目标导航,无需外部定位或全局地图,在AI2-THOR和IsaacSim中验证了优越性能。

Comments Accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏