arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 18 篇

2602.13562 2026-06-30 cs.CR cs.AI cs.CL 88%

Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning

通过自适应安全上下文学习缓解LLM对齐中的安全性与效用权衡

Yanbo Wang, Minzheng Wang, Jian Liang, Lu Wang, Yongcan Yu, Ran He

机构 * Ritzz-AI

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ASCL框架,通过多轮工具使用过程提升推理能力,引入IFPO平衡优势估计,实现更高的整体性能。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28739 2026-06-30 cs.AI 88%

Agent Safety Is Action Alignment

智能体安全即行动对齐

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文指出将内容安全方法(如拒绝训练)直接应用于智能体场景存在根本性错误,提出智能体安全应通过最小权限原则在行动边界外部强制执行,并作为行动对齐(关系性、部署条件属性)来评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28347 2026-06-30 cs.CY cs.AI cs.LG 87%

Agentic Safety is an Epistemic Property, Not a Behavioral One

智能体安全是认知属性,而非行为属性

Charles L. Wang, Keir Dorchen, Peter Jin

专题命中 安全训练 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出AI安全应视为认知属性,强调系统需保持可教性(teachability),即在学习、适应和自修改过程中仍能被纠正。

Comments To appear in proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04385 2026-06-30 cs.CL cs.AI cs.LG 85%

How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models

对齐路由:在语言模型中本地化、扩展和控制策略电路

Gregory N. Frank

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过本地化策略路由机制,探讨在语言模型中扩展和控制策略电路的方法,发现路由机制在安全性和性能上的关键作用。

Comments Code and data: https://github.com/gregfrank/how-alignment-routes. Accepted at the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28843 2026-06-30 cs.CL cs.AI 81%

The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

良性多语言微调的安全影响异质性

Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm, Stratis Tsirtsis, Zihao Fu, Greta Warren, Ryan Brown, Eoin Delaney, Sandra Wachter, Brent Mittelstadt, Chris Russell

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过多语言良性数据微调LLM,发现安全结果对微调语言和评估语言高度敏感,对抗性合规率在某些设置下增加四倍,且多语言安全漂移与通用能力指标脱钩,呈现异质性。

Comments 9 pages

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18879 2026-06-30 cs.PL 78%

Adaptive Shielding via Parametric Safety Proofs

基于参数安全证明的自适应防护

Yao Feng, Jun Zhu, André Platzer, Jonathan Laurent

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种编程语言框架,允许专家静态指定自适应防护,以确保学习代理的安全控制范围,并在运行时获取知识时变得更加宽松。

Journal ref Proceedings of the ACM on Programming Languages, Volume 9, Issue OOPSLA1, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05786 2026-06-30 cs.CR cs.AI cs.CL 73%

Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

AI代理中的证明-护栏以及从其中(不)应信任什么

Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出proof-of-guardrail系统,通过可信执行环境生成加密证明,确保代理在特定开源护栏后生成响应,同时保护开发者隐私,但指出恶意开发者可能欺骗安全措施的风险。

Comments AI4GOOD Workshop at ICML'26. Code: https://github.com/SaharaLabsAI/Verifiable-ClawGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30059 2026-06-30 cs.LG 70%

From Failure Taxonomy to Intervention: A Diagnostic Methodology for Industry-Scale AVLM in Video and Live-Streaming Platform Moderation

从失败分类到干预:面向视频和直播平台审核的工业级AVLM诊断方法

Shuchang Ye, Jinqiang Yu, Zhujun Xiao, Yajing Kong, Yist Y. Lin, Yang Ma, Jiaxi Liu, Xiaolei Xu, Zheng Yu

机构 * TikTok The University of Sydney(悉尼大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 提出一种工业级音视频语言模型(AVLM)诊断方法,通过失败分类法将模型失败映射为可观察的失败特征,并链接到干预空间,应用于大规模视频和直播平台的模型开发与对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14207 2026-06-30 cs.AI 70%

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks

人类恶意的回声在智能体中:为多轮在线骚扰攻击评估LLMs

Trilok Padhi, Pinxian Lu, Abdulkadir Erol, Tanmay Sutar, Gauri Sharma, Mina Sonmez, Munmun De Choudhury, Ugur Kursuncu

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出一个多轮在线骚扰攻击基准测试,通过合成数据集、多智能体模拟和三种 jailbreak 方法评估LLMs在多轮交互中的安全性,发现jailbreak调优显著提高攻击成功率,揭示了智能体在多轮对话中模仿人类攻击模式的弱点。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29869 2026-06-30 cs.CL cs.AI 62%

ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation

ARKD: 自适应强化学习引导的双向KL散度蒸馏用于文本生成

Zilong Liu, Xuewen Zhang, Jinrui Xing, Juyi Qiao, Huiyong Wang, Junming Jiao

机构 * Li Auto, Beijing, China(北京利亚自动化有限公司) School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对单一KL目标难以平衡主分布拟合与长尾概率建模的问题,提出基于强化学习的自适应KL加权蒸馏框架,通过策略网络动态分配前向和反向KL散度权重,实现主模态和长尾模态的双重对齐,在Rouge-L和BertScore上持续提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29265 2026-06-30 cs.CL 57%

MIThinker: A Plug-and-Play Policy-Optimized Thinker For Motivational Interviewing Counseling

MIThinker:一种用于动机性访谈咨询的即插即用策略优化思考器

Yizhe Yang, Palakorn Achananuparp, Heyan Huang, Jing Jiang, Ee-Peng Lim

机构 * Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) Australian National University(澳大利亚国立大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 提出轻量级思考模型MIThinker,通过逆向工程从咨询师回应中生成治疗性思考,结合监督微调和强化学习训练,以显式对齐咨询策略,提升动机性访谈咨询效果,计算量降低一个数量级。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28962 2026-06-30 cs.CR cs.LG 57%

FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks

FlipGuard:防御针对大型语言模型的量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

机构 * School of Cyber Science and Technology(网络安全科学与技术学院) Suzhou Research Institute of Shandong University(山东大学苏州研究院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 提出FlipGuard防御框架,通过量化前扰动权重打破后门触发条件,有效抑制量化条件后门攻击,并引入DER指标统一评估安全、效用与成本。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28360 2026-06-30 cs.IR cs.AI 57%

Carolina Guide: A Multi-Agent RAG System with Institutional Guardrails for Academic Policy Assistance

Carolina Guide:具有机构护栏的多智能体RAG系统用于学术政策咨询

Ben Torsion, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出Carolina Guide系统,采用模块化多智能体管道与机构护栏,基于检索增强生成提供学术政策咨询,在90查询测试集上达到98.9%检索成功率,安全F1为0.89。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25063 2026-06-30 cs.LG cond-mat.mtrl-sci 57%

Reinforcement Learning with a Bilevel World-Model Architecture for Scan-Order Optimisation in Laser Directed Energy Deposition

激光增材制造扫描顺序优化的强化学习:用于奖励和世界模型诊断的双层代理-有限元分析诊断框架

Xian Wu, Haoran Li, Yuanqi Chu, Dongbin Zhao, Bin Wang

机构 * College of Engineering, Design and Physical Sciences, Brunel University London(布鲁内尔大学伦敦工程、设计与物理科学学院) Pattern Recognition Laboratory, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别实验室) ISIS Neutron and Muon Source, Science and Technology Facilities Council, Rutherford Appleton Laboratory(Rutherford Appleton实验室,科学与技术设施委员会ISIS中子与μ子源)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出一个双层代理-有限元分析诊断框架,通过轻量代理和稀疏有限元模拟,诊断强化学习在激光增材制造扫描顺序优化中的奖励和世界模型保真度问题。

Comments 31 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00095 2026-06-30 cs.LG cs.NE 57%

Financial Decision Making using Reinforcement Learning with Dirichlet Priors and Quantum-Inspired Genetic Optimization

利用Dirichlet先验和量子启发式遗传优化的强化学习进行财务决策

Prasun Nandy, Debjit Dhar, Rik Das

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出结合Dirichlet分布和量子启发式遗传优化的强化学习框架,用于动态预算分配,以提高企业财务决策的适应性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29028 2026-06-30 cs.RO 50%

Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer

关键姿态探索:高效的自动轨迹标注与跨实体策略迁移

Yupu Lu, Hang Xu, Yizhou Chen, Jia Pan

机构 * School of Computing and Data Science, The University of Hong Kong, HKSAR(计算与数据科学学院,香港大学,香港特别行政区)

专题命中 安全训练 :alignment(abstract)

AI总结 提出结合视觉语言模型与经典轨迹分析的关键姿态自动标注流程,并利用关键姿态引导扩散策略实现零样本跨实体迁移。

Comments Accepted by IROS2026. Code available at: https://github.com/YupuLu/keypose_labelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28605 2026-06-30 eess.SP 50%

Hybrid AI-Physics Framework for Post-Earthquake Structural Damage Diagnosis with Sparse Sensing

混合AI-物理框架用于稀疏传感下的震后结构损伤诊断

Xiao Liang

专题命中 安全训练 :safety(abstract)

AI总结 提出一种物理信息无监督学习框架,融合传感器数据与物理模拟,通过时空复合自编码网络(SCAN)从震前数据学习正常行为,检测并定位震后损伤,无需标签数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01472 2026-06-30 cs.RO 50%

AERMANI-VLM: Structured Prompting and Reasoning for Aerial Manipulation with Vision Language Models

AERMANI-VLM:基于视觉语言模型的空中 manipulation 的结构提示与推理

Sarthak Mishra, Rishabh Dev Yadav, Avirup Das, Saksham Gupta, Wei Pan, Spandan Roy

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) Newcastle University(纽卡斯尔大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AERMANI-VLM框架,通过分离高层推理与低层控制,利用结构化提示生成自然语言推理轨迹,实现安全可靠的空中 manipulation 任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏