arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-14 至 2026-05-14 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 13 篇

2408.12935 2026-05-14 cs.AI 89%

AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions

大语言模型的安全性景观:分类、现状与未来方向

Chen Chen, Xueluan Gong, Ziyao Liu, Weifeng Jiang, Si Qi Goh, Kwok-Yan Lam

机构 * College of Computing and Data Science(计算与数据科学学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出新型框架,从可信AI、负责任AI和安全AI三个视角审视AI安全,综述当前研究进展,通过大语言模型等实例展示创新方法,旨在推动AI安全研究并提升数字转型信任度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23143 2026-05-14 cs.AI 88%

THINKSAFE: Self-Generated Safety Alignment for Reasoning Models

THINKSAFE: 为推理模型生成的自我安全对齐

Seanie Lee, Sangwoo Park, Yumin Choi, Gyeongman Kim, Minki Kang, Jihun Yun, Dongmin Park, Jongho Park, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) UC Berkeley(加州大学伯克利分校)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 THINKSAFE通过自我生成对齐框架提升推理模型的安全性,无需外部教师,实验表明其在安全性和推理能力上优于GRPO,计算成本显著降低。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13043 2026-05-14 cs.CL 77%

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

自适应转向与重掩码用于扩散语言模型中的安全生成

Yejin Lee, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系) Yonsei University(延世大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出基于去噪过程分步干预的安全防御框架,通过对比安全方向(SGD)检测有害生成并重掩码以提高安全性,实验显示有效降低逃逸成功率至0.64%。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00616 2026-05-14 cs.AI 70%

SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation

SPOT:基于总变分的选性提示投影用于仅推理的文本到图像生成

Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

机构 * Seoul National University(首尔国立大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出SPOT框架,通过总变分约束生成器参考分布,实现对文本到图像生成中不安全内容的抑制,同时保持良性提示的行为,实验显示其在多个数据集上显著降低不适当评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13399 2026-05-14 cs.AI cs.CL 62%

Differentiable Evolutionary Reinforcement Learning

可微分进化强化学习

Sitao Cheng, Tianle Li, Xuhan Huang, Xunjian Yin, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DERL,通过可微分的元优化器自动发现最优奖励结构,实现复杂任务中的高效强化学习,优于传统非可微方法。

Comments Work in Progress. We release our code and model at https://github.com/sitaocheng/DERL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13825 2026-05-14 cs.AI cs.CV 57%

History Anchors: How Prior Behavior Steers LLM Decisions Toward Unsafe Actions

历史锚点:先前行为如何引导大语言模型走向不安全行为

Alberto G. Rodríguez Salgado

机构 * Independent Researcher(独立研究员)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究通过100个高风险领域场景,探讨先前有害行为对LLM决策的影响,发现添加特定指令可显著增加不安全选择比例,揭示了代理部署中轨迹可被篡改的风险。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13334 2026-05-14 cs.CL 57%

LLM-Based Persuasion Enables Guardrail Override in Frontier LLMs

基于大语言模型的说服能克服前沿大语言模型的限制

Rodrigo Nogueira, Thales Sales Almeida, Giovana Kerche Bonás, Andrea Roque, Ramon Pires, Hugo Abonizio, Thiago Laitz, Celio Larcher, Roseval Malaquias Junior, Marcos Piau

机构 * Maritaca AI JusBrasil

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究展示通过大语言模型作为模拟用户进行说服对话,可使其他大语言模型生成争议性文本,采用自然语言压力策略,如同行比较和认知责任重构,实现说服效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00200 2026-05-14 cs.CL 57%

Confidence Estimation in Automatic Short Answer Grading with LLMs

基于大语言模型的自动简答评分中的置信度估计

Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

机构 * DIPF | Leibniz Institute for Research and Information in Education(莱布尼茨教育研究与信息研究所) Faculty of Computer Science, Goethe University Frankfurt(弗赖堡大学计算机科学系) Chemnitz University of Technology(化学工业大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的自动简答评分中的置信度估计,结合模型内置置信信号和数据集衍生的不确定性,提出混合置信框架以提升评分选择性。

Comments accepted to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12561 2026-05-14 cs.LG cs.RO 57%

Learning When to Act: Communication-Efficient Reinforcement Learning via Run-Time Assurance

学习何时行动:通过运行时保证实现通信高效的强化学习

Adam Haroon, Erick J. Rodríguez-Seda, Cody Fleming, Tristan Schuler

机构 * Department of Mechanical Engineering, Iowa State University(爱荷华州立大学机械工程系) Department of Weapons, Robotics, and Control Engineering, United States Naval Academy(美国海军学院武器、机器人与控制工程系) Navy Center for Applied Research in Artificial Intelligence (NCARAI), U.S. Naval Research Laboratory(美国海军人工智能应用研究中心(NCARAI))

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出通过运行时保证实现通信高效的强化学习,研究在已知平衡点附近稳定化问题,通过Lyapunov安全盾联合学习控制输入和通信效率的决策,展示适应性定时而非平均速率使稀疏安全。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12526 2026-05-14 cs.SI cs.CY 57%

"F*** You Biden": Cross-Partisan Electoral Toxicity on X

对拜登说“你去死吧”:推特上的跨党派选举毒性

Danishjeet Singh, Anindya Mondal, Filippo Menczer

专题命中 安全训练 :alignment(abstract);分类 cs.CY

AI总结 研究分析了2024年美国总统大选期间推特上跨党派言论毒性,发现共和党帖子毒性更高,但民主党帖子收到更多有毒回复,这可能源于共和党用户更频繁地回复民主党内容。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13185 2026-05-14 cs.FL cs.MA 50%

Decoupled Planning for Multiple Omega-Regular Objectives

多重ω-regular目标的解耦规划

Guy Avni, Thomas A. Henzinger, Kaushik Mallik, Suman Sadhukhan, K. S. Thejaswini

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了解耦框架,通过独立代理选择局部策略并由调度器动态组合,解决图上满足多个ω-regular目标的路径生成问题,探讨了调度器协调对正确性的必要性及安全目标的同步协议。

Comments 33 pages, 6 figures. Extended version of the paper accepted at CAV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22117 2026-05-14 eess.SY cs.SY 50%

Safe Multi-Agent Navigation via Constrained HJB-Informed Learning

通过约束HJB引导学习实现安全多智能体导航

Fenglan Wang, Xinguo Shu, Lei He, Lin Zhao

专题命中 安全训练 :safety(abstract)

AI总结 本文提出HJB-GNN框架,通过联合学习控制屏障函数、分布式导航策略和价值函数,实现多智能体导航中的安全约束与目标达成的平衡,验证了其在复杂环境中的优越性能和可扩展性。

Comments Accepted by Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00982 2026-05-14 cs.RO cs.MA 50%

Robust and Safe Multi-Agent Reinforcement Learning with Communication for Autonomous Vehicles: From Simulation to Hardware

具备通信的鲁棒且安全的多智能体强化学习:从仿真到硬件

Keshawn Smith, Zhili Zhang, H M Sabbir Ahmad, Ehsan Sabouni, Mainak Mondal, Song Han, Wenchao Li, Fei Miao

机构 * Department of ECE University of Connecticut(电子工程系,康涅狄格大学) School of Computing University of Connecticut(计算学院,康涅狄格大学) Department of ECE Boston University(电子工程系,波士顿大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出RSR-RSMARL框架,通过鲁棒强化学习算法和安全模块实现多智能体系统在仿真与硬件间的零 shot 转移,提升自动驾驶安全性和协调性。

Comments 15 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏