arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-03 至 2026-04-03 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2603.28650 2026-04-03 cs.LG cs.AI stat.ML 81%

Information-Theoretic Limits of Safety Verification for Self-Improving Systems

自我改进系统安全验证的信息论极限

Arsenios Scrivens

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 研究安全验证在允许无界有益自修改的同时维持有限累积风险的理论极限,提出双条件并建立其兼容性理论。

Comments 27 pages, 6 figures. Companion empirical paper: doi:10.5281/zenodo.19237566

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07645 2026-04-03 cs.SE cs.AI cs.CR 79%

A Self-Improving Architecture for Dynamic Safety in Large Language Models

为大语言模型动态安全设计的自改进架构

Tyler Slater

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出自改进安全框架SISF,通过反馈循环实现LLM系统在运行时自动检测安全故障并生成防御策略,实验显示其能有效降低攻击成功率,提升系统鲁棒性。

Comments Under review at the journal Information and Software Technology (Special Issue on Software Architecture for AI-Driven Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20666 2026-04-03 cs.LG cs.AI cs.SY eess.SY 62%

Learning Contextual Runtime Monitors for Safe AI-Based Autonomy

学习上下文感知的运行时监视器以实现安全的基于AI的自主性

Alejandro Luque-Cerpa, Mengyuan Wang, Emil Carlsson, Sanjit A. Seshia, Devdatt Dubhashi, Hazem Torfah

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) University of California at Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种学习上下文感知运行时监视器的新框架,用于安全的基于AI的控制集合。通过将监视学习转化为上下文学习任务,该方法在控制器选择中提供理论安全保证,并提高控制器多样性利用,通过自动驾驶模拟验证了其在安全性和性能上的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00580 2026-04-03 cs.RO cs.AI 57%

OmniUnet: A Multimodal Network for Unstructured Terrain Segmentation on Planetary Rovers Using RGB, Depth, and Thermal Imagery

OmniUnet:一种多模态网络,用于使用RGB、深度和热成像的无结构地形分割在火星车上的应用

Raul Castilla-Arquillo, Carlos Perez-del-Pulgar, Levin Gerdes, Alfonso Garcia-Cerezo, Miguel A. Olivares-Mendez

机构 * University of Luxembourg(卢森堡大学) Universidad de Málaga(马拉加大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 OmniUnet通过整合RGB、深度和热成像数据,实现无结构地形的高效分割,利用自定义传感器设备在西班牙Bardenas半沙漠收集数据,并在资源受限设备上验证了其性能。

Journal ref 2025 International Conference on Space Robotics (iSpaRo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02265 2026-04-03 cs.CV 50%

Modular Energy Steering for Safe Text-to-Image Generation with Foundation Models

模块化能量引导用于基础模型的安全文本到图像生成

Yaoteng Tan, Zikui Cai, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) University of Maryland(马里兰大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于梯度反馈的引导框架,利用预训练基础模型的潜在估计实现安全可控的文本到图像生成,适用于扩散和流匹配模型,提升生成质量与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏