arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-31 至 2026-03-31 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 16 篇

2408.15625 2026-03-31 eess.SY cs.AI cs.CL cs.SY 84%

CBF-LLM: Safe Control for LLM Alignment

CBF-LLM:安全控制用于大语言模型对齐

Yuya Miyaoka, Masaki Inoue

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于控制的对齐框架,利用控制屏障函数确保用户期望的文本生成,通过安全过滤器减少对齐任务的干预次数。

Journal ref IEEE Transactions on Control Systems Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16377 2026-03-31 cs.RO cs.AI 79%

VLM-SAFE: Vision-Language Model-Guided Safety-Aware Reinforcement Learning with World Models for Autonomous Driving

VLM-SAFE: 基于世界模型的视觉-语言模型引导的安全强化学习用于自动驾驶

Yansong Qu, Zilin Huang, Zihao Sheng, Jiancong Chen, Yue Leng, Samuel Labi, Sikai Chen

机构 * Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建筑工程学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出VLM-SAFE框架,通过观察-想象-评估-行动闭环,利用视觉语言模型提供语义安全信号,结合世界模型预测未来轨迹,优化策略以提升自动驾驶的安全性和效率。

Comments N/A

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15446 2026-03-31 cs.CL cs.AI 79%

NP-Hard Lower Bound Complexity for Semantic Self-Verification

语义自验证的NP难下界复杂度

Robin Young

机构 * University of Cambridge(剑桥大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文证明语义自验证问题在特定框架下为NP完全,通过将3SAT问题归约到SSV,揭示了即使简化形式的语义自验证也面临计算障碍,对AI安全和公平性方法有重要影响。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27912 2026-03-31 cs.RO cs.SY eess.SY 78%

Safety Guardrails in the Sky: Realizing Control Barrier Functions on the VISTA F-16 Jet

天空中的安全护栏:在VISTA F-16喷气式飞机上实现控制障碍函数

Andrew W. Singletary, Max H. Cohen, Tamas G. Molnar, Aaron D. Ames

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出Guardrails机制,通过结合人类或AI指令与安全控制动作,确保自主系统在边缘操作域安全运行,展示了其在F-16飞行测试中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22059 2026-03-31 hep-ph cs.LG hep-ex 70%

Stable and Interpretable Jet Physics with IRC-Safe Equivariant Feature Extraction

利用 IRC 安全等价特征提取实现稳定且可解释的喷注物理

Partha Konar, Vishal S. Ngairangbam, Michael Spannowsky, Deepanshu Srivastava

机构 * Physical Research Laboratory(物理研究实验室) Durham University(杜伦大学) Indian Institute of Technology(印度理工学院)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文通过图神经网络实现喷注分类,结合物理诱导偏置,设计 IRC 安全和等价性架构,提升模型稳定性与可解释性,建立学习表示与 QCD 观测的联系。

Comments 30 pages, 3 tables, 7 figures

Journal ref JHEP 03 (2026) 219

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27412 2026-03-31 cs.LG cs.AI cs.CL 67%

The Geometry of Harmful Intent: Training-Free Anomaly Detection via Angular Deviation in LLM Residual Streams

有害意图的几何学:通过残差流中的角度偏差实现无训练异常检测

Isaac Llorente-Saguer

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LatentBiopsy方法,通过分析大语言模型残差流激活的几何特性,无需训练即可检测有害提示。该方法基于残差流激活的主成分分析和角度偏差,实现高精度的异常检测,具有低延迟和强鲁棒性。

Comments 20 pages, 10 figures, 3 tables. Training-free harmful-prompt detector via angular deviation in LLM residual streams. Evaluated on six Qwen variants (base / instruct / abliterated). Achieves AUROC over 0.937 (harmful-vs-normative) and 1.000 (harmful-vs-benign-aggressive) with no harmful training data

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26679 2026-03-31 cs.CY cs.AI cs.HC 62%

AI Meets Mathematics Education: A Case Study on Supporting an Instructor in a Large Mathematics Class with Context-Aware AI

人工智能与数学教育的交汇:一个支持大班数学课程教师的案例研究

Jérémy Barghorn, Anna Sotnikova, Sacha Friedli, Antoine Bosselut

机构 * École polytechnique fédérale de Lausanne(洛桑联邦理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了通过上下文感知AI支持大规模数学课程的教学挑战,通过细调轻量语言模型提高回答准确性,并强调了人机协作在课程支持中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27482 2026-03-31 cs.CV cs.AI 57%

Difference Feedback: Generating Multimodal Process-Level Supervision for VLM Reinforcement Learning

差分反馈:为视觉语言模型强化学习生成多模态过程级监督

Feiding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Chunzheng Zhu, Yaozong Zheng, Yafei Liu, Yeling Peng, Youwei Wang, Sibo Wang, Huiming Yang, Linglin Liao, Shunzhi Yang

机构 * Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出差分反馈方法,通过修复错误推理轨迹自动构建token/步骤级监督掩码,实现多模态推理中的过程级视觉对齐,实验显示在MMMStar和MathVista基准上平均提升3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27299 2026-03-31 cs.LG 57%

From Inference Routing to Agent Orchestration: Declarative Policy Compilation with Cross-Layer Verification

从推理路由到代理编排:基于跨层验证的声明性策略编译

Huamin Chen, Xunzhuo Liu, Bowei He, Xue Liu

机构 * McGill University(麦吉尔大学)

专题命中 安全训练 :jailbreak(abstract);分类 cs.LG

AI总结 本文扩展了非图灵完备的策略语言,从单请求路由到多步骤代理工作流,通过跨层验证确保策略一致性,提升可审计性和可验证性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27194 2026-03-31 cs.RO cs.AI 57%

Multi-AUV Ad-hoc Networks-Based Multi-Target Tracking Based on Scene-Adaptive Embodied Intelligence

基于场景自适应具身智能的多无人水下机器人自组网多目标跟踪

Kai Tian, Jialun Wang, Chuan Lin, Guangjie Han, Shengchao Zhu, Ying Liu, Qian Zhu

机构 * Software College, Northeastern University(东北大学软件学院) Key Laboratory of Maritime Intelligent Network Information Technology, Ministry of Education, Hohai University(河海大学教育部海事智能网络信息技术重点实验室)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于场景自适应具身智能的多AUV自组网架构,通过整合感知、决策与物理执行,提升多目标跟踪的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27148 2026-03-31 cs.CR cs.AI 57%

SafetyDrift: Predicting When AI Agents Cross the Line Before They Actually Do

SafetyDrift: 在实际发生之前预测AI代理跨过界限的时间

Aditya Dhodapkar, Farhaan Pishori

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Santa Clara University(圣克拉拉大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出SafetyDrift模型,通过吸收马尔可夫链分析预测AI代理在有限时间内的安全违规概率,发现不同任务中违规风险差异显著,且轻量监控器在低计算成本下有效检测违规。

Comments 9 pages, 7 figures, sent to COLM conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24143 2026-03-31 cs.CL 57%

Activation Steering for Masked Diffusion Language Models

激活引导用于掩码扩散语言模型

Adi Shnaidman, Erin Feiglin, Osher Yaari, Efrat Mentel, Amit Levi, Raz Lapid

机构 * Deepkeep Technion—Israel Institute of Technology(以色列理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出激活引导方法,通过提取对比提示集的低维方向,实现对MDLMs推理过程的控制,展示了在安全拒绝任务中的有效性及跨语言迁移能力。

Comments Accepted at ReALM-GEN @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11483 2026-03-31 cs.CV cs.AI 57%

ImAgent: A Unified Multimodal Agent Framework for Test-Time Scalable Image Generation

ImAgent:一种统一的多模态代理框架,用于测试时间可扩展的图像生成

Kaishen Wang, Ruibo Chen, Tong Zheng, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 ImAgent通过统一的多模态代理框架,在测试时间实现高效的图像生成扩展,通过内部推理、生成和自评估模块提升图像质量和语义一致性。

Comments 8 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26697 2026-03-31 eess.SY cs.AI cs.SY 57%

Physicochemical-Neural Fusion for Semi-Closed-Circuit Respiratory Autonomy in Extreme Environments

物理化学-神经融合用于极端环境半闭环呼吸自主性

Phillip Kingston, Nicholas Johnston

机构 * Galactic Bioware

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种结合物理化学原理和人工智能的半闭环呼吸系统,通过融合传感器层级和强化学习策略,优化极端环境下的呼吸自主性,提升耐力性能。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27650 2026-03-31 cs.CV 50%

V-CAST: Video Curvature-Aware Spatio-Temporal Pruning for Efficient Video Large Language Models

V-CAST:面向高效视频大语言模型的曲率感知时空剪枝

Xinying Lin, Xuyang Liu, Yiyu Wang, Teng Ma, Wenqi Ren

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Shenzhen Loop Area Institute(深圳河套学院) Sichuan University(四川大学) EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出V-CAST,一种无需训练的视频长上下文推理剪枝策略,通过曲率引导的时空分配模块和双锚点空间选择机制,提升视频大语言模型的效率与性能。

Comments Code: \url{https://github.com/xinyouu/V-CAST}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27583 2026-03-31 cs.RO cs.SY eess.SY 50%

LLM-Enabled Low-Altitude UAV Natural Language Navigation via Signal Temporal Logic Specification Translation and Repair

基于大语言模型的低空无人机自然语言导航:通过信号时序逻辑规范翻译与修复

Yuqi Ping, Huahao Ding, Tianhao Liang, Longyu Zhou, Guangyu Lei, Xinglin Chen, Junwei Wu, Jieyu Zhou, Tingting Zhang

机构 * Guangdong Provincial Key Laboratory of Space-Aerial Networking and Intelligent Sensing, Harbin Institute of Technology, Shenzhen(广东省空天网络与智能感知重点实验室,哈尔滨工业大学(深圳)) Peng Cheng Laboratory (PCL), Shenzhen(鹏城实验室) Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计系) School of Computer Science and Engineering, Central South University, Changsha(中南大学计算机科学与工程学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种统一框架,通过将自然语言指令转换为信号时序逻辑规范并利用混合整数线性规划生成轨迹,提升低空无人机在复杂环境中的安全导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏