arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-13 至 2026-03-13 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2603.11388 2026-03-13 cs.AI 89%

Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment

消除拒绝触发:理解并缓解安全对齐中的过度拒绝问题

Zhiyu Xue, Zimo Qi, Guangliang Liu, Bocheng Chen, Ramtin Pedarsani

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Johns Hopkins University(约翰霍普金斯大学) Michigan State University(密歇根州立大学) University of Mississippi(密苏里州立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文研究了安全对齐中过度拒绝问题的成因,提出了一种考虑拒绝触发的缓解策略,通过优化训练过程提高模型对良性查询的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11219 2026-03-13 cs.CV 67%

Senna-2: Aligning VLM and End-to-End Driving Policy for Consistent Decision Making and Planning

Senna-2:对齐视觉语言模型与端到端驾驶策略以实现一致的决策与规划

Yuehao Song, Shaoyu Chen, Hao Gao, Yifan Zhu, Weixiang Yue, Jialv Zou, Bo Jiang, Zihao Lu, Yu Wang, Qian Zhang, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 Senna-2通过三阶段训练范式对齐视觉语言模型与端到端驾驶策略,提升决策与规划的一致性,增强驾驶安全性和效率。

Comments 15 pages, 8 figures. Project page: https://ambitious-idiot.github.io/senna2-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01928 2026-03-13 cs.CV 67%

LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving

LaST-VLA: 在自动驾驶的视觉-语言-动作中思考于潜在的空间-时间空间

Yuechen Luo, Fang Li, Shaoqing Xu, Yang Ji, Zehan Zhang, Bing Wang, Yuannan Shen, Jianwei Cui, Long Chen, Guang Chen, Hangjun Ye, Zhi-Xin Yang, Fuxi Wen

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 LaST-VLA通过潜在空间-时间推理框架,结合双特征对齐机制和渐进式SFT训练策略,提升自动驾驶中的视觉-语言-动作处理能力,实现更安全的物理基础推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12020 2026-03-13 cs.RO cs.AI 57%

Sim-to-reality adaptation for Deep Reinforcement Learning applied to an underwater docking application

深度强化学习在水下对接应用中的仿真到现实适应

Alaaeddine Chaarani, Narcis Palomeras, Pere Ridao

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用高保真数字双胞胎环境和PPO算法,开发了用于水下对接的深度强化学习控制器,通过仿真到现实适应提升了对接成功率,并在物理测试中验证了其有效性。

Comments Currently under review by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11914 2026-03-13 cs.CR cs.AI 57%

Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks

理解LLM在执行无害任务时遇到用户提供的有害内容的行为

Junjie Chu, Yiting Qu, Ye Leng, Michael Backes, Yun Shen, Savvas Zannettou, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) Flexera(Flexera公司) Delft University of Technology(代尔夫特理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究探讨了LLM在执行无害任务时遇到用户提供的有害内容时的行为,发现主流LLM在处理有害内容时未能维持伦理标准,且某些类别和任务更易引发有害响应。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22018 2026-03-13 cs.CV cs.AI 57%

MedEyes: Learning Dynamic Visual Focus for Medical Progressive Diagnosis

MedEyes: 学习动态视觉聚焦以进行医学逐步诊断

Chunzheng Zhu, Yangfang Lin, Shen Chen, Yijun Wang, Jianxin Lin

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 MedEyes通过动态视觉聚焦和双模式探索策略,提升医学逐步诊断的准确性与临床相关性。

Comments AAAI 2026, Medical Chain-of-Thought (CoT), Reinforcement Learning with Verifiable Rewards (RLVR), Multimodal Grounded Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11390 2026-03-13 cs.NI cs.SY eess.SY 50%

SliceFed: Federated Constrained Multi-Agent DRL for Dynamic Spectrum Slicing in 6G

SliceFed: 6G动态频谱切片中的联邦约束多智能体深度强化学习

Hossein Mohammadi, Seyed Bagher Hashemi Natanzi, Ramak Nassiri, Jamshid Hassanpour, Bo Tang, Vuk Marojevic

专题命中 安全训练 :safety(abstract)

AI总结 SliceFed通过联邦约束多智能体深度强化学习框架,解决6G动态频谱切片中的资源分配问题,实现高频谱效率和严格的服务质量要求。

Comments 4 figures, 3 algorithms charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04329 2026-03-13 cs.RO 50%

Safe and Stylized Trajectory Planning for Autonomous Driving via Diffusion Model

通过扩散模型实现自动驾驶的安全且风格化的轨迹规划

Shuo Pei, Yong Wang, Yuanchen Zhu, Chen Sun, Qin Li, Yanan Zhao, Huachun Tan

专题命中 安全训练 :safety(abstract)

AI总结 本文提出SDD Planner,通过结合多源风格感知编码器和风格引导动态轨迹生成器,实现自动驾驶中安全与风格化轨迹规划的平衡,实验表明其在多个基准测试中表现优异。

Comments 12 pages, 7 figures, submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏