arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-12 至 2026-03-12 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2603.01246 2026-03-12 cs.CR cs.AI 88%

Defensive Refusal Bias: How Safety Alignment Fails Cyber Defenders

防御性拒绝偏差:安全对齐如何失败于网络防御者

David Campbell, Neil Kale, Udari Madhushani Sehwag, Bert Herring, Nick Price, Dan Borges, Alex Levinson, Christina Q Knight

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究发现LLMs在防御性网络安全任务中因语义相似性错误拒绝协助,影响安全防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10588 2026-03-12 cs.AI cs.CL cs.LG 82%

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究

Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Microsoft Research(微软研究院) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) CUHKSZ(香港中文大学(深圳)) THU(清华大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10068 2026-03-12 cs.CR cs.AI cs.CL 73%

ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models

ADVERSA:测量大型语言模型中多轮护栏退化和裁判可靠性

Harry Owiredu-Ashley

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 ADVERSA通过连续合规轨迹评估大型语言模型在多轮对抗中的护栏退化及裁判可靠性,揭示早期轮次更易成功突破。

Comments 12 pages, 12 figures. Independent research. Code and artifacts: https://github.com/Harry-Ashley/adversa-guardrail-degradation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10012 2026-03-12 cs.CL cs.AI 62%

Measuring and Eliminating Refusals in Military Large Language Models

测量和消除军事大语言模型中的拒绝行为

Jack FitzGerald, Dylan Bates, Aristotelis Lazaridis, Aman Sharma, Vincent Lu, Brian King, Yousif Azami, Sean Bailey, Jeremy Cao, Peter Damianov, Kevin de Haan, Joseph Madigan, Jeremy McLaurin, Luke Kerbs, Jonathan Tainer, Dave Anderson, Jonathan Beck, Jamie Cuticello, Colton Malkerson, Tyler Saltsman

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过评估军事大语言模型的拒绝行为,提出通过中期训练和端到端后训练实现零拒绝和最大军事任务准确性的方法。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10504 2026-03-12 cs.CR cs.AI cs.CV 57%

Naïve Exposure of Generative AI Capabilities Undermines Deepfake Detection

生成AI能力的盲目暴露削弱了深度伪造检测

Sunpill Kim, Chanwoo Hwang, Minsu Kim, Jae Hong Seo

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 生成AI能力的盲目暴露导致深度伪造检测失效,商业AI系统因高逼真度和易用性成为更大安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10638 2026-03-12 cs.CV 50%

Splat2Real: Novel-view Scaling for Physical AI with 3D Gaussian Splatting

Splat2Real:基于物理AI的新型视角缩放与3D高斯点云技术

Hansol Lim, Jongseong Brad Choi

机构 * Department of Mechanical Engineering, State University of New York(纽约州立大学机械工程系)

专题命中 安全训练 :safety(abstract)

AI总结 Splat2Real通过CN-Coverage策略提升物理AI在新型视角下的鲁棒性,实现更稳定的深度预训练和下游控制代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23162 2026-03-12 cs.RO cs.CV 50%

Cosmos-H-Surgical: Learning Surgical Robot Policies from Videos via World Modeling

Cosmos-H-Surgical: 通过世界建模学习手术机器人策略

Yufan He, Pengfei Guo, Mengya Xu, Zhaoshuo Li, Andriy Myronenko, Dillan Imans, Bingjie Liu, Dongren Yang, Mingxue Gu, Yongnan Ji, Yueming Jin, Ren Zhao, Baiyong Shen, Daguang Xu

机构 * NVIDIA The Chinese University of Hong Kong(香港中文大学) Sung Kyun Kwan University(全州大学) Wenzhou Medical University(温州医学院) National University of Singapore(新加坡国立大学) Ruijin Hospital(瑞金医院)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出通过世界建模学习手术机器人策略,利用合成数据和逆动力学模型提升自主手术能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20325 2026-03-12 cs.CV 50%

AD-R1: Closed-Loop Reinforcement Learning for End-to-End Autonomous Driving with Impartial World Models

AD-R1: 闭环强化学习用于端到端自动驾驶的中立世界模型

Tianyi Yan, Tao Tang, Xingtai Gui, Yongkang Li, Jiasen Zhesng, Weiyao Huang, Lingdong Kong, Wencheng Han, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, University of Macau(SKL-IOTSC,澳门大学) Li Auto Inc. Sun Yat-sen University(中山大学) Huazhong University of Science and Technology(华中科技大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(abstract)

AI总结 AD-R1通过引入中立世界模型和反事实合成技术,提升自动驾驶系统在危险预测和安全控制方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏