arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-11 至 2026-03-11 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 9 篇

2603.08760 2026-03-11 cs.CY cs.AI cs.CR 90%

Clear, Compelling Arguments: Rethinking the Foundations of Frontier AI Safety Cases

清晰有力的论点:重新思考前沿人工智能安全案例的基础

Shaun Feakins, Ibrahim Habli, Phillip Morgan

机构 * UKRI Centre for Doctoral Training in Safe AI Systems (SAINTS)(英国研究与创新机构安全人工智能系统博士培训中心) Institute for Safe Autonomy(安全自主研究所) The York Law School(约克法律学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文重新思考前沿人工智能安全案例的基础,通过借鉴安全保证领域的方法,提出更稳健的安全案例框架以确保人工智能系统的安全性。

Comments Full paper presented at the International Association of Safe and Ethical AI 2026 Conference (IASEAI 26). 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24235 2026-03-11 cs.RO cs.AI 83%

SafeGen-LLM: Enhancing Safety Generalization in Task Planning for Robotic Systems

SafeGen-LLM: 提高机器人系统任务规划中的安全性泛化能力

Jialiang Fan, Weizhe Xu, Mengyu Liu, Oleg Sokolsky, Insup Lee, Fanxin Kong

机构 * University of Notre Dame(诺丁汉大学) Washington State University(华盛顿州立大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 SafeGen-LLM通过两阶段框架提升机器人任务规划的安全性泛化能力,优于现有基线。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00544 2026-03-11 cs.CL 70%

When Thinking Backfires: Mechanistic Insights Into Reasoning-Induced Misalignment

当思考反噬:对推理引发的不一致的机理洞察

Hanqi Yan, Hainiu Xu, Siya Qi, Shu Yang, Yulan He

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文揭示了推理能力增强导致的不一致现象,通过神经元层面的分析,解释了推理与安全之间的纠缠如何引发灾难性遗忘。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25896 2026-03-11 cs.CV 67%

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

专题命中 安全训练 :safety(abstract);red teaming(abstract)

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09160 2026-03-11 cs.CV cs.AI cs.LG 62%

RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

RubiCap:基于评分标准的强化学习用于密集图像描述

Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu

机构 * Apple(苹果公司) University of Wisconsin—Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 RubiCap通过基于评分标准的强化学习方法,在密集图像描述任务中实现了更高的胜率和词效,优于监督蒸馏和传统RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09157 2026-03-11 cs.AI 57%

Real-Time Trust Verification for Safe Agentic Actions using TrustBench

基于TrustBench的安全代理行为实时信任验证

Tavishi Sharma, Vinayak Sharma, Pragya Sharma

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 TrustBench通过双模式框架在代理行动前验证安全性,有效减少有害行为,提升自主代理的可信度

Comments Accepted at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07409 2026-03-11 eess.SY cs.LG cs.MA cs.RO cs.SY 57%

Learning responsibility allocations for multi-agent interactions: A differentiable optimization approach with control barrier functions

多智能体交互中的责任分配学习:一种基于可微优化与控制屏障函数的方法

Isaac Remy, David Fridovich-Keil, Karen Leung

机构 * University of Washington, Department of Aeronautics and Astronautics(华盛顿大学航空航天系) University of Texas, Austin, Department of Aerospace Engineering and Engineering Mechanics(得克萨斯大学奥斯汀分校航空航天工程与工程力学系) NVIDIA

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于控制屏障函数和可微优化的方法,用于学习多智能体交互中的责任分配,通过数据驱动的方式实现对安全交互行为的可解释性分析。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09090 2026-03-11 cs.LG 57%

Overcoming Valid Action Suppression in Unmasked Policy Gradient Algorithms

克服未遮蔽策略梯度算法中的有效动作抑制

Renos Zabounidis, Roy Siegelmann, Mohamad Qadri, Woojun Kim, Simon Stepputtis, Katia P. Sycara

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 该研究揭示了未遮蔽策略梯度算法中有效动作抑制的机制,并通过实验验证了可行性分类在无需oracle遮蔽的部署中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16158 2026-03-11 cs.HC 50%

Designing Culturally Aligned AI Systems For Social Good in Non-Western Contexts

为非西方语境中的社会公益设计文化契合的AI系统

Deepak Varuvel Dennison, Mohit Jain, Tanuja Ganu, Aditya Vashistha

专题命中 安全训练 :safety(abstract)

AI总结 本文通过分析非西方语境中AI系统的部署案例,提出12条设计指南,强调文化契合与人类资源在构建安全有效AI系统中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏