arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2603.20198 2026-03-24 cs.CR cs.CV cs.LG 85%

Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning

视觉排斥攻击:通过代理规划实现自动多模态红队行动

Yunbei Zhang, Yingqiang Ge, Weijie Xu, Yuhui Xu, Jihun Hamm, Chandan K. Reddy

专题命中 红队测试 :red teaming(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出视觉排斥攻击,通过多模态多轮代理规划框架MM-Plan,实现基于视觉内容的攻击,展示了对前沿模型的高攻击成功率,揭示了当前安全对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20925 2026-03-24 cs.AI 57%

Profit is the Red Team: Stress-Testing Agents in Strategic Economic Interactions

利润是红队:在战略经济互动中压力测试代理

Shouqiao Wang, Marcello Politi, Samuele Marro, Davide Crapis

机构 * Columbia University(哥伦比亚大学) dAI Team, Ethereum Foundation(dAI团队,以太坊基金会) University of Oxford(牛津大学)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本文提出基于利润的红队测试方法,通过学习对手最大化利润来压力测试代理,发现传统静态基线在利润优化压力下易受攻击,且学习对手能自主发现 probing、anchoring 和 deceptive commitments 策略。

详情

展开后加载摘要…

URL PDF HTML 收藏