arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-08 至 2026-04-08 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 红队测试 2 篇

2604.05595 2026-04-08 cs.RO cs.CV 82%

Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming

通过多样性感知的红队行动揭示视觉-语言-动作模型中的语言脆弱性

Baoshun Tong, Haoran He, Ling Pan, Yang Liu, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract)

AI总结 本文提出DAERT框架,通过评估统一策略生成多样化挑战性指令,揭示VLA模型在语言变化下的脆弱性,实验显示任务成功率从93.33%降至5.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04989 2026-04-08 cs.CR 71%

SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement

SkillAttack:通过攻击路径细化实现对代理技能的自动化红队测试

Zenghao Duan, Yuxin Tian, Zhiyi Yin, Liang Pang, Jingcheng Deng, Zihao Wei, Shicheng Xu, Yuyao Ge, Xueqi Cheng

专题命中 红队测试 :red teaming(title)

AI总结 本文提出SkillAttack框架,通过对抗性提示动态验证技能漏洞可利用性,实验显示其在对抗性技能和真实场景中均显著优于基线方法,揭示了即使善意技能在实际代理交互中也存在严重安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏