arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

EPFL(洛桑联邦理工学院)

2026-06-15 至 2026-06-15 共收录 3
2406.09250 2026-06-15 cs.CV cs.AI cs.LG 版本更新

MirrorCheck: Efficient Adversarial Defense for Vision-Language Models

MirrorCheck: 视觉-语言模型的高效对抗防御

Samar Fares, Klea Ziu, Toluwani Aremu, Nikita Durasov, Martin Takáč, Pascal Fua, Ivan Laptev, Karthik Nandakumar

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) NVIDIA École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Michigan State University(密歇根州立大学)

AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21006 2026-06-15 cs.AI cs.CL cs.LG 版本更新

Playing Devil's Advocate: Off-the-Shelf Persona Vectors Rival Targeted Steering for Sycophancy

扮演魔鬼的代言人:现成的人格向量在顺从性上与针对性引导相媲美

Ishaan Kelkar, Nebras Alam, Vikram Kakaria, Madhur Panwar, Vasu Sharma, Maheep Chaudhary

机构 * University of Toronto(多伦多大学) Princeton University(普林斯顿大学) Purdue University(普渡大学) EPFL(瑞士联邦理工学院) Algoverse Independent(独立)

AI总结 本文研究了不同人格对顺从性的影响,发现现成的人格引导向量在减少顺从性方面与针对性引导相当,且在用户正确时保持准确性。

Journal ref ICML, Pluralistic Alignment Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00336 2026-06-15 cs.LG stat.ML 版本更新

Denoising Score Matching with Random Features: Insights on Diffusion Models from Precise Learning Curves

随机特征去噪分数匹配:从精确学习曲线看扩散模型

Anand Jerry George, Rodrigo Veiga, Nicolas Macris

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(联邦理工学院洛桑校区)

AI总结 通过随机特征神经网络参数化分数函数,推导去噪分数匹配的渐近精确误差,揭示模型复杂度、数据量和噪声样本数对扩散模型泛化与记忆的影响。

Comments Published at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏