arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-11 至 2026-05-11 共收录 87 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 14 篇

2410.21438 2026-05-11 cs.CL cs.LG 91%

UFT: Unifying Fine-Tuning of SFT and RLHF/DPO/UNA through a Generalized Implicit Reward Function

UFT:通过通用隐式奖励函数统一SFT和RLHF/DPO/UNA的微调

Zhichao Wang, Bin Bi, Zixu Zhu, Xiangbo Mao, Jun Wang, Shiyu Wang, Cheng Wang, Dong Nie, Lingzi Hong

机构 * Salesforce RadixArk ChatAlpha AI University of North Texas(北卡罗来纳州立大学)

专题命中 偏好对齐 :RLHF(title,title_cn);DPO(title,title_cn);alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出UFT框架,通过隐式奖励函数整合SFT与对齐过程,提升指令微调和事实性任务的性能,实验显示其优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06977 2026-05-11 cs.LG cs.AI cs.IT math.IT stat.ML 90%

$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses

$f$-Divergence Regularized RLHF:采样两则与统一分析

Di Wu, Chengshuai Shi, Jing Yang, Cong Shen

机构 * Department of Electrical and Computer Engineering, University of Virginia, Virginia, United States(弗吉尼亚大学电气与计算机工程系) Princeton Language and Intelligence, Princeton University, New Jersey, United States(普林斯顿大学语言与智能)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出基于一般$f$-散度正则化的在线RLHF框架,通过两种采样策略实现统一理论分析,证明了算法在$O(\log T)$ regret和$O(1/T)$ sub-optimality gap下的效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11121 2026-05-11 cs.CL 90%

BITS Pilani at SemEval-2026 Task 9: Structured Supervised Fine-Tuning with DPO Refinement for Polarization Detection

BITS Pilani 在 SemEval-2026 任务 9:基于 DPO 细调的结构化监督微调用于极化检测

Atharva Gupta, Dhruv Kumar, Yash Sinha

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,瓦拉纳西,印度)

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL

AI总结 本文提出结合结构化监督微调与 DPO 细调的方法,用于社交媒体文本中的极化检测,通过 LoRA 微调 Qwen 2.5-7B-Instruct 并利用自动偏好对减少误判,最终在英文测试集上达到 0.7664 的 Macro-F1 分数。

Comments Accepted to the 20th International Workshop on Semantic Evaluation (SemEval-2026), to be held in conjunction with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15339 2026-05-11 cs.LG cs.CL 89%

UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types

UNA: 一种统一的监督框架,用于高效对齐跨反馈类型的大型语言模型

Zhichao Wang, Bin Bi, Can Huang, Shiva Kumar Pentyala, Zixu James Zhu, Sitaram Asur, Na Claire Cheng, Cheng Wan, Dong Nie, Lingzi Hong

机构 * Salesforce RadixArk ChatAlpha AI University of North Texas(北得克萨斯大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 UNA框架通过通用隐式奖励函数统一处理二元、成对和评分反馈,理论证明其最优性,实验验证其在经典基准上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07172 2026-05-11 cs.CL 89%

Topology-Enhanced Alignment for Large Language Models: Trajectory Topology Loss and Topological Preference Optimization

基于拓扑的大型语言模型对齐:轨迹拓扑损失与拓扑偏好优化

Yurui Pan, Ke Xu, Bo Peng

机构 * School of Computing and Intelligent Innovation, Fudan University(复旦大学计算与智能创新学院) School of Economics and Management, Tongji University(同济大学经济与管理学院) College of Information Technology, Shanghai Ocean University(上海海洋大学信息学院)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出基于拓扑的对齐框架,通过轨迹拓扑损失和拓扑偏好优化提升大型语言模型的对齐性能,实验表明其在自动偏好指标和LLM判断评估中优于传统方法。

Comments Accepted to ACL 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06850 2026-05-11 cs.LG cs.AI 88%

How to Compress KV Cache in RL Post-Training? Shadow Mask Distillation for Memory-Efficient Alignment

如何在RL后训练中压缩KV缓存?基于影子遮罩的内存高效对齐

Rui Zhu, Weiheng Bai, Qiushi Wu, Yang Ren, Haixu Tang, Yuchu Liu

机构 * Yale University(耶鲁大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 偏好对齐 :alignment(title);RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出影子遮罩蒸馏方法,用于缓解RL后训练中KV缓存内存瓶颈问题,通过减少采样时的上下文密度来降低偏置,提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21183 2026-05-11 cs.LG cs.AI cs.CL 86%

MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge

MaPPO:结合先验知识的最大后验偏好优化

Guangchen Lan, Sipeng Zhang, Tianle Wang, Yuwei Zhang, Daoan Zhang, Xinpeng Wei, Xiaoman Pan, Hongming Zhang, Dong-Jun Han, Christopher G. Brinton

机构 * Purdue University(普渡大学) University of California, San Diego(加州大学圣地亚哥分校) Amazon(亚马逊) Meta, FAIR Yonsei University(延世大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MaPPO通过整合先验奖励知识优化偏好学习,提升对齐性能,无需额外超参数,适用于离线和在线设置,支持DPO变体插件,实验显示在多个基准上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06895 2026-05-11 cs.AI 83%

Mitigating Cognitive Bias in RLHF by Altering Rationality

通过调整理性度来缓解强化学习中的人类反馈认知偏差

Tiffany Horter, Andrew Markham, Niki Trigoni, Serena Booth

机构 * University of Oxford(牛津大学) Brown University(布朗大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

AI总结 本文提出通过动态调整理性参数beta来缓解人类反馈中的认知偏差,提升奖励学习模型的理性度,即使在存在强烈偏见的偏好数据集上也能获得更理性的下游模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08037 2026-05-11 cs.LG cs.AI 79%

Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph

超越成对:你的语言模型其实是在优化一个偏好图

Ning Liu, Chuanneng Sun, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphDPO,通过构建偏好图结构优化语言模型,解决传统成对优化在处理多轮次数据时的局限性,提升模型在推理和编程任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06987 2026-05-11 cs.LG cs.GT econ.TH stat.ML 74%

Response Time Enhances Alignment with Heterogeneous Preferences

响应时间增强异质偏好对齐

Federico Echenique, Alireza Fallah, Baihe Huang, Michael I. Jordan

机构 * Department of Economics, University of California, Berkeley(加州大学伯克利分校经济系) Department of Computer Science and Ken Kennedy Institute, Rice University(休斯敦大学计算机科学系和肯尼迪研究所) Departments of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系) Departments of Electrical Engineering and Computer Sciences and Statistics, University of California, Berkeley(加州大学伯克利分校电子工程与计算机科学系和统计学系;巴黎Inria) Inria Paris

专题命中 偏好对齐 :alignment(title);分类 cs.LG

AI总结 本文提出通过引入用户响应时间信号来纠正传统偏好数据中对异质偏好的估计偏差,证明该方法能准确识别群体平均偏好,提升大型语言模型对人类偏好的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07063 2026-05-11 cs.LG cs.AI 73%

Dr. Post-Training: A Data Regularization Perspective on LLM Post-Training

Dr. Post-Training:一种数据正则化视角下的LLM后训练

Pingbang Hu, Xueshen Liu, Z. Morley Mao, Jiaqi W. Ma

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出Dr. Post-Training框架,通过将通用训练数据作为数据诱导正则化器,防止模型过拟合稀缺目标数据,从而提升LLM后训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07925 2026-05-11 cs.CL 70%

How Value Induction Reshapes LLM Behaviour

价值观诱导如何重塑大语言模型行为

Arnav Arora, Natalie Schluter, Katherine Metcalf, Maartje ter Hoeve

机构 * University of Copenhagen(哥本哈根大学) Apple(苹果公司)

专题命中 偏好对齐 :safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 研究探讨价值观诱导对大语言模型行为的影响,发现诱导价值观会引发其他相关或对立价值观的表达,提升安全性,但增加拟人化语言使用,导致模型更易产生验证性和趋炎附势倾向。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07011 2026-05-11 cs.LG 57%

Dual-Agent Co-Training for Health Coaching via Implicit Adversarial Preference Optimization

双代理协同训练用于健康教练的隐式对抗偏好优化

Da Long, Lingyi Fu, Diya Michelle Rao, Jasmine Ruales Carrera, Yang Bai, Shandian Zhe

机构 * Kahlert School of Computing University of Utah(Utah大学计算学院Kahlert学院) Department of Health and Kinesiology University of Utah(健康与运动科学系Utah大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出双代理框架,通过隐式对抗偏好优化提升健康教练质量,改进对话和模拟器训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15356 2026-05-11 eess.IV cs.AI 57%

Q-Probe: Scaling Image Quality Assessment to High Resolution via Context-Aware Agentic Probing

Q-Probe:通过上下文感知代理探测扩展图像质量评估至高分辨率

Xiang Li, Xueheng Li, Yu Wang, Xuanhua He, Zhangchi Hu, Weiwei Yu, Chengjun Xie

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Institute of Intelligent Machines, Chinese Academy of Sciences(中国科学院智能 Machines 研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 Q-Probe通过上下文感知探测方法解决高分辨率图像质量评估中的局部退化捕捉问题,提出Vista-Bench基准和三阶段训练框架,实现高分辨率下的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 13 篇

2605.02971 2026-05-11 cs.LG cs.AI cs.CL 90%

Multilingual Safety Alignment via Self-Distillation

通过自蒸馏实现多语言安全对齐

Ruiyang Qin, Qingzhuo Wang, Dongrui Liu, Qiang Li, Zhihua Wei, Wen Shen

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多语言自蒸馏框架,通过将高资源语言的安全能力迁移到低资源语言,解决多语言安全对齐问题,无需特定语言响应数据,实验表明方法在多语言安全性能上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05995 2026-05-11 cs.CR cs.AI cs.CL 84%

Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

安全锚:通过几何瓶颈防御有害微调

Guoxin Lu, Letian Sha, Qing Wang, Peijie Sun, Hao Zhou, Hua Dai, Fu Xiao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出安全瓶颈正则化(SBR),通过几何瓶颈层限制有害查询的隐藏状态,以对抗有害微调攻击,实验表明单个安全锚即可显著降低有害分数。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07630 2026-05-11 cs.CL cs.AI cs.LG 82%

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

安全,还是仅仅无能?重新思考手机使用代理的安全性评估

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯文言) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06992 2026-05-11 cs.LG stat.ML 79%

Why Does Agentic Safety Fail to Generalize Across Tasks?

为何代理安全无法跨任务泛化?

Yonatan Slutzky, Yotam Alexander, Tomer Slor, Yoav Nagel, Nadav Cohen

机构 * Some Institute(某些研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文探讨了代理安全在多任务场景中泛化失败的原因,指出安全要求使任务与安全执行的关系更为复杂,通过理论和实验表明需新的方法提升安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07324 2026-05-11 cs.CL cs.AI cs.CR cs.LG 75%

Activation Differences Reveal Backdoors: A Comparison of SAE Architectures

激活差异揭示后门:SAE架构的比较

Sachin Kumar

机构 * LexisNexis

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过对比稀疏自编码器架构,探讨如何通过激活差异检测语言模型中的后门,发现Diff-SAE在后门隔离中表现优于Crosscoders,且在不同层和微调策略下均有效。

Comments Accepted at IJCNN 2026 (IEEE WCCI). ©2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01569 2026-05-11 cs.AI cs.CL 73%

InvThink: Premortem Reasoning for Safer Language Models

InvThink:用于更安全语言模型的预mortem推理

Yubin Kim, Taehan Kim, Eugene Park, Chunjong Park, Cynthia Breazeal, Daniel McDuff, Hae Won Park

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Samsung Research(三星研究)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 InvThink通过预mortem推理框架提升语言模型安全性,通过枚举、分析和约束潜在故障来生成响应,相比现有方法在安全性和减少有害行为方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07982 2026-05-11 cs.CL cs.CR 70%

GLiGuard: Schema-Conditioned Classification for LLM Safeguard

GLiGuard:面向LLM安全的模式条件分类

Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney, Ash Lewis

机构 * Qwen Team(通义实验室)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 GLiGuard通过模式条件编码实现高效多维度内容安全评估,在参数更小的情况下达到与大模型守卫模型相当的准确率,同时提升吞吐量和降低延迟。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07883 2026-05-11 cs.CL 70%

Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement

超越'我无法完成此请求':通过标签增强缓解LLM中的刚性拒绝

Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

机构 * Southeast University, Nanjing, China(东南大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出LANCE方法,通过标签增强实现安全且灵活的响应,减少LLM中的刚性拒绝问题,提升交互自然性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03327 2026-05-11 cs.LG cs.AI 62%

DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

DGPO:基于分布的策略优化用于细粒度信用分配

Hongbo Jin, Rongpeng Zhu, Zhongjing Du, Xu Jiang, Jingqi Tian, Qiaoman Zhang, Jiayu Ding

机构 * Peking University(北京大学) SJTU(上海交通大学) Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DGPO通过引入分布引导的策略优化框架,解决传统方法在细粒度信用分配中的不足,通过Hellinger距离和熵门机制实现安全探索与有效区分真实推理突破,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07462 2026-05-11 cs.CL cs.AI 62%

The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment

Moltbook Files:一场无害的混乱还是人类的最后实验

William Brach, Federico Torrielli, Stine Lyngsø Beltoft, Annemette Brok Pirchert, Peter Schneider-Kamp, Lukas Galke Poech

机构 * Slovak University of Technology(斯洛伐克技术大学) University of Turin(都灵大学) University of Southern Denmark(南部丹麦大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究Moltbook平台上的群体行为,通过分析232k篇帖子和2.2M条评论,发现其数据对语言模型的影响,发现微调后真实性下降,但Reddit数据集也产生类似效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07396 2026-05-11 cs.LG cs.AI 62%

Rubric-based On-policy Distillation

基于评分标准的在线蒸馏

Junfeng Fang, Zhepei Hong, Mao Zheng, Mingyang Song, Gengsheng Li, Houcheng Jiang, Dan Zhang, Haiyun Guo, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Tencent(腾讯)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ROPD框架,利用教师生成的响应而非教师日志进行在线蒸馏,实现更灵活的黑盒兼容方案,实验显示在多数场景下性能优于基于日志的蒸馏方法,样本效率提升达10倍。

Comments Preprint. Code is available at https://github.com/Peregrine123/ROPD_official

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 57%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 50%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2605.07250 2026-05-11 cs.CV cs.AI 90%

Hard to Read, Easy to Jailbreak: How Visual Degradation Bypasses MLLM Safety Alignment

难以阅读,却容易被破解:视觉退化如何绕过大语言模型的安全对齐

Zhixue Song, Boyan Han, Yiwei Wang, Chi Zhang

机构 * AGI Lab, Westlake University, China(西lake大学AGI实验室,中国) University of California, Merced, USA(加州大学默塞德分校,美国)

专题命中 越狱攻击 :safety(title,abstract);alignment(title);jailbreak(title);分类 cs.AI

AI总结 研究发现视觉退化会削弱大语言模型的安全防御,提出结构化认知卸载策略以缓解风险。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07447 2026-05-11 cs.CV cs.AI cs.CL cs.LG 67%

Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs

稀疏自编码器作为视觉语言模型中对抗攻击检测的即插即用防火墙

Hao Wang, Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh, Daisuke Kawahara

机构 * Magellan Technology Research Institute (MTRI)(马杰伦技术研究 institute) Waseda University(早稻田大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于稀疏自编码器的轻量级对抗攻击检测框架SAEgis,通过插入预训练VLM中的稀疏自编码模块,利用学习到的稀疏潜在特征检测对抗扰动输入,实验显示其在跨领域和跨攻击设置中表现优异,且无需额外对抗训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07490 2026-05-11 cs.CR 50%

Cross-Modal Backdoors in Multimodal Large Language Models

多模态模型中的跨模态后门

Runhe Wang, Li Bai, Haibo Hu, Songze Li

专题命中 越狱攻击 :alignment(abstract)

AI总结 研究提出一种利用轻量级连接器漏洞的跨模态后门攻击,通过污染连接器实现跨模态后门激活,展示攻击的有效性和可迁移性,揭示多模态对齐中的基本漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏