arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 162 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 16 篇

2604.11477 2026-04-14 cs.AI cs.SE q-fin.TR 83%

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

OOM-RL:基于大语言模型多智能体系统的出钱强化学习市场驱动对齐

Kun Liu, Liqun Chen

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出OOM-RL方法,通过将智能体部署到金融市场中,利用资本耗尽作为不可篡改的负梯度,使多智能体系统从过度迎合的基线进化为稳健的流动性感知架构,最终实现稳定均衡。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10673 2026-04-14 cs.AI cs.HC 79%

Principles Do Not Apply Themselves: A Hermeneutic Perspective on AI Alignment

原则不自行应用:一种诠释学视角下的人工智能对齐

Behrooz Razeghi

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文从诠释学角度探讨AI对齐问题,指出原则应用需依赖情境判断,强调对齐过程中的解释性成分,并指出部署响应分布与语料库分布差异可能导致审计失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26202 2026-04-14 cs.CL cs.AI 79%

What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data

我的人类反馈中有什么?通过稀疏自编码器学习可解释的偏好数据描述

Rajiv Movva, Smitha Milli, Sewon Min, Emma Pierson

机构 * UC Berkeley(加州大学伯克利分校) FAIR at Meta(Meta AI研究院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WIMHF方法,通过稀疏自编码器解释人类反馈数据,揭示偏好数据中的人类可解释特征,发现不同数据集中的偏好差异及潜在不安全偏好,为数据筛选和个性化调整提供支持。

Comments ICLR 2026 (oral). v2 adds SAE ablations and robustness checks. Code: https://github.com/rmovva/wimhf; Demo: https://rajivmovva.com/demo-wimhf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08557 2026-04-14 cs.CL cs.AI 73%

Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models

重新掩码和引导:利用去噪不可逆性在扩散语言模型中进行攻击

Arth Singh

机构 * National Institute of Technology Agartala(阿加尔塔拉国立理工学院)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrajHijack攻击,通过重新掩码已承诺的拒绝标记并注入短的肯定前缀,显著提升ASR性能,揭示了扩散语言模型的安全性漏洞及防御机制的不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-04-14 cs.MA cs.AI cs.CL 73%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07523 2026-04-14 cs.CL 70%

Aligning What LLMs Do and Say: Towards Self-Consistent Explanations

对LLMs的行为与说法进行对齐:迈向自洽的解释

Sahar Admoni, Ofra Amir, Assaf Hallak, Yftah Ziser

机构 * Technion – Israel Institute of Technology(以色列理工学院) Nvidia Research(英伟达研究院) University of Groningen(格罗宁根大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 研究通过比较回答与解释的特征重要性分布,发现后验自一致性银行(PSCB)能更可靠地体现模型决策与解释的一致性,应用DPO优化提升对齐性而不影响任务精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10799 2026-04-14 cs.CL cs.AI 62%

Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series

通过优化分词器推动波兰语言建模:Bielik v3 7B和11B系列

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

机构 * SpeakLeash ACK Cyfronet AGH(AGH科技大学计算机中心) Jagiellonian University(雅盖隆大学) Azurro Enelpol

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了Bielik v3系列模型中通过优化分词器提升波兰语言建模性能的方法,包括专有词汇表、嵌入初始化、多阶段预训练和后训练对齐技术。

Comments arXiv admin note: text overlap with arXiv:2601.11579

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11050 2026-04-14 cs.CL cs.AI 62%

Shared Emotion Geometry Across Small Language Models: A Cross-Architecture Study of Representation, Behavior, and Methodological Confounds

小语言模型中的共享情感几何:跨架构研究中的表示、行为和方法学混淆

Jihoon Jeong

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院) ModuLabs(ModuLabs实验室)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了十二种小语言模型在统一理解模式下的21种情绪向量几何,发现五种成熟架构在情绪几何上几乎相同,而Gemma-3 1B base则表现出极端残差流各向异性。

Comments 34 pages, 6 figures, 1 table in main text + appendix. Ongoing series on Model Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR 57%

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02956 2026-04-14 cs.CL 57%

Enhancing Multilingual RAG Systems with Debiased Language Preference-Guided Query Fusion

通过去偏语言偏好引导查询融合增强多语言RAG系统

Jeonghyun Park, Byeongjeong Kim, Seojin Hwang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出DeLP指标以消除评估基准中的结构偏见,发现多语言检索增强生成系统更倾向单语对齐,由此提出DELTA框架优化跨语言检索与生成,实验表明其在多种语言上优于英语枢纽和mRAG基线。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07972 2026-04-14 cs.AI 57%

SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance

SHE:面向电商搜索相关性的分步混合检验强化学习框架

Pengkun Jiao, Yiming Jin, Jianhui Yang, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出SHE框架,通过分步奖励策略优化提升电商搜索相关性预测的逻辑一致性与准确性,优于SFT、DPO等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02231 2026-04-14 physics.chem-ph cs.LG 57%

SmileyLlama: Modifying Large Language Models for Directed Chemical Space Exploration

SmileyLlama:通过监督微调改进大语言模型以定向探索化学空间

Joseph M. Cavanagh, Kunyang Sun, Andrew Gritsevskiy, Dorian Bagni, Yingze Wang, Thomas D. Bannister, Teresa Head-Gordon

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 SmileyLlama通过监督微调和直接偏好优化,改进大语言模型以生成具有特定性质的药物分子,展示了其在药物发现中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20725 2026-04-14 cs.CV 50%

Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation

Premier: 基于可学习用户嵌入的个性化偏好调节在文本到图像生成中

Zihao Wang, Yuxiang Wei, Xinpeng Zhou, Tianyu Zhang, Tao Liang, Yalong Bai, Hongzhi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Duxiaoman(度小满)

专题命中 偏好对齐 :alignment(abstract)

AI总结 Premier通过可学习用户嵌入和偏好适配器实现个性化图像生成,引入分散损失提升用户偏好区分度,实验显示其在偏好对齐和文本一致性上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07251 2026-04-14 cs.HC 50%

MeepleLM: A Virtual Playtester Simulating Diverse Subjective Experiences

MeepleLM:一种模拟多样化主观体验的虚拟玩家测试者

Zizhen Li, Chuanhao Li, Yibin Wang, Yukang Feng, Jianwen Sun, Jiaxin Ai, Fanrui Zhang, Mingzhu Sun, Yifei Huang, Kaipeng Zhang

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出MeepleLM,通过整合规则书和玩家反馈数据,模拟多样化玩家体验,提升棋盘游戏设计的协作效率与批判性。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21834 2026-04-14 cs.CV 50%

PrefPaint: Enhancing Medical Image Inpainting through Expert Human Feedback

PrefPaint:通过专家人类反馈增强医学图像修复

Duy-Bao Bui, Hoang-Khang Nguyen, Thao Thi Phuong Dao, Kim Anh Phung, Tam V. Nguyen, Justin Zhan, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science(科学大学) Vietnam National University(越南国立大学) Thong Nhat Hospital(统一医院) University of Cincinnati(辛辛那提大学) University of Dayton(代顿大学)

专题命中 偏好对齐 :RLHF(abstract)

AI总结 本文提出PrefPaint系统,结合专家反馈提升医学图像修复的准确性,通过简化界面和模型树版本控制,提高临床应用中的实用性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09704 2026-04-14 cs.CV 50%

Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank

多粒度推理用于图像质量评估:通过属性感知的强化学习排序

Xiangyong Chen, Xiaochuan Lin, Haoran Liu, Xuan Li, Yichen Su, Xiangwei Guo

机构 * Henan Polytechnic University(河南理工大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出MG-IQA框架,通过属性感知强化学习排序实现图像质量及细粒度属性的联合评估,提升整体质量预测和属性评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 11 篇

2509.13356 2026-04-14 cs.CY cs.CL 62%

CogniAlign: Survivability-Grounded Multi-Agent Moral Reasoning for Safe and Transparent AI

CogniAlign:基于生存性的多智能体道德推理以实现安全透明的AI

Hasin Jawad Ali, Ilhamul Azam, Ajwad Abrar, Md. Kamrul Hasan, Hasan Mahmud

机构 * Islamic University of Technology(伊斯兰科技大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 CogniAlign通过基于自然主义道德现实的多智能体框架,将道德推理 grounded 在生存性上,通过学科专家智能体的结构化辩论实现透明和经验锚定的判断,证明了可审计的AI对齐方法的可行性。

Comments Under Review

Journal ref AI and Ethics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10557 2026-04-14 cs.CL cs.AI 62%

LLMs Should Incorporate Explicit Mechanisms for Human Empathy

LLMs应纳入显式的人类共情机制

Xiaoxing You, Qiang Huang, Jun Yu

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLM应纳入显式共情机制以保持人类视角,指出现有模型在共情方面存在系统性缺陷,提出通过认知、文化和关系维度分析共情失败,并推动建立共情意识的目标、基准和训练信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00013 2026-04-14 cs.CL cs.AI 62%

C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis

C2F-Thinker:基于提示引导强化学习的粗到细推理用于多模态情感分析

Miaosen Luo, Zhenhao Yang, Jieshen Long, Jinghu Sun, Yichu Liu, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出C2F-Thinker框架,通过粗到细结构推理与提示引导强化学习,提升多模态情感分析的可解释性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10991 2026-04-14 cs.HC cs.AI 57%

Examining EAP Students' AI Disclosure Intention: A Cognition-Affect-Conation Perspective

审视EAP学生的AI披露意愿:一种认知-情感-动机视角

Yiran Du, Huimin He

机构 * University of Cambridge(剑桥大学) Xi'an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究从认知-情感-动机视角探讨EAP学生使用AI工具披露意愿的影响因素,发现心理安全正向预测披露意愿,而对负面评价的恐惧则负向预测,强调了清晰政策和支持性教学环境的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10504 2026-04-14 cs.AI 57%

CARO: Chain-of-Analogy Reasoning Optimization for Robust Content Moderation

CARO:用于鲁棒内容审核的类比推理优化

Bingzhe Wu, Haotian Lu, Yuchen Mou

机构 * National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Shenzhen University(深圳大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :DPO(abstract);分类 cs.AI

AI总结 CARO通过两阶段训练框架提升LLM的类比推理能力,有效缓解内容审核中的误导性决策短路问题,实验显示其在模糊审核基准上平均F1得分提升24.9%。

Comments Accepted to ACL 2026 findings; under official publication process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10316 2026-04-14 cs.CL 57%

Comparative Analysis of Large Language Models in Healthcare

医疗领域大型语言模型的比较分析

Subin Santhosh, Farwa Abbas, Hussain Ahmad, Claudia Szabo

机构 * Adelaide University(阿德莱德大学) South Australian Health and Medical Research Institute(南澳大利亚健康与医学研究所)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文通过评估多个医疗任务,比较了ChatDoctor等领域模型与Grok等通用模型的性能,发现领域模型在医疗文本生成中更准确,而通用模型在问答任务中表现更优,强调了任务特定评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09963 2026-04-14 cs.DC cs.AI cs.SE 57%

Rebooting Microreboot: Architectural Support for Safe, Parallel Recovery in Microservice Systems

重振微重启:用于微服务系统的安全并行恢复架构支持

Laurent Bindschaedler

机构 * Max Planck Institute for Software Systems (MPI-SWS)(马克斯·普朗克软件系统研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种安全并行恢复架构,通过分离规划与执行,利用类型化的修复计划和微内核确保安全,实验证明其在工业级数据和故障注入测试中有效减少修复带来的损害。

Comments 18 pages, 1 figure, 4 tables. Published at ARCS 2026

Journal ref Proc. 39th GI/ITG International Conference on Architecture of Computing Systems (ARCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12639 2026-04-14 cs.CV 50%

RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization

RoboStereo: 双塔4D具身世界模型用于统一策略优化

Ruicheng Zhang, Guangyu Chen, Zunnan Xu, Zihao Liu, Zhizhou Zhong, Mingyang Zhang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot HKUST(香港科技大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出RoboStereo,通过双塔4D具身世界模型实现统一策略优化,解决几何幻觉和缺乏统一优化框架的问题,实验显示在细粒度操作任务中平均相对提升超过97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01241 2026-04-14 cs.CR 50%

Peering Behind the Shield: Guardrail Identification in Large Language Models

窥视屏障之后:大型语言模型中的屏障识别

Ziqing Yang, Yixin Wu, Rui Wen, Michael Backes, Yang Zhang

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AP-Test方法,通过对抗性提示检测黑盒AI代理中的屏障,解决安全对齐LLM和缺乏决策策略的问题,实验显示其在多种场景下实现完美分类准确率。

Comments To Appear in the 64th Annual Meeting of the Association for Computational Linguistics, July 2-7, 2026. ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10598 2026-04-14 cs.RO 50%

AWARE: Adaptive Whole-body Active Rotating Control for Enhanced LiDAR-Inertial Odometry under Human-in-the-Loop Interaction

AWARE: 一种适应性全身主动旋转控制用于增强人体在环交互下的激光雷达惯性里程计

Yizhe Zhang, Jianping Li, Liangliang Yin, Zhen Dong, Bisheng Yang

机构 * organization= State Key Laboratory of Information Engineering in Surveying, Mapping Remote Sensing , addressline= Wuhan University , city= Wuhan , postcode= 430079 , country= China organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , postcode= 639798 , country= Singapore

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AWARE框架,通过UAV自身旋转能力扩展传感器视野,提升LIO可观测性。采用可微分MPC与强化学习结合,实现估计精度与飞行稳定性平衡,并通过安全飞行走廊机制确保操作安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07299 2026-04-14 cs.NE cs.SY eess.SY 50%

Optimizing Chlorination in Water Distribution Systems via Surrogate-assisted Neuroevolution

通过代理辅助神经进化优化水分配系统中的氯化

Rivaaj Monsia, Daniel Young, Olivier Francon, Risto Miikkulainen

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于神经进化、多目标优化和代理建模的框架,用于优化水分配系统中氯气的投放策略,通过进化神经网络实现氯气在关键节点的投放,以减少总投放量并保持浓度均匀,优于传统强化学习方法。

Comments 13 pages, 9 figures, GECCO '26

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 7 篇

2604.10403 2026-04-14 cs.LG 83%

Latent Instruction Representation Alignment: defending against jailbreaks, backdoors and undesired knowledge in LLMs

潜在指令表示对齐:防御对抗性指令、后门和不期望知识在大语言模型中的攻击

Eric Easley, Sebastian Farquhar

机构 * ML Alignment & Theory Scholars(机器学习对齐与理论学者)

专题命中 越狱攻击 :alignment(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出LIRA方法,通过改变模型对指令的解释方式提升泛化能力,并通过内部对抗训练算法进一步增强泛化,有效防御了99%以上的PEZ对抗攻击,移除了一个具有挑战性的不安全代码后门,并在WMDP网络中实现最优遗忘。

Comments 33 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10299 2026-04-14 cs.CV cs.CL 83%

Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking

见善不为:通过对抗性注意力劫持使大视觉-语言模型失明以确保安全

Jingru Li, Wei Ren, Tianqing Zhu

机构 * China University of Geosciences, Wuhan(中国地质大学(武汉)) City University of Macau(澳门城市大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出Attention-Guided Visual Jailbreaking方法,通过操控注意力模式规避安全对齐机制,减少梯度冲突并提高攻击成功率,揭示了安全失明的失败模式。

Comments Accepted to ACL 2026. Code: https://github.com/Landsayy/AttentionJailbreak

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09748 2026-04-14 cs.CR cs.AI 83%

Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward

在RLVR中存在后门:从可验证奖励中对LLM的后门攻击

Weiyang Guo, Zesheng Shi, Zeen Zhu, Yuan Zhou, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出了一种在RLVR框架中通过注入污染数据植入后门的新方法,展示了该攻击在不同模型规模上高效且具有泛化能力,导致安全性能下降73%。

Comments 20 pages,8 figures, publish in acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏