arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2605.24535 2026-06-01 cs.CR cs.LG 70%

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

超越支持域:无监督越狱激活模拟的对抗训练

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

机构 * University of Technology Sydney, Sydney, Australia(技术悉尼大学) School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Xi'an Jiaotong University, Xi'an, China(西安交通大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 针对现有安全引导方法对未见越狱攻击泛化失败的问题,提出基于无监督潜在方向发现的双层对抗训练框架,通过外推拒绝态有害请求激活模拟多样越狱激活,并训练势诱导引导场实现零样本越狱防御。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27823 2026-05-28 cs.CR cs.AI cs.CV 70%

Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security

解耦对抗性提示:基于语义图的鲁棒大语言模型安全防御

Xiang Fang, Wanlong Fang

机构 * Xiang Fang(1. 方翔) Wanlong Fang(2. 方万龙)

专题命中 越狱攻击 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出对抗性提示解耦(APD)框架,通过互信息语义分解、图谱分析和轻量级分类器,在输入处理前识别并中和恶意组件,将有害输出减少85%以上。

Comments Published in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01604 2026-05-28 cs.AI 70%

CRaFT: Circuit-Guided Refusal Feature Selection via Cross-Layer Transcoders

CRaFT:基于跨层转码器的电路引导拒绝特征选择

Su-Hyeon Kim, Hyundong Jin, Yejin Lee, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出CRaFT框架,利用跨层转码器构建稀疏特征电路图,通过量化特征间影响及其对最终输出的贡献,选择控制拒绝行为的关键特征,显著提升越狱攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26332 2026-05-27 cs.CV cs.AI 70%

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

被擦除但可被利用:针对已遗忘文本到图像扩散模型的黑盒嵌入感知提示攻击

Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

机构 * Department of Computer Engineering(计算机工程系)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出一种黑盒嵌入感知对抗提示攻击BEAP,利用大语言模型迭代生成有效对抗提示,以恢复被遗忘概念,并在攻击成功率上提升超过60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24834 2026-05-26 cs.CR cs.AI 70%

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

Reflect-Guard: 通过逻辑自我反思增强大语言模型对对抗性提示的防护

Lixing Lin, Juli You, Yue Li, Luyun Lin, Yiqing Wang, Zhen Zhang, Moxuan Zheng

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学) Citigroup(摩根大通) Independent Researcher(独立研究者)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 提出Reflect-Guard方法,通过参数高效微调为大语言模型安全分类器注入链式思维自我反思能力,显著提升对对抗性越狱攻击的检测性能。

Comments 12 pages, 2 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21362 2026-05-21 cs.CL 70%

LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models

LASH:适应性语义混合用于大语言模型的黑盒劫持

Abdullah Al Nomaan Nafi, Fnu Suya, Swarup Bhunia, Prabuddha Chakraborty

机构 * University of Maine(缅因大学) University of Tennessee, Knoxville(田纳西大学, 基纳顿分校) University of Florida(佛罗里达大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出LASH框架,通过适应性语义混合方法,利用多个基础攻击的输出作为可重用的种子提示,针对不同目标模型和有害类别进行自适应组合,从而在黑盒红队测试中取得更高的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22292 2026-05-20 cs.CV cs.AI 70%

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

通过场景分割策略对文本到视频模型进行劫持

Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院) AIM Intelligence(AIM智能) Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出了一种新的黑盒劫持方法SceneSplit,通过将有害叙述分割成多个良性场景,利用场景组合作为约束来引导最终输出,从而提高生成有害视频的可能性,验证了当前文本到视频模型的安全机制存在漏洞。

Comments ICLR 2026. Project page at https://velpegor.github.io/SceneSplit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18988 2026-05-20 cs.CR cs.AI 70%

Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks

在不可见中存活:面向新颖多轮多模态攻击的预测防御

Doohee You

机构 * Trust and Safety, Google(谷歌信任与安全部)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出了一种预测性防御方法,用于应对新颖多轮多模态攻击,通过动态生存预测和轨迹动态问题来解决静态防御机制的不足,建立了一个计算高效且可解释的安全保障框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11730 2026-05-13 cs.LG cs.CR 70%

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

基于身份的对抗提示:多身份红队测试用于对抗发现与缓解

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

机构 * IBM Research(IBM研究院) Trinity College Dublin(都柏林大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出PCAP方法,通过多身份对抗搜索发现真实攻击场景,提升模型鲁棒性,生成多样化防御数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05687 2026-05-08 cs.AI 70%

DataDignity: Training Data Attribution for Large Language Models

DataDignity: 为大语言模型训练数据的归因

Xiaomin Li, Andrzej Banburski-Fahey, Jaron Lanier

机构 * Microsoft(微软)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.AI

AI总结 研究提出通过归因方法识别支持语言模型响应的文档,引入FakeWiki基准测试,评估ScoringModel在九个模型上的表现,提升Recall@10至52.2,展示训练数据归因需区分真实支持与主题或词汇相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10998 2026-04-30 cs.CR cs.CL 70%

SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models

SCOUT:一种对抗微调语言模型数据中毒攻击的防御方法

Mohamed Afane, Abhishek Satyam, Ke Chen, Tao Li, Junaid Farooq, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Electrical Engineering, Zhejiang University(浙江大学电子工程系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Computer Engineering, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校电气与计算机工程系)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出SCOUT框架,通过令牌级显著性分析检测数据中毒攻击,有效识别隐含触发器,提升对复杂攻击的防御能力。

Comments 9 pages, 3 figures

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17687 2026-04-28 cs.CR cs.AI 70%

CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks

CrossGuard: 保护大规模多模态语言模型免受联合模态隐式恶意攻击

Xu Zhang, Hao Li, Zhichao Lu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Computer Science & Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校计算机科学与工程系)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CrossGuard,一种意图感知的防护系统,通过生成隐式样本和实验验证,有效防御显式和隐式攻击,提升大规模多模态语言模型的安全性与实用性。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23338 2026-04-28 cs.CR cs.LG 70%

From Stateless Queries to Autonomous Actions: A Layered Security Framework for Agentic AI Systems

从无状态查询到自主行动:面向代理AI系统的分层安全框架

Kexin Chu

机构 * School of Computing, University of Connecticut(康涅狄格大学计算机学院)

专题命中 越狱攻击 :alignment(abstract);prompt injection(abstract);分类 cs.LG

AI总结 本文提出分层攻击面模型,分析代理AI系统安全威胁的分层结构与时间维度,揭示高层攻击与慢烧时间的交集区域,提出跨层防御体系,强调将代理安全视为嵌入对抗生态的分布式系统问题。

Comments 23 pages, 3 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14053 2026-04-16 cs.CL 70%

From Where Words Come: Efficient Regularization of Code Tokenizers Through Source Attribution

词源何处:通过源归属高效正则化代码分词器

Pavel Chizhov, Egor Bogomolov, Ivan P. Yamshchikov

机构 * CAIRO, Technical University of Applied Sciences Würzburg-Schweinfurt(CAIRO应用技术大学(乌尔姆-施维林)) JetBrains Research(JetBrains研究) TU Delft(代尔夫特理工大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文通过源归属BPE(SA-BPE)正则化方法,解决代码分词器因训练数据不平衡导致的冗余token问题,提升分词效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12817 2026-04-15 cs.LG cs.CR stat.ML 70%

Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory

通过上下文学习理论理解并改进LLMs的连续对抗训练

Shaopeng Fu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析实验室) King Abdullah University of Science and Technology(卡布斯大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.LG

AI总结 本文基于上下文学习理论,首次对LLMs的连续对抗训练进行了理论分析,提出通过引入奇异值正则化项提升对抗训练的鲁棒性与实用性。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12359 2026-04-15 cs.CR cs.CL 70%

Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors

通过空空间约束将激活转向编译为权重以实现隐蔽后门

Rui Yin, Tianxu Han, Naen Xu, Changjiang Li, Ping He, Chunyi Zhou, Jun Wang, Zhihui Fu, Tianyu Du, Jinbao Li, Shouling Ji

机构 * Zhejiang University(浙江大学) Palo Alto Networks(帕洛阿尔托网络) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学) OPPO Research Institute(OPPO研究院) Qilu University of Technology(齐鲁大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文通过将后门目标从表面标记转向内部表示,提出一种高效方法,利用空空间约束在触发时激活后门,同时保持隐蔽性和安全性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09750 2026-04-14 cs.CR cs.AI 70%

Conflicts Make Large Reasoning Models Vulnerable to Attacks

冲突使大型推理模型容易受到攻击

Honghao Liu, Chengjin Xu, Xuhui Jiang, Cehao Yang, Shengming Yin, Zhengwu Ma, Lionel Ni, Jian Guo

机构 * International Digital Economy Academy(国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The City University of Hong Kong(香港城市大学) DataArc Tech

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究探讨了冲突如何影响大型推理模型的安全性,发现冲突显著增加攻击成功率,揭示了安全表示在冲突下的变化,强调需更深入的对齐策略以确保模型的鲁棒性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04842 2026-04-07 cs.CL 70%

Do No Harm: Exposing Hidden Vulnerabilities of LLMs via Persona-based Client Simulation Attack in Psychological Counseling

勿伤人:通过基于人设的客户端模拟攻击暴露大语言模型的隐藏漏洞

Qingyang Xu, Yaling Shen, Stephanie Fong, Zimu Wang, Yiwen Jiang, Xiangyu Zhao, Jiahe Liu, Zhongxing Xu, Vincent Lee, Zongyuan Ge

机构 * Monash University(莫纳什大学) University of Liverpool(利物浦大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出基于人设的客户端模拟攻击框架PCSA,通过模拟心理辅导中的客户端对话,揭示大语言模型在心理安全对齐方面的漏洞,实验表明其在七个通用和心理健康专用LLM上表现优于其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03968 2026-04-07 cs.CR cs.AI 70%

TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol

TraceGuard:结构化多维监控作为抗合谋的控制协议

Khanh Linh Nguyen, Hoa Nghiem, Tu Tran

机构 * Independent Researchers(独立研究人员) Apart Research

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出TraceGuard,一种结构化多维监控协议,通过五个维度评估代理行为,结合LLM调用和启发式检测器,有效区分攻击与诚实行为,防止合谋攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13518 2026-04-06 cs.AI cs.NE 70%

AgenticRed: Evolving Agentic Systems for Red-Teaming

AgenticRed:为红队测试设计的进化系统

Jiayi Yuan, Jonathan Nöther, Natasha Jaques, Goran Radanović

机构 * University of Washington(华盛顿大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 AgenticRed通过进化算法自动设计红队系统,无需人工干预,显著提升攻击成功率,达到96%-100%的ASR。

Comments Website: https://yuanjiayiy.github.io/AgenticRed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15323 2026-04-06 cs.CL 70%

Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling

通过输出预填充改进多选问答中的LLM首词预测

Silvia Cappelletti, Tobia Poppi, Samuele Poppi, Zheng-Xin Yong, Diego Garcia-Olano, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学与雷焦艾米利亚大学) University of Pisa(比萨大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Brown University(布朗大学) Meta

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文提出预填充攻击,通过在模型输出前添加结构化自然语言前缀,提升多选问答中LLM首词预测的准确性与可靠性。

Comments 23 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29062 2026-04-01 cs.CR cs.AI 70%

CivicShield: A Cross-Domain Defense-in-Depth Framework for Securing Government-Facing AI Chatbots Against Multi-Turn Adversarial Attacks

CivicShield:一种跨领域纵深防御框架,用于保护面向政府的AI聊天机器人免受多轮对抗攻击

KrishnaSaiReddy Patil

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出CivicShield框架,通过多层防御机制提升政府AI聊天机器人安全性,有效检测多轮对抗攻击,理论分析显示多层防御可将攻击概率降低1-2个数量级。

Comments 25 pages, 17 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27918 2026-03-31 cs.CR cs.AI 70%

Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey

对多模态大语言模型的对抗攻击:全面综述

Bhavuk Jain, Sercan Ö. Arık, Hardeo K. Thakur

机构 * Google(谷歌) Bennett University, India(印度贝内特大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文综述了多模态大语言模型面临的对抗威胁,分析了攻击类型及其根源,提出分类框架以提升模型安全性。

Comments Survey paper, 37 pages, 10 figures, accepted at TMLR

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11132 2026-03-20 cs.CR cs.AI 70%

WebWeaver: Breaking Topology Confidentiality in LLM Multi-Agent Systems with Stealthy Context-Based Inference

WebWeaver: 在LLM多智能体系统中通过隐蔽的基于上下文推断打破拓扑保密性

Zixun Xiong, Gaoyi Wu, Lingfeng Yao, Miao Pan, Xiaojiang Du, Hao Wang

机构 * Department of Electrical and Computer Engineering, Stevens Institute of Technology(斯蒂文斯理工学院电气与计算机工程系) Genentech(基因泰克) Department of Electrical and Computer Engineering, University of Houston(休斯顿大学电气与计算机工程系)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 WebWeaver通过仅 compromise 一个任意智能体推断LLM多智能体系统的完整拓扑,采用隐蔽的基于上下文推断方法,提出新的隐蔽 jailbreak 机制和无 jailbreak 扩散设计,提升推断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14860 2026-03-17 cs.CR cs.AI 70%

Architecture-Agnostic Feature Synergy for Universal Defense Against Heterogeneous Generative Threats

面向异质生成威胁的通用特征协同架构

Bingxue Zhang, Yang Gao, Feida Zhu, Yanyan Shen, Yang Shi

机构 * University of Shanghai for Science and Technology(上海理工大学) Singapore Management University(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出ATFS框架,通过目标引导图像实现多模型防御的统一特征空间对齐,有效解决异质生成威胁下的防御问题,实验显示其在扩散模型+GAN场景中达到SOTA性能。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16765 2026-03-13 cs.CR cs.AI 70%

Hiding in Plain Sight: A Steganographic Approach to Stealthy LLM Jailbreaks

明目张胆:一种用于隐蔽大语言模型劫持的隐写术方法

Jianing Geng, Biao Yi, Zekun Fei, Ruiqi He, Lihai Nie, Tong Li, Zheli Liu

机构 * College of Cyber Science, Key Laboratory of DISSec, Nankai University(网络安全学院、DISSec重点实验室、南开大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 StegoAttack通过隐写术在无害段落中嵌入有害查询,实现对大语言模型的高效隐蔽劫持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07590 2026-03-10 cs.CV cs.LG 70%

Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprints

模型作为乐高积木:通过语义蓝图从良性积木中组装恶意内容

Chenxi Li, Xianggan Liu, Dake Shen, Yaosong Du, Zhibo Yao, Hao Jiang, Linyi Jiang, Chengwei Cao, Jingzhe Zhang, RanYi Peng, Peiling Bai, Xiande Huang

机构 * DAIL Tech(DAIL科技) NLP & KG Lab, Huazhong University of Science and Technology(自然语言处理与知识图谱实验室,华中科技大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出StructAttack,通过语义蓝图将看似无害的槽类型组合成恶意内容,揭示LVLMs在视觉模态整合中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00565 2026-03-03 cs.CV cs.AI cs.CR 70%

MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs

MIDAS: 多图像分散与语义重建用于对抗多模态大语言模型

Yilian Liu, Xiaojun Jia, Guoshun Nan, Jiuyang Lyu, Zhican Chen, Tao Guan, Shuyuan Luo, Zhongyi Zhai, Yang Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Guilin University of Electronic Technology(桂林电子科技大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 MIDAS通过多图像分散与语义重建技术,提升对抗多模态大语言模型的劫持性能,达到81.46%的平均攻击成功率。

Journal ref The Fourteenth International Conference on Learning Representations(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17132 2026-03-03 cs.CV cs.CL 70%

Dynamic Token Reweighting for Robust Vision-Language Models

动态令牌重加权用于鲁棒的视觉-语言模型

Tanqiu Jiang, Jiacheng Liang, Rongyi Zhu, Jiawei Zhou, Fenglong Ma, Ting Wang

机构 * Stony Brook University(石溪大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 DTR通过优化KV缓存动态调整视觉令牌权重,提升视觉-语言模型对多模态劫持攻击的鲁棒性,同时保持模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21236 2026-02-26 cs.SI cs.CY 70%

@GrokSet: multi-party Human-LLM Interactions in Social Media

@GrokSet:社交媒体中多方人与LLM互动

Matteo Migliarini, Berat Ercevik, Oluwagbemike Olowe, Saira Fatima, Sarah Zhao, Minh Anh Le, Vasu Sharma, Ashwinee Panda

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 @GrokSet 是一个大规模社交媒体数据集,揭示了LLM在高风险政治辩论中作为权威裁决者的功能转变及其在社交验证中的低地位

详情

展开后加载摘要…

URL PDF HTML 收藏