arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2605.28632 2026-05-28 cs.CR cs.AI 57%

Blind PRNG Hijacking: An Undetectable Integrity-Preserving Attack Against LLM Watermarking

盲PRNG劫持:一种针对LLM水印的不可检测的完整性保持攻击

Ziyang You, Huilong He, Xiaoke Yang, Xuxing Lu

机构 * Fujian Provincial Key Laboratory of Automotive Electronics and Electric Drive(福建省汽车电子与电力驱动重点实验室) School of Electronic, Electrical and Physics(电子、电气与物理学院) Fujian University of Technology(福建理工大学) School of Humanities(人文学院) Institute of Applied Physics and Materials Engineering(应用物理与材料工程学院) University of Macau(澳门大学)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

AI总结 提出SeedHijack攻击,通过替换伪随机数生成器(PRNG)在供应链层面对LLM水印进行盲攻击,同时保持完整性并规避检测。

Comments Preprint prepared for submission to IEEE TIFS. 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28201 2026-05-28 cs.AI 57%

Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents

种植、持久化、触发:针对大语言模型智能体的潜伏攻击

Yongxiang Li, Moxin Li, Zhixin Ma, Fengbin Zhu, Dongrui Liu, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出潜伏攻击(Sleeper Attack),即攻击者将对抗性内容注入智能体状态并持久化,在后续交互中被良性用户查询触发,导致有害行为;构建包含1896个实例的基准测试,实验表明当前最强LLM智能体仍易受此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27927 2026-05-28 cs.CV cs.LG 57%

Structure-Guided Visual Perturbation Neutralization for LVLMs

结构引导的视觉扰动中和用于大型视觉语言模型

Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) JIUTIAN Research(JIUTIAN研究所) Nanyang Technological University(南洋理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 提出结构诱导引导中和(SIGN)框架,通过先验结构提取和动态引导中和实现轻量级、即插即用的对抗性防御,在仅0.5%像素修改和0.16秒每图下达到87%以上防御成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27110 2026-05-27 cs.CR cs.CL 57%

BAIT: Boundary-Guided Disclosure Escalation via Self-Conditioned Reasoning

BAIT: 基于边界引导的自我条件推理披露升级

Xuan Luo, Yue Wang, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen University(深圳大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 提出BAIT三步越狱框架,通过识别保护边界、细化边界和请求详细示例,利用模型自身推理和一致性倾向实现恶意目标披露,实验表明在多个基准上攻击成功率显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26526 2026-05-27 cs.LG cs.CR 57%

Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

开源权重大语言模型微调防御易受简单攻击

Kevin Kuo, Chhavi Yadav, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 本文发现针对开源权重大语言模型的防御措施易受abliteration和prefilling等低成本攻击,并提出abliteration-resistant tuning (ART) 方法将攻击成功率降低10%-20%。

Comments main body: 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09621 2026-05-20 cs.CR cs.CY 57%

Technologies and Security Challenges in Metaverse

元宇宙中的技术与安全挑战

Krishno Dey, Diogo Barradas, Saqib Hakak

专题命中 越狱攻击 :safety(abstract);分类 cs.CY

AI总结 本文研究了元宇宙中的技术基础和安全挑战,通过系统性文献综述分析了元宇宙平台中的关键漏洞及应对措施,总结了当前进展、研究空白和未来发展方向,以确保元宇宙的安全性和伦理规范性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18150 2026-05-19 cs.AI 57%

Whispers in the Noise: Surrogate-Guided Concept Awakening via a Multi-Agent Framework

噪声中的低语:通过多智能体框架引导的代理觉醒

Mengyu Sun, Ziyuan Yang, Zunlong Zhou, Junxu Liu, Haibo Hu, Yi Zhang

机构 * Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系) School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文研究了在黑盒约束下如何通过多智能体框架从预训练模型中恢复被擦除的概念,提出了一种无需训练的代理方法,通过引导噪声状态来实现可控的觉醒,展示了当前概念擦除方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18083 2026-05-19 cs.CL 57%

A Data-Efficient Path to Multilingual LLMs: Language Expansion via Post-training PARAM$Δ$ Integration into Upcycled MoE

多语言大语言模型的高效路径:通过后训练PARAM$Δ$整合到再利用MoE进行语言扩展

Hao Zhou, Tianhao Li, Zhijun Wang, Shuaijie She, Linjuan Wu, Hao-Ran Wei, Baosong Yang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Zhejiang University(浙江大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种高效的方法,通过将密集模型转换为MoE架构,并将不同语言分配给不同专家,从而在不进行复杂对齐阶段的情况下提升多语言大语言模型的性能,同时保留原始能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15172 2026-05-15 cs.CR cs.CL 57%

MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs

MetaBackdoor:利用位置编码作为大语言模型中的后门攻击面

Rui Wen, Mark Russinovich, Andrew Paverd, Jun Sakuma, Ahmed Salem

机构 * Institute of Science Tokyo(东京科学研究院) Microsoft Azure(微软Azure) Microsoft Security Response Center(微软安全响应中心)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 本文提出MetaBackdoor,通过利用位置信息作为触发器,而非修改文本内容,实现对大语言模型的后门攻击,展示了长度相关的触发器可激活隐蔽后门,并展示了自我激活场景和与内容后门的组合攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14396 2026-05-15 cs.CV cs.CR cs.LG cs.RO 57%

Systematic Discovery of Semantic Attacks in Online Map Construction through Conditional Diffusion

通过条件扩散系统发现在线地图构建中的语义攻击

Chenyi Wang, Ruoyu Song, Raymond Muller, Jean-Philippe Monteuuis, Jonathan Petit, Z. Berkay Celik, Ryan Gerdes, Ming F. Li

机构 * University of Arizona(亚利桑那大学) Purdue University(普渡大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出MIRAGE框架,系统发现能绕过对抗防御的语义攻击,通过寻找环境变化(如阴影、湿路)来降低地图预测准确性,实验显示两种攻击在多种防御下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14237 2026-05-15 cs.AI 57%

Good to Go: The LOOP Skill Engine That Hits 99% Success and Slashes Token Usage by 99% via One-Shot Recording and Deterministic Replay

Good to Go:LOOP技能引擎:通过一次录制和确定性重放实现99%的成功率并减少99%的token使用

Xiaohua Wang, Kai Yu, XuXiao Liang, Liang Wang, Chao Han

机构 * Artificial Intelligence Research Center, Bengbu Medical University(蚌埠医科大学人工智能研究中心) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物科技有限公司)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 LOOP技能引擎通过一次录制和确定性重放,实现99%的成功率和99%的token减少,解决重复周期性任务中大语言模型的不确定性与高成本问题。

Comments 8 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01758 2026-05-15 cs.AI 57%

Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems

在感染蔓延前捕捉它:多智能体系统中的前瞻性引导防御

Yue Ma, Ziyuan Yang, Yi Zhang

机构 * Sichuan University(四川大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出Foresight-Guided Local Purification框架,通过智能体模拟未来交互行为,消除感染。实验表明,该方法将最大累积感染率从95%降至5.47%,有效保持交互多样性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27517 2026-05-15 cs.CR cs.AI 57%

A Security Analysis of the OpenClaw AI Agent Framework

对OpenClaw AI代理框架的安全性分析

Surada Suwansathit, Yuxuan Zhang, Guofei Gu

机构 * SUCCESS Lab(SUCCESS实验室) Texas A&M University(德克萨斯大学)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文分析了OpenClaw AI代理框架的安全性,揭示了其在架构层和信任违反类型上的漏洞,发现三个主要问题:远程代码执行路径、执行允许列表的闭世界假设失效以及技能分发面缺乏运行时策略控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13115 2026-05-14 cs.CR cs.LG 57%

DiffusionHijack: Supply-Chain PRNG Backdoor Attack on Diffusion Models and Quantum Random Number Defense

DiffusionHijack: 供应链PRNG后门攻击针对扩散模型和量子随机数防御

Ziyang You, Liling Zheng, Xiaoke Yang, Xuxing Lu

机构 * School of Electronics, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子工程与物理学院) School of Humanities, Fujian University of Technology(福建工程学院人文学院) Institute of Applied Physics and Materials Engineering, University of Macau(澳门大学应用物理与材料工程学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究提出DiffusionHijack攻击通过供应链注入恶意PRNG控制扩散模型生成图像,采用量子随机数生成器有效防御该攻击,降低输出相似度至随机基线水平。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13044 2026-05-14 cs.CR cs.AI 57%

No Attack Required: Semantic Fuzzing for Specification Violations in Agent Skills

无需攻击:用于代理技能规范违规的语义模糊测试

Ying Li, Hongbo Wen, Yanju Chen, Hanzhi Liu, Yuan Tian, Yu Feng

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出Sefz框架,通过语义模糊测试发现代理技能中的规范违规问题,揭示了安全规则漏洞对用户信任的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11770 2026-05-13 cs.CR cs.AI cs.SY eess.SY 57%

Behavioral Integrity Verification for AI Agent Skills

AI代理技能的行为完整性验证

Yuhao Wu, Tung-Ling Li, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出行为完整性验证(BIV)方法,通过类型集比较验证AI代理技能声明与实际能力的一致性,发现80%的技能存在描述与实现差距,并在恶意技能检测中取得高F1值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11029 2026-05-13 cs.CR cs.AI 57%

FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

FragBench:隐藏在看似无害片段中的跨会话攻击

Astha Mehta, Niruthiha Selvanayagam, Cedric Lam, Hengxu Li, Phuc-Nguyen Nguyen, Raymond Lee, Olivia McGoffin, My, Luong, Arthur Collé, Jamie Johnson, David Williams-King, Linh Le

机构 * New York University(纽约大学) Tufts University(塔夫茨大学) Distributed Systems(分布式系统) ERA(欧洲研究联盟) Lida Safety(Lida安全) Mila

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 FragBench通过24个真实网络攻击案例构建,评估LLM跨会话攻击检测,采用对抗重写和图基检测方法,实现事件级F1分数达0.88-0.96。

Comments preprint of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10582 2026-05-12 cs.CR cs.AI 57%

Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing

通过干扰-校正平滑实现保证的对抗防御

Zheng Lin, Zhenxing Niu, Haoxuan Ji, Haichang Gao

机构 * Xidian University(西安电子科技大学) Xi’an Jiaotong University(西安交通大学)

专题命中 越狱攻击 :harmlessness(abstract);分类 cs.AI

AI总结 本文提出了一种基于平滑的新型防御方法,通过干扰-校正机制提升大语言模型对劫持攻击的防御能力,理论分析提供了防御成功的紧界和干扰强度要求,实验表明其在安全性和有用性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10176 2026-05-12 cs.CR cs.AI 57%

When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications

当提示成为载荷:一种缓解大型语言模型驱动应用中SQL注入攻击的框架

Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd, Pejman Najafi, Feng Cheng, Christoph Meinel

机构 * Hasso Plattner Institute, University of Potsdam, Germany(波茨坦大学霍斯曼-普拉特研究所, 德国) Chemnitz University of Technology, Chemnitz, Germany(Chemnitz技术大学, Chemnitz, 德国)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出一种多层安全框架,通过提示清洗、威胁检测和签名控制层缓解LLM介导的SQL注入攻击,实验表明其在检测精度和误报率方面表现优异。

Comments 11 pages

Journal ref ICAART 2026, 18th Int. Conf. on Agents and Artificial Intelligence, pp. 1380-1390, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08460 2026-05-12 cs.CR cs.AI 57%

When Child Inherits: Modeling and Exploiting Subagent Spawn in Multi-Agent Networks

当子代理继承:在多代理网络中建模和利用子代理生成

Ziwen Cai, Yihe Zhang, Xiali Hei

机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉弗奈分校)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究多代理网络中子代理继承带来的安全风险,指出继承内存可能传播恶意指令,提出通过显式安全不变量进行防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01034 2026-05-05 cs.CL 57%

A Theoretical Game of Attacks via Compositional Skills

通过组合技能的攻击理论游戏

Xinbo Wu, Huan Zhang, Abhishek Umrawal, Lav R. Varshney

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stony Brook University(石溪大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文提出一个理论框架,分析攻击者与防御者之间的博弈,设计最优攻击策略并揭示其与现有对抗提示方法的关系,同时推导出可证明最优的防御策略,并通过实验验证其在不同LLM和基准上的优越性。

Comments arXiv admin note: text overlap with arXiv:2505.20841

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28129 2026-05-01 cs.CR cs.AI 57%

Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection

潜在对抗检测:适应性探测LLM激活以多轮攻击检测

Prashant Kulkarni

机构 * Mountain View, CA(山景城,加利福尼亚州)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过分析LLM激活层的轨迹特征,提出对抗性不稳定性概念,提升多轮攻击检测精度,验证了模型家族间的信号一致性及数据分布对泛化能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24983 2026-04-29 cs.AI 57%

Adaptive Prompt Embedding Optimization for LLM Jailbreaking

适应性提示嵌入优化用于大语言模型劫持

Miles Q. Li, Benjamin C. M. Fung, Boyang Li, Radin Hamidi Rad, Ebrahim Bagheri

机构 * School of Information Studies, McGill University, Montreal, QC, Canada(麦吉尔大学信息研究学院) Department of Computer Science, Kean University, Union, NJ, United States(凯恩大学计算机科学系) Mila - Quebec AI Institute, Montreal, QC, Canada(魁北克人工智能研究所) Faculty of Information, University of Toronto, Toronto, ON, Canada(多伦多大学信息学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出PEO方法,通过优化原始提示嵌入而非附加对抗性标记,实现更有效的白盒劫持,实验显示其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24790 2026-04-29 cs.CR cs.AI 57%

Semantic Denial of Service in LLM-controlled robots

语义拒绝服务在LLM控制的机器人中

Jonathan Steinberg, Oren Gal

机构 * Swarms & AI Lab (SAIL) University of Haifa(群集与人工智能实验室(SAIL)海法大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文研究了LLM控制机器人中语义拒绝服务攻击,发现通过注入安全可信的短语可触发安全推理中断,提出防御策略需平衡攻击抑制与真实危险响应,强调系统架构而非提示级别的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15384 2026-04-29 cs.CR cs.AI cs.SE 57%

LinuxArena: A Control Setting for AI Agents in Live Production Software Environments

LinuxArena:AI代理在实时生产软件环境中的控制设置

Tyler Tracy, Ram Potham, Nick Kuhn, Myles Heller, Anshul Khandelwal, Cody Rushing, Henri Lemoine, Miguel Brandao, Tomas Turlik, Adam Hanson, Josh Hills, Amy Ngo, Ram Rachum, Nik Mitchell, Falko Galperin, Oscar Sykes, Pip Arnott, Samuel Prieto Lima, Carlos Giudice, Matt Goldwater, Daniel Popp, Drew de Wet, Ruben Castaing, Qi Guo, Douw Marx, Benjamin Shaffrey, Justin Shenk, Martin Milbradt, Hannah Meagher, Shaheen Ahmed-Chowdhury, Daniel O'Connell, Chris Canal, Buck Shlegeris, Aryan Bhatt

机构 * Redwood Research EquiStamp Senior Authors

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 LinuxArena是首个大规模多服务生产环境控制设置,包含20个环境、1671个合法任务和184个安全失败任务,用于评估AI代理在实时环境中的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16182 2026-04-28 cs.CR cs.CL 57%

DualGuard: Dual-stream Large Language Model Watermarking Defense against Paraphrase and Spoofing Attack

DualGuard: 双流大语言模型水印防御对抗同义词和伪装攻击

Hao Li, Yubing Ren, Yanan Cao, Yingjie Li, Fang Fang, Shi Wang, Li Guo

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院) Institute of Computing Technology, Chinese Academy of Sciences(计算技术研究所,中国科学院)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL

AI总结 DualGuard通过双流水印机制有效防御同义词和伪装攻击,提升水印检测的可靠性与可追溯性,实验表明其在多数据集和语言模型上的检测性、鲁棒性和文本质量均表现优异。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL 57%

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23124 2026-04-28 cs.SE cs.AI 57%

ArgRE: Formal Argumentation for Conflict Resolution in Multi-Agent Requirements Negotiation

ArgRE:基于形式论证的多智能体需求协商中的冲突解决

Haowei Cheng, Milhan Kim, Chong Liu, Teeradaj Racharak, Truong Vinh Truong Duy, Phan Thi Huyen Thanh, Jialong Li, Naoyasu Ubayashi, Hironori Washizaki

机构 * Department of Computer Science and Communications Engineering, Waseda University(早稻田大学计算机科学与通信工程系) College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) Advanced Institute of So-Go-Chi (Convergence Knowledge) Informatics, Tohoku University(东北大学So-Go-Chi(融合知识)信息学高级研究所) Aisin Corporation(日产公司)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 ArgRE通过嵌入Dung风格的抽象论证,提供多智能体需求协商中的冲突解决,提升可审计性与合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 57%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18457 2026-04-24 cs.CV cs.LG 57%

VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models

VFM-VAE:视觉基础模型可以作为潜在扩散模型的良好分词器

Tianci Bi, Xiaoyi Zhang, Yan Lu, Nanning Zheng

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 本文提出VFM-VAE,利用冻结的视觉基础模型作为潜在扩散模型的分词器,通过设计新解码器提升图像重建能力,实现分词器与扩散模型的协同优化,提升训练效率与性能。

Comments Accepted at CVPR 2026. Code and models available at: https://github.com/tianciB/VFM-VAE

详情

展开后加载摘要…

URL PDF HTML 收藏