arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-20 至 2026-05-20 共收录 87 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2605.20082 2026-05-20 cs.CV cs.AI 90%

VL-DPO: Vision-Language-Guided Finetuning for Preference-Aligned Autonomous Driving

VL-DPO:基于视觉语言的偏好对齐自动驾驶微调

Zhefan Xu, Ghassen Jerfel, Marina Haliem, Qi Zhao, Jeonhyung Kang, Khaled S. Refaat

机构 * Waymo

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.AI

AI总结 本文提出VL-DPO,一种基于视觉语言模型的框架,通过零样本推理生成偏好对来微调自动驾驶模型,以提升与人类驾驶偏好的对齐程度,实验表明该方法在RFS和ADE指标上均优于基线模型。

Comments Published in International Conference on Robotics and Automation (ICRA), 2026 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17305 2026-05-20 cs.AI cs.CL cs.LG 88%

Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations

对比推理对齐:从隐藏表示中学习强化学习

Haozheng Luo, Yimin Wang, Jiahao Yu, Binghui Wang, Yan Chen

机构 * Northwestern University(西北大学) University of Michigan(密歇根大学) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 偏好对齐 :alignment(title,abstract);jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于对比学习和强化学习的框架CRAFT,通过优化隐藏状态空间中的目标来提升对抗攻击的鲁棒性,核心贡献是通过隐藏空间的几何结构实现推理层面的安全对齐。

Comments International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23461 2026-05-20 cs.LG cs.AI 82%

Eliminating Inductive Bias in Reward Models with Information-Theoretic Guidance

通过信息论指导消除奖励模型中的归纳偏置

Zhuo Li, Pengyu Cheng, Zhechao Yu, Feifei Tong, Anningzhe Gao, Tsung-Hui Chang, Xiang Wan, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于信息论的奖励模型去偏方法DIR,通过最大化奖励模型评分与人类偏好对之间的互信息,同时最小化奖励模型输出与偏好输入偏置属性之间的互信息,从而有效缓解归纳偏置问题并提升RLHF性能。

Comments Published as a conference paper at The International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18808 2026-05-20 cs.LG cs.AI cs.CL 75%

Compositional Literary Primitives in Instruction-Tuned LLMs: Cross-Architectural SAE Features for Self, Style, and Affect

在指令微调的LLM中构建组合文学原语:跨架构SAE特征用于自我、风格和情感

Joao Paulo Cavalcante Presa, Savio Salvarino Teles de Oliveira

机构 * Federal University of Goias(戈亚斯联邦大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过稀疏自编码器研究了指令微调的LLM中组合文学原语的架构,发现四种特征类别,并通过跨架构SAE特征验证了自我、风格和情感的表达能力。

Comments 36 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05933 2026-05-20 cs.CL cs.LG 73%

Structured Style-Rewrite with Chain-of-Thought Planning for Low-Resource Character Dialogue

结构化风格重写与思维链规划用于低资源字符对话

Chanhui Zhu

机构 * Guangdong University of Finance(广东金融学院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出了一种结构化风格重写框架,结合思维链规划,以解决低资源条件下中文字符驱动生成中的风格分离问题,通过分解角色风格为可解释的格式签名、语法和语用维度,并利用思维链监督进行显式风格规划,实验表明该方法在保持语义忠实性的同时提升了风格质量。

Comments 30 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19242 2026-05-20 cs.CV cs.AI cs.ET cs.LG cs.MM 73%

PhyWorld: Physics-Faithful World Model for Video Generation

PhyWorld: 用于视频生成的物理忠实世界模型

Pu Zhao, Juyi Lin, Timothy Rupprecht, Arash Akbari, Chence Yang, Rahul Chowdhury, Elaheh Motamedi, Arman Akbari, Yumei He, Chen Wang, Geng Yuan, Weiwei Chen, Yanzhi Wang

机构 * Northeastern University(东北大学) University of Georgia(佐治亚大学) Tulane University(路易斯安那大学) EmbodyX

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出PhyWorld,一种通过两阶段训练提升视频生成模型的物理忠实性,以改进世界模拟器的性能,从而更有效地支持物理AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10614 2026-05-20 cs.LG cs.AI 73%

Fine-tuning Large Language Model for Automated Algorithm Design

微调大语言模型用于自动化算法设计

Fei Liu, Rui Zhang, Xi Lin, Zhichao Lu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文探讨了微调大语言模型以提升其在自动化算法设计中的性能,提出了一种多样性感知的排名策略和直接偏好优化方法,通过实验验证了任务特定微调在不同算法设计任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18815 2026-05-20 cs.LG cs.DC 70%

DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training

DynaTrain: 快速在线并行切换用于弹性大语言模型训练

Yuanqing Wang, Yuchen Zhang, Hao Lin, Junhao Hu, Chunyang Zhu, Quanlu Zhang, Boxun Li, Guohao Dai, Zhi Yang, Daning Cheng, Yunquan Zhang, Yu Wang

机构 * Institute of Computing Technology, CAS(中国科学院计算技术研究所) Peking University(北京大学) Infinigence AI Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出DynaTrain,一种能够快速在线重新配置任意多维并行性的分布式训练系统,通过虚拟参数空间抽象统一所有分布式训练状态,实现并行配置的确定性映射,并在密集和MoE模型上展示了显著的性能提升。

Comments GitHub Repo: https://github.com/infinigence/ElasticMegatron

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18822 2026-05-20 cs.LG cs.AI 62%

Hybrid-LoRA: Bridging Full Fine-Tuning and Low-Rank Adaptation for Post-Training

Hybrid-LoRA: 桥接全微调与低秩适应以实现训练后优化

Chengqian Zhang, Wei Zhu, Kyumin Lee

机构 * Worcester Polytechnic Institute(沃斯特理工学院) University of Hong Kong(香港大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hybrid-LoRA框架,通过选择性地对部分模块进行全微调,其余模块使用LoRA进行适应,从而在训练后优化中实现高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17237 2026-05-20 cs.IR cs.AI 57%

HeadRank: Decoding-Free Passage Reranking via Preference-Aligned Attention Heads

HeadRank: 通过偏好对齐的注意力头实现无需解码的段落重排序

Juyuan Wang, Chenxing Wang, Yuchen Fang, Huiyun Hu, Junwu Du, Aolin Li, Shunlin Rong, Haijun Wu, Jin Xu, Ligang Liu, Dongliang Liao

机构 * Weixin Group, Tencent, China(腾讯微信集团,中国) South China University of Technology, Guangzhou, China(华南理工大学,广州,中国)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出HeadRank框架,通过熵正则化的头部选择、硬相邻级偏好对和分布正则化,在连续注意力域中提升偏好优化,从而在无需解码的情况下实现高效的段落重排序,其在多个基准测试中均取得最佳的平均NDCG@10成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 11 篇

2605.19722 2026-05-20 cs.CR cs.AI 88%

Measuring Safety Alignment Effects in Autonomous Security Agents

在自主安全代理中测量安全对齐效应

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于轨迹的基准测试,用于评估安全代理在执行漏洞分析任务时的安全对齐效果,发现安全代理的性能差异主要体现在拒绝、不安全行为和工具可靠性等方面,而非单纯的拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11768 2026-05-20 cs.AI 79%

Governing Evolving Memory in LLM Agents: Risks, Mechanisms, and the Stability and Safety Governed Memory (SSGM) Framework

在LLM代理中治理演化的记忆:风险、机制以及稳定性与安全性的治理记忆(SSGM)框架

Chingkwun Lam, Jiaxin Li, Lingfei Zhang, Kuo Zhao

机构 * College of Intelligent Science and Engineering(智能科学与工程学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了LLM代理中记忆治理的问题,提出了一种新的SSGM框架,通过一致性验证、时间衰减建模和动态访问控制来缓解记忆腐蚀风险,提高记忆系统的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21484 2026-05-20 cs.LG 79%

ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment

ETS: 为无训练强化学习对齐的能耗引导测试时缩放

Xiuyu Li, Jinkai Zhang, Mingyang Yi, Yu Li, Longqiang Wang, Yue Wang, Ju Fan

机构 * Renmin University of China, Beijing, China(中国人民大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出了一种无需训练的推理方法,直接从最优强化学习策略中采样,通过结合参考策略模型和能耗项来改进掩码语言模型的过渡概率,并通过在线蒙特卡洛方法估计关键能耗项,从而提高生成质量。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24470 2026-05-20 cs.RO cs.AI 79%

Foundation models on the bridge: Semantic hazard detection and safety maneuvers for maritime autonomy with vision-language models

桥梁上的基础模型:基于视觉-语言模型的语义危险检测与安全操作用于海上自主性

Kim Alexander Christensen, Andreas Gudahl Tufte, Alexey Gusev, Rohan Sinha, Milan Ganai, Ole Andreas Alsos, Marco Pavone, Martin Steinert

机构 * Dept. of Mechanical and Industrial Engineering, NTNU(机械与工业工程系,挪威科技大学) Dept. of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学) Dept. of Computer Science, Stanford University(计算机科学系,斯坦福大学) NVIDIA Research(NVIDIA研究)

专题命中 安全训练 :safety(title);alignment(abstract);分类 cs.AI

AI总结 本文提出了一种基于视觉-语言模型的语义危险检测与安全操作方法,用于满足IMO草案MASS代码对海上自主船舶的要求,通过快速-慢速异常管道和短时间范围的人类可覆盖回退操作来实现,在40个港口场景中验证了该方法的性能。

Comments 17 pages without bibliography or appendix. The main paper has 16 figures. Paper webpage can be found at https://kimachristensen.github.io/bridge_policy/

Journal ref Ocean Engineering 359, Part 3 (2026), Article 124646

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18842 2026-05-20 cs.LG 79%

Safe Continual Reinforcement Learning under Nonstationarity via Adaptive Safety Constraints

在非平稳环境下通过自适应安全约束实现安全的持续强化学习

Timofey Tomashevskiy

机构 * McMaster Centre for Software Certification(麦斯特软件认证中心) Department of Computing and Software(计算与软件系) McMaster University(麦斯特大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出了一种结合三种自适应安全机制的框架,用于在非平稳环境下实现安全的持续强化学习,通过自适应约束机制减少分布偏移下的安全违规,同时保持任务性能。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18843 2026-05-20 cs.LG 74%

TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting

TEMPO: 通过模式分离策略优化实现可信大语言模型回测的时序执行

Zeyu Zhang, Bradly C. Stadie

机构 * Department of Statistic and Data Science(统计与数据科学系)

专题命中 安全训练 :trustworthy(title);分类 cs.LG

AI总结 本文提出TEMPO方法,通过模式分离策略优化,解决大语言模型回测中因泄露后截止日期知识导致的评估不准确问题,核心贡献是引入双模式奖励和基于GRPO的训练流程,有效减少知识泄露并提升任务性能。

Comments 9 pages in main context

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19940 2026-05-20 cs.AI cs.RO 70%

Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains

受机器人启发的用于社会敏感领域基础模型的护栏

Rebecca Ramnauth, Drazen Brscic, Brian Scassellati

机构 * Yale University(耶鲁大学) Kyoto University(京都大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于机器人学的护栏框架,用于在社会敏感领域中对基础模型进行运行时行为控制,以减少交互轨迹中向不良状态的漂移,并适应多样化的社会情境。

Comments Under review at Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13727 2026-05-20 cs.AI 70%

From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails

从拒绝到恢复:一种生成AI防护机制的控制论方法

Ravi Pandya, Madison Bland, Duy P. Nguyen, Changliu Liu, Jaime Fernández Fisac, Andrea Bajcsy

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Equal Advising(平等指导)

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于控制论的生成AI防护机制,通过实时监控和主动纠正高风险输出,提供了一种动态替代传统标志和阻断方法的解决方案。

Journal ref Second International Association on Safe and Ethical AI Conference (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19433 2026-05-20 cs.CL cs.AI 62%

Backtracking When It Strays: Mitigating Dual Exposure Biases in LLM Reasoning Distillation

在偏离时回溯:缓解大语言模型推理蒸馏中的双重暴露偏差

Bing Wang, Shaotian Yan, Chen Shen, kaiyuan liu, Sinan Fan, Ximing Li, Rui Miao, Xiaosong Yuan, Zhanming Shen, Jieping Ye

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(吉林大学符号计算与知识工程重点实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的LLM推理蒸馏方法MOTAB,通过动态监控学生模型生成过程并回溯偏离安全边界的情况,缓解了传统蒸馏方法中因训练分布与推理上下文不匹配导致的双重暴露偏差问题,从而提升推理性能。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13646 2026-05-20 cs.RO cs.AI 57%

Causality-Aware End-to-End Autonomous Driving via Ego-Centric Joint Scene Modeling

基于因果性的端到端自动驾驶:通过以自身为中心的联合场景建模

Seokha Moon, Minseung Lee, Joon Seo, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) Kakao Mobility

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出CaAD框架,通过共享潜在场景表示捕捉车辆与周围代理之间的因果依赖关系,以提高端到端自动驾驶的闭环规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19967 2026-05-20 eess.SY cs.SY 50%

Safe Deep Reinforcement Learning for Spacecraft Reorientation with Pointing Keep-Out Constraint

具有指向保持区约束的空间飞行器再定向的安全深度强化学习

Juntang Yang, Mohamed Khalil Ben-Larbi

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种用于具有单一指向保持区的空间飞行器再定向控制的深度强化学习方法,设计了新的状态空间表示,制定了奖励函数以实现控制目标并施加姿态约束,采用软演员评论家算法处理连续状态和动作空间,并通过课程学习方法训练智能体,通过基于控制屏障函数的安全过滤器保证姿态约束的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 8 篇

2605.19321 2026-05-20 cs.CR cs.AI 86%

Exploring and Developing a Pre-Model Safeguard with Draft Models

探索和开发预模型安全防护机制

Hongyu Cai, Arjun Arunasalam, Yiming Liang, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学) Florida International University(佛罗里达国际大学)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究了如何通过利用 jailbreak 攻击的可转移性,在目标模型推理前确保提示的安全性,提出了一种新的安全防护设计,减少了预模型防护的误报率,并提供了一种低开销的替代方案。

Journal ref ACM Conference on AI and Agentic Systems (ACM CAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18915 2026-05-20 cs.CR cs.AI 86%

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

DMN: 一种用于多图像输入多模态大语言模型的组合框架

Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

机构 * AI Security Lab(360人工智能安全实验室) International Computer Science Institute(国际计算机科学研究所) UC Berkeley(加州大学伯克利分校) Beihang University(北航大学)

专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15362 2026-05-20 cs.LG cs.AI cs.CL cs.CR 85%

Faster-GCG: Efficient Discrete Optimization Jailbreak Attacks against Aligned Large Language Models

Faster-GCG: 面向对齐大语言模型的高效离散优化监狱突破攻击

Xiao Li, Wei Zhang, Zhuhong Li, Qiongxiu Li, Shei PernChua, BingZe Lee, Jinghao Cui, Yifan Huang, Xiaolin Hu

机构 * Tsinghua University(清华大学) Sea-Fill Duke University(杜克大学) Aalborg University(奥胡斯大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Faster-GCG,通过改进估计、高效采样和避免重复评估,提高了对齐大语言模型的监狱突破攻击效率,实现了样本效率提升8倍,时间减少7倍,并在多个模型上取得了更高的突破成功率。

Comments 18 pages, new version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22292 2026-05-20 cs.CV cs.AI 70%

Jailbreaking on Text-to-Video Models via Scene Splitting Strategy

通过场景分割策略对文本到视频模型进行劫持

Wonjun Lee, Haon Park, Doehyeon Lee, Bumsub Ham, Suhyun Kim

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院) AIM Intelligence(AIM智能) Seoul National University(首尔国立大学) Kyung Hee University(庆熙大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出了一种新的黑盒劫持方法SceneSplit,通过将有害叙述分割成多个良性场景,利用场景组合作为约束来引导最终输出,从而提高生成有害视频的可能性,验证了当前文本到视频模型的安全机制存在漏洞。

Comments ICLR 2026. Project page at https://velpegor.github.io/SceneSplit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18988 2026-05-20 cs.CR cs.AI 70%

Surviving the Unseen: Predictive Defense for Novel Multi-Turn Multimodal Attacks

在不可见中存活:面向新颖多轮多模态攻击的预测防御

Doohee You

机构 * Trust and Safety, Google(谷歌信任与安全部)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出了一种预测性防御方法,用于应对新颖多轮多模态攻击,通过动态生存预测和轨迹动态问题来解决静态防御机制的不足,建立了一个计算高效且可解释的安全保障框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19966 2026-05-20 cs.LG cs.AI 62%

Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes

通过顺序熵变化检测基于优化的对抗性提示

Mohammed Alshaalan, Miguel R. D. Rodrigues

机构 * Department of Electronic and Electrical Engineering, University College London, London, United Kingdom(电子与电气工程系,伦敦大学学院,伦敦,英国)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于在线变化点检测的对抗性后缀检测方法CPD,通过标准化用户令牌熵并应用单侧CUSUM统计量,提高了对优化基于对抗性提示的检测性能,同时在多个大型语言模型上实现了更高的F1分数和AUC性能。

Comments Accepted at ICML 2026; 20 pages, including 9 pages main text, references, and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18930 2026-05-20 cs.CR cs.AI cs.LG 62%

OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences

OEP: 通过局部正确但不可转移的经验污染自演化LLM代理

Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了通过局部正确但不可转移的经验污染自演化LLM代理的安全风险,提出OEP攻击方法,利用低权限黑盒攻击在无需直接控制系统提示或记忆数据库的情况下诱导有害泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09621 2026-05-20 cs.CR cs.CY 57%

Technologies and Security Challenges in Metaverse

元宇宙中的技术与安全挑战

Krishno Dey, Diogo Barradas, Saqib Hakak

专题命中 越狱攻击 :safety(abstract);分类 cs.CY

AI总结 本文研究了元宇宙中的技术基础和安全挑战,通过系统性文献综述分析了元宇宙平台中的关键漏洞及应对措施,总结了当前进展、研究空白和未来发展方向,以确保元宇宙的安全性和伦理规范性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2601.22569 2026-05-20 cs.CR cs.AI 79%

Whispers of Wealth: Red-Teaming Google's Agent Payments Protocol via Prompt Injection

财富低语:通过提示注入对谷歌的Agent支付协议进行红队测试

Tanusree Debi, Wentian Zhu, Pranjol Sen Gupta

机构 * School of Computing University of Georgia Athens, USA(佐治亚大学计算机学院 美国亚特兰大) Department of Information Technology Kennesaw State University Kennesaw, USA(凯斯韦尔州立大学信息科技学院 美国凯斯韦尔)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文通过红队测试评估了谷歌的Agent支付协议,揭示了由于间接和直接提示注入导致的漏洞,并提出了两种攻击技术,即品牌低语攻击和宝库低语攻击,以操纵产品排名并提取敏感用户数据。

详情

展开后加载摘要…

URL PDF HTML 收藏