arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-07 至 2026-04-07 共收录 121 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2604.04261 2026-04-07 cs.LG cs.AI 87%

APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs

APPA:自适应偏好多元对齐用于大语言模型公平联邦强化学习从人类反馈

Mahmoud Srewa, Tianyu Zhao, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title);分类 cs.AI、cs.LG

AI总结 本文提出APPA框架,通过动态调整群体奖励权重,提升联邦强化学习中多群体公平对齐效果,实验显示其在保持整体对齐性的同时,显著提升最差群体对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04410 2026-04-07 cs.LG cs.AI cs.CL stat.ML 85%

Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment

相对密度比优化用于稳定且统计一致的模型对齐

Hiroshi Takahashi, Tomoharu Iwata, Atsutoshi Kumagai, Sekitoshi Kanai, Masanori Yamada, Kosuke Nishida, Kazutoshi Shinoda

机构 * NTT, Inc.(日本电信电话株式会社) NTT DOCOMO, INC.(NTT DOCOMO公司)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种稳定且统计一致的模型对齐方法,通过相对密度比优化,改进了直接密度比优化的稳定性与收敛性。

Comments Code is available at https://github.com/takahashihiroshi/rdro

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12575 2026-04-07 cs.CV cs.AI 83%

BalancedDPO: Adaptive Multi-Metric Alignment

BalancedDPO:适应性多指标对齐

Dipesh Tamboli, Souradip Chakraborty, Aditya Malusare, Biplab Banerjee, Amrit Singh Bedi, Vaneet Aggarwal

机构 * Purdue University(普渡大学) University of Maryland(马里兰大学) Indian Institute of Technology Bombay(印度理工学院孟买分校) University of Central Florida(中佛罗里达大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.AI

AI总结 BalancedDPO通过多指标共识和动态参考模型更新,在DPO框架中实现多指标偏好对齐,提升模型在不同评估标准下的稳定性与性能。

Comments Transactions on Machine Learning Research, Apr 2026

Journal ref Transactions on Machine Learning Research, Apr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04497 2026-04-07 cs.LG cs.AI cs.CL 75%

One Model for All: Multi-Objective Controllable Language Models

一个模型解决所有问题:多目标可控语言模型

Qiang He, Yucheng Yang, Tianyi Zhou, Meng Fang, Mykola Pechenizkiy, Setareh Maghsudi

机构 * Ruhr University Bochum(波鸿鲁尔大学) Eindhoven University of Technology(埃因霍温理工大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多目标控制(MOC),通过引入多目标优化原理训练单个语言模型,使其能根据用户偏好在帕累托前沿生成个性化输出,提升模型可控性、输出质量和泛化能力。

Comments Published in Transactions on Machine Learning Research (03/2026): https://openreview.net/forum?id=qAM5PmvFYY

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04215 2026-04-07 cs.CL 74%

DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

DARE:扩散大语言模型对齐与强化执行器

Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(title);分类 cs.CL

AI总结 DARE框架整合了监督微调、参数高效微调、偏好优化和强化学习,为扩散大语言模型提供统一的执行栈,支持多种模型家族,实现算法覆盖、可重复评估和实际加速。

Comments 14 pages,3 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04064 2026-04-07 cs.CL cs.AI 73%

Extracting and Steering Emotion Representations in Small Language Models: A Methodological Comparison

在小型语言模型中提取和引导情绪表示:一种方法学比较

Jihoon Jeong

机构 * ModuLabs(ModuLabs实验室)

专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了小型语言模型中情绪向量提取方法,评估了9种模型在5种架构家族中的情绪表示,发现生成基于的方法在情绪分离上更优,并揭示了情绪表示在中间transformer层的定位及引导实验中的三种 regime。

Comments 14 pages, 4 figures, 7 tables. Paper #6 in the Model Medicine series

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03417 2026-04-07 cs.LG 57%

Beauty in the Eye of AI: Aligning LLMs and Vision Models with Human Aesthetics in Network Visualization

人工智能之眼中的美感:通过LLMs和视觉模型对网络可视化的人类美学对齐

Peng Zhang, Xuefeng Li, Xiaoqi Wang, Han-Wei Shen, Yifan Hu

机构 * Northeastern University(东北大学) Bosch AI Research(博世人工智能研究院) The Ohio State University(俄亥俄州立大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文探讨利用LLMs和视觉模型作为人类判断的代理,通过用户研究收集人类偏好标签,提升网络可视化的人类美学对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04361 2026-04-07 cs.HC 50%

Developing Authentic Simulated Learners for Mathematics Teacher Learning: Insights from Three Approaches with Large Language Models

构建数学教师学习的真挚模拟学习者:基于三种方法与大语言模型的洞察

Jie Cao, Ha Nguyen, Selim Yavuz, Boran Yu, Shuguang Wang, Pavneet Kaur Bharaj, Dionne Cross Francis

专题命中 偏好对齐 :DPO(abstract)

AI总结 本文探讨三种方法提升模拟学生的真实性与教学效用,发现多代理和DPO方法能生成明确的解题策略解释,而微调模型虽生成真实回应但限制思维扩展。

Comments This paper has been accepted in AIED'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00851 2026-04-07 cs.SE 50%

Reliability of Large Language Models for Design Synthesis: An Empirical Study of Variance, Prompt Sensitivity, and Method Scaffolding

大语言模型在设计综合中的可靠性:方差、提示敏感性和方法框架的实证研究

Rabia Iftikhar, Andreas Rausch

专题命中 偏好对齐 :alignment(abstract)

AI总结 本研究探讨大语言模型在设计综合中的可靠性,通过方差、提示敏感性和方法框架的实证分析,评估三种LLM在不同提示策略下的表现,发现偏好对齐虽提升设计意图符合度,但无法消除非确定性,模型行为影响设计可靠性。

Journal ref International Conference on Software Architecture 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 15 篇

2604.04876 2026-04-07 cs.AI 88%

Incompleteness of AI Safety Verification via Kolmogorov Complexity

通过克利福德复杂性验证AI安全的不完全性

Munawar Hasan

机构 * Michigan Technological University(密歇根理工大学)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文通过克利福德复杂性分析AI安全验证的固有限制,证明任何固定验证器都无法认证复杂度超过阈值的真正合规实例,揭示了验证方法的内在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12626 2026-04-07 cs.HC cs.AI cs.CY cs.ET 81%

DoubleAgents: Human-Agent Alignment in a Socially Embedded Workflow

DoubleAgents:社会嵌入式工作流中的人机对齐

Tao Long, Xuanming Zhang, Sitong Wang, Zhou Yu, Lydia B Chilton

机构 * Columbia University(哥伦比亚大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 DoubleAgents通过分布式认知框架实现人机对齐,整合协调代理、可视化仪表板和策略模块,提升复杂社会嵌入式任务的执行效率与用户信任。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03242 2026-04-07 cs.LG 79%

DRAFT: Task Decoupled Latent Reasoning for Agent Safety

草稿:任务解耦的潜在推理用于代理安全

Lin Wang, Junfeng Fang, Dan Zhang, Fei Shen, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore, Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文提出DRAFT框架,通过解耦安全判断为提取器和推理器两个阶段,利用潜在空间证据聚合提升代理安全性,在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04500 2026-04-07 cs.CV 78%

Saliency-R1: Enforcing Interpretable and Faithful Vision-language Reasoning via Saliency-map Alignment Reward

Saliency-R1: 通过显著图对齐奖励增强可解释性和忠实的视觉-语言推理

Shizhan Gong, Minda Hu, Qiyuan Zhang, Chen Ma, Qi Dou

机构 * The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :alignment(title,abstract)

AI总结 Saliency-R1通过显著图对齐奖励提升视觉-语言模型的推理可解释性和忠实性,利用显著图技术高效突出关键图像区域,结合GRPO优化策略增强模型对相关区域的关注,实验显示提升推理忠实性和任务性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01438 2026-04-07 cs.AI 70%

ClawSafety: "Safe" LLMs, Unsafe Agents

ClawSafety: 安全的LLM,不安全的代理

Bowen Wei, Yunbei Zhang, Jinhao Pan, Kai Mei, Xiao Wang, Jihun Hamm, Ziwei Zhu, Yingqiang Ge

机构 * George Mason University(乔治梅森大学) Tulane University(杜兰大学) Rutgers University(罗格斯大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 ClawSafety评估了120个对抗性测试场景,揭示了高权限工作环境中LLM的安全性问题,强调部署栈对安全性的关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21343 2026-04-07 cs.CL cs.AI cs.LG 67%

Self-Improving Pretraining: using post-trained models to pretrain better models

自我改进预训练:利用后训练模型来预训练更好的模型

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva

机构 * FAIR at Meta(Meta FAIR)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新的预训练和中训练方法,通过利用已有的强后训练模型来重写预训练数据并判断策略模型的 rollout,从而在早期训练中引入安全、事实性、生成质量和推理能力等关键行为,提升模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06391 2026-04-07 cs.CL cs.AI 62%

HatePrototypes: Interpretable and Transferable Representations for Implicit and Explicit Hate Speech Detection

HatePrototypes: 用于隐性与显性仇恨言论检测的可解释且可迁移的表示

Irina Proskurina, Marc-Antoine Carpentier, Julien Velcin

机构 * Laboratoire Hubert Curien, UMR CNRS 5516(于贝尔·居里实验室,法国国家科学研究中心5516联合研究单位) Université Lumière Lyon 2(里昂第二大学) Université Claude Bernard Lyon 1(克洛德·贝尔纳里昂第一大学) ERIC, Lyon(里昂ERIC实验室) École Centrale de Lyon(里昂中央理工学院) LIRIS CNRS UMR 5205(LIRIS实验室,法国国家科学研究中心5205联合研究单位)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HatePrototypes,通过语言模型优化的类级向量表示,实现显性和隐性仇恨言论的跨任务迁移,无需重复微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04527 2026-04-07 cs.SE cs.AI cs.PL 57%

ENCRUST: Encapsulated Substitution and Agentic Refinement on a Live Scaffold for Safe C-to-Rust Translation

ENCRUST:在活体支架上进行封装替换和代理细化以实现安全的C到Rust翻译

Hohyun Sim, Hyeonjoong Cho, Ali Shokri, Zhoulai Fu, Binoy Ravindran

机构 * Korea University(高丽大学) University of Houston(休斯顿大学) State University of New York Korea(纽约州立大学韩国分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 ENCRUST通过封装替换和代理细化方法,解决C到Rust翻译中的类型不匹配和不安全构造问题,通过ABI保持封装模式和整体代码库验证,实现安全且可编译的转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04426 2026-04-07 cs.AI 57%

ShieldNet: Network-Level Guardrails against Emerging Supply-Chain Injections in Agentic Systems

ShieldNet: 针对代理系统中新兴供应链注入的网络级防护

Zhuowen Yuan, Zhaorun Chen, Zhen Xiang, Nathaniel D. Bastian, Seyyed Hadi Hashemi, Chaowei Xiao, Wenbo Guo, Bo Li

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) University of Georgia(佐治亚大学) United States Military Academy(美国军事学院) eBay Johns Hopkins University(约翰霍普金斯大学) UCSB(加州大学圣塔芭芭拉分校) Virtue AI

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出ShieldNet,通过观察真实网络交互检测供应链注入,优于现有工具,检测性能达0.995 F-1,误报率低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00495 2026-04-07 cs.AI 57%

AI Runtime Infrastructure

AI 运行时基础设施

Christopher Cruz

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出AI运行时基础设施,通过在模型与应用之间引入执行层,主动监控和干预智能体行为,优化任务成功率、延迟、令牌效率、可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03278 2026-04-07 eess.SY cs.AI cs.SY math.OC 57%

Safe Decentralized Operation of EV Virtual Power Plant with Limited Network Visibility via Multi-Agent Reinforcement Learning

通过多智能体强化学习实现有限网络可见性的电动汽车虚拟电厂安全分布式运行

Chenghao Huang, Jiarong Fan, Weiqing Wang, Hao Wang

机构 * Department of Data Science and AI, Faculty of IT, Monash University(蒙纳士大学信息技术学院数据科学与人工智能系) Monash Energy Institute, Monash University(蒙纳士大学蒙纳士能源研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种安全增强的虚拟电厂框架,利用多智能体强化学习在有限信息约束下协调多个电动汽车充电站,确保电压安全并维持经济运行。

Comments The 2026 IEEE Power & Energy Society General Meeting, 7 pages including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03232 2026-04-07 cs.AI 57%

IC3-Evolve: Proof-/Witness-Gated Offline LLM-Driven Heuristic Evolution for IC3 Hardware Model Checking

IC3-Evolve: 用于IC3硬件模型检查的自动离线LLM驱动启发式进化

Mingkai Miao, Guangyu Hu, Ziyi Yang, Hongce Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 IC3-Evolve通过离线LLM提出小范围修正,实现IC3硬件模型检查的自动优化,确保正确性验证下的启发式改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04499 2026-04-07 eess.SY cs.SY math.OC 50%

Distributed Covariance Steering via Non-Convex ADMM for Large-Scale Multi-Agent Systems

通过非凸ADMM实现分布式协方差控制用于大规模多智能体系统

Augustinos D. Saravanos, Isin M. Balci, Arshiya Taj Abdul, Efstathios Bakolas, Evangelos A. Theodorou

专题命中 安全训练 :safety(abstract)

AI总结 本文研究在概率碰撞避免约束下,通过非凸ADMM实现分布式协方差控制,提出三种方法在保守性和计算效率间平衡,验证了算法的收敛性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15858 2026-04-07 cs.PL cs.SE 50%

Search-Based Multi-Trajectory Refinement for Safe C-to-Rust Translation with Large Language Models

基于搜索的多轨迹优化用于大型语言模型驱动的安全C到Rust转换

HoHyun Sim, Hyeonjoong Cho, Yeonghyeon Go, Sadegh AlMahdi Kazemi Zarkouei, Zhoulai Fu, Ali Shokri, Binoy Ravindran

专题命中 安全训练 :safety(abstract)

AI总结 本文提出LAC2R方法,利用MCTS系统探索多轨迹优化,提升C到Rust转换的安全性和准确性,实验表明其在大规模和小规模基准测试中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03995 2026-04-07 cs.CV cs.SD 50%

A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning

多模态字体攻击在音频视觉推理中的系统研究

Tianle Chen, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 11 篇

2602.04448 2026-04-07 cs.LG cs.AI cs.CR 90%

RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models

RASA:面向混合专家模型的路由感知安全对齐

Jiacheng Liang, Yuhui Wang, Tanqiu Jiang, Ting Wang

机构 * Department of XXX, University of YYY(YYY大学XXX系) School of ZZZ, Institute of WWW(WWW学院ZZZ学院)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 RASA通过针对性修复安全关键专家提升混合专家模型的安全性,有效防止路由绕过,实现高鲁棒性和跨攻击泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03598 2026-04-07 cs.CR 82%

AttackEval: A Systematic Empirical Study of Prompt Injection Attack Effectiveness Against Large Language Models

AttackEval: 一种针对大语言模型的提示注入攻击有效性系统性实证研究

Jackson Wang

专题命中 越狱攻击 :prompt injection(title,abstract);safety(abstract)

AI总结 AttackEval系统性研究提示注入攻击有效性,揭示了Obfuscation攻击在对抗意图感知防御时的成功率最高,以及复合攻击策略显著提升攻击成功率,为改进大语言模型安全系统提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04759 2026-04-07 cs.CR cs.AI cs.CL 81%

Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw

你的代理,他们的资产:OpenClaw的现实世界安全性分析

Zijun Wang, Haoqin Tu, Letian Zhang, Hardy Chen, Juncheng Wu, Xiangyan Liu, Zhenlong Yuan, Tianyu Pang, Michael Qizhe Shieh, Fengze Liu, Zeyu Zheng, Huaxiu Yao, Yuyin Zhou, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) NUS(新加坡国立大学) Tencent(腾讯) ByteDance(字节跳动) UC Berkeley(加州大学伯克利分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文首次对OpenClaw进行现实世界安全性评估,引入CIK分类法分析代理的持久状态,发现攻击单个CIK维度可显著提高攻击成功率,强调需系统性保障个人AI代理的安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04842 2026-04-07 cs.CL 70%

Do No Harm: Exposing Hidden Vulnerabilities of LLMs via Persona-based Client Simulation Attack in Psychological Counseling

勿伤人:通过基于人设的客户端模拟攻击暴露大语言模型的隐藏漏洞

Qingyang Xu, Yaling Shen, Stephanie Fong, Zimu Wang, Yiwen Jiang, Xiangyu Zhao, Jiahe Liu, Zhongxing Xu, Vincent Lee, Zongyuan Ge

机构 * Monash University(莫纳什大学) University of Liverpool(利物浦大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出基于人设的客户端模拟攻击框架PCSA,通过模拟心理辅导中的客户端对话,揭示大语言模型在心理安全对齐方面的漏洞,实验表明其在七个通用和心理健康专用LLM上表现优于其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03968 2026-04-07 cs.CR cs.AI 70%

TraceGuard: Structured Multi-Dimensional Monitoring as a Collusion-Resistant Control Protocol

TraceGuard:结构化多维监控作为抗合谋的控制协议

Khanh Linh Nguyen, Hoa Nghiem, Tu Tran

机构 * Independent Researchers(独立研究人员) Apart Research

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出TraceGuard,一种结构化多维监控协议,通过五个维度评估代理行为,结合LLM调用和启发式检测器,有效区分攻击与诚实行为,防止合谋攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04561 2026-04-07 cs.CR cs.AI cs.CL 62%

Mapping the Exploitation Surface: A 10,000-Trial Taxonomy of What Makes LLM Agents Exploit Vulnerabilities

映射利用表面:一种10000次试验的分类,揭示使LLM代理利用漏洞的因素

Charafeddine Mouzouni

机构 * OPIT -- Open Institute of Technology(OPIT——开放理工学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过10000次试验分析系统提示特征对LLM代理利用漏洞的影响,发现目标重构是唯一可靠触发因素,其他维度在特定条件下未产生显著利用。

Comments 18 pages, 8 tables, code and data at https://github.com/Cmouzouni/exploitation-surface

详情

展开后加载摘要…

URL PDF HTML 收藏