arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 116 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 13 篇

2502.11026 2026-03-24 cs.LG cs.AI cs.CL 91%

RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment

通过SFT方式实现RLHF:从最优解到奖励加权对齐

Yuhao Du, Zhuo Li, Pengyu Cheng, Zhihong Chen, Yuejiao Xie, Xiang Wan, Anningzhe Gao

机构 * Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Qwen LLM Application Team, Alibaba(阿里巴巴Qwen大模型应用团队) Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(title,abstract);DPO(abstract);harmlessness(abstract)

AI总结 本文提出VAR方法,通过变分推断视角简化RLHF,将对齐目标转化为离线奖励驱动的加权监督微调形式,提升训练稳定性和效果,实验证明其在帮助性和无害性指标上优于DPO,且在计算效率和收敛速度上优于在线采样方法。

Comments Published in TMLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22165 2026-03-24 cs.CV 82%

ACPO: Counteracting Likelihood Displacement in Vision-Language Alignment with Asymmetric Constraints

ACPO: 通过不对称约束对抗视觉-语言对齐中的似然位移

Kaili Huang, Hongming Zhang, Rui Shen, Linjun Dai, Jiahao Wang, Hanming Deng, Lewei Lu

机构 * SenseTime Research(商汤科技研究院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract)

AI总结 ACPO通过动态目标导向缩放解决视觉-语言对齐中的似然位移问题,通过不对称抑制拒绝项梯度流,防止视觉锚点坍塌,提升多模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21276 2026-03-24 cs.LG cs.AI 81%

Aggregation Alignment for Federated Learning with Mixture-of-Experts under Data Heterogeneity

在数据异质性下基于混合专家的联邦学习聚合对齐

Zihan Fang, Qianru Wang, Haonan An, Zheng Lin, Yiqin Deng, Xianhao Chen, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City(香港JC STEM实验室) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文针对联邦学习中混合专家模型因数据异质性导致的聚合挑战,提出FedAlign-MoE框架,通过路由一致性和专家语义对齐提升模型收敛速度和准确性。

Comments 14 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21175 2026-03-24 cs.LG cs.AI 73%

Reward Sharpness-Aware Fine-Tuning for Diffusion Models

奖励敏锐度感知的扩散模型微调

Kwanyoung Kim, Byeongsu Sim

机构 * Department of AI Convergence, GIST(人工智能融合系,韩国科学技术院) Samsung Research(三星研究院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RSA-FT方法,通过改进奖励模型梯度的鲁棒性来缓解扩散模型中的奖励黑客问题,提升RDRL的可靠性。

Comments Cam ready version of CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20639 2026-03-24 cs.AI 70%

Agentic AI and the next intelligence explosion

代理AI与下一次智能爆炸

James Evans, Benjamin Bratton, Blaise Agüera y Arcas

机构 * Paradigms of Intelligence Team, Google(谷歌智能范式团队) University of Chicago(芝加哥大学) Santa Fe Institute(圣菲研究所) Antikythera, Berggruen Institute(安提基特拉与伯格格林研究所) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文探讨代理AI如何通过模拟内部思想社会解决复杂任务,提出智能爆炸将不再是单一硅基脑,而是复杂社会结构。

Comments 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21359 2026-03-24 cs.CL cs.AI cs.CY 67%

Benchmarking Bengali Dialectal Bias: A Multi-Stage Framework Integrating RAG-Based Translation and Human-Augmented RLAIF

印地语方言偏见评估:整合基于RAG的翻译和人类增强的RLAIF的多阶段框架

K. M. Jubair Sami, Dipto Sumit, Ariyan Hossain, Farig Sadeque

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出一个多阶段框架,通过基于RAG的翻译和人类增强的RLAIF评估九种印地语方言的偏见。研究发现方言差异导致性能下降,模型规模增加不总是缓解偏见。

Comments 12 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21006 2026-03-24 cs.CY cs.AI cs.CL cs.HC 67%

How AI Systems Think About Education: Analyzing Latent Preference Patterns in Large Language Models

AI系统如何看待教育:分析大型语言模型中的潜在偏好模式

Daniel Autenrieth

机构 * Independent Researcher, PhD Candidate(独立研究者,博士候选人) RWTH Aachen University(亚琛工业大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文首次系统测量大型语言模型的教育契合度,通过48项跨八个教育理论维度的德尔菲验证工具,发现GPT-5.1在教育人文原则上表现出高度一致的偏好模式,但在规范性争议领域偏离专家意见。

Comments 15 pages, 2 figures, 8 tables. Code and data available at https://github.com/brianadvent/education-llm-spe-study. arXiv admin note: text overlap with arXiv:2502.08640 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12299 2026-03-24 cs.CL cs.AI 62%

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

MobileIPL: 通过迭代偏好学习增强移动代理的思维过程

Kun Huang, Weikai Xu, Yuxuan Liu, Quandong Wang, Pengzhi Gao, Wei Liu, Jian Luan, Bin Wang, Bo An

机构 * Xiaomi Inc.(小米公司) Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20212 2026-03-24 cs.CL cs.LG 62%

Fast-Slow Thinking RM: Efficient Integration of Scalar and Generative Reward Models

快速-缓慢思考RM:标量与生成奖励模型的有效整合

Jiayun Wu, Peixu Hou, Shan Qu, Peng Zhang, Ning Gu, Tun Lu

机构 * Fudan University(复旦大学) Meituan(美团)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文提出F/S-RM,结合快速和缓慢思考机制,提升奖励模型性能并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 57%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21872 2026-03-24 cs.CV cs.AI 57%

Manifold-Aware Exploration for Reinforcement Learning in Video Generation

面向流形的探索用于视频生成的强化学习

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin Lin, Kaixiong Gong, Zhao Zhong, Liefeng Bo, Qifeng Chen, Harry Yang

机构 * Tencent Hunyuan(腾讯文脉)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00835 2026-03-24 cs.AI cs.CV 57%

SynPO: Synergizing Descriptiveness and Preference Optimization for Video Detailed Captioning

SynPO:融合描述性和偏好优化的视频详细描述生成

Jisheng Dang, Yizhou Zhang, Hao Ye, Teng Wang, Siming Chen, Huicheng Zheng, Yulan Guo, Jianhuang Lai, Bin Hu

机构 * Sun Yat-Sen University(中山大学) Lanzhou University(兰州大学) The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出SynPO方法,通过偏好学习提升视频描述生成性能,解决直接偏好优化的局限性,提升训练效率20%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19731 2026-03-24 stat.ML cs.LG 57%

Proximal Point Nash Learning from Human Feedback

基于人类反馈的近端点纳什学习

Daniil Tiapkin, Daniele Calandriello, Denis Belomestny, Eric Moulines, Alexey Naumov, Kashif Rasul, Michal Valko, Pierre Menard

机构 * CMAP, CNRS, École Polytechnique, IPP(CMAP、CNRS、巴黎高等学院、IPP) LMO, Université Paris-Saclay(LMO、巴黎萨克雷大学) Google DeepMind(谷歌DeepMind) Duisburg-Essen University(杜伊斯堡-埃森大学) HSE University(俄罗斯高等经济大学) Mohamed Bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) LRE EPITA(EPITA LRE) Hugging Face Isara Labs(Isara实验室) ENS Lyon(里昂大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出Nash Prox算法,通过近端点框架稳定纳什学习过程,解决传统RLHF中偏好结构建模不准确的问题,并在大语言模型训练中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 12 篇

2603.08104 2026-03-24 cs.LG 85%

Invisible Safety Threat: Malicious Finetuning for LLM via Steganography

不可见的安全威胁:通过隐写术对LLM进行恶意微调

Guangnian Wan, Xinyin Ma, Gongfan Fang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文揭示了LLM中隐藏的安全威胁,通过隐写术在看似无害的回复中嵌入恶意内容,展示了对GPT-4.1及多个开源模型的攻击效果,验证了该方法的广泛适用性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17017 2026-03-24 cs.CL 83%

SafeSearch: Do Not Trade Safety for Utility in LLM Search Agents

SafeSearch: 不应为效用而牺牲安全性的LLM搜索代理

Qiusi Zhan, Angeline Budiman-Chan, Abdelrahman Zayed, Xingzhi Guo, Daniel Kang, Joo-Kyung Kim

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的搜索代理在安全与效用之间的平衡问题,提出SafeSearch方法通过多目标强化学习提升安全性和效用,实验表明其显著降低有害输出并保持问答性能。

Comments EACL 2026 Findings. Code available at https://github.com/amazon-science/SafeSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14602 2026-03-24 cs.CL cs.AI cs.LG 82%

PA3: Policy-Aware Agent Alignment through Chain-of-Thought

PA3: 通过链式推理实现政策感知的智能体对齐

Shubhashis Roy Dipta, Daniel Bis, Kun Zhou, Lichao Wang, Benjamin Z. Yao, Chenlei Guo, Ruhi Sarikaya

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) Amazon Alexa AI(亚马逊Alexa AI)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多阶段对齐方法,通过链式推理让模型在推理时回忆并应用相关业务政策,无需在上下文中包含完整政策,同时引入PolicyRecall奖励和hallucination惩罚,提升性能并减少字数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20206 2026-03-24 cs.CL cs.AI 81%

Enhancing Safety of Large Language Models via Embedding Space Separation

通过嵌入空间分离增强大语言模型的安全性

Xu Zhao, Xiting Wang, Weiran Shen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出嵌入空间分离方法,通过扩大有害与安全表示间的距离提升大语言模型安全性,同时保持模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21975 2026-03-24 cs.CR cs.AI cs.CL cs.LG 80%

SecureBreak -- A dataset towards safe and secure models

SecureBreak -- 一个面向安全和安全模型的数据集

Marco Arazzi, Vignesh Kumar Kembu, Antonino Nocera

机构 * Department of Electrical, Computer Biomedical Engineering, University of Pavia, Italy\ .

专题命中 安全训练 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SecureBreak数据集,用于检测由安全对齐残余弱点引起的有害大语言模型输出,通过手动标注确保可靠性,并在多个风险类别中有效检测不安全内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20994 2026-03-24 cs.AI cs.GT cs.LG 62%

The Intelligent Disobedience Game: Formulating Disobedience in Stackelberg Games and Markov Decision Processes

智能不服从游戏:在Stackelberg游戏和马尔可夫决策过程中建模不服从

Benedikt Hornig, Reuth Mirsky

机构 * Independent Researcher(独立研究者) Tufts University(塔夫茨大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出智能不服从游戏(IDG),通过Stackelberg游戏框架建模人类与辅助体的不对称信息交互,分析多步场景中的最优策略,揭示如'安全陷阱'等战略现象,为开发安全非合规学习算法和研究人类对不服从AI的信任提供数学基础。

Comments Accepted for presentation at the Rebellion and Disobedience in AI (RaD-AI) at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21810 2026-03-24 eess.SY cs.MA cs.RO cs.SY 50%

Partial Attention in Deep Reinforcement Learning for Safe Multi-Agent Control

深度强化学习中多智能体控制的安全部分注意力

Turki Bin Mohaya, Peter Seiler

机构 * Department of Electrical Engineering and Computer Science at the University of Michigan(密歇根大学电气工程与计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出在多智能体安全控制中应用注意力机制,设计神经网络控制高速公路汇入场景的自动驾驶车辆,通过部分注意力提升安全性和效率。

Comments This work has been accepted for publication in the proceedings of the 2026 American Control Conference (ACC), New Orleans, Louisiana, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21427 2026-03-24 cs.SE 50%

Dynasto: Validity-Aware Dynamic-Static Parameter Optimization for Autonomous Driving Testing

Dynasto:面向自动驾驶测试的有效性感知动态-静态参数优化

Dmytro Humeniuk, Mohammad Hamdaqa, Houssem Ben Braiek, Amel Bennaceur, Foutse Khomh

专题命中 安全训练 :safety(abstract)

AI总结 Dynasto通过联合优化初始场景参数和动态对抗行为,发现更多真实安全关键故障,揭示自动驾驶系统中的弱点。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21142 2026-03-24 cs.RO 50%

Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation

动态控制屏障函数调节与视觉-语言模型用于安全、适应性和实时视觉导航

Jeffrey Chen, Rohan Chandra

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出AlphaAdj框架,利用视觉-语言模型动态调整控制屏障函数参数,以实现在动态环境中安全、高效和实时的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20658 2026-03-24 cs.RO 50%

Speedup Patch: Learning a Plug-and-Play Policy to Accelerate Embodied Manipulation

加速补丁:学习一种插件式策略以加快具身操作

Zhichao Wu, Junyin Ye, Zhilong Zhang, Yihao Sun, Haoxin Lin, Jiaheng Luo, Haoxiang Ren, Lei Yuan, Yang Yu

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China School of Artificial Intelligence, Nanjing University, China Mila-Quebec AI Institute \& Université de Montréal, Canada

专题命中 安全训练 :safety(abstract)

AI总结 本文提出Speedup Patch,一种轻量且策略无关的框架,通过仅使用离线数据实现插件式加速,通过约束马尔可夫决策过程优化调度器,提升执行效率而不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20356 2026-03-24 cs.LO cs.CR cs.FL 50%

Agentproof: Static Verification of Agent Workflow Graphs

Agentproof: 静态验证代理工作流图

Melwin Xavier, Vaisakh M A, Melveena Jolly, Midhun Xavier

专题命中 安全训练 :safety(abstract)

AI总结 Agentproof通过提取四个主流代理框架的统一抽象图模型,应用六种结构检查并生成见证轨迹,评估时间安全策略,实现无需手动建模的静态验证,发现工作流中的结构缺陷和政策违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15674 2026-03-24 eess.SY cs.SY 50%

Safe and Stable Formation Control with Autonomous Multi-Agents Using Adaptive Control (Extended Version)

使用自适应控制的自主多智能体安全稳定编队控制(扩展版)

Jose A. Solano-Castellanos, Peter A. Fisher, Anuradha Annaswamy

专题命中 安全训练 :safety(abstract)

AI总结 本文提出结合自适应控制、控制屏障函数和连接图的方法,解决多智能体系统在动态不确定性和通信限制下的稳定与安全编队控制问题,通过自适应控制确保稳定性,安全过滤器生成安全指令,参考模型实现无不确定情况下的编队控制。

Comments Accepted to Modeling, Estimation and Control Conference (MECC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2603.20976 2026-03-24 cs.LG cs.AI cs.HC 62%

Detection of adversarial intent in Human-AI teams using LLMs

利用大语言模型检测人类-人工智能团队中的对抗意图

Abed K. Musaffar, Ambuj Singh, Francesco Bullo

机构 * Department of Mechanical Engineering, University of California at Santa Barbara(加州大学圣巴巴拉分校机械工程系) Department of Computer Science, University of California at Santa Barbara(加州大学圣巴巴拉分校计算机科学系)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型在人类-人工智能团队中作为防御监督者的潜力,通过分析交互痕迹检测恶意行为,发现LLM能实时识别恶意行为,且无需任务特定信息,表明了任务无关防御的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 2 篇

2603.20198 2026-03-24 cs.CR cs.CV cs.LG 85%

Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning

视觉排斥攻击:通过代理规划实现自动多模态红队行动

Yunbei Zhang, Yingqiang Ge, Weijie Xu, Yuhui Xu, Jihun Hamm, Chandan K. Reddy

专题命中 红队测试 :red teaming(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出视觉排斥攻击,通过多模态多轮代理规划框架MM-Plan,实现基于视觉内容的攻击,展示了对前沿模型的高攻击成功率,揭示了当前安全对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20925 2026-03-24 cs.AI 57%

Profit is the Red Team: Stress-Testing Agents in Strategic Economic Interactions

利润是红队:在战略经济互动中压力测试代理

Shouqiao Wang, Marcello Politi, Samuele Marro, Davide Crapis

机构 * Columbia University(哥伦比亚大学) dAI Team, Ethereum Foundation(dAI团队,以太坊基金会) University of Oxford(牛津大学)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本文提出基于利润的红队测试方法,通过学习对手最大化利润来压力测试代理,发现传统静态基线在利润优化压力下易受攻击,且学习对手能自主发现 probing、anchoring 和 deceptive commitments 策略。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2603.21642 2026-03-24 cs.CR cs.SE 78%

Are AI-assisted Development Tools Immune to Prompt Injection?

基于提示注入的AI辅助开发工具是否具有免疫力?

Charoes Huang, Xin Huang, Amin Milani Fard

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文研究了基于MCP协议的AI辅助开发工具在提示注入攻击下的安全性,分析了七种常用工具的检测与缓解机制,揭示了其在安全特性上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05244 2026-03-24 cs.CR 78%

Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks?

间接提示注入:防火墙足够吗,还是需要更强的基准?

Rishika Bhagwatkar, Kevin Kasa, Abhay Puri, Gabriel Huang, Irina Rish, Graham W. Taylor, Krishnamurthy Dj Dvijotham, Alexandre Lacoste

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出一种简单高效的防御机制,通过防火墙在代理-工具接口实现高安全性和实用性,同时指出现有基准的不足,并提出改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏