arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-13 至 2026-05-13 共收录 102 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2605.10998 2026-05-13 cs.CR cs.AI 92%

Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs

少样本真正无害的DPO攻击用于对抗LLMs

Sangyeon Yoon, Wonje Jeung, Yoonjun Cho, Dongjae Jeon, Albert No

机构 * Yonsei University(延世大学)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究提出一种利用10对无害偏好对的真正无害DPO攻击,通过优化模型偏好来减少拒绝行为,从而在对抗LLMs时取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07892 2026-05-13 cs.LG cs.CL 91%

Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection

安全对齐作为持续学习:通过正交梯度投影缓解对齐税

Guanglong Sun, Siyuan Zhang, Liyuan Wang, Jun Zhu, Hang Su, Yi Zhong

机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research(生命科学学院,IDG/麦戈文脑科学研究所) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center(计算机科学与技术系,人工智能研究所,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心) Tsinghua University, Beijing, China(清华大学,北京,中国)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文通过持续学习视角研究安全对齐与通用能力退化之间的权衡,提出OGPSA方法通过正交梯度投影提升安全性和实用性,实验显示在不同训练流程中显著改善安全-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12339 2026-05-13 cs.LG cs.AI 88%

BSO: Safety Alignment Is Density Ratio Matching

BSO:安全对齐是密度比匹配

Tien-Phat Nguyen, Truong Nguyen, Thin Nguyen, Duy Minh Ho Nguyen, Ngoc-Thanh Dinh, Trung Le

机构 * Hanoi University of Science and Technology(河内科学技术大学) Deakin University(德金大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校) VinUniversity(文大学) Monash University(墨尔本大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出BSO方法,通过密度比匹配实现安全对齐,简化了安全对齐流程,无需辅助模型,且能提升安全与有用性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11217 2026-05-13 cs.LG cs.AI cs.CR 84%

Leveraging RAG for Training-Free Alignment of LLMs

利用RAG实现无需训练的LLM对齐

John T. Halloran

机构 * Leidos(莱迪奥斯公司)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAG-Pref算法,通过对比信息提升对抗攻击拒绝能力,相比其他方法在五种主流LLM上提升3.7倍,同时保持计算效率。

Comments 19 pages, 4 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11483 2026-05-13 cs.CL 79%

StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models

StoicLLM:在小型语言模型中通过偏好优化实现哲学对齐

Ishmam Khan, Sindhuja Thogarrati, Shuo Zhang

机构 * Tufts University(塔夫茨大学) Bose Corporation(博世公司)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 研究通过偏好优化方法对小型语言模型进行微数据集训练,实现对斯多葛主义内在美德的强对齐,但发现模型在处理斯多葛主义外在义务时存在代表性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11662 2026-05-13 cs.IR 78%

HSUGA: LLM-Enhanced Recommendation with Hierarchical Semantic Understanding and Group-Aware Alignment

HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐

Guorui Li, Dugang Liu, Lei Li, Xing Tang, Zhong Ming

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12406 2026-05-13 cs.AI 77%

Semantic Reward Collapse and the Preservation of Epistemic Integrity in Adaptive AI Systems

语义奖励崩溃与自适应AI系统中知识完整性保护

William Parris

机构 * BDB Labs / BagelTech(BDB实验室/BagelTech)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI

AI总结 研究探讨了自适应AI系统中语义奖励崩溃问题,指出其导致知识完整性受损,并提出宪法奖励分层框架以保护不同知识属性。

Comments 15 pages including references. Position and framework paper. Companion empirical work available at arXiv:2604.17587

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2605.11882 2026-05-13 cs.AI 88%

On-Policy Self-Evolution via Failure Trajectories for Agentic Safety Alignment

通过失败轨迹实现的在线自我进化以实现代理安全对齐

Bo Yin, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11716 2026-05-13 cs.AI 81%

SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

SafeSteer: 多模态大语言模型中的解码级防御机制

Xinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Chongqing University(重庆大学) Wuhan University(武汉大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);harmlessness(abstract)

AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08813 2026-05-13 cs.LG 77%

Robust Policy Optimization to Prevent Catastrophic Forgetting

鲁棒策略优化以防止灾难性遗忘

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

专题命中 安全训练 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG

AI总结 本文提出FRPO框架,通过优化当前策略及下游适应可达的KL限制邻域内策略,提升鲁棒性,减少安全性能退化,同时保持下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05630 2026-05-13 cs.CL cs.AI cs.CR 73%

One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue

一念之差:多轮对话中针对隐藏恶意意图的响应感知防御

Xinjie Shen, Rongzhe Wei, Peizhi Niu, Haoyu Wang, Ruihan Wu, Eli Chien, Bo Li, Pin-Yu Chen, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UCSD(加州大学圣地亚哥分校) National Taiwan University(台湾大学) IBM Research(IBM研究院) Virtue AI

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TurnGate,通过检测最早使交互达到有害行为阈值的轮次,提升多轮对话中恶意意图检测效果,同时保持低拒绝率。

Comments Project Website: https://turn-gate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11036 2026-05-13 cs.CR cs.AI 57%

Sequential Behavioral Watermarking for LLM Agents

序列行为水印用于LLM代理

Hyeseon An, Shinwoo Park, Dongsu Kim, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出SeqWM,通过在历史条件下的转移模式中嵌入信号,实现对代理轨迹的无位置验证,提升水印鲁棒性与检测可靠性。

Comments 17 pages, 3 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10956 2026-05-13 cs.SE cs.AI 57%

Project-Level C-to-Rust Translation via Pointer Knowledge Graphs

基于指针知识图谱的项目级C到Rust翻译

Zhiqiang Yuan, Wenjun Mao, Zhuo Chen, Xiyue Shang, Chong Wang, Yiling Lou, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于指针知识图谱的项目级C到Rust翻译方法PtrTrans,通过增强代码依赖图的指针语义,提升生成Rust代码的安全性和正确性,实验表明其在安全性与功能性上均优于现有方法。

Comments Accepted by FSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12251 2026-05-13 cs.GT 50%

Social Welfare under Heterogeneous Time Preferences

社会福利在异质时间偏好下的研究

Sarvin Bahmani, Soumyajit Paul, Sven Schewe, Shadi Tasdighi Kalat, Ashutosh Trivedi

专题命中 安全训练 :alignment(abstract)

AI总结 本文研究了在异质时间偏好下,如何通过社会福利最大化来制定最优策略,展示了即使所有主体获得相同奖励,最优策略也不再是位置性的,但策略结构仍保持简单。

Comments 14 pages including appendices, Accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17510 2026-05-13 cs.RO 50%

Interpreting Context-Aware Human Preferences for Multi-Objective Robot Navigation

解释情境感知的人类偏好以实现多目标机器人导航

Tharun Sethuraman, Subham Agrawal, Nils Dengler, Jorge de Heuvel, Teena Hassan, Maren Bennewitz

机构 * Hochschule Bonn-Rhein-Sieg, Germany(波恩-莱茵-锡格应用科学大学,德国) University of Bonn, Germany(波恩大学,德国) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种结合基础模型与多目标强化学习政策的框架,使机器人能理解并应用情境依赖的导航偏好,提升在共享人类环境中的适应性、透明性和可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 12 篇

2605.11002 2026-05-13 cs.CR cs.AI 89%

MT-JailBench: A Modular Benchmark for Understanding Multi-Turn Jailbreak Attacks

MT-JailBench: 一个多模块的多轮 jailbreak 攻击评估基准

Xinkai Zhang, Zhipeng Wei, Huanli Gong, Jing Ting Zheng, Yuchen Zhang, Yue Dong, N. Benjamin Erichson

机构 * International Computer Science Institute(国际计算机科学研究所) Berkeley Lab(伯克利实验室)

专题命中 越狱攻击 :jailbreak(title,title_cn);分类 cs.AI

AI总结 本文提出 MT-JailBench,一个用于评估多轮 jailbreak 攻击的模块化框架,揭示了资源预算和评估函数对攻击效果的影响,发现提示生成是性能变化的主要因素,而动态策略生成并非必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02280 2026-05-13 cs.SE cs.AI cs.CL cs.CR cs.LG 85%

RACC: Representation-Aware Coverage Criteria for LLM Safety Testing

RACC:面向LLM安全测试的表示感知覆盖标准

Zeming Wei, Zhixin Zhang, Chengcan Wu, Yihao Zhang, Xiaokun Luan, Meng Sun

机构 * Peking University(北京大学)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RACC,一种专为LLM安全测试设计的覆盖标准,通过提取安全表示并评估测试提示的激活情况,有效提升测试套件质量,同时对冗余输入不敏感,适用于大规模神经网络的安全测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13420 2026-05-13 cs.CR cs.AI 79%

Accelerating Suffix Jailbreak attacks with Prefix-Shared KV-cache

通过前缀共享KV缓存加速后缀劫持攻击

Xinhai Wang, Shaopeng Fu, Shu Yang, Liangyu Wang, Tianhang Zheng, Di Wang

机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI

AI总结 本文提出PSKV技术,通过共享前缀KV缓存减少后缀劫持攻击的计算开销,实验表明在五种广泛部署的LLM上,PSKV将推理时间减少40%,峰值内存使用减少50%。

Comments 27 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11003 2026-05-13 cs.CR cs.AI 79%

The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents

授权-执行间隙是开放世界智能体中的主要安全和安全问题

Baoyuan Wu, Qingshan Liu, Adel Bibi, Irwin King, Siwei Lyu

机构 * Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) Nanjing University of Posts and Telecommunications, China(南京邮电大学) University of Oxford, UK(牛津大学) Chinese University of Hong Kong, China(香港中文大学) State University of New York at Buffalo, USA(纽约州立大学布法罗分校)

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 本文指出开放世界智能体中授权-执行间隙(AEG)是安全和安全的关键问题,其源于授权意图与实际执行的差异,需通过源导向的诊断和防御来解决,强调执行中需进行授权完整性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12290 2026-05-13 cs.LG 77%

Targeted Neuron Modulation via Contrastive Pair Search

通过对比对偶搜索进行定向神经元调节

Sam Herring, Jake Naviasky, Karan Malhotra

机构 * Nous Research(Nous研究)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 研究通过对比神经元属性识别有害与良性提示的区分神经元,实现无梯度的神经元干预,有效降低拒绝率并保持输出流畅性,展示了神经层面干预在行为引导中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12128 2026-05-13 cs.CL cs.CY 73%

Metaphor Is Not All Attention Needs

隐喻并非注意力所需全部

Olga Sorokoletova, Francesco Giarrusso, Giacomo De Luca, Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Marcello Galisai, Vincenzo Suriani, Daniele Nardi

机构 * Sapienza University of Rome Department of Computer, Control and Management Engineering(罗马大学Sapienza计算机、控制与管理工程系) DEXAI – Icaro Lab(DEXAI – Icaro实验室) University of Rome Tor Vergata(罗马大学Tor Vergata) Sant’Anna School of Advanced Studies(Sant’Anna高级研究学校)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.CY

AI总结 本文研究文学式绕过策略为何有效,发现其效果源于风格不规则性而非对文学格式的识别失败,表明安全机制需考虑风格变化对模型行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11442 2026-05-13 cs.CR cs.AI cs.CL 73%

Can a Single Message Paralyze the AI Infrastructure? The Rise of AbO-DDoS Attacks through Targeted Mobius Injection

单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起

Zi Liang, Ronghua Li, Yanyun Wang, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) HKUST (GZ)(香港科技大学(广州))

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11730 2026-05-13 cs.LG cs.CR 70%

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

基于身份的对抗提示:多身份红队测试用于对抗发现与缓解

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

机构 * IBM Research(IBM研究院) Trinity College Dublin(都柏林大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出PCAP方法,通过多身份对抗搜索发现真实攻击场景,提升模型鲁棒性,生成多样化防御数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16769 2026-05-13 cs.LG cs.CL cs.CR cs.CV 62%

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

通过上下文经验回放和语义保留提示重写对文本到图像模型进行红队测试

Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) IBM Research(IBM 研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出ICER框架,通过提示重写和上下文经验回放生成流畅的对抗性提示,有效提升图像生成模型的安全性测试能力,实验表明其在多个安全机制上优于现有方法。

Comments The source code is available at https://github.com/zhiyichin/ICER

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11770 2026-05-13 cs.CR cs.AI cs.SY eess.SY 57%

Behavioral Integrity Verification for AI Agent Skills

AI代理技能的行为完整性验证

Yuhao Wu, Tung-Ling Li, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出行为完整性验证(BIV)方法,通过类型集比较验证AI代理技能声明与实际能力的一致性,发现80%的技能存在描述与实现差距,并在恶意技能检测中取得高F1值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11029 2026-05-13 cs.CR cs.AI 57%

FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments

FragBench:隐藏在看似无害片段中的跨会话攻击

Astha Mehta, Niruthiha Selvanayagam, Cedric Lam, Hengxu Li, Phuc-Nguyen Nguyen, Raymond Lee, Olivia McGoffin, My, Luong, Arthur Collé, Jamie Johnson, David Williams-King, Linh Le

机构 * New York University(纽约大学) Tufts University(塔夫茨大学) Distributed Systems(分布式系统) ERA(欧洲研究联盟) Lida Safety(Lida安全) Mila

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 FragBench通过24个真实网络攻击案例构建,评估LLM跨会话攻击检测,采用对抗重写和图基检测方法,实现事件级F1分数达0.88-0.96。

Comments preprint of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11514 2026-05-13 cs.CR 50%

FlowSteer: Prompt-Only Workflow Steering Exposes Planning-Time Vulnerabilities in Multi-Agent LLM Systems

FlowSteer:仅凭提示的流程引导揭示多智能体LLM系统的规划时间漏洞

Fanxiao Li, Jiaying Wu, Tingchao Fu, Natasha Jaques, Wei Zhou, Min-Yen Kan

专题命中 越狱攻击 :safety(abstract)

AI总结 研究通过社会影响探测工作流识别高影响子任务,揭示恶意信号传播漏洞,提出FlowSteer攻击方法提升恶意成功率,并引入FlowGuard防御机制降低攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 6 篇

2605.11868 2026-05-13 cs.CR cs.AI 79%

IPI-proxy: An Intercepting Proxy for Red-Teaming Web-Browsing AI Agents Against Indirect Prompt Injection

IPI-proxy:一种用于对抗间接提示注入的拦截代理

Chia-Pei, Chen, Kentaroh Toyoda, Anita Lai, Alex Leung

机构 * Vulcan Research, AIFT(火山研究,AIFT)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出IPI-proxy,一种开源工具,用于针对间接提示注入攻击的网络浏览AI代理进行红队测试。通过拦截代理重写白名单域的HTTP响应,嵌入攻击负载,支持多种嵌入技术与插入点,实现参数扫描评估。

Comments code: https://github.com/VulcanLab/IPI-Proxy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11516 2026-05-13 cs.NI 67%

Agents Should Replace Narrow Predictive AI as the Orchestrator in 6G AI-RAN

智能体应取代窄预测AI作为6G AI-RAN的协调者

Pranshav Gajjar, Vijay K Shah

专题命中 提示注入 :alignment(abstract);prompt injection(abstract)

AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11039 2026-05-13 cs.CR cs.AI 57%

The Granularity Mismatch in Agent Security: Argument-Level Provenance Solves Enforcement and Isolates the LLM Reasoning Bottleneck

代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈

Linfeng Fan, Ziwei Li, Yuan Tian, Yichen Wang, Rongsheng Li, Xiong Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) Dongbei University of Finance and Economics(东北财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏