arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-15 至 2026-04-15 共收录 76 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 3 篇

2604.12168 2026-04-15 cs.CR cs.AI 57%

Fully Homomorphic Encryption on Llama 3 model for privacy preserving LLM inference

在Llama 3模型上实现全同态加密以实现隐私保护的LLM推理

Anes Abdennebi, Nadjia Kara, Laaziz Lahlou

专题命中 隐私与版权 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过在Llama 3模型推理管道中集成基于后量子密码学的格基同态加密,提高模型对数据隐私攻击的防护能力,实验显示在i9 CPU上实现98%的文本生成准确率和237 ms的延迟,验证了方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12127 2026-04-15 cs.NI 50%

BLAST: Blockchain-based LLM-powered Agentic Spectrum Trading

BLAST:基于区块链的大型语言模型驱动的代理频谱交易

Anas Abognah, Otman Basir

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 本文提出BLAST框架,结合大型语言模型代理与许可区块链,实现自主、隐私和安全的频谱交易生态系统。通过三种拍卖机制评估,证明第二价格拍卖在提升社会福利和分配效率方面最优,同时验证了隐私保护机制。

Comments This work has been submitted to the IEEE Transactions on Cognitive Communications and Networking for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全评测 17 篇

2604.12875 2026-04-15 cs.AI 88%

AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance

AISafetyBenchExplorer:一个基于指标的AI安全基准目录揭示了测量碎片化和弱基准治理

Abiodun A. Solanke

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本文提出AISafetyBenchExplorer,通过多表结构记录195个AI安全基准的元数据、指标定义等,揭示当前基准体系中测量标准化滞后于基准繁衍的问题,强调碎片化而非稀缺性是领域的主要失败模式。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11120 2026-04-15 cs.AI 83%

Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs

不受欢迎的人:针对具有人格特征的LLM,单一方法的安全性评估是不完整的

Wenkai Li, Fan Yang, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文指出,针对具有人格特征的LLM,仅通过提示进行的安全性评估不完整,因为提示和激活引导暴露了不同的、依赖于架构的漏洞特征。研究显示,激活引导的漏洞无法通过提示侧排名预测,且在不同架构模型中表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12216 2026-04-15 cs.CR cs.CL 79%

TimeMark: A Trustworthy Time Watermarking Framework for Exact Generation-Time Recovery from AIGC

TimeMark: 一种用于从AIGC中精确生成时间恢复的可信时间水印框架

Shangkun Che, Silin Du, Ge Gao

机构 * Economics and Management School, Wuhan University(武汉大学经济管理学院) School of Economics and Management, Tsinghua University(清华大学经济管理学院) School of Business Administration, Southwestern University of Finance and Economics(西南财经大学商学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 本文提出TimeMark框架,通过加密技术和监管监督下的时间依赖秘密密钥,实现100%准确的生成时间恢复,防止任意时间戳伪造,解决现有水印技术的可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12411 2026-04-15 cs.CV 78%

DeferredSeg: A Multi-Expert Deferral Framework for Trustworthy Medical Image Segmentation

DeferredSeg: 一种多专家延迟框架用于可信的医学图像分割

Qiuyu Tian, Haoliang Sun, Yunshan Wang, Yinghuan Shi, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Department of Clinical Laboratory, Shandong Provincial Hospital Affiliated to Shandong First Medical University(山东第一医科大学附属山东省人民医院临床检验科) School of Computer Science and Technology, Nanjing University(南京大学计算机科学与技术学院)

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 DeferredSeg通过引入延迟感知分割框架,在医学图像分割中实现人机协作,通过动态路由和损失函数提升分割可靠性,优于基线方法。

Comments 27 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11868 2026-04-15 cs.CV 67%

MedConcept: Unsupervised Concept Discovery for Interpretability in Medical VLMs

MedConcept: 医学视觉语言模型中的无监督概念发现以实现可解释性

Md Rakibul Haque, KM Arefeen Sultan, Tushar Kataria, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah Scientific Computing(犹他大学计算学校科学计算) Imaging Institute, University of Utah(犹他大学影像研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract)

AI总结 MedConcept通过无监督方法发现医学VLMs中的潜在概念,并利用临床可验证的文本语义进行解释,提供定量评估协议和三个概念评分以评估模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07178 2026-04-15 cs.AI cs.HC cs.LG 62%

ContextualSHAP : Enhancing SHAP Explanations Through Contextual Language Generation

ContextualSHAP:通过上下文语言生成增强SHAP解释

Latifa Dwiyanti, Sergio Ryan Wibisono, Hidetaka Nambo

机构 * Kanazawa University(金泽大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合大语言模型生成上下文解释的ContextualSHAP,提升SHAP解释的可理解性与实用性,通过医疗案例验证其有效性。

Comments This paper was accepted and presented at the 7th World Symposium on Software Engineering (WSSE) 2025 on 25 October 2025 in Okayama, Japan, and is currently awaiting publication

Journal ref WSSE '25: Proceedings of the 2025 7th World Symposium on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05795 2026-04-15 cs.CL 57%

Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health Conversation

衡量重要性!!评估心理健康对话中的治疗原则

Abdullah Mazhar, Het Riteshkumar Shah, Aseem Srivastava, Smriti Joshi, Md Shad Akhtar

机构 * IIIT Delhi(印度德里理工学院) MBZUAI(马尔科姆·比尔人工智能研究所) Wysa

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出CARE框架,通过多阶段方法评估AI生成的治疗回应是否符合临床标准,实验显示其在F-1分数上优于基线模型,展示了结构化推理和上下文建模的重要性。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12282 2026-04-15 cs.CL 57%

Towards Robust Real-World Spreadsheet Understanding with Multi-Agent Multi-Format Reasoning

面向多代理多格式推理的鲁棒现实世界电子表格理解

Houxing Ren, Mingjie Zhan, Zimu Lu, Ke Wang, Yunqiao Yang, Haotian Hou, Hongsheng Li

机构 * CUHK MMLab(CUHK多模态实验室) SenseTime Research(商汤科技研究院) Shenzhen Loop Area Institute(深圳河套学院) CPII under InnoHK(创新香港下的CPII)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出SpreadsheetAgent框架,通过多模态逐步阅读推理解决大规模电子表格处理问题,通过结构草图和行列摘要提升推理可靠性,实验表明其在Spreadsheet Bench上表现优异。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12034 2026-04-15 cs.AI 57%

Memory as Metabolism: A Design for Companion Knowledge Systems

记忆作为代谢:一种陪伴知识系统的 设计

Stefan Miteski

机构 * CODE University Berlin(CODE大学柏林)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种针对单用户知识维基的治理框架,通过五项操作处理记忆中的矛盾证据,以避免固化问题。

Comments 41 pages, 1 table. Preprint v3.642. Concept DOI: 10.5281/zenodo.19501651

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06390 2026-04-15 cs.CV cs.AI 57%

MorphDistill: Distilling Unified Morphological Knowledge from Pathology Foundation Models for Colorectal Cancer Survival Prediction

MorphDistill: 从病理基础模型中提取统一形态学知识以预测结直肠癌生存率

Hikmat Khan, Usama Sajjad, Metin N. Gurcan, Anil Parwani, Wendy L. Frankel, Wei Chen, Muhammad Khalid Khan Niazi

机构 * Department of Pathology, College of Medicine, The Ohio State University Wexner Medical Center(俄亥俄州立大学医学学院病理学系,韦克斯纳医学中心) Center for Artificial Intelligence Research, Wake Forest University School of Medicine(威克森林大学医学院人工智能研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出MorphDistill框架,通过多病理基础模型提取互补知识,构建紧凑的结直肠癌特异性编码器,提升生存预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12793 2026-04-15 cs.HC 56%

Human Agency, Causality, and the Human Computer Interface in High-Stakes Artificial Intelligence

人类代理、因果性与高风险人工智能中的人机接口

Georges Hattab

专题命中 安全评测 :trustworthy(abstract);alignment(comments)

AI总结 本文探讨高风险人工智能系统中人类代理的保护问题,提出因果代理框架以解决人机交互中的不确定性与因果控制问题。

Comments 2026 CHI Workshop on Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12833 2026-04-15 cs.CV 50%

Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks

用可部署的多模态语义照明攻击挑战视觉-语言模型

Yingying Zhao, Chengyin Hu, Qike Zhang, Xin Li, Xin Wang, Yiwei Wei, Jiujiang Guo, Jiahuan Long, Tingsong Jiang, Wen Yao

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出MSLA攻击框架,通过可控对抗性照明攻击视觉-语言模型的多模态语义理解,揭示其在现实世界中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12781 2026-04-15 cs.CV 50%

Fragile Reconstruction: Adversarial Vulnerability of Reconstruction-Based Detectors for Diffusion-Generated Images

脆弱的重建:基于重建的检测器在扩散生成图像中的对抗脆弱性

Haoyang Jiang, Mingyang Yi, Shaolei Zhang, Junxian Cai, Qingbin Liu, Xi Chen, Ju Fan

机构 * Renmin University of China(中国人民大学) Tencent Inc.(腾讯公司)

专题命中 安全评测 :safety(abstract)

AI总结 研究发现基于重建的检测器在扩散生成图像检测中存在严重对抗脆弱性,通过微小对抗扰动可使检测准确率降至近零,揭示了现有检测策略的安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12693 2026-04-15 cs.CV 50%

Risk-Calibrated Learning: Minimizing Fatal Errors in Medical AI

风险校准学习:在医学AI中最小化致命错误

Abolfazl Mohammadi-Seif, Ricardo Baeza-Yates

机构 * Department of Engineering(工程系) Universitat Pompeu Fabra(庞培乌法拉大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出风险校准学习方法,通过区分视觉模糊与结构性错误,提升医学AI的可靠性,实验表明其在多种影像模态中显著降低关键错误率。

Comments This work has been accepted for publication in the Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026). The final published version should be cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11767 2026-04-15 cs.PL cs.MA cs.SE 50%

$λ_A$: A Typed Lambda Calculus for LLM Agent Composition

$λ_A$: 一种用于LLM代理组合的类型lambda演算

Qin Liu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出$λ_A$类型lambda演算,通过引入oracle调用、有界固定点、概率选择和可变环境扩展简单类型lambda演算,证明类型安全性和终止性,并展示其在代理配置检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12403 2026-04-15 cs.CV 50%

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

双模锚引导过滤用于测试时提示微调

Jungwon Choi, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程学院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出双模锚引导框架,通过语义证据指导视图选择,结合文本和图像锚点进行过滤和集成,提升测试时提示微调的鲁棒性。

Comments Accepted by CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12048 2026-04-15 cs.SE 50%

ORBIT: Guided Agentic Orchestration for Autonomous C-to-Rust Transpilation

ORBIT: 用于自主C到Rust转换的引导代理 orchestration

Muhammad Farrukh, Baris Coskun, Tapti Palit, Michalis Polychronakis

专题命中 安全评测 :safety(abstract)

AI总结 ORBIT 提出一种自主代理框架,通过动态上下文收集和依赖引导 orchestration 实现项目级 C到Rust转换,显著提升大规模代码转换的准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. AI治理与伦理 8 篇

2604.12076 2026-04-15 cs.CL cs.AI cs.CY 82%

Narrative over Numbers: The Identifiable Victim Effect and its Amplification Under Alignment and Reasoning in Large Language Models

数字之外的叙事:可识别受害者效应及其在对齐和推理中的放大

Syed Rifat Raiyan

机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了大语言模型中可识别受害者效应的普遍存在及其受对齐训练的影响,发现指令调优模型表现出极端效应,而推理专精模型则逆转了该效应,且标准CoT提示放大了该效应。

Comments Under review, 49 pages, 20 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12851 2026-04-15 cs.CY 79%

Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment

基于人物提示的LLM能否模拟子群体价值观?对文化契合性一般性和公平性的实证分析

Bryan Chen Zhengyu Tan, Zhengyuan Liu, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Roy Ka-Wei Lee

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CY

AI总结 本文探讨LLM在细粒度价值观对齐中的挑战,通过新加坡案例研究发现,即使使用GPT-4.1等先进模型,预测子群体偏好准确率仅57.4%,但通过结构化数值偏好微调可提升17.4%,但存在预存的公平性偏见。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10200 2026-04-15 cs.AI cs.CV 70%

Edu-MMBias: A Three-Tier Multimodal Benchmark for Auditing Social Bias in Vision-Language Models under Educational Contexts

Edu-MMBias: 一种三级多模态基准,用于在教育背景下审计视觉-语言模型中的社会偏见

Ruijia Li, Mingzi Zhang, Zengyi Yu, Yuang Wei, Bo Jiang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(东华师范大学教育人工智能研究所) Faculty of Education, East China Normal University(东华师范大学教育学院)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Edu-MMBias基准,通过三级维度审计视觉-语言模型中的社会偏见,揭示模型存在补偿性类偏见和深层健康与种族刻板印象,视觉输入可触发偏见回潮。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11839 2026-04-15 cs.CR cs.AI 61%

Beyond Static Sandboxing: Learned Capability Governance for Autonomous AI Agents

超越静态沙箱:为自主AI代理的学得能力治理

Bronislav Sidik, Lior Rokach

机构 * Institute for Applied AI Research(应用人工智能研究所) Faculty of Computer and Information Science(计算机与信息科学学院) Ben-Gurion University of the Negev(贝内-约尔大学)

专题命中 AI治理与伦理 :safety(abstract,comments);分类 cs.AI

AI总结 本文提出Aethelgard框架,通过学得策略实现AI代理的最小必要能力集,解决能力过度配置问题。

Comments 17 pages (9 content pages), 2 figures, 7 tables. Submitted to NeurIPS 2026 Agent Safety Workshop. Code and dataset available at https://github.com/sidikbro/aethelgard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05972 2026-04-15 cs.CY 57%

THETA: A Textual Hybrid Embedding-based Topic Analysis Framework and AI Scientist Agent for Scalable Computational Social Science

THETA: 一种基于文本混合嵌入的主题分析框架和AI科学家代理用于可扩展的计算社会科学

Zhenke Duan, Xin Li

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 THETA通过Domain-Adaptive Fine-tuning优化语义向量结构,结合AI Scientist Agent框架实现主题分析的理论深度与数据规模的平衡,实验显示其在捕捉领域特定解释性构念方面优于传统模型。

Comments we should change the authors and some results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12133 2026-04-15 cs.AI 57%

Towards Platonic Representation for Table Reasoning: A Foundation for Permutation-Invariant Retrieval

迈向表格推理的柏拉图表示:一种排列不变检索的基础

Willy Carlos Tchuitcheu, Tan Lu, Ann Dooms

机构 * Department of Mathematics and Data Science, Vrije Universiteit Brussel (VUB)(瓦隆公国布鲁塞尔自由大学数学与数据科学系) Data Science Lab, Royal Library of Belgium (KBR)(比利时皇家图书馆数据科学实验室)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出柏拉图表示假设,主张表格推理需要内在排列不变的潜在空间,通过分析和实验揭示了现有模型在布局变化下的脆弱性,并提出结构感知的表格推理编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11934 2026-04-15 cs.CY 57%

BiasIG: Benchmarking Multi-dimensional Social Biases in Text-to-Image Models

BiasIG:评估文本到图像模型中多维社会偏见的基准测试

Hanjun Luo, Zhimu Huang, Haoyu Huang, Ziye Deng, Ruizhe Chen, Xinfeng Li, Zuozhu Liu, Hanan Salam

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文提出BiasIG基准,通过47040个提示的定制数据集量化多维社会偏见,结合社会学和机器伦理框架,揭示生成偏见的细粒度诊断方法,并验证了公平性在AIGC中的精确分类方法。

Comments Accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08740 2026-04-15 econ.TH 50%

Misspecified Model Estimation and Its Impact on Predictions

模型误设估计及其对预测的影响

Junnan He, Lin Hu, Matthew Kovach, Anqi Li

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究线性统计模型中,因变量依赖于具有固定总体系数和观察特定潜系数的自变量及测量误差。决策者估计总体系数并用于预测给定观察的潜系数。分析模型误设如何扭曲预测,探讨残差信息与误设向量与潜变量到系数映射的对齐性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他安全 19 篇

2604.12012 2026-04-15 cs.CV 78%

TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment

TIPSv2:通过增强的补丁-文本对齐推进视觉-语言预训练

Bingyi Cao, Koert Chen, Kevis-Kokitsi Maninis, Kaifeng Chen, Arjun Karpur, Ye Xia, Sahil Dua, Tanmaya Dabral, Guangxing Han, Bohyung Han, Joshua Ainslie, Alex Bewley, Mithun Jacob, René Wagner, Washington Ramos, Krzysztof Choromanski, Mojtaba Seyedhosseini, Howard Zhou, André Araujo

机构 * Google(谷歌) DeepMind(深度Mind)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出TIPSv2,通过改进的预训练方法提升视觉-语言模型的补丁-文本对齐能力,实验表明其在多种任务和数据集上表现优异。

Comments CVPR2026 camera-ready + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11964 2026-04-15 cs.HC cs.MM 78%

When Drawing Is Not Enough: Exploring Spontaneous Speech with Sketch for Intent Alignment in Multimodal LLMs

当绘画不够时:探索通过草图进行意图对齐的自发性言语在多模态大语言模型中的应用

Weiyan Shi, Dorien Herremans, Kenny Tsu Wei Choo

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文探讨了在多模态大语言模型中,通过草图与自发性言语的结合来提升设计初期意图对齐的效果,通过实验表明加入自发性言语能显著提高生成图像的意图匹配度。

Comments Accepted at DIS 2026 PWiP

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13789 2026-04-15 cs.CR cs.AI 70%

Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks

揭示并对齐异常注意力头以防御NLP后门攻击

Haotian Jin, Yang Li, Haihui Fan, Lin Shen, Xiangfang Li, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出基于注意力相似性的后门检测方法,通过检测异常注意力头相似性来防御后门攻击,结合头部微调修复污染的注意力头,有效降低攻击成功率并保持下游任务性能。

Journal ref "Proceedings of the 40th AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏