arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 136 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2603.14825 2026-03-17 cs.CV cs.AI 83%

Two Birds, One Projection: Harmonizing Safety and Utility in LVLMs via Inference-time Feature Projection

双鸟归一投影:通过推理时特征投影在LVLMs中调和安全与效用

Yewon Han, Yumin Seol, EunGyung Kong, Minsoo Jo, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Mobilint

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文探讨了安全与效用在LVLMs中的对抗性,提出通过推理时投影消除模态偏差方向以提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23404 2026-03-17 cs.CL 83%

AJF: Adaptive Jailbreak Framework Based on the Comprehension Ability of Black-Box Large Language Models

AJF:基于黑盒大语言模型理解能力的自适应突破框架

Mingyu Yu, Wei Wang, Yanjie Wei, Sujuan Qin, Fei Gao, Wenmin Li

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);分类 cs.CL

AI总结 本文提出AJF框架,通过分析目标LLM的理解能力,针对不同类型的LLM采用不同的突破策略,实验显示在GPT-4o和GPT-4.1上攻击成功率分别达到98.9%和99.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15259 2026-03-17 cs.LG cs.AI cs.CL cs.CR 80%

Directional Embedding Smoothing for Robust Vision Language Models

方向嵌入平滑用于鲁棒视觉语言模型

Ye Wang, Jing Liu, Toshiaki Koike-Akino

机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过方向嵌入平滑技术提升视觉语言模型的鲁棒性,针对多模态劫持攻击,验证了方向嵌入噪声在降低攻击成功率中的有效性。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14860 2026-03-17 cs.CR cs.AI 70%

Architecture-Agnostic Feature Synergy for Universal Defense Against Heterogeneous Generative Threats

面向异质生成威胁的通用特征协同架构

Bingxue Zhang, Yang Gao, Feida Zhu, Yanyan Shen, Yang Shi

机构 * University of Shanghai for Science and Technology(上海理工大学) Singapore Management University(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出ATFS框架,通过目标引导图像实现多模型防御的统一特征空间对齐,有效解决异质生成威胁下的防御问题,实验显示其在扩散模型+GAN场景中达到SOTA性能。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14278 2026-03-17 cs.CR 67%

Activation Surgery: Jailbreaking White-box LLMs without Touching the Prompt

激活手术:无需修改提示的白盒LLM劫持

Maël Jenny, Jérémie Dentan, Sonia Vanier, Michaël Krajecki

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 本文提出通过直接操控模型内部激活来改变生成轨迹,揭示拒绝产生的位置与机制,并抑制安全机制,探讨开放权重模型的安全影响。

Comments To appear in Proceedings of ESORICS 2026 (Springer LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 提示注入 1 篇

2603.13424 2026-03-17 cs.CR cs.AI 79%

Agent Privilege Separation in OpenClaw: A Structural Defense Against Prompt Injection

OpenClaw中代理特权分离:一种对抗提示注入的结构性防御

Darren Cheng, Wen-Kwang Tsao

机构 * TrendAI Lab(TrendAI实验室)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文提出通过代理隔离和JSON格式化相结合的结构化防御机制,有效阻止提示注入攻击,在OpenClaw平台上实现零攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 9 篇

2603.13255 2026-03-17 cs.CY cs.AI 88%

The Ghost in the Grammar: Methodological Anthropomorphism in AI Safety Evaluations

语法中的幽灵:人工智能安全评估中的方法论人类学

Mariana Lins Costa

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过分析近期技术报告,探讨人工智能安全领域中对AI系统投射意图、人格等属性的隐性人类学倾向,质疑其对安全评估方法论的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15397 2026-03-17 cs.CR cs.AI 85%

SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration

SFCoT:通过主动安全评估和校准实现更安全的推理链

Yu Pan, Wenlong Yu, Tiejun Wu, Xiaohu Ye, Qiannan Si, Guangquan Xu, Bin Wu

机构 * Department College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) NSFOCUS Technologies Group Co., Ltd.(NSFOCUS技术集团有限公司) College of Management and Economics(管理与经济学院) School of Cyber Security(网络安全学院)

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出SFCoT框架,通过实时评估和校准潜在不安全的推理步骤,有效降低对抗攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11248 2026-03-17 cs.LG cs.CL 62%

Reasoning-Grounded Natural Language Explanations for Language Models

基于推理的自然语言解释方法用于语言模型

Vojtech Cahlik, Rodrigo Alves, Pavel Kordik

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。

Comments (v2) Added acknowledgements section

Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13676 2026-03-17 cs.AI 57%

TheraAgent: Multi-Agent Framework with Self-Evolving Memory and Evidence-Calibrated Reasoning for PET Theranostics

TheraAgent:具有自我进化记忆和证据校准推理的多智能体框架用于PET治疗诊断

Zhihao Chen, Jiahui Wang, Yizhou Chen, Xiaozhong Ji, Xiaobin Hu, Jimin Hong, Wolfram Andreas Bosbach, Axel Rominger, Ali Afshar-Oromieh, Hongming Shan, Kuangyu Shi

机构 * Fudan University(复旦大学) University of Bern(伯尔尼大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 TheraAgent通过自我进化记忆和证据校准推理,解决PET治疗诊断中数据稀缺、信息异构和证据推理的问题,实现75.7%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13374 2026-03-17 cs.CV cs.AI 57%

Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection

基于几何的语义推理用于无训练视频异常检测

Ali Zia, Usman Ali, Muhammad Umer Ramzan, Hamza Abid, Abdul Rehman, Wei Xiang

机构 * School of Computing, Engineering \& Mathematical Sciences, La Trobe University, Melbourne, Australia School of Engineering Applied Sciences, GIFT University, Gujranwala 52250, Pakistan

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出MM-VAD框架,通过将异常检测转为适应性测试时推理,利用双曲空间保留层次结构,并结合可学习提示和Mahalanobis细化提升性能,实现在多个基准上优于现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13324 2026-03-17 cs.LG 57%

The Challenge of Out-Of-Distribution Detection in Motor Imagery BCIs

运动想象脑机接口中分布外检测的挑战

Merlijn Quincent Mulder, Matias Valdenegro-Toro, Andreea Ioana Sburlea, Ivo Pascal de Jong

机构 * Department of Artificial Intelligence, University of Groningen(格罗宁根大学人工智能系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文研究了运动想象脑机接口中分布外检测的挑战,通过训练模型并观察对未知类别的检测能力,发现高不确定性影响检测效果,MC Dropout表现最佳,高分类准确率可提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26234 2026-03-17 cs.LG cs.SY eess.SY 57%

Machine Learning Detection of Lithium Plating in Lithium-ion Cells: A Gaussian Process Approach

基于高斯过程的锂离子电池锂沉积检测:一种机器学习方法

Ayush Patnaik, Jackson Fogelquist, Adam B Zufall, Yiwei Ji, Stephen K Robinson, Peng Bai, Xinfan Lin

机构 * Department of Mechanical and Aerospace Engineering, University of California, Davis(加州大学戴维斯分校机械与航空航天工程系) Department of Energy, Environmental & Chemical Engineering and the Institute of Materials Science and Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校能源、环境与化学工程系及材料科学与工程学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出基于高斯过程的锂沉积检测方法,通过直接建模充放电电压关系Q(V)作为随机过程,实现鲁棒检测,具有噪声感知推理、闭式导数和可扩展性等优势。

Comments Accepted for presentation at American Control Conference 2026 - ACC 2026 to be held in New Orleans, Louisiana

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15557 2026-03-17 cs.CV 50%

Anatomy of a Lie: A Multi-Stage Diagnostic Framework for Tracing Hallucinations in Vision-Language Models

Lie的解剖:一种多阶段诊断框架,用于追踪视觉-语言模型中的幻觉

Lexiang Xiong, Qi Li, Jingwen Ye, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) Monash University(墨尔本大学)

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本文提出一种多阶段诊断框架,通过动态认知轨迹分析视觉-语言模型中的幻觉问题,结合几何信息双重视角,实现高效且鲁棒的幻觉检测,提升模型透明度和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16443 2026-03-17 cs.CV 50%

VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences

VGGT-Long:分块、循环、对齐——在千米级长RGB序列上推动VGGT的极限

Kai Deng, Zexin Ti, Jiawei Xu, Jian Yang, Jin Xie

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出VGGT-Long,通过分块处理、重叠对齐和轻量循环闭合优化,解决现有模型的可扩展性瓶颈,实现千米级户外环境的单目3D重建。

Comments IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 隐私与版权 4 篇

2503.05954 2026-03-17 cs.LG 79%

A Survey on Deep Learning Approaches for Tabular Data Generation: Utility, Alignment, Fidelity, Privacy, Diversity, and Beyond

关于表格数据生成的深度学习方法的综述:效用、对齐、保真度、隐私、多样性及其他

Mihaela Cătălina Stoian, Eleonora Giunchiglia, Thomas Lukasiewicz

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG

AI总结 本文综述了表格数据生成的深度学习方法,从效用、对齐、保真度、隐私、多样性等方面探讨不同需求下的生成方法,并讨论评估方法和未来发展方向。

Comments Accepted to Transactions on Machine Learning Research (02/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14265 2026-03-17 cs.CL cs.MA 70%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR 70%

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09775 2026-03-17 cs.CR cs.AI cs.IT cs.LG cs.NI math.IT 62%

Privacy-Preserving Explainable AIoT Application via SHAP Entropy Regularization

通过SHAP熵正则化实现隐私保护的可解释AIoT应用

Dilli Prasad Sharma, Xiaowei Sun, Liang Xue, Xiaodong Lin, Pulei Xiong

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于SHAP熵正则化的隐私保护方法,通过惩罚低熵的SHAP属性分布,减少可解释AIoT中的隐私泄露,同时保持高预测准确性和解释忠实性。

Journal ref 2025 IEEE Annual Congress on Artificial Intelligence of Things (AIoT)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 49 篇

2602.16931 2026-03-17 cs.AI 88%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06594 2026-03-17 cs.CL cs.AI 84%

A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness

安全性的硬币翻转:LLM裁判无法可靠地衡量对抗鲁棒性

Leo Schwinn, Moritz Ladenburger, Tim Beyer, Mehrnaz Mofakhami, Gauthier Gidel, Stephan Günnemann

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有LLM裁判框架在评估对抗鲁棒性时存在分布偏移问题,提出ReliableBench和JudgeStressTest以提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13292 2026-03-17 cs.LG cs.AI 84%

Pragma-VL: Towards a Pragmatic Arbitration of Safety and Helpfulness in MLLMs

Pragma-VL:迈向多模态大语言模型中安全与助人的务实仲裁

Ming Wen, Kun Yang, Xin Chen, Jingyu Zhang, Dingding Han, Shiwen Cui, Yuedong Xu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) UCLA(加州大学洛杉矶分校) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 Pragma-VL通过引入一种端到端的对齐算法,解决了多模态大语言模型在安全与助人之间的平衡问题,通过增强视觉风险感知和理论保证的奖励模型,在多数多模态安全基准上提升了性能。

Comments 31 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16643 2026-03-17 cs.CV cs.AI 83%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08009 2026-03-17 cs.CY cs.AI 81%

The Law-Following AI Framework: Legal Foundations and Technical Constraints. Legal Analogues for AI Actorship and technical feasibility of Law Alignment

遵循法律的AI框架:法律基础与技术限制。AI行为者的法律类比和技术可行性

Katalina Hernandez Delgado

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文评估了O'Keefe等人提出的

Comments Presented at SMU Computational Legal Studies Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13558 2026-03-17 stat.ML cs.CL cs.IT cs.LG math.IT 81%

Holographic Invariant Storage: Design-Time Safety Contracts via Vector Symbolic Architectures

全息不变存储:通过向量符号架构实现设计时的安全合同

Arsenios Scrivens

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出全息不变存储协议,通过整合双极向量符号架构的特性,为LLM上下文漂移缓解提供设计时的安全合同,提供三种可预估的保障,提升系统工程师在设计阶段的恢复保真度和代码本容量预算能力。

Comments 25 pages, 7 figures, includes appendices with extended proofs and pilot LLM experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13305 2026-03-17 cs.LG cs.AI 81%

Evidence-based Distributional Alignment for Large Language Models

基于证据的分布对齐用于大语言模型

Viet-Thanh Pham, Lizhen Qu, Zhuang Li, Gholamreza Haffari

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Evi-DA方法,通过检索世界价值观调查数据预测国家条件下的答案分布,提升大语言模型在领域和文化变化下的分布估计精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13286 2026-03-17 cs.CY cs.AI 81%

How Meta-research Can Pave the Road Towards Trustworthy AI In Healthcare: Catalogue of Ideas and Roadmap for Future Research

元研究如何推动可信AI在医疗领域的发展:想法目录与未来研究路线图

Valerie Bürger, Marlie Besouw, Jana Fehr, Riana Minocher, Emma Moorhead, Isabel Velarde, Louis Agha-Mir-Salim, Julia Amann, Alexandra Bannach-Brown, David B. Blumenthal, Kaitlyn Hair, Bert Heinrichs, Moritz Herrmann, Elizabeth Hofvenschiöld, Sune Holm, Anne A. H. de Hond, Sara Kijewski, Stuart McLennan, Timo Minssen, Marco S. Nobile, Nico Pfeifer, Jessica L. Rohmann, Tony Ross-Hellauer, Marija Slavkovik, Karin Tafur, Eleonora Viganò, Magnus Westerlund, Tracey Weissgerber, Vince I. Madai

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过跨学科研讨会探讨AI伦理原则在医疗领域实践中的挑战,提出元研究对提升AI鲁棒性、可重复性及透明度等关键问题的贡献,并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 79%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13247 2026-03-17 cs.AI cs.CR 79%

ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems

ILION:用于代理AI系统的确定性预执行安全闸门

Florin Adrian Chitan

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ILION通过五层架构实现代理AI系统的安全控制,无需训练数据和API依赖,达到高精度和低延迟的判定效果。

Comments 16 pages, 7 tables, 7 figures. Benchmark and code available at https://github.com/Athonitul/ilion-framework-simulator. Patent application A/00052, OSIM Romania

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17646 2026-03-17 cs.LG 70%

Unveiling the Basin-Like Loss Landscape in Large Language Models

揭示大语言模型中的盆地状损失景观

Huanran Chen, Yinpeng Dong, Zeming Wei, Yao Huang, Yichi Zhang, Hang Su, Jun Zhu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 研究发现大语言模型的损失景观中出现盆地结构,随着模型规模增大,模型对参数空间扰动的鲁棒性增强,但最坏方向的损失景观尖锐且有害,对抗性微调会快速降低模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏