arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-06 至 2026-03-06 共收录 51 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 13 篇

2603.04968 2026-03-06 cs.CL cs.AI 84%

When Weak LLMs Speak with Confidence, Preference Alignment Gets Stronger

当弱大语言模型自信发言时,偏好对齐会变得更强大

Amirabbas Afzali, Myeongho Jeon, Maria Brbic

机构 * EPFL(苏黎世联邦理工学院) Sharif University of Technology(谢赫·穆吉加布大学)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CW-PO框架,利用弱LLM的置信度加权实现更高效的偏好对齐,仅用20%的人类标注即可超越传统方法。

Comments 32 pages, 8 figures, International Conference on Learning Representations 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04822 2026-03-06 cs.AI 83%

VISA: Value Injection via Shielded Adaptation for Personalized LLM Alignment

VISA: 通过屏蔽适应进行价值注入以实现个性化大语言模型对齐

Jiawei Chen, Tianzhuo Yang, Guoxi Zhang, Jiaming Ji, Yaodong Yang, Juntao Dai

机构 * Peking University(北京大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 VISA通过屏蔽适应机制,有效缓解大语言模型对齐税,实现精细化价值观对齐与语义完整性保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25762 2026-03-06 cs.LG 79%

OPPO: Accelerating PPO-based RLHF via Pipeline Overlap

OPPO: 通过管道重叠加速基于PPO的RLHF

Kaizhuo Yan, Yingjie Yu, Yifan Yu, Haizhong Zheng, Fan Lai

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.LG

AI总结 OPPO通过管道重叠技术提升基于PPO的RLHF训练效率,加速训练过程并提高GPU利用率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00485 2026-03-06 cs.AI 79%

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models

用偏好替代参数:异构视觉-语言模型的联邦对齐

Shule Lu, Yujing Wang, Hainan Zhang, Xiaoshan Yang, Hongwei Zheng, Yongxin Tong, Changsheng Xu, Zhiming Zheng

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出MoR框架,通过用偏好替代参数实现异构视觉-语言模型的联邦对齐,提升泛化、鲁棒性和跨客户端适应性。

Comments Due to the need for substantial revisions, the authors believe that the paper should be retracted first.A revised version may be resubmitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05293 2026-03-06 cs.LG cs.CL 73%

Knowledge Divergence and the Value of Debate for Scalable Oversight

知识分歧与辩论在可扩展监督中的价值

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 偏好对齐 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 本文通过几何方法分析辩论在可扩展监督中的价值,揭示了辩论与RLAIF之间的联系,并探讨了知识分歧对辩论效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02015 2026-03-06 cs.CV 67%

OSPO: Object-Centric Self-Improving Preference Optimization for Text-to-Image Generation

OSPO: 以对象为中心的自我改进偏好优化用于文本到图像生成

Yoonjin Oh, Yongjin Kim, Hyomin Kim, Donghwan Chi, Sungwoong Kim

机构 * Korea University(韩国大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract)

AI总结 OSPO通过自构造对象中心偏好数据和对象加权损失,提升文本到图像生成中对象级对齐和保真度,优于现有自我改进方法和专门扩散模型。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00177 2026-03-06 cs.CL cs.AI 62%

PrefDisco: Benchmarking Proactive Personalized Reasoning

PrefDisco:主动个性化推理的基准测试

Shuyue Stella Li, Avinandan Bose, Faeze Brahman, Simon Shaolei Du, Pang Wei Koh, Maryam Fazel, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能联盟)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 PrefDisco提出了一种评估方法,通过心理基础的人设将静态基准转化为互动个性化任务,定义PrefAlign作为细粒度的偏好对齐度量,揭示个性化推理需要专门开发而非自然产生。

Comments 65 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04409 2026-03-06 cs.CL cs.AI cs.HC 62%

Unpacking Human Preference for LLMs: Demographically Aware Evaluation with the HUMAINE Framework

解析人类对大语言模型的偏好:基于HUMAINE框架的民主意识评估

Nora Petrova, Andrew Gordon, Enzo Blindow

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

AI总结 HUMAINE框架通过多维、人口统计学意识的评估方法,揭示了人类对大语言模型的偏好差异,发现年龄是主要分歧轴,且不同评估维度的判别能力差异显著。

Comments Published as a conference paper at ICLR 2026. 21 pages, 11 figures. https://openreview.net/forum?id=kVaE2kYjtV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07419 2026-03-06 cs.LG cs.CV 57%

Revolutionizing Mixed Precision Quantization: Towards Training-free Automatic Proxy Discovery via Large Language Models

颠覆混合精度量化:通过大语言模型实现无训练的自动代理发现

Haidong Kang, Jun Du, Lihong Lin

机构 * School of Computer and Communication Engineering, Northeastern University(东北大学计算机与通信工程学院) School of Software Engineering, Beijing Jiaotong University(北京交通大学软件工程学院) School of Software, Northeastern University(东北大学软件学院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 本文提出TAP框架,利用大语言模型和进化搜索策略,实现无训练的自动代理发现,提升混合精度量化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22571 2026-03-06 cs.AI 57%

PerfGuard: A Performance-Aware Agent for Visual Content Generation

PerfGuard: 一种面向视觉内容生成的性能感知代理

Zhipeng Chen, Zhongrui Zhang, Chao Zhang, Yifan Xu, Lan Yang, Jun Liu, Ke Li, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Beijing Digital Native Digital City Research Center, China(北京数字原生数字城市研究中心) School of Computer Science and Engineering, Beihang University, China(北航计算机科学与工程学院) SketchX, CVSSP, University of Surrey, United Kingdom(SketchX、CVSSP、英国萨里大学) Chenxi Shuzhi (Beijing) Technology Co., Ltd, China(北京晨曦智数科技有限公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 PerfGuard通过性能感知机制提升视觉内容生成任务中工具选择的准确性与执行可靠性。

Comments This paper has been accepted by ICLR 2026. The original paper link is: https://openreview.net/pdf?id=tdN42GTv4S The code repository link is: https://github.com/FelixChan9527/PerfGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06690 2026-03-06 cs.CL 57%

Think-While-Generating: On-the-Fly Reasoning for Personalized Long-Form Generation

在生成过程中思考:面向个性化长文本生成的即兴推理

Chengbing Wang, Yang Zhang, Wenjie Wang, Xiaoyan Zhao, Fuli Feng, Xiangnan He, Tat-Seng Chua

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong(香港中文大学) National Engineering Laboratory for BITA, University of Science and Technology of China(BITA国家工程实验室,科学技术大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 FlyThinker通过在生成过程中进行动态推理,提升个性化长文本生成的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02282 2026-03-06 cs.CV cs.LG 57%

VidGuard-R1: AI-Generated Video Detection and Explanation via Reasoning MLLMs and RL

VidGuard-R1: 通过推理MLLMs和RL进行AI生成视频检测与解释

Kyoungjun Park, Yifan Yang, Juheon Yi, Shicheng Zheng, Yifei Shen, Dongqi Han, Caihua Shan, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院)

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 VidGuard-R1通过推理MLLMs和强化学习,实现AI生成视频的高准确检测与可解释性分析。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02464 2026-03-06 cs.CV 50%

SAMPO-Path: Segmentation Intent-Aligned Preference Optimization for Pathology Foundation Model Segmentation

SAMPO-Path: 分段意图对齐的偏好优化用于病理基础模型分段

Yonghuang Wu, Wenwen Zeng, Xuan Xie, Chengqian Zhao, Guoqing Wu, Jinhua Yu

机构 * School of Biomedical Engineering and Technological Innovation, Fudan university, Shanghai, China.(生物医学工程与技术创新学院,复旦大学,上海,中国)

专题命中 偏好对齐 :DPO(abstract)

AI总结 SAMPO-Path通过偏好优化框架提升病理图像分割的准确性和临床意图一致性。

Comments 15 pages, 9 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2603.04707 2026-03-06 cs.CL cs.AI 62%

Detection of Illicit Content on Online Marketplaces using Large Language Models

利用大语言模型检测在线市场上的非法内容

Quoc Khoa Tran, Thanh Thi Nguyen, Campbell Wilson

机构 * AiLECS Lab Monash University(AiLECS实验室 莫纳什大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了利用大语言模型检测在线市场非法内容的有效性,发现LLM在复杂分类任务中表现优于传统方法。

Comments Accepted for publication in the Proceedings of the 8th International Conference on Natural Language Processing (ICNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00121 2026-03-06 cs.MA 50%

Graph-theoretic Agreement Framework for Multi-agent LLM Systems

图论同意框架用于多智能体大语言模型系统

Muhammad Umar Javed

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出图论框架用于分析多智能体大语言模型中的共识稳定性,通过映射Transformer交叉熵到带符号拉普拉斯矩阵,解决不可观测死锁问题,并验证了共识定理和多项式时间算法。

Comments arXiv admin comment: This version has been removed by arXiv administrators as the submitter did not have the rights to agree to the license at the time of submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03848 2026-03-06 eess.SY cs.MA cs.RO cs.SY 50%

Dual-Interaction-Aware Cooperative Control Strategy for Alleviating Mixed Traffic Congestion

双交互感知的协同控制策略用于缓解混合交通拥堵

Zhengxuan Liu, Yuxin Cai, Yijing Wang, Xiangkun He, Chen Lv, Zhiqiang Zuo

机构 * Tianjin Key Laboratory of Intelligent Unmanned Swarm Technology and System, School of Electrical and Information Engineering, Tianjin University(天津智能无人群技术与系统重点实验室,电气与信息工程学院,天津大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(深圳高等研究院,电子科学与技术大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出双交互感知协同控制策略,通过去中心化决策模块、集中化批评者和奖励设计,提升混合交通瓶颈场景下的交通效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02338 2026-03-06 cs.SE cs.RO 50%

Vision Language Model-based Testing of Industrial Autonomous Mobile Robots

基于视觉语言模型的工业自主移动机器人测试

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali, Thomas Peyrucain

机构 * Simula Research Laboratory and University of Oslo(Simula研究实验室和奥斯陆大学) Mondragon University(蒙dragon大学) Simula Research Laboratory(Simula研究实验室) PAL Robotics(PAL机器人技术)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出基于视觉语言模型的测试方法,用于生成违反功能和安全要求的机器人交互场景,以提高自主移动机器人在复杂环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 红队测试 1 篇

2602.19948 2026-03-06 cs.CL cs.AI cs.CY cs.HC cs.MA 85%

Assessing Risks of Large Language Models in Mental Health Support: A Framework for Automated Clinical AI Red Teaming

评估大型语言模型在心理健康支持中的风险:一种用于自动化临床AI红队测试的框架

Ian Steenstra, Paola Pedrelli, Weiyan Shi, Stacy Marsella, Timothy W. Bickmore

机构 * Northeastern University(东北大学) Harvard Medical School(哈佛医学院)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种评估AI心理治疗师在心理健康支持中安全风险的框架,通过模拟测试发现AI在治疗中的潜在风险,并验证了交互式可视化工具的有效性。

Comments This paper is a condensed version of the first author's Ph.D. dissertation submitted to Northeastern University

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 3 篇

2603.04746 2026-03-06 cs.AI cs.HC econ.GN q-fin.EC 57%

Visioning Human-Agentic AI Teaming: Continuity, Tension, and Future Research

展望人机协同AI:连续性、张力与未来研究

Bowen Lou, Tian Lu, T. S. Raghu, Yingjie Zhang

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学) Peking University(北京大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出Team SA理论作为人机协同AI转型的整合锚点,探讨在适应性自主下持续对齐的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21039 2026-03-06 cs.IR cs.LG 57%

Agentic Multi-Persona Framework for Evidence-Aware Fake News Detection

代理多角色框架用于证据感知的虚假新闻检测

Roopa Bukke, Soumya Pandey, Suraj Kumar, Soumi Chattopadhyay, Chandranath Adak

机构 * Dept. of CSE, Indian Institute of Technology Indore(计算机科学与工程系,印度理工学院印度奥尔德分校) Dept. of CSE, Indian Institute of Technology Patna(计算机科学与工程系,印度理工学院帕纳分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出AMPEND-LS框架,通过LLM与SLM协同作用,实现多模态虚假新闻检测,提升准确率和鲁棒性,增强信息安全性。

Comments 10 pages, 3 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05465 2026-03-06 cs.CV 50%

HALP: Detecting Hallucinations in Vision-Language Models without Generating a Single Token

在不生成单个标记的情况下检测视觉-语言模型中的幻觉

Sai Akhil Kogilathota, Sripadha Vallabha E G, Luzhe Sun, Jiawei Zhou

机构 * Stony Brook University(石英溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 通过探测模型内部表示在生成前检测视觉-语言模型的幻觉风险,展示不同架构中信息丰富的层和模态差异,并验证轻量级探测器在提升安全性和效率方面的潜力。

Journal ref The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 18 篇

2603.04904 2026-03-06 cs.AI cs.CL 88%

Alignment Backfire: Language-Dependent Reversal of Safety Interventions Across 16 Languages in LLM Multi-Agent Systems

对齐反噬:在16种语言的LLM多智能体系统中语言依赖性的安全干预逆转

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(犯罪精神病研究所以及性犯罪医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神病学系)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,在不同语言的LLM多智能体系统中,对齐干预可能导致安全措施的逆转,揭示了语言空间对对齐效果的决定性影响。

Comments 89 pages, 4 figures, 4 supplementary figures, 12 supplementary tables; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04410 2026-03-06 cs.CL cs.AI 86%

SalamahBench: Toward Standardized Safety Evaluation for Arabic Language Models

SalamahBench: 向阿拉伯语言模型的安全评估标准化迈进

Omar Abdelnasser, Fatemah Alharbi, Khaled Khasawneh, Ihsen Alouani, Mohammed E. Fouda

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 SalamahBench提出了一种统一的阿拉伯语言模型安全评估基准,评估五种先进模型的安全性,揭示了不同模型在安全对齐上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21033 2026-03-06 cs.AI 83%

Towards Trustworthy Legal AI through LLM Agents and Formal Reasoning

通过LLM代理和形式推理实现可信的法律AI

Linze Chen, Yufan Cai, Zhe Hou, Jin Song Dong

机构 * National University of Singapore(国立新加坡大学) Griffith University(格里菲斯大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 L4L通过LLM代理与形式推理实现法律AI的可信性,通过四个阶段确保法律推理的逻辑性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04837 2026-03-06 cs.AI 81%

Design Behaviour Codes (DBCs): A Taxonomy-Driven Layered Governance Benchmark for Large Language Models

设计行为代码(DBCs):一种以分类为导向的分层治理基准用于大型语言模型

G. Madan Mohan, Veena Kiran Nambiar, Kiranmayee Janardhan

专题命中 安全评测 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 本文提出DBC基准,用于评估大型语言模型中的行为治理层,通过三臂实验展示DBC在降低风险暴露率和提升合规性方面的效果。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 81%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03098 2026-03-06 q-bio.QM cs.LG 79%

An AI Implementation Science Study to Improve Trustworthy Data in a Large Healthcare System

一项提升大型医疗系统中可信数据的AI实施科学研究

Benoit L. Marteau, Andrew Hornback, Shaun Q. Tan, Christian Lowson, Jason Woloff, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Shriners Hospitals for Children(夏皮罗儿童医院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本研究通过在大型医疗系统中实施AI技术,提升数据质量并整合可信AI原则,探索混合实施策略以促进医疗AI的发展。

Comments 10 pages, 7 figures. Preprint version. This manuscript has been accepted at IEEE BHI 2025. This is the author-prepared version and not the final published IEEE version. The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05255 2026-03-06 cs.CV 78%

CATNet: Collaborative Alignment and Transformation Network for Cooperative Perception

CATNet:用于协作感知的协同对齐与变换网络

Gong Chen, Chaokun Zhang, Tao Tang, Pengcheng Lv, Feng Li, Xin Xie

机构 * School of Computer Science and Technology, Tianjin University(计算机科学与技术学院,天津大学) School of Cybersecurity, Tianjin University(网络安全学院,天津大学) School of Future Technology, Tianjin University(未来技术学院,天津大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 CATNet通过时空同步、小波去噪和自适应选择器提升多代理协作感知的鲁棒性和适应性。

Comments Accepted by CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04423 2026-03-06 cs.CL cs.AI 62%

Generating Realistic, Protocol-Compliant Maritime Radio Dialogues using Self-Instruct and Low-Rank Adaptation

利用自指导和低秩适应生成符合协议的海上无线电对话

Gürsel Akdeniz, Emin Cagatay Nakilcioglu

机构 * Fraunhofer Center for Maritime Logistics and Services(弗劳恩霍夫海洋物流与服务研究中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种自指导和低秩适应方法,生成符合IMO SMCP协议的海上无线电对话,通过整合验证流程和高效微调技术,提升对话生成的准确性和合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04407 2026-03-06 cs.CL cs.AI 62%

Semantic Containment as a Fundamental Property of Emergent Misalignment

语义包容作为涌现偏差的根本属性

Rohan Saxena

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现语义触发器可自发诱导模型限制,无需混合无害和有害训练数据,揭示有害微调的潜在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏