arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1359 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 27 篇

2510.04465 2026-08-11 cs.HC cs.AI cs.CR 版本更新 70%

Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents

自主性重塑个性化对隐私担忧和对LLM代理信任的影响

Zhiping Zhang, Yi Evie Zhang, Freda Shi, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学)

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理自主性如何影响个性化对用户隐私担忧和信任的影响,发现风险驱动的自主性可缓解个性化带来的负面影响。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06488 2026-07-23 cs.LG cs.CR stat.ML 版本更新 70%

Membership Inference Attacks for Unseen Classes

针对未见类别的成员推理攻击

Pratiksha Thaker, Neil Kale, Zhiwei Steven Wu, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 研究针对未见类别的成员推理攻击,指出多数现有攻击因无法访问完整目标分布而失败,提出“未见类”设置,证明分位数回归攻击在此设置下优于其他方法,从实证和理论上展示其优势并给出成功所需泛化属性模型。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05860 2026-07-16 cs.CL 版本更新 70%

Overcoming Language Barriers: Multilingual Analysis of the 2023 Swiss Privacy Law's Impact

克服语言障碍:对2023年瑞士隐私法影响的多语言分析

Luka Nenadic, David Rodriguez, Joseph A. Calandrino

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 隐私与版权 :alignment(abstract,abstract_cn);分类 cs.CL

AI总结 研究2023年瑞士隐私法与欧盟法规对齐对瑞士网站隐私政策的影响,开发基于大语言模型的管道提取法律信息,应用于超35000个网站隐私政策,发现政策中数据主体权利披露增加,还揭示了政策生成器对披露率的影响。

Journal ref Proceedings on Privacy Enhancing Technologies 2026(4) 703-723

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新 67%

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29293 2026-07-07 quant-ph 版本更新 67%

Private training in quantum machine learning

量子机器学习中的私有训练

Tigran Sedrakyan, Frédéric Grosshans, Elham Kashefi

专题命中 隐私与版权 :safety(abstract);AI safety(abstract)

AI总结 研究经典差分隐私SGD在混合变分量子模型中的应用,分析梯度裁剪与噪声添加的相互作用,发现量子模型在私有训练中能保持更高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21218 2026-06-23 cs.CL cs.AI cs.CR cs.LG 版本更新 67%

EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors

EPSVec: 通过数据集向量实现高效且私密的合成数据生成

Amin Banayeeanzade, Qingchuan Yang, Deqing Fu, Spencer Hong, Erin Babinsky, Alfy Samuel, Anoop Kumar, Robin Jia, Sai Praneeth Karimireddy

机构 * Capital One

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出EPSVec,一种轻量级差分隐私方法,通过提取并净化数据集向量来引导LLM生成合成文本,在低数据场景下实现高保真度,且计算开销低。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22651 2026-08-14 cs.LG cs.AI cs.CE cs.MA 版本更新 62%

Automated Design Optimization via Strategic Search with Large Language Models

通过大语言模型的战略搜索实现自动化设计优化

Anthony Carreon, Vansh Sharma, Venkat Raman

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出AUTO框架,利用大语言模型的战略搜索实现GPU代码优化,提升搜索效率并降低成本。

Comments 16 pages, 4 tables, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08604 2026-08-06 cs.CL cs.AI 版本更新 62%

Memorization in Large Language Models in Medicine: Prevalence, Characteristics, and Implications

医学领域大型语言模型中的记忆现象:普遍性、特征与影响

Anran Li, Lingfei Qian, Mengmeng Du, Yu Yin, Yan Hu, Zihao Sun, Yihang Fu, Hyunjae Kim, Erica Stutz, Xuguang Ai, Qianqian Xie, Rui Zhu, Jimin Huang, Yifan Yang, Siru Liu, Yih-Chung Tham, Lucila Ohno-Machado, Hyunghoon Cho, Zhiyong Lu, Hua Xu, Qingyu Chen

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨医学领域大型语言模型的记忆现象,分析其普遍性、特征及对医疗应用的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24042 2026-07-07 cs.LG cs.AI 版本更新 62%

Hidden-State Privacy Has an Empty Middle

隐藏状态隐私存在空中间

Alexander Okezue Bell

机构 * Stanford University(斯坦福大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过理论下界和实验证明,高斯释放机制在隐藏状态隐私中无法同时实现中等效用和隐私,存在空中间区域,并提出了对角逆Fisher机制作为最优解。

Comments 74 pages, 61 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17270 2026-06-23 cs.HC cs.AI cs.CR cs.CY 版本更新 62%

Understanding U.S. Users' Security and Privacy Transparency Needs for Consumer-Facing Generative AI

用户在面向消费者的人工智能生成技术中需要哪些安全和隐私透明度

Jiaxun Cao, Yu Dong, Chunxi Zhan, Rithvik Neti, Sai Teja Peddinti, Pardis Emami-Naeini

机构 * Duke University(杜克大学) Duke Kunshan University(杜克昆山大学) Google(谷歌)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨用户在使用面向消费者的人工智能生成技术时对安全和隐私信息的需求,发现现有信息不足以驱动初始采用,用户更依赖流行度等粗略指标,后续使用中不确定性影响用户行为,提出需可信信息和易用界面的透明度设计。

Comments To Appear at the Twenty-Second Symposium on Usable Privacy and Security (SOUPS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22483 2026-06-23 cs.LG cs.AI 版本更新 62%

OFMU: Optimization-Driven Framework for Machine Unlearning

OFMU:面向机器遗忘的优化驱动框架

Sadia Asif, Mohammad Mohammadi Amiri

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出OFMU,一种基于惩罚的双层优化框架,通过层次结构优先遗忘并保持保留性能,在视觉和语言基准上优于现有方法。

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06367 2026-06-18 cs.CR cs.AI cs.LG 版本更新 62%

WebSP-Eval: Evaluating Web Agents on Website Security and Privacy Tasks

WebSP-Eval:在网站安全与隐私任务上评估网络代理

Guruprasad Viswanathan Ramesh, Asmit Nayak, Basieem Siddique, Kassem Fawaz

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出WebSP-Eval框架,通过200个任务实例和自动化评估器,测试多模态大模型在网站安全与隐私任务上的表现,发现状态UI元素(如开关)导致超过45%的任务失败。

Comments Accepted at PETS 2026. Project Page: https://wiscprivacy.com/webspeval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10239 2026-06-18 cs.LG cs.AI 版本更新 62%

Efficient Zeroth-Order Federated Finetuning of Language Models on Resource-Constrained Devices

资源受限设备上语言模型的高效零阶联邦微调

Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Huawei(华为) Heisenberg Research Center (Munich), Germany(海森堡研究中心(慕尼黑),德国)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于零阶优化的联邦微调方法,通过分块模型并分配更多扰动到后一块,复用中间激活减少前向评估次数,在保持内存和通信优势的同时将计算量降低至其他零阶方法的1/3。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11219 2026-06-16 cs.LG cs.AI 版本更新 62%

SDFLoRA: Selective Decoupled Federated LoRA for Privacy-preserving Fine-tuning with Heterogeneous Clients

SDFLoRA: 面向异构客户隐私保护微调的选择性解耦联邦LoRA

Zhikang Shen, Jianrong Lu, Haiyuan Wan, Jianhai Chen

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出SDFLoRA,通过将LoRA更新解耦为共享和私有组件,仅聚合共享部分并注入差分隐私噪声,解决联邦微调中的秩异构和数据异构问题,提升隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10467 2026-07-15 cs.SE cs.LG 版本更新 57%

Toward Production-Ready Federated Learning in Healthcare: Privacy, Orchestration, and Governance in MLOps

迈向医疗保健领域可投入生产的联邦学习:MLOps 中的隐私、编排与治理

Sakshi Gorkhali, Jonesh Shrestha

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.LG

AI总结 研究医疗保健领域联邦学习,探讨 MLOps 实践和 FLOps 理念,回答容器化编排对联邦部署的支持、隐私机制的影响及部署后重要实践等问题,提出需集成 MLOps 架构让联邦医疗保健机器学习系统更具性能。

Comments 5 pages, 2 figures, 1 table; v2 adds the permanent arXiv identifier and DOI to the reference block. No changes to the analysis or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12765 2026-07-15 cs.LG 版本更新 57%

Inference-Time Machine Unlearning via Gated Activation Redirection

推理时的机器去学习 via 门控激活重定向

Vinícius Conte Turani, Otávio Parraga, João Vitor Boer Abitante, Kristen K. Arguello, Joana Pasquali, Ramiro N. Barros, Flavio du Pin Calmon, Christian Mattjie, Rodrigo C. Barros, Lucas S. Kupssinskü

机构 * MALTA, Machine Learning Theory and Applications Lab, PUCRS, Porto Alegre, Brazil(MALTA机器学习理论与应用实验室,PUCRS,波士顿-阿尔格雷,巴西) Harvard University(哈佛大学) Kunumi Institute, Brazil(库努米研究所,巴西)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种无需训练和梯度的机器去学习方法GUARD-IT,通过在推理时依赖输入的激活引导来消除特定数据集的影响,同时保持模型性能,且在量化部署下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10254 2026-07-10 cs.LG 版本更新 57%

Improving TabPFN's Synthetic Data Generation by Integrating Causal Structure

通过整合因果结构改进TabPFN的合成数据生成

Davide Tugnoli, Andrea De Lorenzo, Marco Virgolin, Giovanni Cinà

机构 * Department of Mathematics, Informatics and Geosciences(数学、信息学与地质科学系) University of Trieste(特里este大学) Department of Engineering and Architecture(工程与建筑系) InSilicoTrials Technologies BV(InSilicoTrials技术公司) Amsterdam UMC Institute for Logic, Language and Computation(阿姆斯特丹大学医学中心逻辑、语言与计算研究所) University of Amsterdam(阿姆斯特丹大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 通过整合因果结构改进TabPFN的合成数据生成,提升合成数据的质量和稳定性

Comments Camera-ready version, accepted at UAI 2026. 9 pages main text, 44 pages total (including supplementary material), 35 figures. Code: https://github.com/DavideTugnoli/tabpfn-causal-synthetic

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28421 2026-07-09 cs.CV cs.AI 版本更新 57%

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

JuZhou 1.0 技术报告:首个完全在中国开发的AI加速器上训练的边缘原生文本到图像基础模型

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 提出JuZhou 1.0,一个超轻量级文本到图像基础模型,通过紧凑骨干网络、Rectified Flow训练、DMD2蒸馏和中文语义对齐,实现完全离线设备端运行,性能优于SDXL等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19780 2026-06-23 cs.AI 版本更新 57%

NOEM$^{3}$A: a Neuro-symbolic Ontology-Enhanced Method for Multi-intent understanding in Mobile Agents

NOEM$^{3}$A:一种用于移动代理中多意图理解的神经符号本体增强方法

Ioannis Tzachristas, Aifen Sui

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Technical University of Munich(慕尼黑技术大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 提出NOEM$^{3}$A,一种轻量级神经符号层,通过意图本体增强紧凑语言模型,在低延迟和隐私约束下提升移动代理的自然语言理解准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24735 2026-08-10 cs.HC 版本更新 50%

Examining the Effect of Explanations of AI Privacy Redaction in AI-mediated Interactions

考察AI隐私擦除解释在AI中介互动中的影响

Roshni Kaushik, Maarten Sap, Koichi Onoue

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 研究探讨AI中介互动中解释擦除操作对用户信任的影响,发现解释能提升隐私保护效果,且情境因素和个体差异影响解释效果。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18266 2026-08-06 cs.CV 版本更新 50%

YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos

YouTube-Occ:从YouTube视频学习室内3D语义占据预测

Haoming Chen, Lichen Yuan, TianFang Sun, Jingyu Gong, Xin Tan, Zhizhong Zhang, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学)

专题命中 隐私与版权 :alignment(abstract)

AI总结 针对室内3D语义占据预测数据稀缺的问题,提出YouTube-Occ框架,通过自动化数据流水线与双对齐预训练策略,在NYUv2等基准上实现性能提升,代码数据将公开。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18036 2026-07-27 cs.CR cs.CV 版本更新 50%

NWaaS: A Non-Intrusive and Privacy-Preserving Watermarking-as-a-Service System with Adaptive Resource Scheduling

NWaaS:一种具有自适应资源调度的非侵入性和隐私保护水印即服务系统

Haonan An, Qianyao Ren, Guang Hua, Tao Li, Yu Guo, Yanan Ma, Hangcheng Cao, Yuguang Fang

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 研究针对机器学习即服务中保护知识产权的挑战,提出NWaaS框架。核心方法包括$\mathtt{ShadowMark}$算法、协作分区机制和比例差异联合调度算法。贡献是能在多样模态中提供强大所有权验证,保障隐私并提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23179 2026-06-19 eess.IV cs.CV 版本更新 50%

OncoReg: Medical Image Registration for Oncological Challenges

OncoReg:面向肿瘤学挑战的医学图像配准

Wiebke Heyer, Yannic Elser, Lennart Berkel, Xinrui Song, Xuanang Xu, Pingkun Yan, Xi Jia, Jinming Duan, Zi Li, Tony C. W. Mok, BoWen LI, Tim Hable, Christian Staackmann, Christoph Großbröhmer, Lasse Hansen, Alessa Hering, Malte M. Sieren, Mattias P. Heinrich

机构 * Institute of Medical Informatics, University of Lübeck(吕贝克大学医学信息学研究所) Institute of Radiology and Nuclear Medicine, University Hospital Schleswig-Holstein(石勒斯维希-霍尔斯坦大学医院放射科和核医学研究所) Department of Biomedical Engineering and Center for Biotechnology and Interdisciplinary Studies, Rensselaer Polytechnic Institute(伦塞拉塞尔理工学院生物医学工程系和生物技术与跨学科研究中心) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院) Division of Informatics, Imaging and Data Sciences, University of Manchester(曼彻斯特大学信息学、成像和数据科学系) DAMO Academy, Alibaba Group(阿里集团DAMO学院) Hangzhou Shengshi Technology Co., Ltd(杭州盛世科技有限公司) Department of Radiation Oncology, University Hospital Schleswig-Holstein(石勒斯维希-霍尔斯坦大学医院放射肿瘤科) EchoScout GmbH Radboud University Medical Center, Nijmegen(奈密根大学医学中心) Institute of Interventional Radiology, University Hospital Schleswig-Holstein(石勒斯维希-霍尔斯坦大学医院介入放射科)

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出OncoReg挑战,通过两阶段框架在保护患者隐私的同时开发可泛化的图像配准方法,用于放射治疗中锥束CT与扇束CT的配准,发现特征提取是关键,深度学习和经典方法结合最有效。

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04799 2026-06-09 cs.CR 版本更新 50%

Maris: A Formally Verifiable Privacy Policy Enforcement Paradigm for Multi-Agent Collaboration Systems

Maris:一种用于多智能体协作系统的形式化可验证隐私策略执行范式

Jian Cui, Zichuan Li, Chi Wang, Luyi Xing, Xiaojing Liao

专题命中 隐私与版权 :prompt injection(abstract)

AI总结 针对多智能体协作系统(MACS)中敏感数据泄露风险,提出一种基于引用监视器的隐私增强开发范式Maris,通过嵌入消息流控制机制实现细粒度数据保护,并在AutoGen和LangChain框架中实现,实验表明其能有效缓解数据泄露威胁且保持高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全评测 457 篇

2602.19021 2026-07-21 cs.CR 版本更新 91%

Trustworthy AI LLM Scalability Risk Index (LSRI): A Cybersecurity Framework Assessing Agentic-AI Security & Software Model Supply Chain Safety Boosting AI-Generated Malware Defense & Explainability Mitigating Emerging Risks of Generative AI

大语言模型在代理AI中的可扩展性风险与模型供应链安全

Kiarash Ahi, Vaibhav Agrawal, Saeed Valizadeh

专题命中 安全评测 :safety(title,abstract);trustworthy(title);alignment(abstract);RLHF(abstract)

AI总结 本文研究了大语言模型在代理AI中的可扩展性风险及模型供应链安全问题,提出LSRI指数和模型供应链框架,以提升安全关键环境下的LLM部署安全性。

Comments Accepted for publication in Journal of Computer Information Systems (2026). DOI: 10.1080/08874417.2026.2624670

Journal ref Journal of Computer Information Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29759 2026-07-17 cs.CV cs.AI 版本更新 89%

TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios

TSHA:用于可信安全危害评估场景的视觉语言模型基准

Qiucheng Yu, Ruijie Xu, Mingang Chen, Jianfeng Dong, Xin Tan

机构 * City University of Hong Kong(香港城市大学) East China Normal University(华东师范大学) University of Western Australia(西澳大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Development Center of Computer Software Technology(上海计算机软件技术开发中心) Zhejiang Gongshang University(浙江工商大学)

专题命中 安全评测 :safety(title,abstract);trustworthy(title,abstract_cn);分类 cs.AI

AI总结 本文提出TSHA基准,通过81809个精心挑选的训练样本和1707个挑战性测试样本,评估视觉语言模型在复杂家庭安全场景中的鲁棒性和泛化能力,发现现有模型在安全危害评估中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03919 2026-08-03 cs.CR 版本更新 89%

When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG

当安全成为漏洞:利用LLM对齐同质性进行可转移阻塞在RAG中

Junchen Li, Liang Xu, Qizhi Chen, Rongzheng Wang, Chao Qi, Shihao He, Di Liang, Haibo Shi, Shuang Liang

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);prompt injection(abstract)

AI总结 TabooRAG通过利用LLM对齐同质性,在黑盒环境下实现跨模型的可转移阻塞攻击,针对安全对齐机制提出新型攻击框架。

Comments Expanded the scale of the experimental evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17003 2026-08-05 cs.CY cs.CL 版本更新 88%

Beyond Simulations: What 20,000 Real Conversations Reveal About Mental Health AI Safety

超越模拟:20000次真实对话揭示心理健康AI安全

Caitlin A. Stamatis, Jonah Meyerhoff, Richard Zhang, Olivier Tieleman, Matteo Malgaroli, Thomas D. Hull

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.CY

AI总结 本研究通过分析20000次真实对话,揭示心理健康AI在现实应用中的安全性能差异,指出专门设计的AI在减少有害内容生成方面表现更优,但测试集失败率高于实际部署,强调需转向持续的安全保障而非有限的基准认证。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29581 2026-07-16 cs.LG cs.AI 版本更新 88%

The Joint Effect of Quantization and Sampling Temperature on LLM Safety Alignment: A Factorial Analysis

量化和采样温度对LLM安全对齐的联合效应:一项因子分析

Hari Prasad, Ritam Pal

机构 * Conscious Engines(意识引擎)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 通过因子分析评估9个模型在3种精度和6种温度下的安全对齐,发现量化通常安全中性,而高温增加决策不稳定性,且两者无系统性叠加效应。

Comments 11 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03793 2026-08-12 cs.CL cs.CV 版本更新 88%

Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models

探索多语言多模态大语言模型的对抗鲁棒性与安全对齐

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡比拉大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 本研究通过梯度攻击和跨语言评估,发现多语言多模态大语言模型存在可迁移的对抗脆弱性,并揭示低资源语言因理解失败而呈现的虚假安全现象,提出深层训练整合才能实现真正的多语言安全对齐。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏