arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 686 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 686 篇

2407.07638 2024-12-31 cs.CV cs.AI 74%

Tuning Vision-Language Models with Candidate Labels by Prompt Alignment

Zhifang Zhang, Yuwei Niu, Xin Liu, Beibei Li

专题命中 隐私与版权 :alignment(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01583 2024-11-05 cs.CR cs.AI cs.DC 74%

Trustworthy Federated Learning: Privacy, Security, and Beyond

Chunlu Chen, Ji Liu, Haowen Tan, Xingjian Li, Kevin I-Kai Wang, Peng Li, Kouichi Sakurai, Dejing Dou

专题命中 隐私与版权 :trustworthy(title);分类 cs.AI

Comments 32 pages, to appear in KAIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00538 2024-10-23 cs.CR cs.AI cs.CV eess.IV 74%

Privacy-Preserving and Trustworthy Deep Learning for Medical Imaging

Kiarash Sedghighadikolaei, Attila A Yavuz

专题命中 隐私与版权 :trustworthy(title);分类 cs.AI

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.08552 2019-02-25 cs.CR cs.LG 74%

Adversarial Neural Network Inversion via Auxiliary Knowledge Alignment

Ziqi Yang, Ee-Chien Chang, Zhenkai Liang

专题命中 隐私与版权 :alignment(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09867 2026-08-11 cs.CR cs.AI cs.LG 新提交 73%

Stealing Reasoning Traces from Proprietary LLM APIs

从专有大语言模型API窃取推理轨迹

Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

专题命中 隐私与版权 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现专有LLM API的加密推理轨迹存在跨会话、用户及模型的兼容性漏洞,开发了可扩展解密越狱方法,能提取模型推理、窃取PII等,还提出了对应缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24523 2026-06-24 cs.CL cs.AI 新提交 73%

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

海报:探索基于音频的土耳其电话诈骗检测的极限

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语电话诈骗,构建首个多模态数据集(100对音频-文本),评估7个LLM在三种输入条件下的检测性能,发现基于文本的输入优于直接音频处理。

Comments Poster paper accepted at 47th IEEE Security & Privacy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23362 2026-03-31 cs.CL cs.AI 73%

Dual-Space Smoothness for Robust and Balanced LLM Unlearning

双空间平滑性用于鲁棒且平衡的LLM反学习

Han Yan, Zheyuan Liu, Meng Jiang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系)

专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PRISM框架,通过双空间平滑性提升LLM反学习的鲁棒性和平衡性,有效对抗重学和劫持攻击。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12914 2026-03-13 cs.CR cs.AI cs.LG 73%

CTIGuardian: A Few-Shot Framework for Mitigating Privacy Leakage in Fine-Tuned LLMs

CTIGuardian:一种缓解微调大语言模型隐私泄露的少样本框架

Shashie Dilhara Batan Arachchige, Benjamin Zi Hao Zhao, Hassan Jameel Asghar, Dinusha Vatsalan, Dali Kaafar

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 CTIGuardian通过少样本监督整合隐私分类器和红员,提升微调大语言模型的隐私保护与效用平衡。

Comments Accepted at the 18th Cybersecurity Experimentation and Test Workshop (CSET), in conjunction with ACSAC 2025

Journal ref 2025 Annual Computer Security Applications Conference Workshops (ACSAC Workshops), Honolulu, HI, USA, 2025, pp. 510-522

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15252 2026-02-18 cs.GT cs.AI cs.LG 73%

Decision Making under Imperfect Recall: Algorithms and Benchmarks

不完美回忆下的决策:算法与基准测试

Emanuel Tewolde, Brian Hu Zhang, Ioannis Anagnostides, Tuomas Sandholm, Vincent Conitzer

机构 * Computer Science Dept., Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学计算机科学系) Foundations of Cooperative AI Lab (FOCAL)(协作人工智能基础实验室(FOCAL)) Strategy Robot, Inc.(策略机器人公司) Strategic Machine, Inc.(战略机器公司) Optimized Markets, Inc.(优化市场公司)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个不完美回忆决策问题的基准测试集,并引入后悔匹配算法家族,在大规模约束优化中表现优异。

Comments 39 pages, 71 figures, 4 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16530 2026-02-03 cs.CR cs.AI cs.CL 73%

DuFFin: A Dual-Level Fingerprinting Framework for LLMs IP Protection

DuFFin:一种用于LLM知识产权保护的双层指纹框架

Yuliang Yan, Haochun Tang, Shuo Yan, Enyan Dai

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Jilin University(吉林大学)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 DuFFin通过双层指纹框架在黑盒环境下实现LLM知识产权验证,准确识别模型来源并达到高验证精度。

Comments Accepted by EACL 2026, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14964 2025-11-20 cs.CY cs.AI cs.HC 73%

How Should the Law Treat Future AI Systems? Fictional Legal Personhood versus Legal Identity

Heather J. Alexander, Jonathan A. Simon, Frédéric Pinard

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments 69 pages. Forthcoming in Case Western Journal of Law, Technology & the Internet (publication offer date september 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05925 2025-11-18 cs.CY cs.AI 73%

Small Models, Big Support: A Local LLM Framework for Educator-Centric Content Creation and Assessment with RAG and CAG

Zarreen Reza, Alexander Mazur, Michael T. Dugdale, Robin Ray-Chaudhuri

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05734 2025-08-11 cs.CR cs.AI cs.LG 73%

LeakAgent: RL-based Red-teaming Agent for LLM Privacy Leakage

Yuzhou Nie, Zhun Wang, Ye Yu, Xian Wu, Xuandong Zhao, Wenbo Guo, Dawn Song

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05219 2025-02-11 cs.CY cs.AI cs.CR 73%

Enabling External Scrutiny of AI Systems with Privacy-Enhancing Technologies

Kendrea Beers, Helen Toner

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12367 2024-10-03 cs.LG cs.AI cs.CR 73%

Extracting Memorized Training Data via Decomposition

Ellen Su, Anu Vellore, Amy Chang, Raffaele Mura, Blaine Nelson, Paul Kassianik, Amin Karbasi

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02435 2023-08-07 cs.CY cs.AI 73%

Designing Fiduciary Artificial Intelligence

Sebastian Benthall, David Shekman

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.04073 2020-08-11 cs.CY cs.AI 73%

AI Failures: A Review of Underlying Issues

Debarag Narayan Banerjee, Sasanka Sekhar Chanda

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21455 2026-04-24 cs.HC 71%

The Privacy Guardian Agent: Towards Trustworthy AI Privacy Agents

隐私守护代理:迈向可信AI隐私代理

Vincent Freiberger

专题命中 隐私与版权 :trustworthy(title)

AI总结 本文提出隐私守护代理,通过用户资料和上下文感知自动化隐私同意选择,同时在不确定或高风险情况时通知用户,确保透明和用户自主权。

Comments Position paper for the CHI26 Workshop "Moving Beyond Clicks: Rethinking Consent and User Control in the Age of AI"

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09070 2025-07-15 eess.AS cs.SD 71%

SemAlignVC: Enhancing zero-shot timbre conversion using semantic alignment

Shivam Mehta, Yingru Liu, Zhenyu Tang, Kainan Peng, Vimal Manohar, Shun Zhang, Mike Seltzer, Qing He, Mingbo Ma

机构 * KTH Royal Institute of Technology(皇家理工学院) Meta

专题命中 隐私与版权 :alignment(title)

Comments 6 pages, 2 figures, Accepted at the ISCA Speech Synthesis Workshop (SSW) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04465 2026-08-11 cs.HC cs.AI cs.CR 版本更新 70%

Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents

自主性重塑个性化对隐私担忧和对LLM代理信任的影响

Zhiping Zhang, Yi Evie Zhang, Freda Shi, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学)

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理自主性如何影响个性化对用户隐私担忧和信任的影响,发现风险驱动的自主性可缓解个性化带来的负面影响。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06488 2026-07-23 cs.LG cs.CR stat.ML 版本更新 70%

Membership Inference Attacks for Unseen Classes

针对未见类别的成员推理攻击

Pratiksha Thaker, Neil Kale, Zhiwei Steven Wu, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 研究针对未见类别的成员推理攻击,指出多数现有攻击因无法访问完整目标分布而失败,提出“未见类”设置,证明分位数回归攻击在此设置下优于其他方法,从实证和理论上展示其优势并给出成功所需泛化属性模型。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18847 2026-07-22 cs.CR cs.AI 新提交 70%

Data Leakage Prevention in Agentic Applications via Preemptive Hardening

通过先发制硬化防止智能应用中的数据泄露

Akansha Shukla, Emily Bellov, Parth Atulbhai Gandhi, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 隐私与版权 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究智能应用数据泄露问题,提出预部署管道,通过分析提示模板等识别泄露模式并生成补丁,经硬化和验证确保应用功能不受影响,评估显示能有效减少数据泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16227 2026-07-21 cs.LG cs.CR 新提交 70%

LLM Unlearning for Cyber Defense: A Survey on Methods, Challenges, and Emerging Threats

用于网络防御的大语言模型遗忘:方法、挑战及新出现威胁的综述

Ruppikha Sree Shankar, Abhishek Bhardwaj, Arnav Doshi, Anusri Nagarajan, Troy Paulus Asia, Saptarshi Sengupta

机构 * Manipal Institute of Technology, Manipal Academy of Higher Education(马尼帕尔理工学院,马尼帕尔高等教育学院) San José State University(圣何塞州立大学)

专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 综述聚焦于网络防御中LLM遗忘问题,探讨其面临风险,核心问题是现有方法能否真的去除知识。主要关注基于梯度的方法,因其与现有训练管道兼容且可扩展,从多方面审视LLM遗忘,为解决相关问题提供参考。

Comments 42 pages, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05860 2026-07-16 cs.CL 版本更新 70%

Overcoming Language Barriers: Multilingual Analysis of the 2023 Swiss Privacy Law's Impact

克服语言障碍:对2023年瑞士隐私法影响的多语言分析

Luka Nenadic, David Rodriguez, Joseph A. Calandrino

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 隐私与版权 :alignment(abstract,abstract_cn);分类 cs.CL

AI总结 研究2023年瑞士隐私法与欧盟法规对齐对瑞士网站隐私政策的影响,开发基于大语言模型的管道提取法律信息,应用于超35000个网站隐私政策,发现政策中数据主体权利披露增加,还揭示了政策生成器对披露率的影响。

Journal ref Proceedings on Privacy Enhancing Technologies 2026(4) 703-723

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02077 2026-04-30 cs.CR cs.AI cs.MA 70%

Open Challenges in Multi-Agent Security: Towards Secure Systems of Interacting AI Agents

多智能体安全中的开放挑战:迈向交互式AI智能体的安全系统

Christian Schroeder de Witt, Klaudia Krawiecka, Igor Krawczuk, Ben Hagag, William L. Anderson, Peter Belcak, Ben Bucknall, Xiaohong Cai, Ayush Chopra, Doron Cohen, Ron F. Del Rosario, Andis Draguns, Annie Gray, Keren Katz, Vasilios Mavroudis, Jaron Mink, Sumeet Ramesh Motwani, Jonathan Petit, Leif-Sebastian Rembeck, Chandler Smith, John Sotiropoulos, Steven Young, Sarah Scheffler, Mary Llewellyn

机构 * Oxford Witt Lab, University of Oxford(牛津Witt实验室,牛津大学) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Association for Computing Machinery (ACM)(计算机协会(ACM)) Independent(独立) MATS Research(MATS研究) CyLab Security & Privacy Institute, Carnegie Mellon University(CyLab安全与隐私研究所,卡内基梅隆大学) Qualcomm Inc.(高通公司) Oxford Martin AI Governance Initiative(牛津马丁人工智能治理倡议) Carnegie Mellon University(卡内基梅隆大学) MIT Media Lab(麻省理工媒体实验室) SAP SE(SAP德国分公司) OWASP GenAI Security Project - Agentic Security Initiative(OWASP生成式AI安全项目-代理安全倡议) Contramont Research(Contramont研究) The Alan Turing Institute(艾伦·图灵研究所) Department of Economics, New York University(纽约大学经济系) Zenity(Zenity公司) King’s College London(伦敦国王学院) Arizona State University(亚利桑那州立大学) Torr Vision Group, University of Oxford(托尔视觉组,牛津大学) Deep Cyber Ltd(Deep Cyber有限公司)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文探讨多智能体交互带来的安全挑战,提出多智能体安全新领域,旨在解决智能体间及与人类、机构的交互中出现的安全问题,分析安全与效用、安全与安全之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14548 2026-04-21 cs.SD cs.LG eess.AS 70%

VoxSafeBench: Not Just What Is Said, but Who, How, and Where

VoxSafeBench:不仅仅是所说的内容,还有谁、如何以及在哪里

Yuxiang Wang, Hongyu Liu, Yijiang Xu, Qinke Ni, Li Wang, Wan Lin, Kunyu Feng, Dekun Chen, Xu Tan, Lei Wang, Jie Shi, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Amphion Technology Co., Ltd.(Amphion科技有限公司)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 VoxSafeBench首次联合评估SLM在安全、公平和隐私三个维度上的社会契合度,揭示语音识别中的普遍缺口,即模型在文本中能识别社会规范,但在语音中却无法正确应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05144 2026-04-02 cs.AI 70%

Distilling the Thought, Watermarking the Answer: A Principle Semantic Guided Watermark for Large Reasoning Models

提炼思维,标注答案:一种基于原则语义的水印方法用于大型推理模型

Shuliang Liu, Xingyu Li, Hongyi Liu, Dong Fang, Yibo Yan, Bingchen Duan, Qi Zheng, Lingfeng Su, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) LIGHTSPEED(光速)

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出ReasonMark,一种专为推理密集型LLM设计的水印框架,通过分离生成过程为无干扰的思维阶段和水印标注的答案阶段,利用关键性评分提取语义关键标记,提升水印鲁棒性与推理质量。

Comments 31 pages, Published in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19314 2026-03-23 cs.LG cs.CR 70%

DPxFin: Adaptive Differential Privacy for Anti-Money Laundering Detection via Reputation-Weighted Federated Learning

DPxFin:基于声誉加权联邦学习的反洗钱检测中的自适应差分隐私

Renuga Kanagavelu, Manjil Nepal, Ning Peiyan, Cai Kangning, Xu Jiming, Fei Gao, Yong Liu, Goh Siow Mong Rick, Qingsong Wei

机构 * A*STAR IHPC(A*STAR 国家实验室信息物理计算中心) SRM University-AP(SRM 大学-安得拉邦) Evyd Singapore(Evyd 新加坡)

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出DPxFin框架,通过声誉引导的自适应差分隐私技术,在反洗钱检测中提升隐私保护与模型效用的平衡。

Comments Accepted at AI FOR FINANCIAL FRAUD DETECTION & PREVENTION AT ACM ICAIF-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15679 2026-03-18 cs.CR cs.AI cs.CV 70%

IdentityGuard: Context-Aware Restriction and Provenance for Personalized Synthesis

IdentityGuard: 基于上下文的限制与溯源的个性化合成

Lingyun Zhang, Yu Xie, Ping Chen

机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学与技术学院) Institute of Big Data, Fudan University(复旦大学大数据研究院) Purple Mountain Laboratories(紫金山实验室)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出IdentityGuard,通过上下文感知的限制和概念特定水印,实现个性化合成的安全控制,防止滥用同时保持模型效用。

Comments 5 pages, 3 figures, Accepted to ICASSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14265 2026-03-17 cs.CL cs.MA 70%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏