Tuning Vision-Language Models with Candidate Labels by Prompt Alignment
专题命中 隐私与版权 :alignment(title);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 隐私与版权 :alignment(title);分类 cs.AI
专题命中 隐私与版权 :trustworthy(title);分类 cs.AI
Comments 32 pages, to appear in KAIS
专题命中 隐私与版权 :trustworthy(title);分类 cs.AI
Comments This work has been submitted to the IEEE for possible publication
专题命中 隐私与版权 :alignment(title);分类 cs.LG
从专有大语言模型API窃取推理轨迹
专题命中 隐私与版权 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现专有LLM API的加密推理轨迹存在跨会话、用户及模型的兼容性漏洞,开发了可扩展解密越狱方法,能提取模型推理、窃取PII等,还提出了对应缓解措施。
海报:探索基于音频的土耳其电话诈骗检测的极限
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Education University of Hong Kong(香港教育大学)
专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 针对土耳其语电话诈骗,构建首个多模态数据集(100对音频-文本),评估7个LLM在三种输入条件下的检测性能,发现基于文本的输入优于直接音频处理。
Comments Poster paper accepted at 47th IEEE Security & Privacy 2026
双空间平滑性用于鲁棒且平衡的LLM反学习
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系)
专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 本文提出PRISM框架,通过双空间平滑性提升LLM反学习的鲁棒性和平衡性,有效对抗重学和劫持攻击。
Comments Accepted by ICLR 2026
CTIGuardian:一种缓解微调大语言模型隐私泄露的少样本框架
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 CTIGuardian通过少样本监督整合隐私分类器和红员,提升微调大语言模型的隐私保护与效用平衡。
Comments Accepted at the 18th Cybersecurity Experimentation and Test Workshop (CSET), in conjunction with ACSAC 2025
Journal ref 2025 Annual Computer Security Applications Conference Workshops (ACSAC Workshops), Honolulu, HI, USA, 2025, pp. 510-522
不完美回忆下的决策:算法与基准测试
机构 * Computer Science Dept., Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学计算机科学系) ; Foundations of Cooperative AI Lab (FOCAL)(协作人工智能基础实验室(FOCAL)) ; Strategy Robot, Inc.(策略机器人公司) ; Strategic Machine, Inc.(战略机器公司) ; Optimized Markets, Inc.(优化市场公司)
专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出首个不完美回忆决策问题的基准测试集,并引入后悔匹配算法家族,在大规模约束优化中表现优异。
Comments 39 pages, 71 figures, 4 table
DuFFin:一种用于LLM知识产权保护的双层指纹框架
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Jilin University(吉林大学)
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 DuFFin通过双层指纹框架在黑盒环境下实现LLM知识产权验证,准确识别模型来源并达到高验证精度。
Comments Accepted by EACL 2026, Findings
专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments 69 pages. Forthcoming in Case Western Journal of Law, Technology & the Internet (publication offer date september 2025)
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
Comments Accepted by COLM 2025
专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
Comments 8 pages
隐私守护代理:迈向可信AI隐私代理
专题命中 隐私与版权 :trustworthy(title)
AI总结 本文提出隐私守护代理,通过用户资料和上下文感知自动化隐私同意选择,同时在不确定或高风险情况时通知用户,确保透明和用户自主权。
Comments Position paper for the CHI26 Workshop "Moving Beyond Clicks: Rethinking Consent and User Control in the Age of AI"
机构 * KTH Royal Institute of Technology(皇家理工学院) ; Meta
专题命中 隐私与版权 :alignment(title)
Comments 6 pages, 2 figures, Accepted at the ISCA Speech Synthesis Workshop (SSW) 2025
自主性重塑个性化对隐私担忧和对LLM代理信任的影响
机构 * Northeastern University(东北大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Waterloo(滑铁卢大学)
专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 研究探讨了LLM代理自主性如何影响个性化对用户隐私担忧和信任的影响,发现风险驱动的自主性可缓解个性化带来的负面影响。
Comments Accepted to COLM 2026
针对未见类别的成员推理攻击
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.LG
AI总结 研究针对未见类别的成员推理攻击,指出多数现有攻击因无法访问完整目标分布而失败,提出“未见类”设置,证明分位数回归攻击在此设置下优于其他方法,从实证和理论上展示其优势并给出成功所需泛化属性模型。
Comments Published at ICML 2026
通过先发制硬化防止智能应用中的数据泄露
机构 * Faculty of Computer and Information Science(计算机与信息科学系) ; Ben-Gurion University of the Negev(内盖夫本· Gurion大学)
专题命中 隐私与版权 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI
AI总结 研究智能应用数据泄露问题,提出预部署管道,通过分析提示模板等识别泄露模式并生成补丁,经硬化和验证确保应用功能不受影响,评估显示能有效减少数据泄露。
用于网络防御的大语言模型遗忘:方法、挑战及新出现威胁的综述
机构 * Manipal Institute of Technology, Manipal Academy of Higher Education(马尼帕尔理工学院,马尼帕尔高等教育学院) ; San José State University(圣何塞州立大学)
专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.LG
AI总结 综述聚焦于网络防御中LLM遗忘问题,探讨其面临风险,核心问题是现有方法能否真的去除知识。主要关注基于梯度的方法,因其与现有训练管道兼容且可扩展,从多方面审视LLM遗忘,为解决相关问题提供参考。
Comments 42 pages, 5 tables
克服语言障碍:对2023年瑞士隐私法影响的多语言分析
机构 * ETH Zurich(苏黎世联邦理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 隐私与版权 :alignment(abstract,abstract_cn);分类 cs.CL
AI总结 研究2023年瑞士隐私法与欧盟法规对齐对瑞士网站隐私政策的影响,开发基于大语言模型的管道提取法律信息,应用于超35000个网站隐私政策,发现政策中数据主体权利披露增加,还揭示了政策生成器对披露率的影响。
Journal ref Proceedings on Privacy Enhancing Technologies 2026(4) 703-723
多智能体安全中的开放挑战:迈向交互式AI智能体的安全系统
机构 * Oxford Witt Lab, University of Oxford(牛津Witt实验室,牛津大学) ; Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Association for Computing Machinery (ACM)(计算机协会(ACM)) ; Independent(独立) ; MATS Research(MATS研究) ; CyLab Security & Privacy Institute, Carnegie Mellon University(CyLab安全与隐私研究所,卡内基梅隆大学) ; Qualcomm Inc.(高通公司) ; Oxford Martin AI Governance Initiative(牛津马丁人工智能治理倡议) ; Carnegie Mellon University(卡内基梅隆大学) ; MIT Media Lab(麻省理工媒体实验室) ; SAP SE(SAP德国分公司) ; OWASP GenAI Security Project - Agentic Security Initiative(OWASP生成式AI安全项目-代理安全倡议) ; Contramont Research(Contramont研究) ; The Alan Turing Institute(艾伦·图灵研究所) ; Department of Economics, New York University(纽约大学经济系) ; Zenity(Zenity公司) ; King’s College London(伦敦国王学院) ; Arizona State University(亚利桑那州立大学) ; Torr Vision Group, University of Oxford(托尔视觉组,牛津大学) ; Deep Cyber Ltd(Deep Cyber有限公司)
专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文探讨多智能体交互带来的安全挑战,提出多智能体安全新领域,旨在解决智能体间及与人类、机构的交互中出现的安全问题,分析安全与效用、安全与安全之间的权衡。
VoxSafeBench:不仅仅是所说的内容,还有谁、如何以及在哪里
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; Amphion Technology Co., Ltd.(Amphion科技有限公司)
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 VoxSafeBench首次联合评估SLM在安全、公平和隐私三个维度上的社会契合度,揭示语音识别中的普遍缺口,即模型在文本中能识别社会规范,但在语音中却无法正确应用。
提炼思维,标注答案:一种基于原则语义的水印方法用于大型推理模型
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; LIGHTSPEED(光速)
专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本文提出ReasonMark,一种专为推理密集型LLM设计的水印框架,通过分离生成过程为无干扰的思维阶段和水印标注的答案阶段,利用关键性评分提取语义关键标记,提升水印鲁棒性与推理质量。
Comments 31 pages, Published in ICLR 2026
DPxFin:基于声誉加权联邦学习的反洗钱检测中的自适应差分隐私
机构 * A*STAR IHPC(A*STAR 国家实验室信息物理计算中心) ; SRM University-AP(SRM 大学-安得拉邦) ; Evyd Singapore(Evyd 新加坡)
专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.LG
AI总结 本文提出DPxFin框架,通过声誉引导的自适应差分隐私技术,在反洗钱检测中提升隐私保护与模型效用的平衡。
Comments Accepted at AI FOR FINANCIAL FRAUD DETECTION & PREVENTION AT ACM ICAIF-25
IdentityGuard: 基于上下文的限制与溯源的个性化合成
机构 * School of Computer Science and Technology, Fudan University(复旦大学计算机科学与技术学院) ; Institute of Big Data, Fudan University(复旦大学大数据研究院) ; Purple Mountain Laboratories(紫金山实验室)
专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文提出IdentityGuard,通过上下文感知的限制和概念特定水印,实现个性化合成的安全控制,防止滥用同时保持模型效用。
Comments 5 pages, 3 figures, Accepted to ICASSP
MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试
专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。
Comments 17 pages, 5 figures