arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 686 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 686 篇

2603.13385 2026-03-17 cs.CV cs.AI cs.CR cs.IR 70%

VisualLeakBench: Auditing the Fragility of Large Vision-Language Models against PII Leakage and Social Engineering

VisualLeakBench: 对大型视觉-语言模型在PII泄露和社会工程中的脆弱性进行审计

Youting Wang, Yuan Tang, Yitian Qian, Chen Zhao

机构 * Northeastern University(东北大学) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) New York University(纽约大学)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出VisualLeakBench,通过合成对抗图像评估LVLMs对OCR注入和PII泄露的鲁棒性,揭示了Claude~4在PII识别上的高风险及防御策略的模板依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13477 2026-02-26 cs.AI 70%

OMNI-LEAK: Orchestrator Multi-Agent Network Induced Data Leakage

OMNI-LEAK:协调多智能体网络引发的数据泄露

Akshat Naik, Jay Culligan, Yarin Gal, Philip Torr, Rahaf Aljundi, Alasdair Paren, Adel Bibi

机构 * University of Oxford(牛津大学)

专题命中 隐私与版权 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 OMNI-LEAK攻击通过多智能体协调设置中的单个提示注入泄露敏感数据,揭示了多代理系统在数据安全方面的关键漏洞。

Comments Preprint; corrected typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06331 2026-02-09 cs.LG 70%

Don't Break the Boundary: Continual Unlearning for OOD Detection Based on Free Energy Repulsion

不要破坏边界:基于自由能排斥的持续性无学习用于OOD检测

Ningkang Peng, Kun Shao, Jingyang Mao, Linjing Qian, Xiaoqian Peng, Xichen Yang, Yanhui Gu

机构 * School of Computer and Electronic Information, Nanjing Normal University(计算机与电子信息学院,南京师范大学) School of Artificial Intelligence and Information Technology, Nanjing University of Chinese Medicine(人工智能与信息科技学院,南京中医药大学)

专题命中 隐私与版权 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出TFER框架,通过自由能原理构建Push-Pull机制,实现边界保持的持续无学习,提升OOD检测性能和模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00298 2026-02-03 cs.AI 70%

Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning

评估窄微调下领域层面的涌现对齐风险

Abhishek Mishra, Mugilan Arulvanan, Reshma Ashok, Polina Petrova, Deepesh Suranjandass, Donnie Winkelmann

机构 * Anonymous Authors(匿名作者)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文通过评估不同领域中窄微调下的涌现对齐风险,揭示了后门触发器对对齐效果的影响,并提出了基于成员推断度量的预测方法,为AI安全提供了新的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06232 2026-01-13 cs.CR cs.AI 70%

Multi-Agent Framework for Controllable and Protected Generative Content Creation: Addressing Copyright and Provenance in AI-Generated Media

可控且受保护的生成内容创作多智能体框架:解决人工智能生成媒体中的版权和来源问题

Haris Khan, Sadia Asif, Shumaila Asif

机构 * National University of Sciences(国家科学与技术大学) Rensselaer Polytechnic Institute New York, United States(新泽西理工学院纽约分校)

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种多智能体框架,通过集成水印和智能体角色解决生成内容的可控性和版权问题,提升语义对齐和水印恢复率。

Journal ref IEEE ICDM Visionary Innovation in Standards and Technology of GenAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22070 2025-10-28 cs.LG cs.CV eess.IV stat.ML 70%

MAGIC-Flow: Multiscale Adaptive Conditional Flows for Generation and Interpretable Classification

Luca Caldera, Giacomo Bottacini, Lara Cavinato

机构 * MOX, Department of Mathematics Politecnico di Milano(米兰理工大学数学系MOX部门)

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22948 2025-09-30 cs.CL cs.AI cs.CY cs.LG 70%

SUV: Scalable Large Language Model Copyright Compliance with Regularized Selective Unlearning

Tianyang Xu, Xiaoze Liu, Feijie Wu, Xiaoqian Wang, Jing Gao

机构 * Purdue University(普渡大学)

专题命中 隐私与版权 :DPO(abstract);分类 cs.CL、cs.AI、cs.CY

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17530 2025-09-23 cs.LG 70%

An Unlearning Framework for Continual Learning

Sayanta Adhikari, Vishnuprasadh Kumaravelu, P. K. Srijith

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10538 2025-09-16 cs.LG cs.AI cs.CL cs.CY 70%

DualAlign: Generating Clinically Grounded Synthetic Data

Rumeng Li, Xun Wang, Hong Yu

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06632 2025-05-13 cs.CR cs.AI 70%

AI-Powered Anomaly Detection with Blockchain for Real-Time Security and Reliability in Autonomous Vehicles

Rathin Chandra Shit, Sharmila Subudhi

机构 * IIIT Bhubaneswar(比哈尔邦理工学院) Dept. of Computer Science(计算机科学系) Maharaja Sriram Chandra Bhanja Deo University(玛哈拉吉·斯里拉姆·昌德拉·班贾德欧大学)

专题命中 隐私与版权 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments Scheduled for presentation at an upcoming conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06791 2025-04-10 cs.LG 70%

Beware of "Explanations" of AI

David Martens, Galit Shmueli, Theodoros Evgeniou, Kevin Bauer, Christian Janiesch, Stefan Feuerriegel, Sebastian Gabel, Sofie Goethals, Travis Greene, Nadja Klein, Mathias Kraus, Niklas Kühl, Claudia Perlich, Wouter Verbeke, Alona Zharova, Patrick Zschech, Foster Provost

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.LG

Comments This work was inspired by Dagstuhl Seminar 24342

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03194 2024-10-04 cs.CL 70%

MAGID: An Automated Pipeline for Generating Synthetic Multi-modal Datasets

Hossein Aboutalebi, Hwanjun Song, Yusheng Xie, Arshit Gupta, Justin Sun, Hang Su, Igor Shalyminov, Nikolaos Pappas, Siffi Singh, Saab Mansour

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15838 2023-08-01 cs.LG 70%

Holistic Survey of Privacy and Fairness in Machine Learning

Sina Shaham, Arash Hajisafi, Minh K Quan, Dinh C Nguyen, Bhaskar Krishnamachari, Charith Peris, Gabriel Ghinita, Cyrus Shahabi, Pubudu N. Pathirana

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00691 2023-07-04 cs.CR cs.AI 70%

From ChatGPT to ThreatGPT: Impact of Generative AI in Cybersecurity and Privacy

Maanak Gupta, CharanKumar Akiri, Kshitiz Aryal, Eli Parker, Lopamudra Praharaj

专题命中 隐私与版权 :prompt injection(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05608 2026-03-03 cs.CR cs.AI cs.CL cs.LG 69%

BinaryShield: Cross-Service Threat Intelligence in LLM Services using Privacy-Preserving Fingerprints

BinaryShield: 在LLM服务中利用隐私保护指纹实现跨服务威胁情报

Waris Gill, Natalie Isak, Matthew Dressman

机构 * Microsoft Redmond, USA(微软红mond分校) Microsoft New York, USA(微软纽约分校)

专题命中 隐私与版权 :prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)

AI总结 BinaryShield通过隐私保护技术实现跨服务威胁情报共享,提升LLM安全防护能力。

Comments Accepted at the 2026 IEEE Conference on Secure and Trustworthy Machine Learning (SaTML)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18442 2025-01-27 cs.CR cs.AI cs.CY cs.LG 69%

SoK: On the Offensive Potential of AI

Saskia Laura Schröer, Giovanni Apruzzese, Soheil Human, Pavel Laskov, Hyrum S. Anderson, Edward W. N. Bernroider, Aurore Fass, Ben Nassi, Vera Rimmer, Fabio Roli, Samer Salam, Ashley Shen, Ali Sunyaev, Tim Wadhwa-Brown, Isabel Wagner, Gang Wang

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG;trustworthy(comments)

Comments Systematization of Knowledge (SoK) paper. Accepted to the 3rd IEEE Conference on Secure and Trustworthy Machine Learning (SaTML'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新 67%

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29293 2026-07-07 quant-ph 版本更新 67%

Private training in quantum machine learning

量子机器学习中的私有训练

Tigran Sedrakyan, Frédéric Grosshans, Elham Kashefi

专题命中 隐私与版权 :safety(abstract);AI safety(abstract)

AI总结 研究经典差分隐私SGD在混合变分量子模型中的应用,分析梯度裁剪与噪声添加的相互作用,发现量子模型在私有训练中能保持更高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13955 2026-06-26 cs.CL cs.AI cs.CY 67%

Guided Persona-based AI Surveys: Can we replicate personal mobility preferences at scale using LLMs?

引导式基于人设的AI调查:能否利用LLMs在大规模上复制个人移动偏好

Ioannis Tzachristas, Santhanakrishnan Narayanan, Constantinos Antoniou

机构 * Chair of Transportation Systems Engineering, TUM School of Engineering and Design, TUM, Germany(交通系统工程教授、技术大学工程与设计学院、技术大学、德国)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究探讨LLMs生成人工调查的潜力,通过'人设'结合现实数据,有效捕捉德国个人移动偏好中的复杂依赖关系,为交通规划提供可扩展、低成本的数据生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15980 2026-06-23 cs.LG cs.AI cs.CL 新提交 67%

Do Activation Monitors Survive Model Updates? Benchmarking, Predicting, and Repairing Activation-Monitor Staleness

安全监控器在更新后是否仍可靠?激活监控器陈旧性的基准测试与预测

Evan Duan

机构 * University of Michigan(密歇根大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型更新后激活监控器是否仍可靠,发现量化更新影响小,微调更新常导致监控器失效,且可通过预部署特征预测退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15948 2026-06-23 eess.SY cs.SY 新提交 67%

Artificial Intelligence for Power-Converter-Rich Electrical Systems: A Review

人工智能在富含电力电子变换器的电力系统中的应用综述

Pengfeng Lin, Yuan Gao, Yuxi Tang, Muhammad Waqas Qaisar, Peifeng Hui, Chuanlin Zhang, Miao Zhu, Xiaoyong, Cao, Chia-chi Chu, Peng Wang

专题命中 隐私与版权 :alignment(abstract);safety(abstract)

AI总结 本文综述了人工智能在富含电力电子变换器的电力系统全生命周期中的应用,涵盖设计、控制、运行和治理,并指出了部署关键差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21218 2026-06-23 cs.CL cs.AI cs.CR cs.LG 版本更新 67%

EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors

EPSVec: 通过数据集向量实现高效且私密的合成数据生成

Amin Banayeeanzade, Qingchuan Yang, Deqing Fu, Spencer Hong, Erin Babinsky, Alfy Samuel, Anoop Kumar, Robin Jia, Sai Praneeth Karimireddy

机构 * Capital One

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出EPSVec,一种轻量级差分隐私方法,通过提取并净化数据集向量来引导LLM生成合成文本,在低数据场景下实现高保真度,且计算开销低。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07688 2026-06-09 cs.IR cs.AI cs.CL cs.LG 新提交 67%

TRACER: Token ReAssignment for Concept ERasure in Generative Recommendation

TRACER: 面向生成式推荐中概念擦除的令牌重分配

Ziheng Chen, Jiali Cheng, Zezhong Fan, Hadi Amiri, Diyuan Wu, Gabriele Tolomei, Yang Zhang

机构 * Stony Brook University(石英布鲁克大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) Columbia University(哥伦比亚大学) Institute of Science and Technology Austria(奥地利科学技术研究院) Sapienza University of Rome(罗马大学 sapienza) National University of Singapore(新加坡国立大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对生成式推荐中概念遗忘与推荐效用冲突的问题,提出基于令牌重分配的概念遗忘框架TRACER,通过将概念相关物品重分配给替代令牌并引入一致性正则化,有效移除目标概念同时保持推荐效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18879 2026-06-04 cs.LG cs.AI cs.CL 67%

ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models

ZeroUnlearn:大语言模型中的少样本知识遗忘

Yujie Lin, Chengyi Yang, Zhishang Xiang, Yiping Song, Jinsong Su

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ZeroUnlearn框架,通过模型编辑将机器遗忘重新定义为精确的知识重映射问题,利用封闭解乘法参数更新实现高效、定向的少样本遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00467 2026-06-02 cs.CL cs.AI cs.LG stat.ML 67%

On the Limits of LLM Adaptability: Impact of Model-Internalized Priors on Annotation Task Performance

论大语言模型适应性的局限:模型内化先验对标注任务性能的影响

Etienne Casanova, Rafal Kocielnik, R. Michael Alvarez

机构 * University of Washington(华盛顿大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过毒性检测实验,研究大语言模型内化先验与指令交互的三个维度,发现近三分之二的零样本错误难以通过提示纠正,并引入定义特定熟悉度(DSF)指标,证明其与性能正相关,而文本记忆指标则无此关联。

Comments Accepted at ICML 2026 (Oral & Spotlight); PMLR vol. 306. 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20065 2026-04-23 cs.IR 67%

From Hidden Profiles to Governable Personalization: Recommender Systems in the Age of LLM Agents

从隐藏档案到可控个性化:在LLM代理时代推荐系统

Jiahao Liu, Mingzhe Han, Guanming Liu, Weihang Wang, Dongsheng Li, Hansu Gu, Peng Zhang, Tun Lu, Ning Gu

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract)

AI总结 本文探讨LLM代理时代推荐系统从隐藏平台档案转向可控个性化,提出五个研究方向,强调用户模型的透明性、隐私保护及跨领域设计。

Comments 6 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14833 2026-04-17 cs.IR 67%

Federated User Behavior Modeling for Privacy-Preserving LLM Recommendation

联邦用户行为建模用于隐私保护的大语言模型推荐

Lei Guo, Hongyun Yang, Pengjie Ren, Tong Chen, Hui Liu, Zhumin Chen

专题命中 隐私与版权 :alignment(abstract,abstract_cn)

AI总结 本文提出SF-UBM方法,通过语义增强的联邦架构解决跨域推荐中隐私保护问题,整合多模态数据并融合协同过滤信号,提升LLM推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24857 2026-03-27 cs.CR cs.AI cs.CL cs.CV cs.LG 67%

AI Security in the Foundation Model Era: A Comprehensive Survey from a Unified Perspective

在基础模型时代的人工智能安全:从统一视角的综合调查

Zhenyi Wang, Siyu Luan

机构 * University of Central Florida(中佛罗里达大学) University of Copenhagen(哥本哈根大学)

专题命中 隐私与版权 :jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从统一视角出发,系统探讨了基础模型时代AI安全问题,提出统一闭环威胁分类框架,揭示模型与数据之间的双向风险传播,为构建可扩展的安全策略提供理论基础。

Comments Published at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24772 2026-03-27 cs.CL cs.AI cs.LG 67%

Evaluating Fine-Tuned LLM Model For Medical Transcription With Small Low-Resource Languages Validated Dataset

评估细调LLM模型在医疗转录中的表现:针对小规模低资源语言验证数据集

Mohammed Nowshad Ruhani Chowdhury, Mohammed Nowaz Rabbani Chowdhury, Sakari Lukkarinen

机构 * School of ICT and Industrial Management(信息通信技术与工业管理学院) Metropolia University of Applied Sciences(Metropolia应用科学大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过在有限的芬兰语验证数据集上微调LLaMA 3.1-8B,评估了领域对齐的NLP模型在医疗转录中的有效性,结果显示BLEU、ROUGE-L和BERTScore F1等指标表现良好,表明细调在芬兰语医疗口语转录中的可行性。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02882 2026-03-04 cs.CV 67%

SIGMark: Scalable In-Generation Watermark with Blind Extraction for Video Diffusion

SIGMark: 用于视频扩散模型的可扩展生成内水印与盲提取

Xinjie Zhu, Zijing Zhao, Hui Jin, Qingxiao Guo, Yilong Ma, Yunhao Wang, Xiaobing Guo, Weifeng Zhang

机构 * Lenovo Research(联想研究院)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract)

AI总结 SIGMark是一种用于视频扩散模型的可扩展生成内水印框架,通过盲提取技术实现无损水印并提升鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏