arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 684 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 684 篇

1710.02770 2026-06-04 cs.LO cs.SE cs.SY eess.SY 78%

Proceedings 2nd International Workshop on Causal Reasoning for Embedded and safety-critical Systems Technologies

第二届嵌入式和安全关键系统技术因果推理国际研讨会论文集

Alex Groce, Stefan Leue

专题命中 隐私与版权 :safety(title,abstract)

AI总结 本文探讨了复杂嵌入式和安全关键系统中因果推理的方法,旨在促进不同领域研究者之间的交流,以提升关键系统故障根本原因分析的科学性。

Journal ref EPTCS 259, 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05277 2026-05-08 cs.CR 78%

GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy

GLiNER Guard:面向生产LLM安全与隐私的统一编码器家族

Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

专题命中 隐私与版权 :safety(title,abstract)

AI总结 本文提出GLiNER Guard统一编码器,实现安全分类与PII检测,提升生产LLM的安全性和隐私保护效率。

Comments Models: https://huggingface.co/collections/hivetrace/gliner-guard-v1 PII-Bench: https://huggingface.co/datasets/hivetrace/pii-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13728 2026-03-19 cs.CV cs.CR 78%

Bodhi VLM: Privacy-Alignment Modeling for Hierarchical Visual Representations in Vision Backbones and VLM Encoders via Bottom-Up and Top-Down Feature Search

Bodhi VLM:通过自上而下和自下而上的特征搜索实现视觉主干和VLM编码器中层次视觉表示的隐私对齐建模

Bo Ma, Wei Qi Yan, Jinsong Wu

机构 * Auckland University of Technology(奥克兰技术大学) Resideo Technologies, Inc.(Resideo技术公司) Guilin University of Electronic Technology(桂林电子科技大学) Universidad de Chile(智利大学)

专题命中 隐私与版权 :alignment(title,abstract)

AI总结 本文提出Bodhi VLM框架,通过NCP和MDAV聚类将敏感概念与分层神经表示的层间分组关联,并利用自上而下和自下而上的策略定位敏感特征区域,结合EMPA模块生成可解释的隐私预算对齐信号,验证了在目标检测和VLM视觉编码器中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08882 2026-02-17 cs.HC cs.CV 78%

Designing Multi-Robot Ground Video Sensemaking with Public Safety Professionals

设计多机器人地面视频感知以服务于公共安全专业人员

Puqi Zhou, Ali Asgarov, Aafiya Hussain, Wonjoon Park, Amit Paudyal, Sameep Shrestha, Chia-wei Tang, Michael F. Lighthiser, Michael R. Hieb, Xuesu Xiao, Chris Thomas, Sungsoo Ray Hong

机构 * George Mason University(乔治·玛森大学) University of Maryland(马里兰大学)

专题命中 隐私与版权 :safety(title,abstract)

AI总结 本文提出了一种多机器人地面视频感知测试平台和MRVS工具,旨在提升公共安全专业人员的情报意识和工作效率,同时关注假警报和隐私问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13390 2026-01-27 cs.CV 78%

Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment

通过大模型感知的语义蒸馏与对齐实现WiFi手势识别的泛化

Feng-Qi Cui, Yu-Tong Guo, Tianyue Zheng, Jinyang Huang

机构 * Institute of Advanced Technology, University of Science and Technology of China(科学技术大学先进技术研究院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) School of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程学院)

专题命中 隐私与版权 :alignment(title,abstract)

AI总结 GLSDA通过大模型感知的语义蒸馏与对齐提升WiFi手势识别的泛化能力,实现领域内和跨领域任务的高性能识别。

Comments Accepted by IEEE ICPADS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11398 2026-01-19 cs.CR 78%

Understanding Help Seeking for Digital Privacy, Safety, and Security

理解数字隐私、安全和安全性的求助行为

Kurt Thomas, Sai Teja Peddinti, Sarah Meiklejohn, Tara Matthews, Amelia Hassoun, Animesh Srivastava, Jessica McClearn, Patrick Gage Kelley, Sunny Consolvo, Nina Taft

专题命中 隐私与版权 :safety(title,abstract)

AI总结 研究通过分析Reddit帖子了解用户在数字隐私、安全和安全问题上的求助行为,并为开发更好的用户资源提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20991 2025-12-16 cs.CV 78%

MR-COSMO: Visual-Text Memory Recall and Direct CrOSs-MOdal Alignment Method for Query-Driven 3D Segmentation

MR-COSMO:一种用于查询驱动3D分割的视觉-文本记忆召回与直接跨模态对齐方法

Chade Li, Pengju Zhang, Yihong Wu

专题命中 隐私与版权 :alignment(title,abstract)

AI总结 MR-COSMO通过视觉-文本记忆召回与直接跨模态对齐方法,在查询驱动的3D分割中实现几何与语义特征的精确融合,提升点云分割性能。

Comments Accepted by AAAI 2026. Copyright (c) 2026, Association for the Advancement of Artificial Intelligence (www.aaai.org). All rights reserved

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17201 2025-11-24 cs.CV 78%

Continual Alignment for SAM: Rethinking Foundation Models for Medical Image Segmentation in Continual Learning

持续对齐用于SAM:重新思考面向持续学习的医学图像分割的基础模型

Jiayi Wang, Wei Dai, Haoyu Wang, Sihan Yang, Haixia Bi, Jian Sun

机构 * Xi’an Jiaotong University(西安交通大学) School of Information and Communications Engineering, Xi’an Jiaotong University(信息与通信工程学院) School of Mathematics and Statistics, Xi’an Jiaotong University(数学与统计学学院)

专题命中 隐私与版权 :alignment(title,abstract)

AI总结 CA-SAM通过引入对齐层,实现了在持续学习中高效适应医学图像分割,提升性能并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11030 2025-08-29 cs.HC 78%

Families' Vision of Generative AI Agents for Household Safety Against Digital and Physical Threats

Zikai Wen, Lanjing Liu, Yaxing Yao

专题命中 隐私与版权 :safety(title,abstract)

Comments Accepted in Proc. ACM Hum.-Comput. Interact. 9, 7, Article CSCW

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18518 2025-08-01 cs.IR 78%

Transform Before You Query: A Privacy-Preserving Approach for Vector Retrieval with Embedding Space Alignment

Ruiqi He, Zekun Fei, Jiaqi Li, Xinyuan Zhu, Biao Yi, Siyi Lv, Weijie Liu, Zheli Liu

专题命中 隐私与版权 :alignment(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10246 2024-12-31 q-bio.NC cs.AI cs.CL cs.CV cs.HC cs.LG 78%

Deep Neural Networks and Brain Alignment: Brain Encoding and Decoding (Survey)

Subba Reddy Oota, Zijiao Chen, Manish Gupta, Raju S. Bapi, Gael Jobard, Frederic Alexandre, Xavier Hinaut

专题命中 隐私与版权 :alignment(title);分类 cs.CL、cs.AI、cs.LG

Comments 61 pages, 22 figures

Journal ref Published in Transactions on Machine Learning Research (12/2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01273 2024-12-03 cs.HC cs.CV 78%

AR-Facilitated Safety Inspection and Fall Hazard Detection on Construction Sites

Jiazhou Liu, Aravinda S. Rao, Fucai Ke, Tim Dwyer, Benjamin Tag, Pari Delir Haghighi

专题命中 隐私与版权 :safety(title,abstract)

Comments 2 pages, 1 figure, ISMAR24 Workshop Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05579 2024-05-10 cs.HC cs.SY eess.SY 78%

Intelligent EC Rearview Mirror: Enhancing Driver Safety with Dynamic Glare Mitigation via Cloud Edge Collaboration

Junyi Yang, Zefei Xu, Huayi Lai, Hongjian Chen, Sifan Kong, Yutong Wu, Huan Yang

专题命中 隐私与版权 :safety(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.10824 2023-03-21 cs.CV cs.CR 78%

k-SALSA: k-anonymous synthetic averaging of retinal images via local style alignment

Minkyu Jeon, Hyeonjin Park, Hyunwoo J. Kim, Michael Morley, Hyunghoon Cho

专题命中 隐私与版权 :alignment(title,abstract)

Comments European Conference on Computer Vision (ECCV), 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.14689 2022-02-18 eess.SP 78%

Machine Learning Assisted Phase-less Millimeter-Wave Beam Alignment in Multipath Channels

Benjamin W. Domae, Ruifu Li, Danijela Cabric

专题命中 隐私与版权 :alignment(title,abstract)

Comments Accepted to 2021 IEEE Global Communications Conference (GLOBECOM), 6 pages (without copyright notice), 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13088 2026-07-16 cs.CR cs.LG 新提交 77%

Securing LLMs in the Wild: Privacy and Security Challenges at the Edge

保障野外大语言模型安全:边缘环境下的隐私与安全挑战

Ren-Yi Huang, Mingchen Li, Dumindu Samaraweera, Morris Chang

机构 * Department of Electrical and Computer Engineering, University of South Florida(电子与计算机工程系,佛罗里达州立大学) Department of Mathematics, Embry-Riddle Aeronautical University(数学系,埃默里-瑞德航空大学)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究边缘大语言模型安全隐私挑战,围绕内存墙等架构约束引入分类法,得出统一约束模型,提出安全操作效率得分,给出决策程序和缓解措施,为联合评估安全、隐私和效率提供框架,保障边缘原生智能系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04960 2025-02-03 cs.CR cs.AI cs.CL cs.CY cs.LG 77%

IsolateGPT: An Execution Isolation Architecture for LLM-Based Agentic Systems

Yuhao Wu, Franziska Roesner, Tadayoshi Kohno, Ning Zhang, Umar Iqbal

专题命中 隐私与版权 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted by the Network and Distributed System Security (NDSS) Symposium 2025

Journal ref The Network and Distributed System Security (NDSS) Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13678 2024-12-19 cs.CY cs.AI cs.CL cs.CR cs.LG 77%

Clio: Privacy-Preserving Insights into Real-World AI Use

Alex Tamkin, Miles McCain, Kunal Handa, Esin Durmus, Liane Lovitt, Ankur Rathi, Saffron Huang, Alfred Mountfield, Jerry Hong, Stuart Ritchie, Michael Stern, Brian Clarke, Landon Goldberg, Theodore R. Sumers, Jared Mueller, William McEachen, Wes Mitchell, Shan Carter, Jack Clark, Jared Kaplan, Deep Ganguli

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21656 2026-03-24 cs.LG cs.CY 76%

TrustFed: Enabling Trustworthy Medical AI under Data Privacy Constraints

TrustFed: 在数据隐私约束下实现可信的医疗AI

Vagish Kumar, Syed Bahauddin Alam, Souvik Chakraborty

机构 * Department of Applied Mechanics(应用力学系) Indian Institute of Technology Delhi(印度理工学院德里) Grainger College of Engineering(工程学院) Nuclear, Plasma & Radiological Engineering Department(核物理与辐射工程系) National Center for Supercomputing Applications(国家超级计算应用中心) Yardi School of Artificial Intelligence (ScAI)(Yardi人工智能学院(ScAI)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 隐私与版权 :trustworthy(title);分类 cs.CY、cs.LG

AI总结 TrustFed通过联邦不确定性量化框架,在异构和不平衡医疗数据上提供分布无关的有限样本覆盖保证,无需集中访问,提升预测可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13181 2025-06-17 cs.CL cs.LG 76%

Align-then-Unlearn: Embedding Alignment for LLM Unlearning

Philipp Spohn, Leander Girrbach, Jessica Bader, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning, MDSI, Helmholtz Munich(慕尼黑机器学习中心,MDSI,海德堡慕尼黑)

专题命中 隐私与版权 :alignment(title);分类 cs.CL、cs.LG

Comments Accepted at ICML 2025 Workshop on Machine Unlearning for Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15231 2025-04-16 cs.LG cs.AI 76%

IterIS: Iterative Inference-Solving Alignment for LoRA Merging

Hongxu Chen, Runshi Li, Bowei Zhu, Zhen Wang, Long Chen

专题命中 隐私与版权 :alignment(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09980 2026-03-12 cs.LG cs.AI cs.CL 75%

Explainable LLM Unlearning Through Reasoning

通过推理实现可解释的LLM反学习

Junfeng Liao, Qizhou Wang, Shanshan Ye, Xin Yu, Ling Chen, Zhen Fang

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于推理的反学习方法TRU,通过引入推理引导的反学习目标,实现更可靠且可解释的LLM反学习,同时保持模型通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17480 2026-01-27 cs.LG cs.AI cs.CL 75%

Unintended Memorization of Sensitive Information in Fine-Tuned Language Models

在微调语言模型中意外记忆敏感信息

Marton Szep, Jorge Marin Ruiz, Georgios Kaissis, Paulina Seidl, Rüdiger von Eisenhart-Rothe, Florian Hinterwimmer, Daniel Rueckert

机构 * TUM University Hospital(慕尼黑工业大学医院) Technical University of Munich (TUM)(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Department of Computing, Imperial College London(伦敦帝国学院计算系)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示微调语言模型时意外记忆敏感信息的风险,分析影响因素并评估隐私保护方法的权衡。

Comments Accepted to EACL 2026. 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02671 2026-01-07 cs.CL cs.AI cs.LG 75%

Extracting books from production language models

从生产语言模型中提取书籍

Ahmed Ahmed, A. Feder Cooper, Sanmi Koyejo, Percy Liang

机构 * Stanford University(斯坦福大学) Yale University(耶鲁大学)

专题命中 隐私与版权 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过两阶段方法测试从生产LLM中提取书籍的可行性,发现部分模型可提取受版权保护文本,但需不同劫持策略,揭示生产LLM存在训练数据泄露风险。

Comments We ran experiments from mid-August to mid-September 2025, notified affected providers shortly after, and now make our findings public after a 90-day disclosure window

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06831 2026-04-09 cs.CR cs.AI 74%

Towards Privacy-Preserving Large Language Model: Text-free Inference Through Alignment and Adaptation

面向隐私保护的大语言模型:通过对齐与适应实现文本-free推理

Jeongho Yoon, Chanhee Park, Yongchan Chun, Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(高丽大学计算机科学与工程系) Samsung Mobile eXperience Business(三星移动体验事业部)

专题命中 隐私与版权 :alignment(title);分类 cs.AI

AI总结 本文提出PPFT方法,通过客户端编码器与服务器投影模块的协同训练,实现无需传输原始文本的隐私保护推理,平衡隐私与模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15550 2026-01-21 cs.CR cs.AI 74%

Zero-Knowledge Federated Learning: A New Trustworthy and Privacy-Preserving Distributed Learning Paradigm

零知识联邦学习:一种新的可信且隐私保护的分布式学习范式

Taotao Wang, Yuxin Jin, Qing Yang, Yihan Xia, Long Shi, Shengli Zhang

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Electronic and Optical Engineering, Nanjing University of Science and Technology(南京理工大学电子与光学工程学院)

专题命中 隐私与版权 :trustworthy(title);分类 cs.AI

AI总结 本文提出了一种基于零知识证明的联邦学习框架,通过可验证的客户端选择算法提升系统信任与安全性。

Comments Accepted by IEEE Communications Magazine. Copyright IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26025 2025-11-05 cs.LG 74%

Exploring Human-AI Conceptual Alignment through the Prism of Chess

Semyon Lomasov, Judah Goldfeder, Mehmet Hamza Erol, Matthew So, Yao Yan, Addison Howard, Nathan Kutz, Ravid Shwartz Ziv

机构 * Stanford University(斯坦福大学) Columbia University(哥伦比亚大学) Kaggle University of Washington(华盛顿大学) NYU(纽约大学)

专题命中 隐私与版权 :alignment(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21695 2025-09-29 cs.LG 74%

Wav2Arrest 2.0: Long-Horizon Cardiac Arrest Prediction with Time-to-Event Modeling, Identity-Invariance, and Pseudo-Lab Alignment

Saurabh Kataria, Davood Fattahi, Minxiao Wang, Ran Xiao, Matthew Clark, Timothy Ruchti, Mark Mai, Xiao Hu

机构 * Nell Hodgson Woodruff School of Nursing, Emory University(埃默里大学护理学院) Department of Pediatrics, Emory School of Medicine(埃默里医学院儿科部)

专题命中 隐私与版权 :alignment(title);分类 cs.LG

Comments Submitted to BPSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12158 2025-08-19 cs.CL 74%

LLM-as-a-Judge for Privacy Evaluation? Exploring the Alignment of Human and LLM Perceptions of Privacy in Textual Data

Stephen Meisenbacher, Alexandra Klymenko, Florian Matthes

机构 * Technical University of Munich School of Computation, Information(慕尼黑技术大学计算、信息与技术学院)

专题命中 隐私与版权 :alignment(title);分类 cs.CL

Comments 13 pages, 3 figures, 4 tables. Accepted to HAIPS @ CCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04071 2025-06-05 cs.LG cs.CV 74%

Optimal Transport-based Domain Alignment as a Preprocessing Step for Federated Learning

Luiz Manella Pereira, M. Hadi Amini

专题命中 隐私与版权 :alignment(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏