arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 686 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 686 篇

2607.00379 2026-07-02 cs.IR cs.CV 新提交 50%

Attribute-Prompted Kernel Hashing for Unsupervised Data-Efficient Cross-Modal Retrieval

属性提示核哈希用于无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) VinUniversity

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出属性提示核哈希(APKH),利用视觉-语言基础模型的广义属性先验,通过上下文优化属性核映射和核平滑对比对齐,在数据受限场景下实现从可见到不可见类别的跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31935 2026-07-01 econ.EM 新提交 50%

Delegation Rights: Property, Agency, and Investment Incentives in the Age of AI Agents

委托权:AI代理时代中的财产、代理与投资激励

Yukun Zhang, Kemu Xu

专题命中 隐私与版权 :safety(abstract)

AI总结 本文定义委托权为账户持有人授权代理执行的可撤销、身份保留、范围受限且模式特定的权限,通过三方不完全契约模型分析平台控制、用户控制与认证委托三种机制对投资激励和风险分配的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24424 2026-06-24 eess.SP 新提交 50%

Explainable AI for Next-Generation Wireless Physical Layer: Basics, State-of-the-Art, and Open Challenges

下一代无线物理层的可解释人工智能:基础、最新进展与开放挑战

Bingnan Xiao, Shuyan Hu, Xiaojing Chen, Zhiyuan Zhai, Bingcong Li, Wei Ni, Xin Wang, Ekram Hossain

专题命中 隐私与版权 :safety(abstract)

AI总结 本文综述了无线物理层中可解释人工智能(XAI)的应用,提出了面向责任的目标,建立了系统分类法,并讨论了可解释性-性能权衡等开放挑战。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23179 2026-06-19 eess.IV cs.CV 版本更新 50%

OncoReg: Medical Image Registration for Oncological Challenges

OncoReg:面向肿瘤学挑战的医学图像配准

Wiebke Heyer, Yannic Elser, Lennart Berkel, Xinrui Song, Xuanang Xu, Pingkun Yan, Xi Jia, Jinming Duan, Zi Li, Tony C. W. Mok, BoWen LI, Tim Hable, Christian Staackmann, Christoph Großbröhmer, Lasse Hansen, Alessa Hering, Malte M. Sieren, Mattias P. Heinrich

机构 * Institute of Medical Informatics, University of Lübeck(吕贝克大学医学信息学研究所) Institute of Radiology and Nuclear Medicine, University Hospital Schleswig-Holstein(石勒斯维希-霍尔斯坦大学医院放射科和核医学研究所) Department of Biomedical Engineering and Center for Biotechnology and Interdisciplinary Studies, Rensselaer Polytechnic Institute(伦塞拉塞尔理工学院生物医学工程系和生物技术与跨学科研究中心) School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院) Division of Informatics, Imaging and Data Sciences, University of Manchester(曼彻斯特大学信息学、成像和数据科学系) DAMO Academy, Alibaba Group(阿里集团DAMO学院) Hangzhou Shengshi Technology Co., Ltd(杭州盛世科技有限公司) Department of Radiation Oncology, University Hospital Schleswig-Holstein(石勒斯维希-霍尔斯坦大学医院放射肿瘤科) EchoScout GmbH Radboud University Medical Center, Nijmegen(奈密根大学医学中心) Institute of Interventional Radiology, University Hospital Schleswig-Holstein(石勒斯维希-霍尔斯坦大学医院介入放射科)

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出OncoReg挑战,通过两阶段框架在保护患者隐私的同时开发可泛化的图像配准方法,用于放射治疗中锥束CT与扇束CT的配准,发现特征提取是关键,深度学习和经典方法结合最有效。

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12341 2026-06-11 cs.CR 新提交 50%

OCELOT: Inference-Leakage Budgets for Privacy-Preserving LLM Agents

OCELOT:面向隐私保护LLM代理的推理泄露预算

Jin Xie, Songze Li

专题命中 隐私与版权 :jailbreak(abstract)

AI总结 提出OCELOT运行时中介,通过后验风险控制和证人验证降级机制,在代理轨迹中预算对手信念更新,平衡任务效用与隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04799 2026-06-09 cs.CR 版本更新 50%

Maris: A Formally Verifiable Privacy Policy Enforcement Paradigm for Multi-Agent Collaboration Systems

Maris:一种用于多智能体协作系统的形式化可验证隐私策略执行范式

Jian Cui, Zichuan Li, Chi Wang, Luyi Xing, Xiaojing Liao

专题命中 隐私与版权 :prompt injection(abstract)

AI总结 针对多智能体协作系统(MACS)中敏感数据泄露风险,提出一种基于引用监视器的隐私增强开发范式Maris,通过嵌入消息流控制机制实现细粒度数据保护,并在AutoGen和LangChain框架中实现,实验表明其能有效缓解数据泄露威胁且保持高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03190 2026-06-03 cs.HC 50%

Focused on the User, Overlooking the Risks: Security and Privacy Understandings, Practices and Challenges of Independent Chinese AI Agent Developers

聚焦用户,忽视风险:中国独立AI代理开发者的安全与隐私理解、实践与挑战

Shuning Zhang, Mingyao Xu, Zhixin Huang, Yutong Jiang, Rongjun Ma, Yuting Yang, Xin Yi, Kanye Ye Wang, Hewu Li

专题命中 隐私与版权 :safety(abstract)

AI总结 通过访谈28名中国独立AI代理开发者,发现他们以用户为中心,关注面向用户的安全风险(如有害内容),但对安全漏洞意识薄弱,依赖临时手动防护和非正式沟通,缺乏正式工具和流程,主要受限于缺乏安全培训、工具和平台指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01225 2026-06-02 cs.CR 50%

Privacy-Preserving Smart Surveillance with Cross-Dataset Violence Detection and Decentralized Evidence Governance

隐私保护的智能监控:跨数据集暴力检测与去中心化证据治理

Hasan Coşkun, Furkan Çolhak, Andrea Kulakov, Vesna Dimitrova

专题命中 隐私与版权 :safety(abstract)

AI总结 提出一种隐私保护智能监控框架,使用轻量级MobileNetV2视频分类器检测暴力片段,并通过Shamir秘密共享和公钥加密实现去中心化证据访问控制,在多个数据集上评估了不同时序模型的表现。

Comments 7 pages. Submitted to the CyberMACS Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09781 2026-05-28 cs.CR 50%

CLIOPATRA: Extracting Private Information from LLM Insights

CLIOPATRA: 从LLM洞察中提取隐私信息

Meenatchi Sundaram Muthu Selva Annamalai, Emiliano De Cristofaro, Peter Kairouz

专题命中 隐私与版权 :prompt injection(abstract)

AI总结 提出CLIOPATRA攻击,通过注入恶意聊天突破多层启发式隐私保护,从LLM洞察系统中提取目标用户敏感信息,在合成医疗聊天中高达65%成功率且几乎100%精确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06304 2026-05-28 cs.CR 50%

SRAF: Stealthy and Robust Adversarial Fingerprint for Copyright Verification of Large Language Models

SRAF:用于大语言模型版权验证的隐蔽且鲁棒的对抗指纹

Zhebo Wang, Zhenhua Xu, Maike Li, Wenpeng Xing, Chunqiang Hu, Chen Zhi, Meng Han

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出SRAF框架,通过协同联合优化和困惑度隐藏技术,在多种模型修改下实现鲁棒且隐蔽的对抗指纹,用于大语言模型所有权验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26882 2026-05-27 cs.CR 50%

Privacy-Preserving Screening for Record Linkage

隐私保护的记录链接筛选

Chenyu Huang, Fan Zhang, Huangxun Chen, Yongjun Zhao, Huaming Rao, Peng Chen, Danqing Huang

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出 Screening-then-Linkage 框架,通过轻量级筛选阶段降低隐私保护记录链接的计算开销,并基于电路PSI设计Appraisal系统实现高效安全筛选。

Comments 14 pages; 2025 IEEE 41st International Conference on Data Engineering (ICDE)

Journal ref 2025 IEEE 41st International Conference on Data Engineering (ICDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22139 2026-05-22 cs.CV 50%

EventGait: Towards Robust Gait Recognition with Event Streams

EventGait: 向事件流中实现鲁棒的步态识别

Senyan Xu, Shuai Chen, Chuanfu Shen, Kean Liu, Zhijing Sun, Chengzhi Cao, Xueyang Fu

机构 * University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出EventGait,一种端到端的双流框架,通过事件相机捕捉动态和形状信息,提升在复杂光照和运动环境下的步态识别鲁棒性,并通过合成数据集和新基准测试验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00273 2026-05-19 cs.HC 50%

Understanding, Challenging, and Demystifying Perceptions of Gig Worker Vulnerabilities

理解、挑战和祛魅网约车工人脆弱性感知

Sander de Jong, Jane Hsieh, Tzu-Sheng Kuo, Rune Møberg Jacobsen, Niels van Berkel, Haiyi Zhu

专题命中 隐私与版权 :safety(abstract)

AI总结 本文研究了网约车工人对自身脆弱性的认知及误解,通过实验发现工人对常见误解的认知不足,提出通过说服策略提升公众对网约车工人劳动条件的认识,以支持集体谈判权益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15791 2026-05-18 cs.NI cs.SY eess.SY 50%

The Shared Prosperity Internet

共享繁荣互联网

Juan A. Cabrera, Pit Hofmann, Jonas Schulz, Frederic Benken, Hrjehor Mark, Giang T. Nguyen, Holger Boche, Frank H. P. Fitzek

专题命中 隐私与版权 :safety(abstract)

AI总结 本文提出共享繁荣互联网架构,通过映射物理约束到三个原则,构建了三个技术支柱,旨在使自动化和AI的效益广泛普及,并定义了可衡量的成果指标。

Comments 8 pages, conference, 4 figures, 16 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14387 2026-05-15 cs.CR eess.SP 50%

Model Forensics in AI-Native Wireless Networks: Taxonomy, Applications, and Case Study

无线网络中的人工智能原生模型取证:分类、应用与案例研究

Pengyu Chen, Weiyang Li, Jin Xu, Jiacheng Wang, Ning Wang, Dusit Niyato, Tao Xiang

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 本文探讨了人工智能原生无线网络中的模型取证问题,包括模型真实性验证、恶意功能识别和责任追溯,通过RF指纹案例展示取证技术的实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12552 2026-05-14 cs.NI eess.SP 50%

DQN-Driven Adaptive Neighbor Discovery for Directional Aerial Networks

基于DQN的自适应邻居发现方向空中网络

Md Asif Ishrak Sarder, Murat Yuksel, Elizabeth Bentley

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出基于DQN的自适应收发机选择协议,解决方向空中网络中邻居发现与隐私保护的平衡问题,通过动态调整探测模式提升连接效率和隐私保护。

Comments Accepted at IEEE ICC 2025. This is the author-accepted manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08104 2026-05-12 cs.CR 50%

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

AgentCrypt: 推动AI代理协作中的隐私与(安全)计算发展

Harish Karthikeyan, Yue Guo, Leo de Castro, Antigoni Polychroniadou, Udari Madhushani Sehwag, Leo Ardon, Sumitra Ganesh, Manuela Veloso

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 AgentCrypt通过三层框架提升AI代理协作中的隐私和安全计算,解决传统访问控制不足和LLM安全性的不足问题,实现数据安全计算和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06630 2026-05-08 eess.SY cs.SY 50%

Quantifying Trade-Offs Between Stability and Goal-Obfuscation

量化稳定性与目标混淆之间的权衡

Yixuan Wang, Dan Guralnik, Warren Dixon

专题命中 隐私与版权 :safety(abstract)

AI总结 本文研究了在连续状态空间中意图隐私的联合控制问题,通过设计隐私约束与跟踪要求的联合可行性分析,提出了基于PCBF的意图隐私保护方法。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10171 2026-04-23 cs.CV cs.ET 50%

SynSpill: Improved Industrial Spill Detection With Synthetic Data

SynSpill:基于合成数据的改进工业泄漏检测

Aaditya Baranwal, Abdul Mueez, Jason Voelker, Guneet Bhatia, Shruti Vyas

机构 * University of Central Florida(佛罗里达中央大学) Siemens Energy(西门子能源)

专题命中 隐私与版权 :safety(abstract)

AI总结 针对工业泄漏检测中数据稀缺问题,提出基于高质量合成数据生成的框架,通过参数高效微调提升VLMs和检测器性能,实现安全关键领域的有效应用。

Comments Accepted at ICCV (VISION'25 Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 1425-1434

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15369 2026-04-20 cs.CR 50%

An Agentic Workflow for Detecting Personally Identifiable Information in Crash Narratives

一种用于检测事故叙述中个人可识别信息的代理工作流

Junyi Ma, Pei Li, Rui Gan, Kai Cheng, Steven T. Parker, Bin Ran

专题命中 隐私与版权 :safety(abstract)

AI总结 本文提出一种本地部署的代理工作流,利用大语言模型检测事故叙述中的个人可识别信息,通过混合提取器和验证器提升检测精度与召回率,实现隐私保护的可扩展数据处理。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12127 2026-04-15 cs.NI 50%

BLAST: Blockchain-based LLM-powered Agentic Spectrum Trading

BLAST:基于区块链的大型语言模型驱动的代理频谱交易

Anas Abognah, Otman Basir

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 本文提出BLAST框架,结合大型语言模型代理与许可区块链,实现自主、隐私和安全的频谱交易生态系统。通过三种拍卖机制评估,证明第二价格拍卖在提升社会福利和分配效率方面最优,同时验证了隐私保护机制。

Comments This work has been submitted to the IEEE Transactions on Cognitive Communications and Networking for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11772 2026-04-14 cs.CR 50%

Towards Automated Pentesting with Large Language Models

向大型语言模型迈进的自动化渗透测试

Ricardo Bessa, Rui Claro, João Trindade, João Lourenço

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出RedShell框架,利用微调的LLM生成针对Windows漏洞的恶意PowerShell代码,实现高效隐私保护的渗透测试自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10052 2026-04-14 cs.CR cs.NI 50%

Impact of Intelligent Technologies on IoV Security: Integrating Edge Computing and AI

智能技术对车联网安全的影响:整合边缘计算和人工智能

Awais Bilal, Kashif Sharif, Liehuang Zhu, Chang Xu, Fan Li, Sadaf Bukhari, Sujit Biswas

专题命中 隐私与版权 :safety(abstract)

AI总结 本文探讨智能技术在车联网安全中的作用,分析边缘计算、机器学习和深度学习的协同效应,展示其在威胁检测、响应时间和适应性安全方面的贡献,并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08352 2026-04-10 cs.SE cs.CR cs.HC 50%

Security Concerns in Generative AI Coding Assistants: Insights from Online Discussions on GitHub Copilot

生成式AI代码助手的安全问题:来自GitHub Copilot在线讨论的洞察

Nicolás E. Díaz Ferreyra, Monika Swetha Gurupathi, Zadia Codabux, Nalin Arachchilage, Riccardo Scandariato

专题命中 隐私与版权 :prompt injection(abstract)

AI总结 研究分析开发者在公共论坛中提出的安全问题,识别出数据泄露、代码授权、对抗攻击和不安全代码建议等四大安全关切,揭示生成式AI在软件工程中的局限性与权衡。

Comments Accepted for publication at EASE '26 Companion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02711 2026-04-10 eess.SP 50%

Foundation Models Defining A New Era In Sensor-based Human Activity Recognition: A Survey And Outlook

基于传感器的人类活动识别的基石模型:一种综述与展望

Sizhen Bian, Mengxi Liu, Lala Shakti Swarup Ray, Bo Zhou, Bin Guo, Zhiwen Yu, Thomas Ploetz, Paul Lukowicz, Siyu Yuan, Vitor Fortes Rey

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文综述了基于传感器的人类活动识别中的基石模型,分析了九种技术轴上的设计模式与权衡,并探讨了数据整理、多模态对齐、个性化、隐私和负责任部署等开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26167 2026-04-09 cs.CV cs.CR 50%

Gaussian Shannon: High-Precision Diffusion Model Watermarking Based on Communication

高斯香农:基于通信的高精度扩散模型水印技术

Yi Zhang, Hongbo Huang, Liang-Jie Zhang

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 本文提出Gaussian Shannon水印框架,通过将扩散过程视为噪声通信信道,实现鲁棒追踪和精确位恢复,适用于无损元数据应用。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11548 2026-04-08 cs.CR 50%

Copyright Protection for Large Language Models: A Survey of Methods, Challenges, and Trends

大型语言模型的版权保护:方法、挑战与趋势的综述

Zhenhua Xu, Xubin Yue, Zhebo Wang, Haobo Zhang, Qichen Liu, Xixiang Zhao, Jingxuan Zhang, Wenjun Zeng, Wengpeng Xing, Dezhang Kong, Changting Lin, Meng Han

专题命中 隐私与版权 :harmlessness(abstract)

AI总结 本文综述了大型语言模型版权保护现状,重点探讨了模型指纹技术,涵盖文本水印与模型水印的关联、多种文本水印技术对比、模型指纹分类、指纹转移与去除技术及评估指标,揭示了开放挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04905 2026-04-07 cs.CV cs.GR cs.HC 50%

ClickAIXR: On-Device Multimodal Vision-Language Interaction with Real-World Objects in Extended Reality

ClickAIXR: 基于设备的多模态视觉-语言交互与现实世界对象在扩展现实中的交互

Dawar Khan, Alexandre Kouyoumdjian, Xinyu Liu, Omar Mena, Dominik Engel, Ivan Viola

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 隐私与版权 :trustworthy(abstract)

AI总结 ClickAIXR通过设备端视觉-语言模型与基于控制器的对象选择方法,实现对现实世界对象的精确点击交互,提升隐私和延迟方面的可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00592 2026-04-02 cs.CV cs.HC 50%

HarassGuard: Detecting Harassment Behaviors in Social Virtual Reality with Vision-Language Models

HarassGuard: 在社交虚拟现实中利用视觉-语言模型检测骚扰行为

Junhee Lee, Minseok Kim, Hwanjo Heo, Seungwon Woo, Jinwoo Kim

机构 * Kwangwoon University(光云大学) ETRI(韩国电子通信研究院) Chungbuk National University(忠北大学)

专题命中 隐私与版权 :safety(abstract)

AI总结 本文提出HarassGuard系统,通过视觉输入检测社交VR中的身体骚扰行为,利用提示工程和微调VLMs,在不使用敏感生物数据的情况下实现高准确率的骚扰检测。

Comments To appear in the 2026 TVCG Special Issue on the 2026 IEEE Conference on Virtual Reality and 3D User Interfaces (VR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22674 2026-03-25 cs.HC 50%

Designing a Meta-Reflective Dashboard for Instructor Insight into Student-AI Interactions

设计一个元反思仪表盘,以帮助教师了解学生与AI的互动

Boxuan Ma, Baofeng Ren, Huiyong Li, Gen Li, Li Chen, Atsushi Shimada, Shin'Ichi Konomi

专题命中 隐私与版权 :alignment(abstract)

AI总结 本文提出一个元反思仪表盘,通过结构化总结学生与AI的交互轨迹和潜在风险,帮助教师在不暴露原始聊天记录的情况下获取学生学习情况,同时减轻隐私担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏