arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-23 至 2026-04-23 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 4 篇

2604.20065 2026-04-23 cs.IR 67%

From Hidden Profiles to Governable Personalization: Recommender Systems in the Age of LLM Agents

从隐藏档案到可控个性化:在LLM代理时代推荐系统

Jiahao Liu, Mingzhe Han, Guanming Liu, Weihang Wang, Dongsheng Li, Hansu Gu, Peng Zhang, Tun Lu, Ning Gu

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract)

AI总结 本文探讨LLM代理时代推荐系统从隐藏平台档案转向可控个性化,提出五个研究方向,强调用户模型的透明性、隐私保护及跨领域设计。

Comments 6 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00911 2026-04-23 cs.CR cs.AI cs.ET cs.HC cs.LG 62%

Device-Native Autonomous Agents for Privacy-Preserving Negotiations

设备本机自主代理用于隐私保护的谈判

Joyjit Roy, Samaresh Kumar Singh

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于设备的自主代理系统,通过零知识证明和本地推理实现隐私保护的谈判,实验显示在保险和B2B采购场景中成功率高,隐私保护效果显著。

Comments 9 pages, 6 figures, 9 tables. This version updates metadata after publication in IEEE Xplore

Journal ref 2026 IEEE SoutheastCon, Huntsville, AL, USA, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00929 2026-04-23 cs.LG cs.CR 57%

Verification of Machine Unlearning is Fragile

验证机器去学习是脆弱的

Binchi Zhang, Zihan Chen, Cong Shen, Jundong Li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文探讨了机器去学习验证的脆弱性,提出两种对抗性去学习过程以绕过现有验证策略,揭示了验证方法的局限性。

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10171 2026-04-23 cs.CV cs.ET 50%

SynSpill: Improved Industrial Spill Detection With Synthetic Data

SynSpill:基于合成数据的改进工业泄漏检测

Aaditya Baranwal, Abdul Mueez, Jason Voelker, Guneet Bhatia, Shruti Vyas

机构 * University of Central Florida(佛罗里达中央大学) Siemens Energy(西门子能源)

专题命中 隐私与版权 :safety(abstract)

AI总结 针对工业泄漏检测中数据稀缺问题,提出基于高质量合成数据生成的框架,通过参数高效微调提升VLMs和检测器性能,实现安全关键领域的有效应用。

Comments Accepted at ICCV (VISION'25 Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 1425-1434

详情

展开后加载摘要…

URL PDF HTML 收藏