arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-07 至 2026-07-07 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 6 篇

2606.29293 2026-07-07 quant-ph 版本更新 67%

Private training in quantum machine learning

量子机器学习中的私有训练

Tigran Sedrakyan, Frédéric Grosshans, Elham Kashefi

专题命中 隐私与版权 :safety(abstract);AI safety(abstract)

AI总结 研究经典差分隐私SGD在混合变分量子模型中的应用,分析梯度裁剪与噪声添加的相互作用,发现量子模型在私有训练中能保持更高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03213 2026-07-07 cs.CV cs.AI cs.CL cs.HC 新提交 62%

OpenGlass: A Sensing-Computing Split Architecture for Local MLLM-Driven Real-Time Visual Assistance

OpenGlass:用于本地MLLM驱动的实时视觉辅助的传感-计算分离架构

Mengzhang Li, Yuan Yao

机构 * Shanghai Qizhi Institute(上海期智研究院) College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对视障和低视力用户,OpenGlass以传感-计算分离解决云MLLM辅助需上传数据、有网络延迟,以及可穿戴眼镜计算和电量受限问题,在本地设备实现低延迟多模态视觉辅助,并给出评估结果。

Comments Accepted to ACL 2026 System Demonstrations. 11 pages, 5 figures, 8 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations), pages 829-839, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02636 2026-07-07 cs.LG cs.AI cs.CV cs.DC 新提交 62%

Federated Learning for Object Detection: Enabling Collaborative Drone Learning Without Centralizing Data

用于目标检测的联邦学习:实现无需集中数据的协作式无人机学习

Daniel M. Jimenez-Gutierrez, Enrique Zuazua, Georgios Kellaris, Joaquin del Rio, Oleksii Sliusarenko, Xabi Uribe-Etxebarria

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究将联邦学习应用于无人机目标检测,通过本地保留图像数据实现隐私保护,在KIIT - MiTA数据集上实现联邦目标检测管道,对比单无人机和集中式基线,结果显示该方法可实现分布式无人机机群的可扩展、高性能且隐私保护的目标检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24042 2026-07-07 cs.LG cs.AI 版本更新 62%

Hidden-State Privacy Has an Empty Middle

隐藏状态隐私存在空中间

Alexander Okezue Bell

机构 * Stanford University(斯坦福大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过理论下界和实验证明,高斯释放机制在隐藏状态隐私中无法同时实现中等效用和隐私,存在空中间区域,并提出了对角逆Fisher机制作为最优解。

Comments 74 pages, 61 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02903 2026-07-07 cs.CR cs.AI 新提交 57%

TIER: Trajectory-Invariant Explanation Regularization for Membership Privacy

TIER:用于成员隐私的轨迹不变解释正则化

Varun Sharma, Kar Wai Fok, Vrizlynn L. L. Thing

机构 * ST Engineering(ST工程)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI

AI总结 研究利用模型自身梯度作为防御信号抵御基于解释的成员推理攻击,提出TIER防御,通过惩罚梯度引导扰动模拟的置信度下降波动及最小化分布偏移来保护隐私,兼顾模型效用和解释保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03688 2026-07-07 cs.CR 新提交 50%

PathMark: Protecting Intellectual Property of Mixture-of-Expert LLMs via Path Watermarks

PathMark:通过路径水印保护混合专家语言模型的知识产权

Yudong Gao, Qingyue Wang, Yuanyuan Yuan, Ruixuan Huang, Linghan Chen, Zimo Ji, Shuai Wang

专题命中 隐私与版权 :alignment(abstract)

AI总结 针对混合专家(MoE)架构中传统水印方案失效的问题,提出PathMark框架,通过主动控制路由作为隐蔽水印通道,利用多种机制解决脆弱决策边界和路由纠缠问题,实现高验证准确率和强鲁棒性。

Comments 20 pages, accepted by CCS'26

详情

展开后加载摘要…

URL PDF HTML 收藏