arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-15 至 2026-07-15 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 3 篇

2607.13003 2026-07-15 cs.CR cs.IT cs.LG math.IT 新提交 57%

Watermark Forensics for Generative Models: An Information-Theoretic Perspective

生成模型的水印取证:信息论视角

Xiaoyu Li, Zheng Gao, Xiaoyan Feng, Jiaojiao Jiang, Yulei Sui, Jiankun Hu

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 从信息论视角研究生成模型水印取证,通过信息轮廓确定取证阶梯各级成本,给出多用户归属和提取有效载荷的熵率定律,实验验证了相关预测常数,揭示了水印取证中的实际差距。

Comments The abstract has been shortened to comply with arXiv's length limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10467 2026-07-15 cs.SE cs.LG 版本更新 57%

Toward Production-Ready Federated Learning in Healthcare: Privacy, Orchestration, and Governance in MLOps

迈向医疗保健领域可投入生产的联邦学习:MLOps 中的隐私、编排与治理

Sakshi Gorkhali, Jonesh Shrestha

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.LG

AI总结 研究医疗保健领域联邦学习,探讨 MLOps 实践和 FLOps 理念,回答容器化编排对联邦部署的支持、隐私机制的影响及部署后重要实践等问题,提出需集成 MLOps 架构让联邦医疗保健机器学习系统更具性能。

Comments 5 pages, 2 figures, 1 table; v2 adds the permanent arXiv identifier and DOI to the reference block. No changes to the analysis or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12765 2026-07-15 cs.LG 版本更新 57%

Inference-Time Machine Unlearning via Gated Activation Redirection

推理时的机器去学习 via 门控激活重定向

Vinícius Conte Turani, Otávio Parraga, João Vitor Boer Abitante, Kristen K. Arguello, Joana Pasquali, Ramiro N. Barros, Flavio du Pin Calmon, Christian Mattjie, Rodrigo C. Barros, Lucas S. Kupssinskü

机构 * MALTA, Machine Learning Theory and Applications Lab, PUCRS, Porto Alegre, Brazil(MALTA机器学习理论与应用实验室,PUCRS,波士顿-阿尔格雷,巴西) Harvard University(哈佛大学) Kunumi Institute, Brazil(库努米研究所,巴西)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种无需训练和梯度的机器去学习方法GUARD-IT,通过在推理时依赖输入的激活引导来消除特定数据集的影响,同时保持模型性能,且在量化部署下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏