arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-11 至 2026-08-11 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 6 篇

2604.26494 2026-08-11 cs.HC cs.AI cs.CY cs.ET 版本更新 87%

Culturally Situated AI Safety for Youth: Saudi Arabian Perspectives of Youth, Parents and Teachers

面向青少年的文化感知生成式AI风险:来自非西方背景的青少年、父母和教师视角

Aljawharah Alzahrani, Tanusree Sharma

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 隐私与版权 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.CY

AI总结 研究从非西方视角探讨青少年使用生成式AI工具的风险,分析文化、宗教和社会因素对隐私和安全的影响,揭示家庭经济因素加剧的共享账户使用问题,并提出符合文化规范的家长控制设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09867 2026-08-11 cs.CR cs.AI cs.LG 新提交 73%

Stealing Reasoning Traces from Proprietary LLM APIs

从专有大语言模型API窃取推理轨迹

Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko

专题命中 隐私与版权 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现专有LLM API的加密推理轨迹存在跨会话、用户及模型的兼容性漏洞,开发了可扩展解密越狱方法,能提取模型推理、窃取PII等,还提出了对应缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04465 2026-08-11 cs.HC cs.AI cs.CR 版本更新 70%

Autonomy Reshapes How Personalization Affects Privacy Concerns and Trust in LLM Agents

自主性重塑个性化对隐私担忧和对LLM代理信任的影响

Zhiping Zhang, Yi Evie Zhang, Freda Shi, Tianshi Li

机构 * Northeastern University(东北大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学)

专题命中 隐私与版权 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究探讨了LLM代理自主性如何影响个性化对用户隐私担忧和信任的影响,发现风险驱动的自主性可缓解个性化带来的负面影响。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09278 2026-08-11 cs.SE cs.AI 新提交 57%

Software Engineering for and with GUI Agent

面向GUI智能体的软件工程及与GUI智能体协同的软件工程

Shengcheng Yu, Yuchen Ling, Junyang Xing, Quan Zhou, Chunrong Fang, Zhenyu Chen

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 该研究通过分析2018年1月至2026年4月的336篇GUI智能体论文,指出其在恢复机制、安全执行等方面的不足,提出需结合可靠执行与生命周期测试等以构建可部署的GUI智能体系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08245 2026-08-11 cs.CR cs.AI cs.HC 新提交 57%

Privacy-Preserving Data Drift Detection and Recovery for Large-Scale LLM Applications via Proxy Representations

基于代理表示的大规模大语言模型应用的隐私保护数据漂移检测与恢复

Michael Levit, Josh Ledgard, Haoyu Dong, Vishwas Suryanarayanan, Eyal Kolman, Sharon Tan, Qiang Gan, Vishal Chowdhary

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 针对大规模LLM应用的隐私约束导致的评估与漂移追踪难题,提出ProxyDrift框架,基于非PII代理表示实现无敏感数据暴露的漂移监测与合成数据生成,实验验证其对齐度达RA~0.9。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08138 2026-08-11 cs.CV cs.LG 新提交 57%

EFFEKT: Efficient Federated Knowledge Transfer to Foundation Models

EFFEKT:面向基础模型的高效联邦知识迁移

Matteo Caligiuri, Francesco Barbato, Pietro Zanuttigh, Francesco Restuccia

机构 * Northeastern University(东北大学) University of Padua(帕多瓦大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 EFFEKT是一种联邦学习框架,通过双向跨蒸馏策略,结合轻量级客户端代理模型与服务器端基础模型,实现高效的领域特定LoRA适配器训练,在低功耗边缘设备上性能优于基线。

Comments 12 main content pages, 8 appendix pages; 3 main figures, 9 appendix figures; 8 main tables, 9 appendix tables; 1 main algorithm, 4 appendix algorithms; accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏