arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-28 至 2026-05-28 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 5 篇

2605.27790 2026-05-28 cs.LG 57%

SYNAPSE: Neuro-Symbolic Visual Thought-to-Text Decoding via Topological Semantic Denoising

SYNAPSE: 通过拓扑语义去噪的神经符号视觉思维到文本解码

Akshaj Murhekar, Abhijit Mishra

机构 * School of Information University of Texas at Austin(信息学院德克萨斯大学奥斯汀分校)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 提出SYNAPSE框架,利用常识图结构和潜在样本进行推理时符号正则化,稳定脑电到文本解码中的语义生成,无需微调大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27766 2026-05-28 cs.AI 57%

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Got a Secret? LLM Agents Can't Keep It: Evaluating Privacy in Multi-Agent Systems

Aman Priyanshu, Supriti Vijay, Esha Pahwa

机构 * Foundation AI USA(Foundation AI美国)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本研究通过多智能体模拟平台评估LLM智能体在社交压力下的隐私泄露风险,发现多轮社交交互显著增加隐私泄露,且泄露具有社交传染性,即使有隐私指令也无法完全消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27348 2026-05-28 cs.CV cs.AI 57%

When Eyes Betray AI: Social Gaze Consistency as a Semantic Cue for AI-Generated Image Detection

当眼睛背叛AI:社交注视一致性作为AI生成图像检测的语义线索

Jihyeon Kim, Sohee Kim, Soosan Lee, Souhwan Jung, James Matthew Rehg, Hyesong Choi

机构 * School of Computer Engineering(计算机工程学院) Hoseo University(Hoseo大学) School of Electronic Engineering(电子工程学院) Soongsil University(Soongsil大学) School of Computer Science(计算机科学学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 提出社交注视一致性作为高层语义线索,通过构建诊断数据集、块组合描述监督和跨架构验证,证明该线索能有效检测AI生成图像,并解释其跨生成器迁移的机制。

Comments 23 pages, 2 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09781 2026-05-28 cs.CR 50%

CLIOPATRA: Extracting Private Information from LLM Insights

CLIOPATRA: 从LLM洞察中提取隐私信息

Meenatchi Sundaram Muthu Selva Annamalai, Emiliano De Cristofaro, Peter Kairouz

专题命中 隐私与版权 :prompt injection(abstract)

AI总结 提出CLIOPATRA攻击,通过注入恶意聊天突破多层启发式隐私保护,从LLM洞察系统中提取目标用户敏感信息,在合成医疗聊天中高达65%成功率且几乎100%精确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06304 2026-05-28 cs.CR 50%

SRAF: Stealthy and Robust Adversarial Fingerprint for Copyright Verification of Large Language Models

SRAF:用于大语言模型版权验证的隐蔽且鲁棒的对抗指纹

Zhebo Wang, Zhenhua Xu, Maike Li, Wenpeng Xing, Chunqiang Hu, Chen Zhi, Meng Han

专题命中 隐私与版权 :alignment(abstract)

AI总结 提出SRAF框架,通过协同联合优化和困惑度隐藏技术,在多种模型修改下实现鲁棒且隐蔽的对抗指纹,用于大语言模型所有权验证。

详情

展开后加载摘要…

URL PDF HTML 收藏