arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-24 至 2026-06-24 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 5 篇

2606.24819 2026-06-24 cs.CR 新提交 82%

HelpBench: Assessing the Ability of LLMs to Provide Privacy, Safety, and Security Advice

HelpBench:评估LLM提供隐私、安全和安全建议的能力

Sarah Meiklejohn, Sunny Consolvo, Patrick Gage Kelley, Tara Matthews, Sai Teja Peddinti, Renee Shelby, Lenin Simicich, Kurt Thomas

专题命中 隐私与版权 :safety(title,abstract);trustworthy(abstract)

AI总结 提出HelpBench基准,通过450个真实用户问题评估18个LLM的隐私、安全建议准确性,发现平均得分82%但10%回答低于65%存在有害建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24523 2026-06-24 cs.CL cs.AI 新提交 73%

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

海报:探索基于音频的土耳其电话诈骗检测的极限

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语电话诈骗,构建首个多模态数据集(100对音频-文本),评估7个LLM在三种输入条件下的检测性能,发现基于文本的输入优于直接音频处理。

Comments Poster paper accepted at 47th IEEE Security & Privacy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24783 2026-06-24 cs.CL cs.AI 新提交 62%

Paying to Know: Micro-Transaction Markets for Verified Product Information in Agentic E-Commerce

付费知情:代理型电商中已验证产品信息的微交易市场

Filippos Ventirozos, Matthew Shardlow

机构 * Manchester Metropolitan University(曼彻斯特城市大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 提出代理型电商作为已验证信息的微交易市场,买家代理通过微支付逐步获取卖家与评论者提供的数据,以解决信息可信度瓶颈,并转化为具体NLP问题。

Comments 8 pages, 1 figure. Vision paper, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20344 2026-06-24 quant-ph cs.DC cs.LG 新提交 57%

Quantum ring all-reduce: communication and privacy advantages for distributed learning

量子环全归约:分布式学习的通信与隐私优势

María Gragera Garcés, Lirandë Pira

机构 * University of Edinburgh(爱丁堡大学) Centre for Quantum Technologies(量子技术中心)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 提出量子环全归约协议,利用预共享纠缠和超密编码将每链路在线通信量减半,并通过验证纠缠实现信息论安全的可组合ε-安全聚合,同时获得通信与隐私优势。

Comments 23 pages, 1 figure / v2: Minor expository corrections; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24424 2026-06-24 eess.SP 新提交 50%

Explainable AI for Next-Generation Wireless Physical Layer: Basics, State-of-the-Art, and Open Challenges

下一代无线物理层的可解释人工智能:基础、最新进展与开放挑战

Bingnan Xiao, Shuyan Hu, Xiaojing Chen, Zhiyuan Zhai, Bingcong Li, Wei Ni, Xin Wang, Ekram Hossain

专题命中 隐私与版权 :safety(abstract)

AI总结 本文综述了无线物理层中可解释人工智能(XAI)的应用,提出了面向责任的目标,建立了系统分类法,并讨论了可解释性-性能权衡等开放挑战。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏