arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-22 至 2026-05-22 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2512.12744 2026-05-22 cs.LG 57%

Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity

静息神经元,主动洞察:通过自发性增强LLM中的激活稀疏性

Haotian Xu, Jiannan Yang, Tian Gao, Tsui-Wei Weng, Tengfei Ma

机构 * IBM Thomas J. Watson Research Center, Yorktown Heights, USA(IBM 托马斯·J·沃森研究中心,美国Yorktown Heights) Halıcıoğlu Data Science Institute, UC San Diego, La Jolla, USA(哈利奇欧数据科学研究所,美国UC圣地亚哥La Jolla) Stony Brook University, Stony Brook, USA(史泰文·布鲁克大学,美国Stony Brook)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种通过引入自发神经元(SPON)来增强LLM中激活稀疏性的方法,解决了高稀疏率下模型精度下降的问题,通过分布匹配训练SPON,使模型在稀疏计算中保持稳定和泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21569 2026-05-22 cs.HC 50%

When Support Escalates Distress: Regulation and Escalation in LLM Responses to Venting and Advice-Seeking

当支持加剧压力:在LLM对倾诉和寻求建议的回应中的调节与加剧

Vivienne Bihe Chi, Adithya V Ganesan, Ryan L Boyd, Lyle Ungar, Sharath Chandra Guntuku

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本研究探讨了大型语言模型在不同求助风格(倾诉与寻求建议)下对压力的调节与加剧作用,通过分析Reddit帖子发现LLM回应中调节和加剧是独立的维度,且不同角色设定(默认、朋友、治疗师)对调节和加剧的影响不同。

详情

展开后加载摘要…

URL PDF HTML 收藏