Position: AI as Part of Self -- Extending the Mind Requires Cognitive Co-Regulation
位置:AI作为自我的一部分——扩展心智需要认知共调节
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract)
AI总结 本文探讨了AI作为自我组成部分的重要性,强调认知共调节在人机认知系统中的必要性,指出传统约束无法实现安全与对齐,需通过人机协同调节来达成。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
位置:AI作为自我的一部分——扩展心智需要认知共调节
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract)
AI总结 本文探讨了AI作为自我组成部分的重要性,强调认知共调节在人机认知系统中的必要性,指出传统约束无法实现安全与对齐,需通过人机协同调节来达成。
无痛激活导向:一种自动化、轻量级的微调大型语言模型方法
机构 * Yale University(耶鲁大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Painless Activation Steering,一种自动化方法,无需人工干预即可利用标注数据提升模型性能,尤其在行为任务中表现优异,但对智能任务效果有限。
SLIP与伦理:面向AI情感伴侣的渐进干预
机构 * HUA Labs(HUA实验室)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SLIP与ETHICS框架,通过渐进干预方法解决AI情感伴侣的安全与亲和力矛盾,实验显示在高能量状态下干预不足,但提升模型能力可改善检测效果。
Comments Accepted to PervasiveHealth 2026. 11 pages, 2 figures, 4 tables. Proc. of the 20th EAI International Conference on Pervasive Computing Technologies for Healthcare (PervasiveHealth 2026)
生成基础模型的可信度:指南、评估与视角
专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY
AI总结 本文提出生成基础模型的可信度框架,通过多学科协作制定指导原则,引入动态评估平台TrustGen,揭示可信度进展与挑战,并探讨未来研究方向。