CNT: Safety-oriented Function Reuse across LLMs via Cross-Model Neuron Transfer
CNT:通过跨模型神经转移实现面向安全的功能重用
专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract)
AI总结 本文提出CNT方法,通过转移少量神经元实现LLM间安全功能重用,有效提升安全对齐和偏见消除效果,性能损失低于1%。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
CNT:通过跨模型神经转移实现面向安全的功能重用
专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract)
AI总结 本文提出CNT方法,通过转移少量神经元实现LLM间安全功能重用,有效提升安全对齐和偏见消除效果,性能损失低于1%。
UGID: 用于去偏大型语言模型的统一图同构
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) ; South China University of Technology(华南理工大学)
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 UGID通过构建Transformer的结构化计算图,在内部表示层面减少模型偏见,通过约束注意力路由和隐藏表示,提升模型行为一致性并保持安全性和实用性。
通过作者画像探测大语言模型中的文化信号
机构 * IMT, Toulouse, France(法国图卢兹IMT学院) ; INRIA Bordeaux, France(法国波尔多INRIA) ; ANITI 2, Toulouse, France(法国图卢兹ANITI) ; IRIT, Toulouse, France(法国图卢兹IRIT) ; Université de Bordeaux, Bordeaux, France(法国波尔多大学) ; BPH, Inserm, France(法国Inserm BPH) ; CNRS IRL CROSSING, Adelaide, Australia(澳大利亚阿德莱德CNRS IRL CROSSING)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 研究通过零样本设置评估大语言模型能否从歌曲歌词中推断歌手性别和种族,发现模型存在系统性文化偏见,提出两种公平性指标量化差异。
超越党派倾向:对大型语言模型中政治偏见的比较分析
机构 * Michigan State University(密歇根州立大学) ; Texas Christian University(德克萨斯基督教大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文通过无角色扮演的专题特定方法评估LLM的政治行为,发现大多数模型倾向左翼,且模型规模和开放性不是主要预测因素。
Journal ref Journal of Information Technology & Politics, 2026