arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-20 至 2026-03-20 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2603.18449 2026-03-20 cs.CR cs.SE 82%

CNT: Safety-oriented Function Reuse across LLMs via Cross-Model Neuron Transfer

CNT:通过跨模型神经转移实现面向安全的功能重用

Yue Zhao, Yujia Gong, Ruigang Liang, Shenchen Zhu, Kai Chen, Xuejing Yuan, Wangjun Zhang

专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract)

AI总结 本文提出CNT方法,通过转移少量神经元实现LLM间安全功能重用,有效提升安全对齐和偏见消除效果,性能损失低于1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19144 2026-03-20 cs.CL cs.AI 73%

UGID: Unified Graph Isomorphism for Debiasing Large Language Models

UGID: 用于去偏大型语言模型的统一图同构

Zikang Ding, Junchi Yao, Junhao Li, Yi Zhang, Wenbo Jiang, Hongbo Liu, Lijie Hu

机构 * University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) South China University of Technology(华南理工大学)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 UGID通过构建Transformer的结构化计算图,在内部表示层面减少模型偏见,通过约束注意力路由和隐藏表示,提升模型行为一致性并保持安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16749 2026-03-20 cs.CL cs.LG 62%

Probing Cultural Signals in Large Language Models through Author Profiling

通过作者画像探测大语言模型中的文化信号

Valentin Lafargue, Ariel Guerra-Adames, Emmanuelle Claeys, Elouan Vuichard, Jean-Michel Loubes

机构 * IMT, Toulouse, France(法国图卢兹IMT学院) INRIA Bordeaux, France(法国波尔多INRIA) ANITI 2, Toulouse, France(法国图卢兹ANITI) IRIT, Toulouse, France(法国图卢兹IRIT) Université de Bordeaux, Bordeaux, France(法国波尔多大学) BPH, Inserm, France(法国Inserm BPH) CNRS IRL CROSSING, Adelaide, Australia(澳大利亚阿德莱德CNRS IRL CROSSING)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究通过零样本设置评估大语言模型能否从歌曲歌词中推断歌手性别和种族,发现模型存在系统性文化偏见,提出两种公平性指标量化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16746 2026-03-20 cs.CY cs.AI 62%

Beyond Partisan Leaning: A Comparative Analysis of Political Bias in Large Language Models

超越党派倾向:对大型语言模型中政治偏见的比较分析

Tai-Quan Peng, Kaiqi Yang, Sanguk Lee, Hang Li, Yucheng Chu, Yuping Lin, Hui Liu

机构 * Michigan State University(密歇根州立大学) Texas Christian University(德克萨斯基督教大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过无角色扮演的专题特定方法评估LLM的政治行为,发现大多数模型倾向左翼,且模型规模和开放性不是主要预测因素。

Journal ref Journal of Information Technology & Politics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏