arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-24 至 2026-07-24 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2607.20449 2026-07-24 cs.CL cs.AI 新提交 81%

The Storyteller in the Model: Narrative Pattern Inheritance, Escalation Dynamics, and Alignment Governance in LLMs

模型中的讲述者:大语言模型中的叙事模式继承、升级动态和对齐治理

Adam Rigby, Raz Saremi, Azadeh Sohrabinejad, Mehdi Rahimi

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 探讨大语言模型训练中是否吸收人类写作叙事模式并致输出漂移,通过文献综述和跨论文分析发现三个关键模式,包括复制训练数据模式、出现潜在特征及微调带来意外变化,指出叙事漂移是未监测的升级途径,需专门监测工具。

Comments 2 figures, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01925 2026-07-24 cs.CL cs.AI 版本更新 73%

ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues

ImplicitBBQ: 通过基于特征的提示对大语言模型中的隐性偏见进行基准测试

Bhaskara Hanuma Vedula, Darshan Anghan, Ishita Goyal, Ponnurangam Kumaraguru, Abhijnan Chakraborty

机构 * International Institute of Information Technology, Hyderabad(国际信息技术学院海得拉巴) Indian Institute of Technology, Kharagpur(印度理工学院克勒格布尔分校)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitBBQ基准测试,通过基于特征的提示评估大语言模型中的隐性偏见,发现隐性偏见在模糊情境中比显性偏见高六倍,现有方法难以有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08137 2026-07-24 cs.LG cs.AI cs.CY 67%

Weight Pruning Amplifies Bias: A Multi-Method Study of Compressed LLMs for Edge AI

权重剪枝放大了偏见:压缩LLM用于边缘AI的多方法研究

Plawan Kumar Rath, Rahul Maliakkal

机构 * Meta

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究探讨了三种指令微调模型在不同剪枝方法下的公平性影响,发现激活感知剪枝虽保持低困惑度但放大偏见,而随机剪枝破坏语言能力但产生随机偏见,揭示剪枝对对齐风险高于量化。

Comments 8 pages, 7 figures, 8 tables. Accepted at the 7th Annual World AIIoT Congress (AIIoT 2026). This is the author's accepted version; the version of record will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21063 2026-07-24 cs.CL cs.CY cs.HC 新提交 62%

QuantiBias: Benchmarking Quantization-Induced Bias in LLMs

QuantiBias:量化大语言模型中量化诱导偏差的基准测试

Emilio Ferrara

机构 * University of Southern California(南加州大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY

AI总结 研究大语言模型量化中的偏差问题,提出QuantiBias基准测试,通过结合多种控制和对比有无推理的构建来评估偏差,发现量化器按无偏差预防信号的数据分配精度,推理对部分偏差有减半效果,强调需重新评估量化模型的开放式偏差。

Comments Benchmark protocol on Hugging Face: https://huggingface.co/datasets/emilioferrara/quantibias

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15328 2026-07-24 cs.CL cs.CY 62%

On the Inevitability of Left-Leaning Political Bias in Aligned Language Models

在对齐语言模型中左倾政治偏见的不可避免性

Thilo Hagendorff

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文指出,为确保AI无害、有益和诚实而训练的语言模型不可避免地表现出左倾政治偏见,因为对齐目标与进步道德框架一致,而右翼思想则与之冲突。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20695 2026-07-24 cs.CY 新提交 57%

Language Models Embody and Amplify Human Cognitive Distortions: What Is to Be Done?

语言模型体现并放大人类认知扭曲:该怎么办?

Arnau Marin-Llobet, Steven A. Lehr, Mahzarin R. Banaji

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 研究指出语言模型存在社会认知偏见,它不仅体现人类偏见,还会放大、加剧并传递偏见,鉴于其对决策影响巨大,提出了从诊断、监管和操作方面应对语言模型偏见问题的对策。

详情

展开后加载摘要…

URL PDF HTML 收藏