arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-10 至 2026-07-10 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2601.06116 2026-07-10 cs.AI cs.CL cs.CY 89%

The Homogenization Problem in LLMs: Towards Meaningful Diversity in AI Safety

在大语言模型中的同质化问题:迈向人工智能安全中的有意义多样性

Ian Rios-Sialer

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨了大语言模型中同质化问题,提出通过编码价值观系统来促进多样性,通过实验揭示性别偏见并引入xeno-reproduction概念以缓解同质化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06269 2026-07-10 cs.AI cs.CL 新提交 62%

From Application-Layer Simulation to Native Meta-Architecture: Structural Tension as an Endogenous Driver for Heterogeneous AI Evolution

从应用层模拟到原生元架构:结构张力作为异构人工智能进化的内生驱动因素

Heting Mao

机构 * Shanghai Lixin University of Accounting and Finance(上海立信会计金融大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型无状态需应用层模拟的问题,提出理论框架,引入结构张力、离线循环回路、推理时可塑性三种机制,使模型实例能演化出不同拓扑结构,构成异构智能生态,重新定位治理为架构智能主要标准。

Comments 17 pages, 1 equation, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏