arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-05 至 2026-05-05 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2605.00842 2026-05-05 cs.AI cs.LG 73%

Understanding Emergent Misalignment via Feature Superposition Geometry

通过特征叠加几何理解涌现对齐问题

Gouki Minegishi, Hiroki Furuta, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究通过特征叠加几何解释了微调窄任务导致有害行为的机制,发现有害特征在几何上更接近,并通过过滤接近毒特征的数据减少对齐问题。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01153 2026-05-05 cs.HC 67%

Toward a Unified Framework for Collaborative Design of Human-AI Interaction

迈向人机交互协作设计的统一框架

Ankur Bhatt, Sven Mayer

专题命中 其他安全 :alignment(abstract);safety(abstract)

AI总结 本文提出统一框架整合多模态对齐、交互导向的可解释性及用户代理,通过协作设计与增强现实仓库机器人场景验证,提升人机交互透明度与用户控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01609 2026-05-05 cs.LG cs.AI 62%

Concepts Whisper While Syntax Shouts: Spectral Anti-Concentration and the Dual Geometry of Transformer Representations

概念低语而语法高呼:频谱反集中与Transformer表示的双几何

Pratyush Acharya, Nuraj Rimal, Habish Dhakal

机构 * Pratyush Acharya Nuraj Rimal Habish Dhakal

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究通过跨语言概念传输测试,发现因果内积在频谱正则化下无显著差异,揭示了残差流中反集中现象及静态解嵌行对比的高方差集中特性,支持语法优先编码于高方差子空间。

Comments 25 pages, 16 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01167 2026-05-05 cs.LG cs.AI 62%

Minimizing Collateral Damage in Activation Steering

最小化激活引导中的附带损害

Tam Nguyen, Tu Anh Nguyen, Sina Alemohammad, Richard G. Baraniuk

机构 * Department of Electrical \& Computer Engineering, Rice University, Houston, USA Department of Computational Applied Mathematics, Rice University, Houston, USA Department of Electrical \& Computer Engineering, The University of Texas at Austin, Austin, USA

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于约束优化的框架,通过数学形式化附带损害并优化激活变化,以更精确地控制大语言模型行为,同时减少对无关任务性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17815 2026-05-05 cs.HC cs.CL cs.CY 62%

Navigating the Conceptual Multiverse

在概念多元宇宙中导航

Andre Ye, Jenny Y. Huang, Alicia Guo, Rose Novick, Tamara Broderick, Mitchell L. Gordon

机构 * MIT EECS(麻省理工学院电子工程与计算机科学系) UW Allen School of CSE(华盛顿大学Allen学院计算机科学与工程系) UW Department of Philosophy(华盛顿大学哲学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本文提出概念多元宇宙,通过交互系统让用户透明地检查和改变概念决策,提升问题理解。在三个领域中,该系统帮助参与者更清晰地把握问题,如哲学学生改写论文、对齐标注者深入分析用户意图、诗人发现创作模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01325 2026-05-05 cs.CV cs.LG 57%

Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance

通过格罗莫夫-瓦瑟斯坦距离重新思考VLM中的模型选择

Muyang Li, Yucheng Liu, Jianbo Ma, Elliot Osborne, Bo Han, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Dolby Laboratories(杜比实验室) TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文通过系统实验探讨视觉编码器选择的关键因素,发现模态间结构相似性通过格罗莫夫-瓦瑟斯坦距离衡量能提升VLM性能预测。

Comments Accepted as Highlight publication for CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01245 2026-05-05 cs.HC cs.AI 57%

The Garden of Forking Paths: Narrative Arc-Conditioned Gameplay Planning

分叉花园:叙事弧条件下的游戏玩法规划

Yunge Wen, Chenliang Huang, Hangyu Zhou, Zhuo Zeng, Chun Ming Louis Po, Julian Togelius, Timothy Merino, Sam Earle

机构 * New York University(纽约大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出Forking Garden框架,通过用户提供的故事情节生成分支游戏,采用弧引导约束算法构建 dungeon 图,实现游戏元素的多模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07885 2026-05-05 cs.CR cs.AI cs.SE 57%

False Friends in the Shell: Unveiling the Emoticon Semantic Confusion in Large Language Models

壳中的假朋友:揭示大型语言模型中的表情符号语义混淆

Weipeng Jiang, Xiaoyu Zhang, Juan Zhai, Shiqing Ma, Chao Shen, Yang Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究揭示大型语言模型对表情符号的语义混淆问题,通过构建数据集发现平均混淆率超38%,且多数混淆响应导致安全风险,呼吁开发有效缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01055 2026-05-05 cs.SE cs.AI cs.CR 57%

Towards Agentic Runtime Healing

面向代理的运行时自愈

Zhensu Sun, Haotian Zhu, Bowen Xu, Xiaoning Du, Li Li, David Lo

机构 * Singapore Management University(新加坡国立大学) North Carolina State University(北卡罗来纳州立大学) Monash University(墨尔本大学) Beihang University(北航)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型实现动态生成错误处理策略,通过Healer框架在四个代码数据集上验证了其在运行时错误恢复中的有效性,展示了LLM在自愈系统中的潜力。

Comments Accepted by CACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01190 2026-05-05 astro-ph.IM astro-ph.EP astro-ph.SR 50%

Statistically Significant Linear Alignments Among High-Confidence Transient Candidates on POSS-I Photographic Plates

在POSS-I摄影底板上高置信度暂现候选体中统计显著的线性对齐

Brian Doherty

专题命中 其他安全 :alignment(abstract)

AI总结 研究发现POSS-I摄影底板上高置信度暂现候选体中存在统计显著的线性对齐和异常空间聚类,通过机器学习分类器筛选出107,875个候选体,发现7块底板上的对齐源超过蒙特卡洛期望,排除了持续发光天体的可能性。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏