arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-05 至 2026-08-05 共收录 94 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 18 篇

2604.06005 2026-08-05 cs.CL 版本更新 57%

Disentangling MLP Neuron Weights in Vocabulary Space

解构词汇空间中的MLP神经元权重

Asaf Avrahamy, Yoav Gur-Arieh, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学布拉瓦特尼克计算机科学与人工智能学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出ROTATE方法,通过优化神经元权重旋转以最大化词汇空间的峰度,解构MLP神经元权重,揭示词汇通道,提升语言模型可解释性。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03899 2026-08-05 cs.IR 新提交 50%

ATLAS: Learning to Recommend Across Unseen Domains

ATLAS:学习在未见域间进行推荐

Pervez Shaik, Prosenjit Biswas, Abhinav Thorat, Ravi Kolla, Niranjan Pedanekar

专题命中 其他安全 :alignment(abstract)

AI总结 ATLAS是一种多源推荐域泛化框架,无需目标域适配或LLM预训练,可从异构源域学习域不变表示,在未见域零样本推荐中优于多种基线,HitRate平均提升24%。

Comments 18 pages, 5 figures, 14 tables. Includes appendix with proofs and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03143 2026-08-05 cs.CV cs.RO 新提交 50%

From Routes to Steps: Separating Semantic Progress from Local Execution in Vision-and-Language Navigation

从路线到步骤:在视觉语言导航中分离语义进展与局部执行

Xiangyun Huang, Xiangchen Wang, Runfeng Lin, Yihao Xu, Kangyu Huang, Jiang Hengchen, Xiwang Dong, Lin Jiarong

专题命中 其他安全 :alignment(abstract)

AI总结 本研究针对视觉语言导航中进展与执行错误难区分的问题,提出Route2Step框架,通过步骤级接口分离语义进展跟踪与动作生成,在R2R-CE数据集上显著提升了导航性能,且在真实环境中具备实用性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03016 2026-08-05 cs.CV 新提交 50%

Clinically-Grounded Hierarchical Classification for Consistent Chest X-ray Interpretation

基于临床依据的分层分类用于一致性胸部X射线影像解读

Jong Hak Moon, Minjun Kim, Minjun Kim

机构 * Yeji X(艺智X)

专题命中 其他安全 :alignment(abstract)

AI总结 本研究针对胸部X射线解读的层级特性,提出CHASE框架,通过三级分类与多层级优化,提升了预测的一致性与性能。

Comments MICCAI 2026 Accepted. First & Corresponding author: Jong Hak Moon (jh.moon@yejix.com)

详情

展开后加载摘要…

URL PDF HTML 收藏