arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-25 至 2026-05-25 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 11 篇

2605.02087 2026-05-25 cs.AI 83%

Model Spec Midtraining: Improving How Alignment Training Generalizes

模型规范中期训练:改进对齐训练的泛化能力

Chloe Li, Nevan Wichers, Sara Price, Samuel Marks, Jon Kutasov

机构 * Anthropic

专题命中 其他安全 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 提出模型规范中期训练(MSM),通过在预训练后、对齐微调前用合成文档训练模型学习规范内容,从而引导模型从后续演示数据中泛化,有效降低代理失调率并提升对齐泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23035 2026-05-25 cs.CL cs.AI q-bio.NC 81%

Sparse Autoencoders Map Brain-LLM Alignment onto Cortical Semantic Topography

稀疏自编码器将大脑-LLM对齐映射到皮层语义拓扑

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 通过稀疏自编码器分解LLM中间层特征,发现语义特征主导大脑预测表现,并验证了皮层语义拓扑的细粒度对齐。

Comments Accepted at CoNLL 2026. 20 pages (9 main + 1 limitations/acknowledgments + 3 references + 7 appendix), 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23032 2026-05-25 cs.CL cs.AI q-bio.NC 81%

Brain-LLM Alignment Tracks Training Data, Not Typology

大脑-大语言模型对齐追踪训练数据,而非语言类型学

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 通过分析英语、中文和法语的fMRI数据及多种大语言模型,发现训练语言主导性而非英语本身驱动大脑-模型对齐模式,且类型学距离独立影响对齐退化。

Comments Accepted to CoNLL 2026. 9 pages main content + 4 pages references + 6 pages appendix; 4 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22826 2026-05-25 cs.CL cs.AI cs.GT cs.MA 79%

Evaluating Large Language Models in a Complex Hidden Role Game

评估大型语言模型在复杂隐藏角色游戏中的表现

Niklas Bauer

机构 * University of Göttingen(哥廷根大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过社交推理游戏《秘密希特勒》评估大型语言模型的推理、说服和欺骗能力,引入新指标并发现当前模型在复杂多轮操纵中效果不佳。

Comments Master's thesis, University of Göttingen

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20087 2026-05-25 cs.CL cs.AI 62%

ThoughtTrace: Understanding User Thoughts in Real-World LLM Interactions

ThoughtTrace: 理解真实世界LLM交互中的用户想法

Chuanyang Jin, Binze Li, Haopeng Xie, Cathy Mengying Fang, Tianjian Li, Shayne Longpre, Hongxiang Gu, Maximillian Chen, Tianmin Shu

机构 * Johns Hopkins University(约翰霍普金斯大学) Massachusetts Institute of Technology(麻省理工学院) Google Research(谷歌研究)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ThoughtTrace,首个大规模数据集,通过配对真实多轮人机对话与用户自述想法(提示原因和对助手回复的反应),揭示用户认知动态,并展示其在行为预测和个性化对齐中的价值。

Comments 53 pages, 23 figures, 4 tables. Project website: https://thoughttrace-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17076 2026-05-25 cs.LG cs.AI cs.DC cs.MA 62%

S-Bus: Automatic Read-Set Reconstruction for Multi-Agent LLM State Coordination

S-Bus: 多智能体LLM状态协调的自动读集重建

Sajjad Khan

机构 * Sajjad Khan

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出S-Bus中间件,通过服务端DeliveryLog机制在提交时从HTTP GET流量中重建每个智能体的读集,实现可观测读隔离(ORI)一致性,防止专用分片拓扑中的结构性竞态条件,并通过形式化证明和实验验证其安全性。

Comments v2: LLM judge validated against human annotator (Zahid Hussain, Mindgigs Peshawar) on PH-3 at strict kappa=0.93 (n=93, 96.8% agreement); over-claim refined to 32% (LLM) / 49% (human). Adds Exp.PG-Comparison Rust-Native and Workload-B chi2=1094.98. 24 pages, 23 tables. Annotation data attached as arXiv ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23778 2026-05-25 physics.ao-ph cs.LG physics.comp-ph 57%

The physics of AI weather models

AI天气模型的物理学

George Craig, Tobias Selz, Matthias Beylich, Kirsten I. Tempest

机构 * Meteorological Institute, LMU Munich(慕尼黑大学气象研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文通过分析AI天气模型的预测技能和中心核对齐相关性,提出AI模型可能隐式求解物理方程,并假设其实现了一种粒子描述,其中潜变量运动遵循梯度流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23346 2026-05-25 cs.LG 57%

Contrastive Distribution Matching for Amortized Sequential Monte Carlo in Discrete Diffusion

对比分布匹配用于离散扩散中的摊销序贯蒙特卡洛

Jaihoon Kim, Taehoon Yoon, Prin Phunyaphibarn, Seungjun Kim, Morteza Mardani, Minhyuk Sung

机构 * KAIST(韩国科学技术院) University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出对比分布匹配(CDM)框架,通过正负样本学习参数化扭曲函数,摊销序贯蒙特卡洛(SMC)推理成本,在离散扩散中高效采样奖励倾斜分布。

Comments Project Page: https://cdm-smc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23116 2026-05-25 cs.CV cs.AI 57%

CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection

CoReVAD: 一种无需训练的视频异常检测上下文推理框架

Hyeongmuk Lim, Youngbum Hur

机构 * Department of Industrial Engineering, Inha University, Incheon, Republic of Korea(韩国釜山大学工业工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出CoReVAD框架,利用单一冻结视觉语言模型直接生成异常分数和时间描述,通过局部响应清洗和全局时序上下文精炼实现无需训练的视频异常检测,在UCF-Crime和XD-Violence数据集上取得竞争性能并提供可解释解释。

Comments Accepted to ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23036 2026-05-25 cs.CL 57%

Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection

通过设计实现多语言引导:多语言稀疏自编码器与原则性层选择

Yusser Al Ghussin, Daniil Gurgurov, Tanja Baeumel, Josef van Genabith, Patrick Schramowski, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) TU Darmstadt(德累斯顿技术大学) Centre for European Research in Trusted AI (CERTAIN)(欧洲可信AI研究中心)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对稀疏自编码器在多语言环境中语言控制不可靠的问题,提出在多语言数据上训练SAE并基于多语言对齐与语言可分离性交集的原则性层选择规则,在LLaMA-3.1-8B和Gemma-2-9B上验证了该方法能稳定语言识别准确率与生成质量之间的权衡。

Comments Accepted to TrustNLP Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21906 2026-05-25 cs.CV 50%

Universal CT Representations from Anatomy to Disease Phenotype through Agglomerative Pretraining

从解剖到疾病表型的通用CT表示:通过聚合预训练

Yuheng Li, Yuan Gao, Haoyu Dong, Yuxiang Lai, Shansong Wang, Mojtaba Safari, James E. Baciak, Xiaofeng Yang

机构 * Wallace H. Coulter Department of Biomedical Engineering, Georgia Institute of Technology and Emory University(沃森·H·库勒生物医学工程系,佐治亚理工学院和埃默里大学) Department of Radiation Oncology and Winship Cancer Institute, Emory University(放射肿瘤学系和Winship癌症研究所,埃默里大学) Department of Electrical and Computer Engineering, Duke University(电气与计算机工程系,杜克大学) Department of Computer Science and Informatics, Emory University(计算机科学与信息学系,埃默里大学) Department of Materials Science & Engineering, Nuclear Engineering Program, University of Florida(材料科学与工程系、核工程项目,佛罗里达大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出FlexiCT系列CT基础模型,通过三阶段聚合连续预训练(二维轴向、三维解剖、报告引导语义对齐)统一CT分析,在分割、分类、配准、视觉语言理解和临床检索等任务上达到或超越专用模型,并捕获与肿瘤分期相关的影像特征。

详情

展开后加载摘要…

URL PDF HTML 收藏