arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-10 至 2026-06-10 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 3 篇

2606.09475 2026-06-10 cs.AI cs.LG 版本更新 84%

Emergent alignment and the projectability of ethical personas

涌现对齐与伦理人格的可投射性

Guillermo Del Pinal, Youngchan Lee, Calum McNamara, Alejandro Perez Carballo

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 AI治理与伦理 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究微调大语言模型在窄任务上如何引发广泛对齐行为,通过宪法AI方法赋予模型伦理人格,发现窄对齐可投射到未训练类别,并提出对齐策略应评估可投射性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07027 2026-06-10 cs.LG cs.AI 版本更新 76%

Representational Alignment with Chemical Induced Fit for Molecular Relational Learning

基于化学诱导契合的表征对齐用于分子关系学习

Peiliang Zhang, Jingling Yuan, Qing Xie, Yongjun Zhu, Chao Che, Lin Li

机构 * Wuhan University of Technology(武汉理工大学) Yonsei University(延世大学) Hubei Key Laboratory of Transportation Internet of Things(湖北省交通运输物联网重点实验室) Dalian University(大连大学)

专题命中 AI治理与伦理 :alignment(title);分类 cs.AI、cs.LG

AI总结 提出ReAlignFit方法,通过引入化学诱导契合的归纳偏置动态对齐子结构表征,并利用子图信息瓶颈优化高化学功能兼容性的子结构对,以提升分子关系学习在化学空间偏移数据上的稳定性。

Comments Accepted by SIGKDD2026 AI for Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03217 2026-06-10 cs.LG cs.CY 版本更新 73%

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估

Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Purdue University(普渡大学) Meta Apple(苹果公司) Wright State University(怀特州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY、cs.LG

AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。

详情

展开后加载摘要…

URL PDF HTML 收藏