arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2601.19768 2026-05-01 cs.AI cs.CR cs.LG 81%

GAVEL: Towards Rule-Based Safety Through Activation Monitoring

GAVEL:通过激活监控实现基于规则的安全性

Shir Rozenfeld, Rahul Pankajakshan, Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky

机构 * Ben Gurion University of the Negev(本·古里安大学) Amrita Vishwa Vidyapeetham(阿米塔大学)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于规则的激活安全性方法,通过细粒度可解释的激活元素捕捉领域特定行为,提升精度并支持定制化,为可扩展的AI治理奠定基础。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27624 2026-05-01 cs.CL cs.AI cs.CY cs.HC cs.LG 70%

Mapping how LLMs debate societal issues when shadowing human personality traits, sociodemographics and social media behavior

映射LLMs在模仿人类性格特征、社会人口统计数据和社会媒体行为时如何辩论社会问题

Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, University of Trento, Department of Psychology and Cognitive Science(CogNosco实验室,特伦托大学心理学与认知科学系)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过CDS数据集研究LLMs在不同社会和情境提示下生成的辩论内容变化,分析其社会议题立场和情感表达。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26958 2026-05-01 cs.CY cs.AI 62%

Designing Ethical Learning for Agentic AI: Toegye Yi Hwang's Ethical Emotion Regulation Framework

为智能代理AI设计道德学习:Toegye Yi Hwang的道德情感调节框架

Ji Yeon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一种基于Toegye Yi Hwang道德哲学的智能代理AI道德情感调节框架,通过五阶段架构和评估工具规范自主决策周期中的道德情感过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26955 2026-05-01 cs.CY cs.AI 62%

Policy-Governed LLM Routing with Intent Matching for Instrument Laboratories

基于意图匹配的政策引导LLM路由用于仪器实验室

Emmanuel A. Olowe, Danial Chitnis

机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学 爱丁堡 英国)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出基于意图匹配的政策引导LLM路由系统,通过Routiium和EduRouter实现对实验室辅助系统的管理和控制,提升学习挑战度和任务完成率。

Comments IEEE EduCon

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27825 2026-05-01 cs.SE 50%

Requirements Debt in AI-Enabled Perception Systems Development: An Industrial RE4AI Perspective

人工智能赋能感知系统开发中的需求债务:一种工业RE4AI视角

Hina Saeeda, Soniya Abraham

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文从工业RE4AI视角探讨AI赋能感知系统开发中的需求债务问题,分析功能和非功能需求演变如何产生并传播需求债务,揭示其对系统审计性、可靠性及认证准备性的负面影响。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23946 2026-05-01 physics.comp-ph physics.flu-dyn 50%

Learning subgrid interfacial area in two-phase flows with regime-dependent inductive biases

在两相流中利用相态依赖性归纳偏置学习子网格界面面积

Anirban Bhattacharjee, Luis H. Hatashita, Suhas S. Jain

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究了在湍流多相流中利用物理结构嵌入学习过程以提高机器学习可靠性,开发并评估了两种子网格闭合模型,发现物理约束模型在不同Weber数下能提升预测精度并抑制非物理伪影。

Comments 34 pages, 17 figures, journal preprint

详情

展开后加载摘要…

URL PDF HTML 收藏