arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-25 至 2026-03-25 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 4 篇

2603.18788 2026-03-25 cs.CL cs.AI 73%

Mi:dm K 2.5 Pro

KT Tech innovation Group

专题命中 AI治理与伦理 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22322 2026-03-25 cs.LG cs.AI cs.CY 67%

AEGIS: An Operational Infrastructure for Post-Market Governance of Adaptive Medical AI Under US and EU Regulations

AEGIS:一种用于美国和欧盟法规下适应性医疗AI市场后治理的操作基础设施

Fardin Afdideh, Mehdi Astaraki, Fernando Seoane, Farhad Abtahi

机构 * Department of Clinical Science, Intervention and Technology, Karolinska Institutet(临床科学、干预与技术部门,Karolinska研究院) Department of Medical Radiation Physics, Stockholm University(医学辐射物理学部门,斯德哥尔摩大学) Department of Oncology-Pathology, Karolinska Institutet(肿瘤学-病理学部门,Karolinska研究院) Department of Clinical Physiology, Karolinska University Hospital(临床生理学部门,Karolinska大学医院) Department of Textile Technology, University of Bor s(纺织技术部门,Bor s大学) Department of Medical Technologies, Karolinska University Hospital(医学技术部门,Karolinska大学医院) Department of Biomedical Engineering and Health System, KTH Royal Institute of Technology(生物医学工程与健康系统部门,KTH皇家理工学院)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出AEGIS框架,通过数据集整合、模型监控和条件决策模块,实现FDA PCCP和EU AI Act条款的执行,支持医疗AI的持续学习与安全更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23251 2026-03-25 cs.CL cs.LG 62%

Is AI Catching Up to Human Expression? Exploring Emotion, Personality, Authorship, and Linguistic Style in English and Arabic with Six Large Language Models

人工智能是否正在赶上人类表达?探索英语和阿拉伯语中情感、个性、作者身份和语言风格的模仿

Nasser A Alsadhan

机构 * College of Computer and Information Sciences, King Saud University(计算机与信息科学学院,沙特阿拉伯国王沙德大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究六种大语言模型在英语和阿拉伯语中模仿情感和个性的能力,发现AI生成文本可被识别,但分类性能下降,揭示了LLM在情感信号编码上的差异。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22612 2026-03-25 cs.CR cs.HC 50%

BioShield: A Context-Aware Firewall for Securing Bio-LLMs

BioShield: 一种面向生物大语言模型的上下文感知防火墙

Protiva Das, Sovon Chakraborty, Sidhant Narula, Lucas Potter, Xavier-Lewis Palmer, Pratip Rana, Daniel Takabi, Mohammad Ghasemigol

专题命中 AI治理与伦理 :safety(abstract)

AI总结 BioShield通过上下文感知的提示扫描和响应验证,为生物领域大语言模型提供多层次安全防护,有效防止双重用途攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏