arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-02 至 2026-04-02 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 5 篇

2604.00021 2026-04-02 cs.CL cs.AI cs.CY 75%

How Do Language Models Process Ethical Instructions? Deliberation, Consistency, and Other-Recognition Across Four Models

语言模型如何处理道德指令?在四个模型中的反思、一致性及其他认知

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry / Sex Offender Medical Center(刑事精神病学研究所/性犯罪者医疗中心) Department of Neuropsychiatry, Kyoto University(京都大学神经精神医学系)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究通过多代理模拟探讨语言模型处理道德指令的机制,发现不同模型存在不同的处理类型,且处理能力与指令格式的交互影响内部处理。

Comments 34 pages, 7 figures, 4 tables. Preprint. OSF pre-registration: osf.io/4n5uf. Companion paper: arXiv:2603.04904

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00323 2026-04-02 cs.CL cs.CY 62%

Large Language Models in the Abuse Detection Pipeline

大语言模型在滥用检测流水线中的应用

Suraj Kath, Sanket Badhe, Preet Shah, Ashwin Sampathkumar, Shivani Gupta

机构 * Google LLC(谷歌有限责任公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本文探讨大语言模型在滥用检测生命周期中的应用,分析其在标签生成、检测、审核及审计等阶段的作用,并讨论其面临的挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02976 2026-04-02 cs.AI 57%

Teaching AI to Handle Exceptions: Supervised Fine-Tuning with Human-Aligned Judgment

教AI处理例外:基于人类对齐判断的监督微调

Matthew DosSantos DiSorbo, Harang Ju, Sinan Aral

机构 * Harvard Business School(哈佛商学院) Johns Hopkins University(约翰霍普金斯大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 研究探讨了如何通过监督微调使AI处理例外,发现使用人类解释的微调能显著提升模型决策能力,揭示了对齐人类判断需明确训练决策过程而非仅决策结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01056 2026-04-02 eess.SY cs.SY 50%

A Functional Learning Approach for Team-Optimal Traffic Coordination

团队最优交通协调的函数学习方法

Weihao Sun, Gehui Xu, Alessio Moreschini, Thomas Parisini, Andreas A. Malikopoulos

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出基于核的方法的策略迭代函数学习框架,用于计算交通协调问题中的团队最优策略,结合二次调节项和非线性安全惩罚项,通过核空间近似求解,并在SUMO中验证。

Comments 8 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22588 2026-04-02 cs.HC cs.ET 50%

Practitioner Voices Summit: How Teachers Evaluate AI Tools through Deliberative Sensemaking

实践者声音峰会:教师如何通过 deliberative sensemaking 评估 AI 工具

Dorottya Demszky, Christopher Mah, Helen Higgins

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文探讨教师在整合AI工具时的评估标准及支持条件,通过全国峰会收集61名数学教师制定的200余条评估标准,揭示了 deliberative sensemaking 的五种机制及TPACK与代理的相互促进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏