arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-03 至 2026-04-03 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2508.18649 2026-04-03 cs.CR cs.AI 89%

PRISM: Robust VLM Alignment with Principled Reasoning for Integrated Safety in Multimodality

PRISM:面向多模态集成安全的原理化推理对齐

Nanxi Li, Zhengyue Zhao, G. Edward Suh, Marco Pavone, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学) Stanford University(斯坦福大学) NVIDIA(英伟达)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract);分类 cs.AI

AI总结 PRISM通过结构化四阶段推理过程,有效应对多模态安全违规,提升VLM的鲁棒性与安全性,同时保持模型实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01787 2026-04-03 cs.CL 83%

DEFT: Distribution-guided Efficient Fine-Tuning for Human Alignment

DEFT:基于分布的高效微调以实现人类对齐

Liang Zhu, Feiteng Fang, Yuelin Bai, Longze Chen, Zhexiang Zhang, Minghuan Tan, Min Yang

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Science and Technology of China(中国科学技术大学) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出DEFT框架,通过数据过滤和分布引导提升模型对齐效率与泛化能力,减少训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14708 2026-04-03 econ.TH cs.AI cs.GT 79%

Human Misperception of Generative-AI Alignment: A Laboratory Experiment

人类对生成式人工智能对齐的误判:一项实验室实验

Kevin He, Ran Shorrer, Mengjia Xia

机构 * University of Pennsylvania(宾夕法尼亚大学) The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 研究通过激励性实验室实验探讨人们在经济决策中对生成式人工智能对齐的感知,发现人们高估了生成式人工智能与人类选择的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02145 2026-04-03 cs.AI cs.CL 73%

MTI: A Behavior-Based Temperament Profiling System for AI Agents

MTI:一种基于行为的 temperament 评估系统用于 AI 代理

Jihoon Jeong

机构 * ModuLabs

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 MTI 评估系统,通过四个维度测量 AI 代理 temperament,发现行为差异与模型大小无关,揭示了 RLHF 对 temperament 的影响。

Comments 29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01576 2026-04-03 cs.LG 70%

Care-Conditioned Neuromodulation for Autonomy-Preserving Supportive Dialogue Agents

关怀条件神经调节用于自主性保留的支持性对话代理

Shalima Binta Manir, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 偏好对齐 :alignment(abstract);harmlessness(abstract);分类 cs.LG

AI总结 本文提出Care-Conditioned Neuromodulation方法,通过状态依赖控制框架提升对话代理在支持性任务中的自主性保留能力,实验表明其在多轮对话中有效提升自主性支持与帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01312 2026-04-03 cs.CL cs.AI 62%

Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences

灰度偏好学习:可解释且偏见意识的奖励建模用于人类偏好

Simona-Vasilica Oprea, Adela Bâra

机构 * Department of Economic Informatics and Cybernetics, Bucharest University of Economic Studies(布加勒斯特经济研究大学经济信息学与控制论系)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型中人类偏好的学习难题,提出特征增强框架以捕捉人类判断的多维特性,通过评估多种大语言模型,展示了改进的奖励建模方法在准确性和可解释性上的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00979 2026-04-03 cs.CL cs.AI 62%

Dual Optimal: Make Your LLM Peer-like with Dignity

双最优:使你的大语言模型具有尊严的同行

Xiangqi Wang, Yue Huang, Haomin Zhuang, Kehan Guo, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Dignified Peer框架,通过反阿谀和可信性对抗逃避服务模式,利用PersonaKnob数据集和容忍约束Lagrangian DPO算法,构建具有尊严和同行能力的语言模型代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01837 2026-04-03 cs.CL 57%

PLOT: Enhancing Preference Learning via Optimal Transport

PLOT:通过最优传输增强偏好学习

Liang Zhu, Yuelin Bai, Xiankun Ren, Jiaxi Yang, Lei Zhang, Feiteng Fang, Hamid Alinejad-Rokny, Minghuan Tan, Min Yang

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Chongqing University(重庆大学) University of New South Wales(新南威尔士大学) University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 PLOT通过最优传输理论提升大语言模型的偏好学习,解决性能、计算成本和全局关系建模问题,实验显示其在人类价值观和逻辑问题解决方面均提升对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏