arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-09 至 2026-04-09 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2604.06833 2026-04-09 cs.CR cs.LG 83%

FedDetox: Robust Federated SLM Alignment via On-Device Data Sanitization

FedDetox: 通过设备端数据净化实现鲁棒的联邦SLM对齐

Shunan Zhu, Jiawei Chen, Yonghao Yu, Hideya Ochiai

机构 * The University of Tokyo(东京大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.LG

AI总结 FedDetox通过设备端数据净化技术,提升联邦学习中小型语言模型的安全对齐能力,保持模型安全性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17183 2026-04-09 cs.CL cs.AI cs.LG 82%

LifeAlign: Lifelong Alignment for Large Language Models with Memory-Augmented Focalized Preference Optimization

LifeAlign: 为大型语言模型设计的终身对齐方法,结合记忆增强的聚焦偏好优化

Junsong Li, Jie Zhou, Bihao Zhan, Yutao Yang, Qianjun Pan, Shilian Chen, Tianyu Huai, Xin Li, Qin Chen, Liang He

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LifeAlign,一种通过记忆增强的聚焦偏好优化实现终身对齐的方法,解决大型语言模型在连续学习任务中保持偏好对齐和知识保留的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07181 2026-04-09 cs.CL 79%

PACIFIC: Can LLMs Discern the Traits Influencing Your Preferences? Evaluating Personality-Driven Preference Alignment in LLMs

PACIFIC:LLM能否辨别影响您偏好的特质?评估LLM中由性格驱动的偏好对齐

Tianyu Zhao, Siqi Li, Yasser Shoukry, Salma Elmalaki

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 研究通过实验发现,基于用户性格特征的偏好对齐可显著提升个性化问答准确性,提出PACIFIC数据集及自动检索框架,用于改进LLM回答生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06621 2026-04-09 cs.GL cs.LG stat.ML 70%

The Theorems of Dr. David Blackwell and Their Contributions to Artificial Intelligence

大卫·布莱克韦尔定理及其对人工智能的贡献

Napoleon Paxton

机构 * School of Information, University of California, Berkeley(加州大学伯克利分校信息学院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文综述了布莱克韦尔的三个重要定理及其对现代人工智能和机器学习的影响,包括马尔可夫链蒙特卡罗推断、自主机器人导航、生成模型训练等领域的应用。

Comments Survey article, 19 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03044 2026-04-09 cs.CL cs.AI 62%

JoyAI-LLM Flash: Advancing Mid-Scale LLMs with Token Efficiency

JoyAI-LLM Flash: 通过令牌效率推进中等规模语言模型

Aichen Cai, Anmeng Zhang, Anyu Li, Bo Zhang, Bohua Cai, Chang Li, Changjian Jiang, Changkai Lu, Chao Xue, Chaocai Liang, Cheng Zhang, Dongkai Liu, Fei Wang, Guoqiang Huang, Haijian Ke, Han Lin, Hao Wang, Ji Miao, Jiacheng Zhang, Jialong Shi, Jifeng Zhu, Jingjing Qian, Junhui Luo, Junwu Xiong, Lam So, Liang Huang, Ming Ke, Mingyang Li, Panfeng Shi, Peng Hao, Qi Wang, Qian Lai, Qiaoqiao Yuan, Qingyu Yin, Qiong Cao, Qixiang Wang, Rongcheng Bian, Rongduo Han, Shaoqiang Zheng, Shi Hu, Shi Suo, Shijie Ren, Shijin Zhang, Shiying Fan, Shuai Xie, Tianyi Zhang, Wei Liu, Wentao Tan, Xianghan Meng, Xiaodong He, Xing Pan, Xiran Wang, Xuyang Peng, Ya Zhang, Yang Liu, Yangyang Duan, Yanxu Chen, Yicheng Gong, Yidan Huang, Yifei Liu, Yinhao Bai, Yongqiang Liu, Yuesong Zhang, Yuqi Zhang, Zerui Xie, Zhenfang Wang, Zhennan Shen, Zheyuan Liu, Zhuwei Zeng

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出JoyAI-LLM Flash,一种高效的混合专家语言模型,通过平衡性能与令牌效率,在50B参数以下的范围内重新定义性能与效率的权衡。

Comments Xiaodong He is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06298 2026-04-09 cs.LG 57%

Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs

难度扩展的极限:在GRPO调优的SLMs中困难样本产生递减回报

Suraj Yadav, Siddharth Yadav, Parth Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文研究了在资源受限条件下,GRPO与LoRA应用于SLMs进行数学推理时,难度增加对准确率的影响,发现高难度样本的提升效果递减。

Comments Accepted at ICLR Workshop 2026 ICBINB

详情

展开后加载摘要…

URL PDF HTML 收藏