arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-23 至 2026-03-23 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2603.19741 2026-03-23 cs.LG cs.CL 86%

FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment

FedPDPO:联邦个性化直接偏好优化用于大语言模型对齐

Kewen Zhu, Liping Yi, Zhiming Zhao, Zhuang Qi, Han Yu, Qinghua Hu

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FedPDPO,一种联邦个性化直接偏好优化框架,通过参数高效微调和个性化奖励头解决非iid数据下的大语言模型对齐问题,实验显示在联邦内域和跨域设置中平均准确率提升达4.80%。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14400 2026-03-23 cs.AI 85%

HPS: Hard Preference Sampling for Human Preference Alignment

HPS: 人类偏好对齐的硬偏好采样

Xiandong Zou, Wanyu Lin, Yuchen Li, Pan Zhou

机构 * Singapore Management University(新加坡国立管理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出HPS框架,通过优先选择最受好评的响应并拒绝所有不受欢迎和有害的响应,提升大语言模型与人类偏好的对齐效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20100 2026-03-23 cs.CL cs.AI 81%

An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models

小语言模型中SFT-DPO交互与参数化的实证研究

Yuming Feng, Christy Yang

机构 * Department of Computer Science(计算机科学系) Stanford University(斯坦福大学)

专题命中 偏好对齐 :DPO(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比SFT、DPO及分阶段训练方法,发现全参数微调在小模型中表现更优,而偏好优化和低秩适应带来的边际收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19665 2026-03-23 cs.IR 71%

GenFacet: End-to-End Generative Faceted Search via Multi-Task Preference Alignment in E-Commerce

GenFacet:通过多任务偏好对齐的端到端生成方法实现电商多维搜索

Zhouwei Zhai, Min Yang, Jin Li

专题命中 偏好对齐 :alignment(title)

AI总结 本文提出GenFacet,一种端到端生成框架,通过多任务偏好对齐提升电商多维搜索效果,实验证明显著提升点击率和转化率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19251 2026-03-23 cs.CL 70%

Enhancing Legal LLMs through Metadata-Enriched RAG Pipelines and Direct Preference Optimization

通过元数据增强的RAG流水线和直接偏好优化增强法律LLM

Suyash Maniyar, Deepali Singh, Rohith Reddy

专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出元数据增强的RAG和直接偏好优化,解决法律领域长文本检索和生成中的精度问题,提升模型的可靠性与安全性。

Comments 12 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09814 2026-03-23 cs.CV 50%

DreamCS: Geometry-Aware Text-to-3D Generation with Unpaired 3D Reward Supervision

DreamCS: 基于几何感知的文本到3D生成与无配对3D奖励监督

Xiandong Zou, Ruihao Xia, Hongsong Wang, Pan Zhou

机构 * Singapore Management University(新加坡管理学院) East China University of Science and Technology(东华大学) Southeast University(东南大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出DreamCS框架,通过无配对3D-MeshPref数据训练奖励模型,提升文本到3D生成的几何准确性和人类偏好对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏