arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-22 至 2026-04-22 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2604.19406 2026-04-22 cs.CV cs.AI 81%

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

HP-Edit:一种用于图像编辑的人类偏好后训练框架

Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin Wang, Renjing Pei, Wangmeng Zuo

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Harbin Institute of Technology(哈尔滨工业大学) Nankai University(南开大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出HP-Edit框架和RealPref-50K数据集,通过少量人类偏好评分数据和预训练视觉大语言模型开发自动评估器,提升图像编辑模型对人类偏好的契合度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06168 2026-04-22 cs.AI 79%

Chain-of-Thought as a Lens: Evaluating Structured Reasoning Alignment between Human Preferences and Large Language Models

思维链作为镜像:评估大语言模型与人类偏好之间结构化推理的对齐

Boxuan Wang, Zhuoyun Li, Xinmiao Huang, Xiaowei Huang, Yi Dong

机构 * School of Computer Science and Informatics, University of Liverpool, United Kingdom(利物浦大学计算机科学与信息学学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种量化评估大语言模型多步结构化推理与人类偏好对齐的方法,引入对齐分数指标,通过构建基于语义熵的矩阵比较模型生成的思维链与人类偏好参考,发现对齐分数在2步推理时达到峰值,支持其作为诊断信号。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19544 2026-04-22 cs.AI 70%

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

DT2IT-MRM:去偏偏好构建与迭代训练用于多模态奖励建模

Zhihong Zhang, Jie Zhao, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xin Liu, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出DT2IT-MRM方法,通过去偏偏好构建、文本到图像偏好数据重构和迭代训练框架,解决多模态奖励建模中偏好数据的偏差、噪声和不一致问题,并在三个基准测试中取得新突破。

Comments code will be uploaded to https://github.com/zhang123434/DT2IT-MRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18589 2026-04-22 cs.HC cs.AI 57%

CentaurTA Studio: A Self-Improving Human-Agent Collaboration System for Thematic Analysis

CentaurTA Studio:一个自我改进的人机协作系统用于主题分析

Lei Wang, Min Huang, Eduard Dragut

机构 * Temple University(Temple大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出CentaurTA Studio,通过人机协作提升主题分析效率,实现高准确率和可靠评估,验证了反馈循环和持续优化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏