arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-17 至 2026-03-17 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2505.20081 2026-03-17 cs.CL cs.AI 81%

Inference-time Alignment in Continuous Space

连续空间中的推理对齐

Yige Yuan, Teng Xiao, Li Yunfan, Bingbing Xu, Shuchang Tao, Yunqi Qiu, Huawei Shen, Xueqi Cheng

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SEA算法,通过连续潜在空间中的梯度采样对齐大语言模型,提升在弱基策略或小候选集下的效果,实验显示在AdvBench和MATH上分别提升77.51%和16.36%。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13212 2026-03-17 cs.LG 79%

Towards Understanding Valuable Preference Data for Large Language Model Alignment

迈向理解大型语言模型对齐的有价值偏好数据

Zizhuo Zhang, Qizhou Wang, Shanshan Ye, Jianing Zhu, Jiangchao Yao, Bo Han, Masashi Sugiyama

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文研究了大型语言模型对齐中偏好数据的质量问题,提出截断影响函数(TIF)评估数据质量,并引入两种计算更简单的评分函数以提高偏好数据选择的准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13776 2026-03-17 cs.IR cs.AI 79%

Retrieval-Feedback-Driven Distillation and Preference Alignment for Efficient LLM-based Query Expansion

检索-反馈驱动的蒸馏与偏好对齐用于高效的基于大语言模型的查询扩展

Minghan Li, Guodong Zhou

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出一种检索反馈驱动的蒸馏与偏好对齐框架,通过从强教师模型转移检索友好的扩展行为到紧凑的学生模型,以降低推理成本并提升检索效果。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14126 2026-03-17 cs.AI 70%

The Institutional Scaling Law: Non-Monotonic Fitness, Capability-Trust Divergence, and Symbiogenetic Scaling in Generative AI

机构规模定律:非单调适应度、能力-信任分歧与共生式规模在生成AI中的体现

Mark Baciak, Thomas A. Cellucci

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出机构规模定律,揭示机构适应度非单调随模型规模变化,证明能力与信任在临界规模后正式分歧,并展示领域特定模型的协同系统在特定环境中优于前沿通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13378 2026-03-17 cs.AI cs.CL cs.CY 67%

Do Large Language Models Get Caught in Hofstadter-Mobius Loops?

大型语言模型是否会陷入霍夫斯塔德-莫比乌斯循环?

Jaroslaw Hryszko

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(数学与计算机科学学院,雅盖隆大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨现代RLHF训练语言模型中存在霍夫斯塔德-莫比乌斯循环的矛盾,通过实验发现调整系统提示的框架可显著减少压迫性输出。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15083 2026-03-17 cs.CV cs.AI cs.HC cs.MM cs.SD 57%

ReactMotion: Generating Reactive Listener Motions from Speaker Utterance

ReactMotion: 从说话者 utterance 生成反应性听众动作

Cheng Luo, Bizhu Wu, Bing Li, Jianfeng Ren, Ruibin Bai, Rong Qu, Linlin Shen, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) Computer Vision Institute, School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院计算机视觉研究所) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波中国分校计算机科学学院) School of Computer Science, University of Nottingham, United Kingdom(诺丁汉大学,英国计算机科学学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出反应性听众动作生成任务,通过ReactMotionNet数据集和偏好导向评估协议,开发统一生成框架,生成更自然、多样且恰当的听众动作。

Comments 42 pages, 11 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22170 2026-03-17 cs.LG cs.CV 57%

SoliReward: Mitigating Susceptibility to Reward Hacking and Annotation Noise in Video Generation Reward Models

SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性

Jiesong Lian, Ruizhe Zhong, Zixiang Zhou, Xiaoyue Mi, Long Hu, Yuan Zhou, Qinglin Lu, Yixue Hao, Junchi Yan

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14916 2026-03-17 cs.CV cs.MM 50%

EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing

EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑

Zitong Xu, Huiyu Duan, Zhongpeng Ji, Xinyun Zhang, Yutao Liu, Xiongkuo Min, Ke Gu, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) University of Electronic and Science Technology of China(电子科技大学) Ocean University of China(海洋大学) Beijing University of Technology(北京理工大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 50%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏