arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-03 至 2026-04-03 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 6 篇

2604.01597 2026-04-03 cs.LG 88%

Learning from the Right Rollouts: Data Attribution for PPO-based LLM Post-Training

从正确的回放中学习:基于PPO的LLM后训练的数据归因

Dong Shu, Denghui Zhang, Jessica Hullman

机构 * Northwestern University(西北大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);SFT(abstract);分类 cs.LG

AI总结 本文提出Influence-Guided PPO框架,通过计算影响分数筛选反向齐梯度的回放片段,提升PPO后训练效率并减少不忠实的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02174 2026-04-03 cs.AI 86%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 后训练与偏好优化 :large language model(title);language model(title);RLHF(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02145 2026-04-03 cs.AI cs.CL 79%

MTI: A Behavior-Based Temperament Profiling System for AI Agents

MTI:一种基于行为的 temperament 评估系统用于 AI 代理

Jihoon Jeong

机构 * ModuLabs

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 MTI 评估系统,通过四个维度测量 AI 代理 temperament,发现行为差异与模型大小无关,揭示了 RLHF 对 temperament 的影响。

Comments 29 pages, 6 figures, 12 tables. Paper #3 in the Model Medicine Series (Paper #1: arXiv:2603.04722)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01312 2026-04-03 cs.CL cs.AI 73%

Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences

灰度偏好学习:可解释且偏见意识的奖励建模用于人类偏好

Simona-Vasilica Oprea, Adela Bâra

机构 * Department of Economic Informatics and Cybernetics, Bucharest University of Economic Studies(布加勒斯特经济研究大学经济信息学与控制论系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型中人类偏好的学习难题,提出特征增强框架以捕捉人类判断的多维特性,通过评估多种大语言模型,展示了改进的奖励建模方法在准确性和可解释性上的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20453 2026-04-03 cs.LG 57%

Regret Bounds for Reinforcement Learning from Multi-Source Imperfect Preferences

基于多源不完美偏好的强化学习遗憾界

Ming Shi, Yingbin Liang, Ness B. Shroff, Ananthram Swami

机构 * University at Buffalo(纽约州立大学布法罗分校) The Ohio State University(俄亥俄州立大学) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.LG

AI总结 本文研究多源不完美偏好下的强化学习,提出统一算法,其遗憾界为~O(√(K/M)+ω),并给出下限和反例,揭示多源反馈如何提升RLHF及累积不完美对其的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02088 2026-04-03 cs.CV 50%

FlowSlider: Training-Free Continuous Image Editing via Fidelity-Steering Decomposition

FlowSlider: 无训练的连续图像编辑通过保真度引导分解

Taichi Endo, Guoqing Hao, Kazuhiko Sumi

机构 * Aoyama Gakuin University(青山学院大学)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 FlowSlider通过保真度引导分解实现无训练连续图像编辑,通过几何分析和实证测量证明其稳定性,提升编辑质量。

Comments HuggingFace Space: https://huggingface.co/spaces/dominoer/FlowSlider

详情

展开后加载摘要…

URL PDF HTML 收藏