arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-30 至 2026-04-30 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2510.04214 2026-04-30 cs.CL 92%

Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards

教LLM变得有说服力:来自异质奖励的强化学习后训练政策优化

Xia Zeng, Yihan Chen, Luhui Liu, Chao Luo, Ye Chen, Zhuoran Zhuang

机构 * Fliggy Alibaba(飞猪阿里)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出REPO方法,通过结合偏好训练奖励模型、LLM作为判断者和规则奖励函数,提升在线旅行社的价格谈判对话质量,实验显示在对话评分、优秀回应比例和坏案例修复率上均有显著提升。

Comments accepted by ACL 2026 indusry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20265 2026-04-30 cs.LG cs.CL 91%

Failure Modes of Maximum Entropy RLHF

最大熵强化学习在RLHF中的失败模式

Ömer Veysel Çağatan, Barış Akgün

机构 * Koç University(科克大学) KUIS AI Center(KUIS人工智能中心)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了最大熵强化学习在在线RLHF中的表现,发现其易出现过度优化和KL动态不稳定,且熵正则化无法有效防止奖励黑客,揭示了参考自由方法在在线与离线学习中的不同挑战。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26553 2026-04-30 cs.CL cs.AI cs.LG 90%

TLPO: Token-Level Policy Optimization for Mitigating Language Confusion in Large Language Models

TLPO:基于令牌级别的策略优化以缓解大语言模型中的语言混淆

Jinho Choo, JunSeung Lee, Jimyeong Kim, Yeeho Song, S. K. Hong, Yeong-Dae Kwon

机构 * Samsung SDS(三星SDS)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TLPO,通过令牌级优化缓解大语言模型中的语言混淆问题,通过局部更新提升语言一致性,同时保持下游任务准确性。

Comments Accepted to the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06624 2026-04-30 cs.CL cs.AI cs.LG 88%

A Practice of Post-Training on Llama-3 70B with Optimal Selection of Additional Language Mixture Ratio

在Llama-3 70B上进行训练实践:最优额外语言混合比例的选择

Ningyuan Xi, Yetao Wu, Kun Fan, Teng Chen, Qingqing Gu, Luo Ji

机构 * Geely AI Lab(吉利人工智能实验室) Beihang University(北航)

专题命中 后训练与偏好优化 :post-training(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过在Llama-3 8B和70B上进行持续预训练,研究额外语言混合比例与学习率的最优相关性,提升中文能力及数学、编程等领域的表现,并在实际聊天系统中部署70B模型取得良好效果。

Comments 12 pages, 2 figures. PAKDD2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17698 2026-04-30 cs.LG cs.CL stat.ML 82%

The Geometric Canary: Predicting Steerability and Detecting Drift via Representational Stability

几何渡鸦:通过表征稳定性预测可操控性并检测漂移

Prashant C. Raju

机构 * Prashant C. Raju

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过表征稳定性预测语言模型的可操控性并检测漂移,展示了监督和非监督稳定性在不同任务中的互补作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24953 2026-04-30 cs.CV cs.AI 79%

ViPO: Visual Preference Optimization at Scale

ViPO:大规模视觉偏好优化

Ming Li, Jie Wu, Justin Cui, Xiaojie Li, Rui Wang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学) ByteDance Seed(字节跳动种子) UCLA(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文提出ViPO大规模偏好数据集和Poly-DPO方法,通过提升数据质量和算法鲁棒性,实现视觉生成模型的高效偏好优化。

Comments ICLR 2026 Paper. Project Page: https://liming-ai.github.io/ViPO ; Code: https://github.com/liming-ai/ViPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23575 2026-04-30 cs.CY cs.CL cs.LG 73%

The Collapse of Heterogeneity in Silicon Philosophers

硅哲学家中的异质性崩溃

Yuanming Shi, Andreas Haupt

机构 * Adobe Inc.(Adobe公司) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现硅样本在哲学领域系统性地压缩了异质性,语言模型过度相关哲学判断,产生人工共识,影响对齐、评估和硅样本替代人类判断的使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26120 2026-04-30 cs.AI 70%

Hierarchical Multi-Persona Induction from User Behavioral Logs: Learning Evidence-Grounded and Truthful Personas

层级多角色诱导从用户行为日志:学习证据导向且真实的角色

Nayoung Choi, Haeyu Jeong, Changbong Kim, Hongjun Lim, Jinho D. Choi

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) Naver Corporation(Naver公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);preference optimization(abstract);分类 cs.AI

AI总结 本文提出层级框架,通过聚类和标注用户行为记忆,诱导多个证据支撑的角色,提升角色的连贯性、证据性和可信度,同时提高未来交互预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26830 2026-04-30 cs.LG cs.AI 62%

Random Cloud: Finding Minimal Neural Architectures Without Training

随机云:无需训练的神经架构搜索

Javier Gil Blázquez

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 随机云方法通过随机探索和逐步结构缩减,在无需训练的情况下发现最小前馈网络拓扑,优于剪枝基线,在7个数据集上实现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏