arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-16 至 2026-03-16 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 5 篇

2603.13045 2026-03-16 cs.CL 81%

Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation

修补漏洞:在多语言翻译中缓解奖励黑客

Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出WALAR方法,通过单语文本提升低资源语言翻译能力,同时保持高资源语言性能。通过词对齐和语言对齐技术缓解现有质量评估模型的漏洞,实验显示在Flores-101数据集上优于LLaMAX。

Comments Our code is available at https://github.com/LeiLiLab/WALAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12628 2026-03-16 q-bio.NC cs.AI eess.SP 81%

Towards unified brain-to-text decoding across speech production and perception

迈向跨语音生成与感知的统一脑-文本解码

Zhizhang Yuan, Yang Yang, Gaorui Zhang, Baowen Cheng, Zehan Wu, Yuhao Xu, Xiaoying Liu, Liang Chen, Ying Mao, Meng Li

机构 * Computer Science and Technology(计算机科学与技术) Zhejiang University(浙江大学) Shanghai Institute of Microsystem and Information Technology(上海微系统与信息工程研究所) Chinese Academy of Sciences(中国科学院) Department of Neurosurgery(神经外科部门) Huashan Hospital, Fudan University(复旦大学华山医院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出一种统一的脑-句子解码框架,用于 Mandarin Chinese 的语音生成与感知,通过单字符数据训练实现句子级解码,并通过多模态神经动态比较提升解码性能。

Comments 37 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12565 2026-03-16 cs.SD cs.CL 79%

Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization

通过直接偏好优化实现日语SpeechLLMs的Speech-Worthy对齐

Mengjie Zhao, Lianbo Liu, Yusuke Fujita, Hao Shi, Yuan Gao, Roman Koshkin, Yui Sudo

机构 * SB Intuitions

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract);分类 cs.CL

AI总结 本文提出通过直接偏好优化方法,改进日语SpeechLLMs以生成适合语音合成的简洁、口语化文本,引入SpokenElyza基准测试,并在保持原有性能的同时显著提升语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12050 2026-03-16 cs.CL cs.AI cs.LG 75%

AdaBoN: Adaptive Best-of-N Alignment

AdaBoN: 适应性最佳N对齐

Vinod Raman, Hilal Asi, Satyen Kale

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种适应性最佳N对齐策略,通过两阶段算法高效分配推理计算资源,实验证明其在不同提示批次中优于均匀分配方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12595 2026-03-16 cs.LG cs.AI 62%

Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback

基于交换引导的偏好学习用于从人类反馈中获得个性化强化学习

Gihoon Kim, Euntai Kim

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Swap-guided Preference Learning (SPL)来解决变分偏好学习中后验崩溃的问题,通过引入交换引导基础正则化、偏好逆自回归流和自适应潜在条件化来提升个性化强化学习效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏