arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-02 至 2026-04-02 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 7 篇

2512.00234 2026-04-02 cs.CL cs.AI 82%

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments Revised submission in review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01129 2026-04-02 cs.CV 78%

ReinDriveGen: Reinforcement Post-Training for Out-of-Distribution Driving Scene Generation

ReinDriveGen:强化学习后训练用于分布外驾驶场景生成

Hao Zhang, Lue Fan, Weikang Bian, Zehuan Wu, Lewei Lu, Zhaoxiang Zhang, Hongsheng Li

机构 * MMLab, CUHK(MMLab,香港中文大学) CASIA(中国科学院自动化研究所) SenseTime Research(商汤科技研究院)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 ReinDriveGen通过动态点云场景生成与强化学习后训练,实现对驾驶场景的可控生成,提升安全关键场景的模拟质量。

Comments Project page: https://drive-sim.github.io/ReinDriveGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00479 2026-04-02 cs.CV 78%

All Roads Lead to Rome: Incentivizing Divergent Thinking in Vision-Language Models

所有道路通向罗马:激励视觉-语言模型的发散性思维

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) Shanghai AI Lab(上海人工智能实验室) GE Research(通用电气研究院)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 本文研究了强化学习在视觉-语言模型中激发发散性思维的机制,提出MUPO方法以解决GRPO的多样性崩溃问题,提升模型的多样性和可扩展性。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00558 2026-04-02 cs.CV 75%

STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO

STAR:通过转弯点对齐和段级DPO缓解空间推理中的级联错误

Pukun Zhao, Longxiang Wang, Chen Chen, Peicheng Wang, Fanqing Zhou, Runze Li, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东财经大学) Chongqing University(重庆大学) Westlake University(西湖大学) The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出STAR框架,通过拓扑锚点解决复杂拓扑中的级联错误问题,引入RedMaze-23K数据集并采用段级DPO提升长距离导航的自我修正能力,实验表明其32B版本在开源模型中表现最优。

Comments 9 pages, 6 figures, 4 tables, Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00200 2026-04-02 cs.LG 74%

Offline Constrained RLHF with Multiple Preference Oracles

离线约束强化学习中的多偏好Oracle

Brenden Latham, Mehrdad Moharrami

机构 * University of Iowa(爱荷华大学)

专题命中 后训练与偏好优化 :RLHF(title);分类 cs.LG

AI总结 本文基于多偏好Oracle研究离线约束强化学习,通过最大似然估计Oracle奖励并分析统计不确定性传播,将约束目标转化为KL-正则化拉格朗日函数,提出仅需对偶的算法以保证约束满足并提供有限样本性能保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00248 2026-04-02 cs.CL cs.AI 62%

REM-CTX: Automated Peer Review via Reinforcement Learning with Auxiliary Context

REM-CTX:通过强化学习与辅助上下文实现的自动化同行评审

Pawin Taechoyotin, Daniel E. Acuna

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI

AI总结 REM-CTX通过强化学习与辅助上下文提升同行评审质量,实验显示其在多个领域中优于基线模型,且在质量和上下文关联性指标上表现突出。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01188 2026-04-02 eess.SY cs.SY 50%

Learning Neural Network Controllers with Certified Robust Performance via Adversarial Training

通过对抗训练学习具有认证鲁棒性能的神经网络控制器

Neelay Junnarkar, Yasin Sonmez, Murat Arcak

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出通过对抗训练联合合成神经网络控制器和鲁棒性证书,以保证闭环系统的鲁棒性能,利用反例指导训练,并通过alpha,beta-CROWN验证非线性动态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏