arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-15 至 2026-04-15 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2512.19728 2026-04-15 cs.LG 95%

Hard Negative Sample-Augmented DPO Post-Training for Small Language Models

增强的DPO后训练用于小型语言模型

Haocheng Lu, Minjun Zhu, Henry Yu

机构 * Computer Science NYU Shanghai(纽约大学上海学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);small language model(title);LLM(abstract,abstract_cn)

AI总结 本文提出一种轻量级后训练方法,通过MathVerifier检测结构化错误,改进DPO以提升小型模型在数学推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11554 2026-04-15 cs.CL 85%

Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale

Relax:一种用于大规模多模态后训练的异步强化学习引擎

Liujie Zhang, Benzhe Ning, Rui Yang, Xiaoyan Yu, Jiaxing Li, Lumeng Wu, Jia Liu, Minghao Li, Weihang Chen, Weiqi Hu, Lei Zhang

机构 * AI Platform, Xiaohongshu Inc(小红书AI平台) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Relax通过三个协同设计的架构层解决多模态数据流、大规模鲁棒性和延迟-吞吐量平衡问题,实现比veRL快1.20倍的端到端加速,并在多模态强化学习中表现出稳定收敛性。

Comments 17 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09780 2026-04-15 cs.LG 84%

Hail to the Thief: Exploring Attacks and Defenses in Decentralised GRPO

向小偷致敬:探索去中心化GRPO中的攻击与防御

Nikolay Blagoev, Oğuzhan Ersoy, Lydia Yiyu Chen

机构 * Gensyn Université de Neuchâtel(Neuchâtel大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究去中心化GRPO的鲁棒性,提出首个对抗攻击及防御措施,通过恶意节点污染良性模型,展示攻击成功率可达100%,并提出两种防御机制以减轻攻击影响。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 83%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25758 2026-04-15 cs.AI 77%

Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training

思考火花!:推理模型后训练期间的涌现注意力头

Yein Park, Minbyul Jeong, Jaewoo Kang

机构 * Korea University(韩国大学) Upstage AI AIGEN Sciences(AIGEN 科技)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 研究探讨了后训练技术如何通过涌现的注意力头提升推理能力,分析不同训练方法对注意力头演化的影响,并揭示了复杂推理与基础计算之间的性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06794 2026-04-15 cs.AI 70%

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning

不再有陈旧的反馈:为开放世界智能体学习的共进化批评者

Zhicong Li, Lingjie Jiang, Yulan Hu, Xingchen Zeng, Yixia Li, Xiangwen Zhang, Guanhua Chen, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学 赛洛岭人工智能学院) Amap, Alibaba Group(阿里巴巴集团 阿里地图) Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ECHO框架,通过同步共进化循环联合优化策略和批评者,解决开放世界环境中策略演变导致的反馈过时问题,提升长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03963 2026-04-15 cs.CV 67%

TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning

TempR1:通过时间感知的多任务强化学习提升多模态大语言模型的时间理解

Tao Wu, Li Yang, Gen Zhan, Yabin Zhang, Yiting Liao, Junlin Li, Deliang Fu, Li Zhang, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Inc.(字节跳动公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 TempR1通过时间感知的多任务强化学习框架,系统增强MLLMs的时间理解能力,通过多任务语料库和改进的GRPO算法实现稳定有效的跨任务优化,提升时间依赖性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12163 2026-04-15 cs.CV 67%

Nucleus-Image: Sparse MoE for Image Generation

Nucleus-Image:稀疏MoE用于图像生成

Chandan Akiti, Ajay Modukuri, Murali Nandan Nagarapu, Gunavardhan Akiti, Haozhe Liu

机构 * Nucleus AI Team(Nucleus AI 团队)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 Nucleus-Image通过稀疏MoE架构在质量与效率上实现新的帕累托前沿,仅使用约2B参数即可达到领先模型性能,无需后训练优化。

详情

展开后加载摘要…

URL PDF HTML 收藏