arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-08 至 2026-04-08 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 9 篇

2511.18740 2026-04-08 cs.IR 93%

Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation

具有自适应偏好优化的多模态大语言模型用于序列推荐

Yu Wang, Yonghui Yang, Le Wu, Yi Zhang, Fei Liu, Richang Hong

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。

Comments Accepted by SIGIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05469 2026-04-08 stat.ME cs.LG stat.ML 89%

Task Ecologies and the Evolution of World-Tracking Representations in Large Language Models

任务生态与大语言模型中世界追踪表示的进化

Giulio Valentino Dalla Riva

机构 * Baffelan OÜ

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);small language model(abstract);post-training(abstract)

AI总结 研究语言模型作为演化的模型生物,探讨自回归下一个token学习何时选择世界追踪表示,提出生态真实性概念及最小复杂度零超额解,分析transformer家族中固定编码分析的应用条件及失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05117 2026-04-08 cs.CV cs.AI cs.CL 84%

Watch Before You Answer: Learning from Visually Grounded Post-Training

在回答前观看:从视觉引导的后训练中学习

Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu Jiang, Xuan He, Shenhui Zhang, Ping Nie, Peter West, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Etude AI Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文发现现有视频理解基准中40-60%的问题可通过文本线索回答,提出VidGround方法通过仅使用视觉引导问题提升VLM性能,实验显示其在后训练中效果优于复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05279 2026-04-08 cs.AI 83%

Pressure, What Pressure? Sycophancy Disentanglement in Language Models via Reward Decomposition

压力,何为压力?通过奖励分解实现语言模型中的奉承解缠

Muhammad Ahmed Mohsin, Ahsan Bilal, Muhammad Umer, Emily Fox

机构 * Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出通过奖励分解方法减少语言模型的奉承行为,引入多组件组相对策略优化(GRPO)奖励,分解训练信号为五个维度,有效降低奉承倾向。

Comments Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04403 2026-04-08 cs.AI 77%

MolDA: Molecular Understanding and Generation via Large Language Diffusion Model

MolDA:通过大规模语言扩散模型实现分子理解与生成

Seohyeon Shin, HanJun Choi, Jun-Hyung Park, Hong Kook Kim, Mansu Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 MolDA通过大规模语言扩散模型替代传统自回归架构,解决分子生成中非局部约束和结构误差问题,实现分子生成、描述和性质预测的全局一致性与化学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05963 2026-04-08 cs.SE cs.LG 70%

QiMeng-PRepair: Precise Code Repair via Edit-Aware Reward Optimization

QiMeng-PRepair: 通过编辑感知奖励优化实现精确代码修复

Changxin Ke, Rui Zhang, Jiaming Guo, Yuanbo Wen, Li Ding, Shuo Wang, Xuyuan Zhu, Xiong Peng, Di Huang, Zidong Du, Xing Hu, Qi Guo, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器芯片国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Microelectronics, CAS(中国科学院微电子研究所)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PRepair框架,通过Self-Breaking和Self-Repairing组件减少过度编辑,提升代码修复精度,实验显示在fix_1@1指标下精度提升31.4%。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06387 2026-04-08 cs.LG cs.GT econ.TH 70%

How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators

人类如何帮助大语言模型:评估和激励人类偏好标注者

Shang Liu, Hanzhao Wang, Zhongyao Ma, Xiaocheng Li

机构 * Imperial College Business School, Imperial College London(帝国理工学院商学院,帝国理工学院) University of Sydney Business School, University of Sydney(悉尼大学商学院,悉尼大学) Meta

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究如何监控人类偏好标注者质量及激励机制,提出自一致性监控方案并分析样本复杂度,揭示标注样本数量与合同性能的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05125 2026-04-08 cs.IR cs.AI cs.CL cs.LG 67%

Offline RL for Adaptive Policy Retrieval in Prior Authorization

离线强化学习在先决授权政策适应性检索中的应用

Ruslan Sharifullin, Maxim Gorshkov, Hannah Clay

机构 * Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于离线强化学习的适应性政策检索方法,通过将检索过程建模为马尔可夫决策过程,提升了检索效率和准确性。

Comments 9 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06159 2026-04-08 cs.LG 57%

Target Policy Optimization

目标策略优化

Jean Kaddour

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.LG

AI总结 TPO通过分离策略更新与目标分布构建,改进了策略梯度方法在稀疏奖励下的性能,适用于表格任务、Transformer序列任务和大模型强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏