arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 12 篇

2604.25895 2026-04-29 cs.CY cs.AI cs.CL 92%

Three Models of RLHF Annotation: Extension, Evidence, and Authority

三种RLHF注释模型:扩展、证据与权威

Steve Coyne

机构 * University of Toronto(多伦多大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨RLHF注释的三种模型:扩展、证据与权威,分析其对注释流程设计的影响,并提出应根据不同维度选择适配的模型。

Comments 17 pages. Accepted to ACM FAccT '26, June 25-28, Montreal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25259 2026-04-29 cs.LG 90%

DGLight: DQN-Guided GRPO Fine-Tuning of Large Language Models for Traffic Signal Control

DGLight:基于DQN的GRPO对大语言模型进行交通信号控制的微调

Chenbo Yu

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出DGLight框架,通过预训练大语言模型适应交通信号控制,采用CoLight深度Q网络估计交通状态的动作价值,并利用GRPO优化策略,实现可解释的信号决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24881 2026-04-29 cs.AI 90%

Latent Agents: A Post-Training Procedure for Internalized Multi-Agent Debate

潜在代理:一种事后训练过程用于内部化多代理辩论

John Seon Keun Yi, Aaron Mueller, Dokyun Lee

机构 * Boston University(波士顿大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title);large language model(abstract);language model(abstract)

AI总结 本文提出一种两阶段微调流程,将多代理辩论转化为单个LLM,通过动态奖励调度和长度截断实现内部化,减少93%的token使用,同时通过激活引导发现代理特定子空间,并展示通过内部化辩论抑制恶意代理的应用。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV 88%

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);pretraining(abstract)

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24804 2026-04-29 cs.LG cs.CL 86%

Intrinsic Mutual Information as a Modulator for Preference Optimization

内在互信息作为偏好优化的调节器

Peng Liao, Peijia Zheng, Lingbo Li, Shangsong Liang, Lin Chen

机构 * Sun Yat-sen University(中山大学) University of Warwick(华威大学) Macao Polytechnic University(澳门理工学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RMiPO框架,利用内在响应级互信息进行偏好优化,通过超参数调节动态解耦偏好贡献,减少训练开销,提升性能。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02467 2026-04-29 cs.CV cs.AI 85%

VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation

VERTIGO:用于电影摄像机轨迹生成的视觉偏好优化

Mengtian Li, Yuwei Lu, Feifei Li, Chenqi Gan, Zhifeng Xie, Xi Wang

机构 * Shanghai University Shanghai Engineering Research Center of Motion Picture Special Effects LIX, \'Ecole Polytechnique, CNRS, IPP magenta http://vertigo.magic-lab.tech/

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出VERTIGO,通过视觉偏好优化提升摄像机轨迹生成的质量,通过实时渲染和视觉语言模型优化,提高画面构图和视觉效果。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23964 2026-04-29 cs.IR 85%

RAD-DPO: Robust Adaptive Denoising Direct Preference Optimization for Generative Retrieval in E-commerce

RAD-DPO:面向电商生成检索的鲁棒自适应去噪直接偏好优化

Zhiguo Chen, Guohao Sun, Yiming Qiu, Xingzhi Yao, Mingming Li, Huimu Wang, Yangqi Zhang, Songlin Wang, Sulong Xu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn)

AI总结 针对生成检索中直接偏好优化的局限性,提出RAD-DPO方法,通过梯度分离保护前缀结构、动态奖励加权缓解标签噪声、全局对比学习扩展正样本覆盖,提升检索精度和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24952 2026-04-29 cs.CV cs.AI 79%

Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization

从噪声偏好学习:一种半监督学习方法用于直接偏好优化

Xinxin Liu, Ming Li, Zonglin Lyu, Yuzhang Shang, Chen Chen

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 本文提出Semi-DPO方法,通过半监督学习处理多维偏好噪声,提升复杂人类偏好对齐性能,无需额外人工标注或显式奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25872 2026-04-29 cs.LG cs.AI stat.ML 79%

When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient

当错误可能有益:对策略梯度中不完美奖励的分类

Shuning Shang, Hubert Strauss, Stanley Wei, Sanjeev Arora, Noam Razin

机构 * Some Institute(某些研究所)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在策略梯度方法中,不完美奖励的错误并非全然有害,通过理论分析分类了不同类型的奖励误差对真实奖励增加的影响,提出了改进人类反馈强化学习和可验证奖励设计的实用方法。

Comments Code available at https://github.com/princeton-pli/imperfect-rewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25832 2026-04-29 cs.AI 70%

TrialCalibre: A Fully Automated Causal Engine for RCT Benchmarking and Observational Trial Calibration

TrialCalibre:一种完全自动化的因果引擎用于RCT基准测试和观察性试验校准

Amir Habibdoust, Xing Song

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TrialCalibre,一种多智能体系统,用于自动化和扩展BenchExCal流程,通过专门的智能体协调整个过程,实现适应性、可审计和透明的因果效应估计。

Comments 5 pages , 2 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025. Copyright 2025 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12759 2026-04-29 cs.CL 57%

RAG-RL: Advancing Retrieval-Augmented Generation via RL and Curriculum Learning

RAG-RL:通过强化学习和课程学习推进检索增强生成

Jerry Huang, Siddarth Madala, Risham Sidhu, Cheng Niu, Hao Peng, Julia Hockenmaier, Tong Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL

AI总结 RAG-RL通过强化学习和课程学习提升检索增强生成性能,使生成模型能识别并引用相关信息,提高样本效率和泛化能力,实验显示在多跳问答任务中准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25291 2026-04-29 cs.IR 50%

From Local Indices to Global Identifiers: Generative Reranking for Recommender Systems via Global Action Space

从局部索引到全局标识符:通过全局动作空间实现生成式重排序的推荐系统

Pengyue Jia, Xiaobei Wang, Yingyi Zhang, Shuchang Liu, Yupeng Hou, Hailan Yang, Xu Gao, Xiaopeng Li, Yejing Wang, Julian McAuley, Xiang Li, Lantao Hu, Yongqi Liu, Kaiqiao Zhan, Han Li, Kun Gai, Xiangyu Zhao

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 本文提出GloRank框架,通过生成全局标识符替代局部索引选择,解决推荐系统重排序中动作空间语义不一致的问题,实验表明其在基准和工业数据上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏