arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-22 至 2026-04-22 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2604.19485 2026-04-22 cs.LG cs.AI cs.CL 90%

EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

EVPO:用于大语言模型后训练中自适应批评者利用的解释方差策略优化

Chengjun Pan, Shichun Liu, Jiahang Lin, Dingwei Zhu, Jiazheng Zhang, Shihan Dou, Songyang Gao, Zhenhua Han, Binghai Wang, Rui Zheng, Xuanjing Huang, Tao Gui, Yansong Feng

机构 * Peking University(北京大学) Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启智科技有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EVPO,通过监控批量方差并自适应切换基于批评者或批量均值估计,证明在每一步都能达到更小的方差。在四个任务中,EVPO优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02063 2026-04-22 cs.HC cs.AI 90%

See2Refine: Vision-Language Feedback Improves LLM-Based eHMI Action Designers

See2Refine:视觉语言反馈提升基于LLM的eHMI动作设计

Ding Xia, Xinyue Gui, Mark Colley, Fan Gao, Zhongyi Zhou, Dongyuan Li, Renhe Jiang, Takeo Igarashi

机构 * The University of Tokyo(东京大学) University College London(伦敦大学学院) Google(谷歌)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 See2Refine通过视觉语言模型的反馈机制,提升基于大语言模型的eHMI动作设计能力,实现无需人工干预的闭环改进,优于传统提示和人工指定基线。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19406 2026-04-22 cs.CV cs.AI 89%

HP-Edit: A Human-Preference Post-Training Framework for Image Editing

HP-Edit:一种用于图像编辑的人类偏好后训练框架

Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang, Xinran Qin, Zhikai Chen, Fenglong Song, Zhixin Wang, Renjing Pei, Wangmeng Zuo

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Harbin Institute of Technology(哈尔滨工业大学) Nankai University(南开大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HP-Edit框架和RealPref-50K数据集,通过少量人类偏好评分数据和预训练视觉大语言模型开发自动评估器,提升图像编辑模型对人类偏好的契合度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18789 2026-04-22 cs.AI cs.CR cs.LG 87%

ARES: Adaptive Red-Teaming and End-to-End Repair of Policy-Reward System

ARES: 自适应红队测试与端到端策略-奖励系统修复

Jiacheng Liang, Yao Ma, Tharindu Kumarage, Satyapriya Krishna, Rahul Gupta, Kai-Wei Chang, Aram Galstyan, Charith Peris

机构 * Amazon Nova Responsible AI(亚马逊Nova责任AI)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 ARES通过自适应红队测试和端到端修复方法,系统发现并缓解策略-奖励系统双重漏洞,提升安全鲁棒性。

Comments 9 pages, ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19024 2026-04-22 cs.LG 86%

Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback

基于人类反馈的安全强化学习策略梯度对偶方法

Qiang Liu, Adrienne Kline, Ermin Wei

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出两种无需奖励模型拟合的Safe RLHF算法,将安全RLHF建模为无限 horizon 折扣约束马尔可夫决策过程,并保证了全局收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09373 2026-04-22 cs.LG cs.AI cs.CV 86%

LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization

LPO:通过位置偏好优化实现更准确的GUI代理交互

Jiaqi Tang, Yu Xia, Yi-Feng Wu, Yuwei Hu, Yuhui Chen, Qing-Guo Chen, Xiaogang Xu, Xiangyu Wu, Hao Lu, Yanqing Ma, Shiyin Lu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Science and Technology(南京理工大学) The Hong Kong University of Science and Technology (Guangzhou)(广州香港科学与技术大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出LPO方法,通过位置偏好优化提升GUI交互精度,利用信息熵预测交互位置并引入动态位置奖励函数,实验表明其在离线和在线评估中均取得最佳性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19544 2026-04-22 cs.AI 81%

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

DT2IT-MRM:去偏偏好构建与迭代训练用于多模态奖励建模

Zhihong Zhang, Jie Zhao, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xin Liu, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DT2IT-MRM方法,通过去偏偏好构建、文本到图像偏好数据重构和迭代训练框架,解决多模态奖励建模中偏好数据的偏差、噪声和不一致问题,并在三个基准测试中取得新突破。

Comments code will be uploaded to https://github.com/zhang123434/DT2IT-MRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05747 2026-04-22 cs.CL 70%

Capturing Classic Authorial Style in Long-Form Story Generation with GRPO Fine-Tuning

通过GRPO微调捕捉经典作者风格在长篇故事生成中的风格

Jinlong Liu, Mohammed Bahja, Venelin Kovatchev, Mark Lee

机构 * School of Computer Science, University of Birmingham, United Kingdom(英国伯明翰大学计算机科学学院)

专题命中 后训练与偏好优化 :preference optimization(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出两阶段流程,通过GRPO微调8B故事生成器,实现基于风格的可控生成,优于开放模型基线。

Comments Accepted to CoNLL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏