arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-11 至 2026-03-11 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2603.08640 2026-03-11 cs.SE cs.AI cs.LG 88%

PostTrainBench: Can LLM Agents Automate LLM Post-Training?

PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?

Ben Rank, Hardik Bhatnagar, Ameya Prabhu, Shira Eisenberg, Karina Nguyen, Matthias Bethge, Maksym Andriushchenko

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09206 2026-03-11 cs.CV cs.LG 85%

MM-Zero: Self-Evolving Multi-Model Vision Language Models From Zero Data

MM-Zero: 从零数据自我进化多模型视觉语言模型

Zongxia Li, Hongyang Du, Chengsong Huang, Xiyang Wu, Lantao Yu, Yicheng He, Jing Xie, Xiaomin Wu, Zhichao Liu, Jiarui Zhang, Fuxiao Liu

机构 * University of Maryland(马里兰大学) Brown University(布朗大学) Washington University in St. Louis(圣路易斯华盛顿大学) Adobe University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Southern California(南加州大学) NVIDIA

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

AI总结 MM-Zero通过多角色框架实现VLM零数据自我进化,提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22607 2026-03-11 cs.AI cs.CL 84%

From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents

从自演化合成数据到可验证奖励强化学习:训练后多轮交互工具使用智能体

Jiaxuan Gao, Jiaao Chen, Chuyi He, Shusheng Xu, Di Jin, Yi Wu

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EigenData框架,结合自演化数据代理与验证器强化学习,通过合成数据提升多轮交互工具使用智能体的训练效率和性能。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17102 2026-03-11 cs.AI 81%

Reinforcement Learning for Self-Improving Agent with Skill Library

基于技能库的自我改进智能体强化学习

Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) AWS Agentic AI(AWS智能代理)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出SAGE框架,通过强化学习结合技能库,提升智能体在新环境中的自我改进能力,实验显示其在准确性和效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09121 2026-03-11 cs.RO cs.AI 79%

DexHiL: A Human-in-the-Loop Framework for Vision-Language-Action Model Post-Training in Dexterous Manipulation

DexHiL: 一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架

Yifan Han, Zhongxi Chen, Yuxuan Zhao, Congsheng Xu, Yanming Shao, Yichuan Peng, Yao Mu, Wenzhao Lian

机构 * CASIA(中国科学院自动化研究所) SJTU(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 DexHiL是一种用于灵巧操作中视觉-语言-动作模型后训练的人机协同框架,通过干预意识的数据采样策略和轻量级远程操作界面,显著提升了模型在不同任务中的成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11595 2026-03-11 cs.LG cs.AI cs.CL 75%

Stepwise Guided Policy Optimization: Coloring your Incorrect Reasoning in GRPO

逐步引导策略优化:在GRPO中着色你的错误推理

Peter Chen, Xiaopeng Li, Ziniu Li, Xi Chen, Tianyi Lin

机构 * Department of Industrial Engineering and Operations Research(工业工程与运营管理系) Department of Mathematics(数学系) Columbia University(哥伦比亚大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Stern School of Business, New York University(纽约大学斯特恩商学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SGPO通过引入组内响应多样性,解决GRPO在所有负样本组时无法更新策略的问题,提升推理模型性能。

Comments Accepted by TMLR; 47 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05630 2026-03-11 cs.LG cs.CL 73%

Rewards as Labels: Revisiting RLVR from a Classification Perspective

奖励作为标签:从分类视角重新审视RLVR

Zepeng Zhai, Meilin Chen, Jiaxuan Zhao, Junlang Qian, Lei Shen, Yuan Lu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出REAL框架,将可验证奖励视为分类标签,通过改进梯度分配提升策略优化效率,实验证明其在数学推理任务中优于GRPO和DAPO等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 67%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06748 2026-03-11 cs.LG cs.AI 62%

Property-driven Protein Inverse Folding With Multi-Objective Preference Alignment

基于属性的蛋白质逆折叠与多目标偏好对齐

Xiaoyang Hou, Junqi Liu, Chence Shi, Xin Liu, Zhi Yang, Jian Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) BioGeometry Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔HEC商学院) CIFAR AI Research Chair(CIFAR人工智能研究主席)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ProtAlign框架,通过多目标偏好对齐提升蛋白质序列设计的开发性与结构保真度,适用于多种蛋白质设计任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13095 2026-03-11 cs.CV cs.LG 57%

ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning

ADHint: 基于难度先验的自适应提示用于强化学习

Feng Zhang, Zezhong Tan, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 ADHint通过整合难度先验,改进强化学习中的探索与模仿平衡,提升推理能力和分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12642 2026-03-11 cs.SE cs.AI quant-ph 57%

QSpark: Towards Reliable Qiskit Code Generation

QSpark:迈向可靠的Qiskit代码生成

Kiana Kheiri, Aamna Aamir, Andriy Miranskyy, Chen Ding

机构 * Toronto Metropolitan University(多伦多 Metropolitan 大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.AI

AI总结 QSpark通过GRPO和ORPO方法提升Qiskit代码生成的可靠性,在基准测试中取得显著成绩,但仍有提升空间。

Journal ref In Proceedings of the 3rd International Workshop on AI for Quantum and Quantum for AI (AIQxQIA 2025), co-located with ECAI 2025, CEUR Workshop Proceedings, Vol. 4153, Paper 6, pp. 1-12, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏