Vision-Language Models as Success Detectors
专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG
Comments This paper was accepted by SIAM Journal on Mathematics of Data Science (SIMODS)
专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI
专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG
Comments 18 pages, 5 figures, 5 tables
AR-CoPO: 利用对比策略优化对齐自回归视频生成
机构 * CUHK MMLab(香港中文大学多媒体实验室) ; Vivix Group Limited(Vivix集团有限公司) ; HKUST(香港科技大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; CPII under InnoHK(InnoHK下的CPII)
专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract)
AI总结 提出AR-CoPO框架,通过分叉机制构建邻域候选、分块级对齐和半在线训练策略,解决流式自回归视频生成中RLHF对齐难题,提升跨域泛化与人类偏好对齐。
Comments ECCV 2026
组图策略优化用于长程智能体强化学习
机构 * Peking University(北京大学) ; Microsoft Corporation(微软公司)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出G2PO算法,通过构建全局状态转移图并引入组聚合状态值估计和边中心优势估计,解决长程智能体强化学习中的奖励稀疏和信用分配粗粒度问题,在WebShop等基准上显著提升成功率。
DPO 解绑:你的训练算法在人类选择理论中实际上是解耦的(且其损失函数的凸性并非必需)
机构 * Google Research(谷歌研究) ; Google DeepMind(谷歌DeepMind) ; Work done while at Google DeepMind(在谷歌深Mind的工作) ; CEE-M, Univ Montpellier, CNRS, INRAE, Institut Agro(CEE-M,蒙彼利埃大学,CNRS,INRAE,农业研究所)
专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文揭示了DPO与人类选择理论的深层联系,证明其损失函数凸性并非必需,并扩展了非凸损失、任意人类选择模型嵌入等新特性。
Comments ICML 2026
GAGPO:通用优势分组策略优化
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; Meituan(美团)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GAGPO提出一种无需价值模型的强化学习方法,通过分组价值代理和动作重要性比,实现多轮任务中精确的时间信用分配,实验表明其在ALFWorld和WebShop上优于现有基线。
多智能体编排的奖励建模
机构 * Rutgers University(罗杰斯大学) ; Salesforce AI Research(Salesforce人工智能研究)
专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出OrchRM框架,通过自监督学习从多智能体执行中间产物构建奖励模型,无需人工标注,实现高效编排器训练和测试时扩展,在多个领域提升性能并降低计算成本。
Comments Preprint; work in progress
用于诊断推理模型中未知未知的结构化无知证书的校准
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出结构化无知证书(SICs)输出格式,通过GRPO微调14B模型,使模型在无法回答时明确承认知识缺失并生成检索查询,在未知未知问题上实现99.46%的JSON有效性和0.967的证书特异性分数。
Comments Accepted in ICML 2026 Workshop: Epistemic Intelligence in Machine Learning
OrderGrad: 通过顺序统计量策略梯度估计超越均值优化
机构 * The University of Tokyo(东京大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出OrderGrad,一种用于顺序统计量目标的似然比和重参数化梯度估计器族,通过奖励变换实现风险厌恶、鲁棒和探索性学习的统一即插即用方法。
TextAlign: 基于层次化奖励的文本渲染偏好对齐
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·穆萨大学人工智能学院) ; Chinese Academy of Sciences Institute of Automation(中国科学院自动化研究所) ; Northeastern University(东北大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
专题命中 后训练与偏好优化 :language model(abstract);foundation model(abstract);post-training(abstract);preference optimization(abstract)
AI总结 提出TextAlign框架,通过层次化视觉语言模型奖励将文本渲染错误分解为全局、单词和字形级别,并转化为标量偏好信号,利用GRPO或DPO进行后训练对齐,在不改变生成器架构下提升文本渲染准确性。
迈向精确意图对齐的VLA空中导航:基于专家引导的GRPO
机构 * Zhejiang University Differential Robotics(浙江大学差分机器人实验室)
专题命中 后训练与偏好优化 :SFT(summary_cn,abstract)
AI总结 提出EG-GRPO框架,通过专家数据增强在线rollout和异构并行流水线,解决VLA模型在无人机导航中因数据稀缺和探索低效导致的意图对齐问题,成功率提升至SFT基线的2.13倍,意图对齐性能提升60.9%。
HealthCraft: 一种用于急救医学的强化学习安全环境
机构 * GOATnote Inc.(GOATnote公司)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出HealthCraft,首个公开的强化学习环境,用于在真实急救医学条件下奖励轨迹级安全,通过FHIR R4世界状态、24个MCP工具和双层评估标准,评估模型在急救任务中的安全性和性能,揭示了模型在多步骤工作流中的安全失败问题。
Comments 16 pages, 5 figures, 6 tables. Code, task suite, and Docker bundle: https://github.com/GOATnote-Inc/healthcraft
通义深研技术报告
机构 * Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文介绍了一种专为长时间深度信息检索任务设计的代理大语言模型,通过端到端训练框架结合代理中期和后期训练,实现了在复杂任务中的可扩展推理和信息检索,同时提供了高可扩展的数据合成管道,实现了无需昂贵人工标注的自动化训练流程,并在多个深度研究基准测试中取得了最先进的性能。
Comments https://tongyi-agent.github.io/blog
自蒸馏代理强化学习
机构 * Zhejiang University(浙江大学) ; Meituan(美团) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SDAR方法,通过将OPSD作为辅助目标并保持RL为主优化,解决多轮代理中的稳定性问题,提升性能。
解释情境感知的人类偏好以实现多目标机器人导航
机构 * Hochschule Bonn-Rhein-Sieg, Germany(波恩-莱茵-锡格应用科学大学,德国) ; University of Bonn, Germany(波恩大学,德国) ; Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出一种结合基础模型与多目标强化学习政策的框架,使机器人能理解并应用情境依赖的导航偏好,提升在共享人类环境中的适应性、透明性和可用性。
不对称优势调制校准RLVR中的熵动态
机构 * North Carolina State University(北卡罗来纳州立大学) ; Case Western Reserve University(凯斯西储大学) ; Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究RLVR中探索受限问题,提出AsymGRPO通过分离正负优势调制强度,精准控制熵动态以提升推理能力。
FaVChat: 基于数据高效GRPO的层次提示-查询引导的面部视频理解
机构 * State Key Laboratory of Networking and Switching Technology, BUPT(北京邮电大学网络与交换技术国家重点实验室) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) ; Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; Central South University(中南大学) ; Zhejiang University(浙江大学) ; College of communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)
专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 FaVChat通过层次化提示引导框架提取面部动态细节信息,结合数据高效GRPO策略提升学习效率,实现在面部视频理解任务中的优越性能。
VAnim:基于渲染的稀疏状态建模用于结构保持的向量动画
机构 * School of Software, Beihang University, Beijing, China(北京航空航天大学软件学院) ; Department of Computer Science, The University of Hong Kong, Hong Kong, China(香港大学计算机科学系) ; College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract)
AI总结 VAnim提出了一种基于LLM的框架,通过稀疏状态更新和渲染感知强化学习,实现结构保持的向量动画生成,优于现有方法。
Comments Accepted to ICML 2026. Project page: https://yukinonooo.github.io/VAnimProject
构建具有人机监督的精确视频语言
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CHAI框架,通过专家与AI协作提升视频描述精度,改进开源模型并实现专业级视频生成。
Comments CVPR 2026 Highlight. Project page: https://linzhiqiu.github.io/papers/chai/
GanitLLM:通过课程-GRPO实现难度感知的孟加拉数学推理
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) ; University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)
专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出GanitLLM模型及新的难度感知孟加拉数学语料库和基于课程的GRPO流程,提升低资源环境下孟加拉数学推理能力。
Comments Accepted at ACL 2026 (Findings)
CLewR:基于重置的课程学习用于机器翻译偏好学习
机构 * Bitdefender ; Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CLewR方法,通过课程学习与重置策略提升机器翻译性能,验证了在多种模型和优化技术中的有效性。
Comments Accepted at ACL 2026
当LLM落后时:来自演进API的代码生成中的知识冲突
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文研究了API演变对LLM代码生成的影响,发现缺乏全面文档时LLM难以优先处理外部上下文,执行率仅42.55%,而结构化文档和大模型规模可提升至66.36%,但推理策略如Self-Reflection可进一步提升11%。
$V_0$: 一种通用的价值模型,用于任何在零状态下的策略
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出$V_0$,一种无需参数更新即可估计任意模型在未见提示上的预期性能的价值模型。通过将策略的动态能力作为显式上下文输入,$V_0$在策略优化中作为关键资源调度器,提升采样预算分配效率和部署时的路由性能。
从LLM中的道德安装到道德作为系统中的LLM
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
AI总结 本文提出道德作为系统框架,重新定义道德行为的动态性与系统耦合问题,探讨道德属性在生命周期中的监测与跨组件一致性。
Comments 22pages, 1 figure, 1 table
基于信息增益的策略优化:一种用于多轮搜索代理的简单而有效的方法
机构 * Venus Team, Ant Group(蚂蚁集团 Venus 团队) ; Renmin University of China(中国人民大学)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于信息增益的策略优化框架,通过密集内在监督提升多轮代理训练效果,实验表明其在多轮场景中优于现有方法,准确性和数据效率更高。
Comments Accepted by ICLR 2026
TIPS: 用于搜索增强的大语言模型的回合级信息潜力奖励塑造
机构 * UC San Diego(加州大学圣地亚哥分校) ; AWS AI(亚马逊人工智能)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TIPS方法,通过回合级信息潜力奖励塑造提升搜索增强LLM的训练稳定性与性能,优于GRPO/PPO基线,在多个问答基准上取得显著提升。
Comments Code: https://github.com/ucsd-wang-lab-lm/tips
原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型
机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);SFT(abstract);RLHF(abstract)
AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。
Comments 25 pages, 10 figures,
ChatShopBuddy:通过强化学习实现可靠的对话购物代理
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 ChatShopBuddy通过强化学习优化对话购物代理,结合分层奖励建模和动态对比策略优化,提升购物代理的稳定性和效率。