arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-13 至 2026-05-13 共收录 32 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 32 篇

2605.11483 2026-05-13 cs.CL 93%

StoicLLM: Preference Optimization for Philosophical Alignment in Small Language Models

StoicLLM:在小型语言模型中通过偏好优化实现哲学对齐

Ishmam Khan, Sindhuja Thogarrati, Shuo Zhang

机构 * Tufts University(塔夫茨大学) Bose Corporation(博世公司)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract);small language model(title);LLM(abstract_cn)

AI总结 研究通过偏好优化方法对小型语言模型进行微数据集训练,实现对斯多葛主义内在美德的强对齐,但发现模型在处理斯多葛主义外在义务时存在代表性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19770 2026-05-13 cs.LG cs.CL 91%

Understanding the Performance Gap in Preference Learning: A Dichotomy of RLHF and DPO

理解偏好学习中的性能差距:RLHF和DPO的二元性

Ruizhe Shi, Minhak Song, Runlong Zhou, Zihan Zhang, Maryam Fazel, Simon S. Du

机构 * University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Amazon Inc.(亚马逊公司)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文分析RLHF和DPO性能差距的来源,揭示模型规格误差对方法选择的影响,指出在线DPO在特定条件下优于其他方法,揭示两阶段学习的统计优势。

Comments ICML accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11217 2026-05-13 cs.LG cs.AI cs.CR 91%

Leveraging RAG for Training-Free Alignment of LLMs

利用RAG实现无需训练的LLM对齐

John T. Halloran

机构 * Leidos(莱迪奥斯公司)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出RAG-Pref算法,通过对比信息提升对抗攻击拒绝能力,相比其他方法在五种主流LLM上提升3.7倍,同时保持计算效率。

Comments 19 pages, 4 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08693 2026-05-13 cs.AI 90%

SkillMaster: Toward Autonomous Skill Mastery in LLM Agents

SkillMaster:迈向LLM代理自主技能掌握

Min Yang, Jinghua Piao, Xu Xia, Xiaochong Lan, Jiaju Chen, Yongshun Gong, Yong Li

机构 * Shandong University(山东大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学) Southeast University(东南大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI

AI总结 SkillMaster通过轨迹引导技能复习、反事实效用评估和DualAdv-GRPO算法,使LLM代理能自主创建、优化和选择技能,提升任务成功率8.8%和9.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12112 2026-05-13 cs.CV 89%

When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy

当策略熵约束失效时:通过感知熵在基于流的RLHF中保持多样性

Xiaofeng Tan, Jun Liu, Bin-Bin Gao, Yuanting Fan, Xi Jiang, Chengjie Wang, Hongsong Wang, Feng Zheng

机构 * Southeast University(东南大学) Tencent Youtu Lab(腾讯云图实验室) Southern University of Science and Technology(南方科技大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn)

AI总结 本文研究了基于流的RLHF中策略熵与多样性之间的关系,提出感知熵作为新的约束方法,通过在感知空间中保持多样性提升模型质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08813 2026-05-13 cs.LG 88%

Robust Policy Optimization to Prevent Catastrophic Forgetting

鲁棒策略优化以防止灾难性遗忘

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出FRPO框架,通过优化当前策略及下游适应可达的KL限制邻域内策略,提升鲁棒性,减少安全性能退化,同时保持下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11978 2026-05-13 cs.CL 87%

On Predicting the Post-training Potential of Pre-trained LLMs

关于预训练语言模型后训练潜力的预测

Xiaoyuan Li, Yubo Ma, Kexin Yang, Moxin Li, Keqin Bao, Wenie Wang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出RuDE框架,通过响应判别预测预训练模型后训练潜力,实验显示与后训练表现相关性超90%,验证了其在高效基础模型开发中的有效性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11906 2026-05-13 cs.CL 87%

YFPO: A Preliminary Study of Yoked Feature Preference Optimization with Neuron-Guided Rewards for Mathematical Reasoning

YFPO:一种基于神经引导奖励的数学推理的初步研究

Yifan Le

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 YFPO通过识别数学相关神经元并构建辅助奖励,提升大语言模型的推理能力,实验表明神经层面信号可增强偏好优化,为更精细的推理后训练提供新方向。

Comments 10 pages, 2figures. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12327 2026-05-13 cs.LG 86%

Grid Games: The Power of Multiple Grids for Quantizing Large Language Models

网格游戏:多个网格在量化大语言模型中的力量

Vage Egiazarian, Erik Schultheis, Andrei Panferov, Earl Killian, Torsten Hoefler, Dan Alistarh

机构 * ISTA ETH Zürich(苏黎世联邦理工学院) Red Hat AI(红帽人工智能)

专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(abstract);分类 cs.LG

AI总结 本文研究了通过多个网格提升大语言模型量化效果的方法,提出PO2网格问题并展示其在不同模型中的优势,实验表明自适应网格能提升精度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00400 2026-05-13 cs.AI 85%

KEPO: Knowledge-Enhanced Preference Optimization for Multimodal Reasoning with Applications to Medical VQA

KEPO:基于知识的偏好优化用于多模态推理及其在医学VQA中的应用

Fan Yang, Rui Meng, Trudi Di Qi, Ali Ezzati, Yuxin Wen

机构 * Chapman University(查普曼大学) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) University of California, Irvine(加州大学伊文斯分校)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 KEPO通过质量门控的在线蒸馏和知识增强的探索策略,提升多模态推理任务的训练稳定性与推理一致性,优于强化学习和在线蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12406 2026-05-13 cs.AI 84%

Semantic Reward Collapse and the Preservation of Epistemic Integrity in Adaptive AI Systems

语义奖励崩溃与自适应AI系统中知识完整性保护

William Parris

机构 * BDB Labs / BagelTech(BDB实验室/BagelTech)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究探讨了自适应AI系统中语义奖励崩溃问题,指出其导致知识完整性受损,并提出宪法奖励分层框架以保护不同知识属性。

Comments 15 pages including references. Position and framework paper. Companion empirical work available at arXiv:2604.17587

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01202 2026-05-13 cs.IT cs.AI math.IT 84%

Forget BIT, It is All about TOKEN: Towards Semantic Information Theory for LLMs

忘掉BIT,一切关于TOKEN:面向大语言模型的语义信息理论

Bo Bai

机构 * Bo Bai(白波)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出语义信息理论,将TOKEN作为意义载体,重构注意力机制和Transformer模型,建立预训练、强化学习和推理中的信息度量方法,明确下一token预测与格兰杰因果推断的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10981 2026-05-13 cs.LG cs.AI 84%

$ξ$-DPO: Direct Preference Optimization via Ratio Reward Margin

$ξ$-DPO:通过比率奖励边际进行直接偏好优化

Zhengyuan Fan, Zhonghua Wu, Yuxuan Du, Qun Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出$ξ$-DPO,通过重新定义奖励形式和优化目标,解决SimPO中超参数联合调优难题,实现更直观的边际解释和稳定训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11865 2026-05-13 stat.ML cs.LG 81%

Variance-aware Reward Modeling with Anchor Guidance

具有锚点指导的方差感知奖励建模

Shuxing Fang, Ruijian Han, Liangyu Zhang, Fan Zhou

机构 * Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);分类 cs.LG

AI总结 本文提出一种通过添加粗粒度响应级锚点标签来解决标准Bradley-Terry奖励模型非识别性问题的框架,改进了奖励建模和下游RLHF性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17510 2026-05-13 cs.RO 80%

Interpreting Context-Aware Human Preferences for Multi-Objective Robot Navigation

解释情境感知的人类偏好以实现多目标机器人导航

Tharun Sethuraman, Subham Agrawal, Nils Dengler, Jorge de Heuvel, Teena Hassan, Maren Bennewitz

机构 * Hochschule Bonn-Rhein-Sieg, Germany(波恩-莱茵-锡格应用科学大学,德国) University of Bonn, Germany(波恩大学,德国) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合基础模型与多目标强化学习政策的框架,使机器人能理解并应用情境依赖的导航偏好,提升在共享人类环境中的适应性、透明性和可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04894 2026-05-13 cs.CL cs.AI cs.LG 80%

Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR

不对称优势调制校准RLVR中的熵动态

Hengrui Gu, Xiaotian Han, Yujing Bian, Feiyi Wang, Kaixiong Zhou

机构 * North Carolina State University(北卡罗来纳州立大学) Case Western Reserve University(凯斯西储大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究RLVR中探索受限问题,提出AsymGRPO通过分离正负优势调制强度,精准控制熵动态以提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12435 2026-05-13 cs.LG cs.CE 79%

Environment-Adaptive Preference Optimization for Wildfire Prediction

环境适应性偏好优化用于野火预测

Enyi Jiang, Wu Sun

机构 * Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Global Ecology, Carnegie Institution for Science(卡内基科学研究所全球生态系部门)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

AI总结 本文提出环境适应性偏好优化框架,通过构造分布对齐数据集并结合监督学习与偏好优化,提升野火预测在环境变化下的鲁棒性与极端情况下的检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22507 2026-05-13 cs.LG cs.CV 79%

Space Syntax-guided Post-training for Residential Floor Plan Generation

基于空间语法的后训练生成住宅平面图

Zhuoyang Jiang, Dongqing Zhang

机构 * College of Architecture and Urban Planning, Tongji University(同济大学建筑与城市规划学院) Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)信息中心)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 本文提出SSPT框架,通过空间语法集成 oracle 评估生成平面图的空间配置质量,改进生成器的配置逻辑,SSPT-PPO在非分布环境下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16070 2026-05-13 cs.CL 79%

Less Redundancy: Boosting Practicality of Vision Language Model in Walking Assistants

减少冗余:提升视觉语言模型在行走助手中的实用性

Chongyang Li, Zhiqiang Yuan, Hanbo Bi, Zexi Jia, Jinchao Zhang

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

AI总结 本文提出WalkVLM-LR模型,通过优化输出和时间冗余,提升视觉语言模型在行走助手中的实用性,实验表明其在输出简洁性和时间冗余方面表现优异。

Comments ICASSP 2026 Best Industry Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11712 2026-05-13 cs.AI 77%

Toward Stable Value Alignment: Introducing Independent Modules for Consistent Value Guidance

迈向稳定的值对齐:引入独立模块以实现一致的价值引导

Wenhao Chen, Sirui Sun, Shengyuan Bai, Guojie Song

机构 * School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) Yuanpei College, Peking University(北京大学元培学院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出SVGT模型,通过独立的价值模块解决大语言模型与人类价值观对齐的问题,采用独立价值建模和显式行为引导,提升价值表达的稳定性,实验显示有效降低有害评分。

Comments Accepted to ICML 2026 (Spotlight). 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10998 2026-05-13 cs.CR cs.AI 77%

Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs

少样本真正无害的DPO攻击用于对抗LLMs

Sangyeon Yoon, Wonje Jeung, Yoonjun Cho, Dongjae Jeon, Albert No

机构 * Yonsei University(延世大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);preference optimization(abstract);分类 cs.AI

AI总结 研究提出一种利用10对无害偏好对的真正无害DPO攻击,通过优化模型偏好来减少拒绝行为,从而在对抗LLMs时取得高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12380 2026-05-13 cs.LG cs.AI 76%

Trust the Batch, On- or Off-Policy: Adaptive Policy Optimization for RL Post-Training

信任批量,策略上或下策略:训练后强化学习的自适应策略优化

Rasool Fakoor, Murdock Aubry, Nicholas Stranges, Alexander J. Smola

机构 * Boson AI

专题命中 后训练与偏好优化 :post-training(title);分类 cs.AI、cs.LG

AI总结 本文提出一种自适应策略优化方法,通过动态调整策略更新的信任区域和下策略正则化强度,以提高强化学习在训练后对数据分布变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11538 2026-05-13 cs.CL cs.AI cs.LG 75%

Taming Extreme Tokens: Covariance-Aware GRPO with Gaussian-Kernel Advantage Reweighting

驯服极端令牌:具有高斯核优势重加权的协方差感知GRPO

Cheng Wang, Qin Liu, Wenxuan Zhou, Muhao Chen

机构 * National University of Singapore(新加坡国立大学) University of California, Davis(加州大学戴维斯分校) University of Southern California(美国南加州大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种协方差感知的GRPO方法,通过高斯核动态降低极端令牌更新权重,以平衡探索与利用,提升大语言模型推理性能并稳定熵。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12495 2026-05-13 cs.CV cs.AI cs.LG 73%

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

AlphaGRPO:通过分解性可验证奖励解锁UMMs中的自反思多模态生成

Runhui Huang, Jie Wu, Rui Yang, Zhe Liu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 AlphaGRPO通过分解性可验证奖励提升多模态生成能力,实现文本到图像生成和自反思修正,验证了自反思强化方法在生成高质量输出中的有效性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12339 2026-05-13 cs.LG cs.AI 73%

BSO: Safety Alignment Is Density Ratio Matching

BSO:安全对齐是密度比匹配

Tien-Phat Nguyen, Truong Nguyen, Thin Nguyen, Duy Minh Ho Nguyen, Ngoc-Thanh Dinh, Trung Le

机构 * Hanoi University of Science and Technology(河内科学技术大学) Deakin University(德金大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校) VinUniversity(文大学) Monash University(墨尔本大学)

专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BSO方法,通过密度比匹配实现安全对齐,简化了安全对齐流程,无需辅助模型,且能提升安全与有用性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11491 2026-05-13 cs.LG cs.AI 73%

Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

理解与防止RLVR中的熵崩溃:基于策略熵流的在线优化

Huimin Xu, Shuai Zhao, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(文大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OPEFO方法,通过平衡熵动态缓解RLVR中的熵崩溃问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05947 2026-05-13 cs.CV 71%

LucidNFT: LR-Anchored Multi-Reward Preference Optimization for Flow-Based Real-World Super-Resolution

LucidNFT: 基于LR锚定的多奖励偏好优化用于基于流的现实世界超分辨率

Song Fei, Tian Ye, Sixiang Chen, Zhaohu Xing, Jianyu Lai, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 后训练与偏好优化 :preference optimization(title)

AI总结 本文提出LucidNFT框架,通过引入LucidConsistency、解耦奖励归一化策略和LucidLR数据集,解决现实世界超分辨率中LR参考一致性、奖励优化瓶颈和真实退化覆盖不足的问题,提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12500 2026-05-13 cs.CV 67%

SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture

SenseNova-U1:基于NEO-unify架构的多模态理解和生成统一范式

Haiwen Diao, Penghao Wu, Hanming Deng, Jiahao Wang, Shihao Bai, Silei Wu, Weichen Fan, Wenjie Ye, Wenwen Tong, Xiangyu Fan, Yan Li, Yubo Wang, Zhijie Cao, Zhiqian Lin, Zhitao Yang, Zhongang Cai, Yuwei Niu, Yue Zhu, Bo Liu, Chengguang Lv, Haojia Yu, Haozhe Xie, Hongli Wang, Jianan Fan, Jiaqi Li, Jiefan Lu, Jingcheng Ni, Junxiang Xu, Kaihuan Liang, Lianqiang Shi, Linjun Dai, Linyan Wang, Oscar Qian, Peng Gao, Pengfei Liu, Qingping Sun, Rui Shen, Ruisi Wang, Shengnan Ma, Shuang Yang, Siyi Xie, Siying Li, Tianbo Zhong, Xiangli Kong, Xuanke Shi, Yang Gao, Yongqiang Yao, Yves Wang, Zhengqi Bai, Zhengyu Lin, Zixin Yin, Wenxiu Sun, Ruihao Gong, Quan Wang, Lewei Lu, Lei Yang, Ziwei Liu, Dahua Lin

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 SenseNova-U1通过NEO-unify架构实现多模态理解与生成的统一,展示了在文本理解、视觉语言感知、知识推理、代理决策和空间智能等任务中的表现,同时在X2I合成、图文生成和视觉语言生成中表现出色。

Comments Project page: https://github.com/OpenSenseNova/SenseNova-U1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12179 2026-05-13 cs.CV 67%

SyncDPO: Enhancing Temporal Synchronization in Video-Audio Joint Generation via Preference Learning

SyncDPO:通过偏好学习增强视频音频联合生成中的时序同步

Xin Cheng, Xihua Wang, Ying Ba, Yuyue Wang, Kaisi Guan, Yinbo Wang, Wenpu Li, Ruihua Song

机构 * Renmin University of China(中国人民大学) Westlake University(西湖大学)

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract)

AI总结 本文提出SyncDPO框架,通过引入基于规则的负样本生成策略提升视频音频联合生成的时序同步能力,并在多个基准测试中验证了其有效性。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11403 2026-05-13 cs.LG cs.AI cs.CL 67%

fg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculum

fg-expo: 基于前沿引导的探索优先策略优化:通过自适应KL和高斯课程学习

Mingxiong Lin, Zhangquan Gong, Maowen Tang, Qian Li, Chuangchuang Wang, Jian Ma, Sutian Huang, Kai Tang, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FG-ExPO算法,通过自适应KL缩放和高斯课程采样提升策略优化效率,实验表明其在数学推理任务中性能显著优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏