arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 470 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 470 篇

2606.09563 2026-06-09 cs.AI cs.LG 新提交 81%

PRISM: Recovering Instruction Sets from Language Model Activations

PRISM:从语言模型激活中恢复指令集

Gilad Gressel, Rahul Pankajakshan, Julia Diament, Efim Hudis, Krishnashree Achuthan, Yisroel Mirsky

机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham(阿姆里塔·维什瓦·维迪亚佩瑟姆网络安全系统与网络中心) Microsoft(微软) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出PRISM方法,通过激活条件解码从冻结目标模型隐藏状态中恢复活跃指令集,利用法官引导的GRPO优化,在多种场景下优于基线方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22995 2026-06-23 cs.LG cs.AI cs.CL 新提交 80%

Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

组图策略优化用于长程智能体强化学习

Yunan Wang, Minghui Song, Zihan Zhang, Shaohan Huang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Peking University(北京大学) Microsoft Corporation(微软公司)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出G2PO算法,通过构建全局状态转移图并引入组聚合状态值估计和边中心优势估计,解决长程智能体强化学习中的奖励稀疏和信用分配粗粒度问题,在WebShop等基准上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13598 2026-06-12 cs.AI cs.CL cs.LG cs.MA 新提交 80%

Reward Modeling for Multi-Agent Orchestration

多智能体编排的奖励建模

King Yeung Tsang, Zihao Zhao, Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Semih Yavuz, Shafiq Joty, Hao Wang

机构 * Rutgers University(罗杰斯大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 后训练与偏好优化 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OrchRM框架,通过自监督学习从多智能体执行中间产物构建奖励模型,无需人工标注,实现高效编排器训练和测试时扩展,在多个领域提升性能并降低计算成本。

Comments Preprint; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08571 2026-06-09 cs.CL cs.AI cs.LG 新提交 80%

Calibration of Structured Ignorance Certificates for Diagnosing Unknown Unknowns in Reasoning Models

用于诊断推理模型中未知未知的结构化无知证书的校准

Subramanyam Sahoo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出结构化无知证书(SICs)输出格式,通过GRPO微调14B模型,使模型在无法回答时明确承认知识缺失并生成检索查询,在未知未知问题上实现99.46%的JSON有效性和0.967的证书特异性分数。

Comments Accepted in ICML 2026 Workshop: Epistemic Intelligence in Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11226 2026-08-13 cs.AI cs.SY eess.SY 新提交 79%

Cutting AI Datacenter Energy with Reinforcement Learning: Measured Power Control of LLM Training from One GPU to the Fleet

用强化学习降低AI数据中心能耗:从单GPU到集群的大语言模型训练实测功率控制

Eliseo Curcio

专题命中 后训练与偏好优化 :LLM(title);post-training(abstract);分类 cs.AI

AI总结 该研究针对大语言模型训练的GPU功耗问题,提出PPO元控制器调整生成参数,在单GPU及集群环境下降低功率违规、提升输出与能效,验证了超额订阅的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09568 2026-08-11 cs.CL 新提交 79%

Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization

Se-DPO:用于直接偏好优化的自进化令牌信用

Wenxiao Zhao, Shu Wang, Ying Nian Wu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

AI总结 Se-DPO是一种在DPO训练中基于模型自身内部信号动态校准令牌信用的方法,无需外部模型,在AlpacaEval 2和Arena-Hard上较DPO分别提升9.8和12.2个百分点。

Comments 16 pages, 2 figures, COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09467 2026-08-11 cs.CV cs.AI 新提交 79%

RecoverFly: A Failure-Aware Reinforcement Learning Post-Training Framework for Aerial Vision-Language Navigation

RecoverFly:面向空中视觉语言导航的故障感知强化学习后训练框架

Boxiong Wang, Hui Kang, Geng Sun, Jiahui Li, Chao Yu, Daxin Tian

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 RecoverFly是面向端到端无人机视觉-语言-动作策略的故障感知强化学习后训练框架,在TravelUAV基准上实现了优于AerialVLA的性能,提升了导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04509 2026-08-06 cs.AI 新提交 79%

CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models

CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法

De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma

专题命中 后训练与偏好优化 :language model(title);post-training(abstract);分类 cs.AI

AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01604 2026-08-04 cs.AI cs.SE 新提交 79%

Post-Training on Office Work Improves Software Engineering: A Behavioral Account of Cross-Domain Transfer

在办公工作上进行后训练可提升软件工程能力:跨域迁移的行为视角

Logan Ritchie, Sushant Mehta, Liudas Panavas, Edwin Chen

机构 * Surge AI

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 该研究通过在办公工作流程的长程多工具智能体任务上后训练Qwen3.5-122B-A10B,发现模型在无相关训练的软件工程基准SWE-Bench Pro上性能提升,证实长程后训练可跨域强化目标导向执行行为。

Comments 20 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28589 2026-07-31 cs.CV cs.LG 新提交 79%

MixFrag: Fragility-Guided Mixed-Precision Post-Training Quantization for Vision Transformers

MixFrag:面向视觉Transformer的脆弱性引导混合精度后训练量化

Md. Mehrab Hossain Opi, Robiul Islam Ryad, Md. Umar Faruk

机构 * Khulna University of Engineering & Technology (KUET)(库尔纳工程技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 针对现有PTQ方法精度分配低效问题,提出MixFrag框架,通过KL散度估计量化脆弱性并将位分配建模为MCKP,在ImageNet、COCO任务上实现最优混合精度PTQ性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25136 2026-07-29 cs.AI 新提交 79%

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Siheng Wang, Haoyan Xu, Yuqi Li, Chenhao Wei, Zhengdao Li, Rongchao Zhang, Guang Yang, Yidong Wang, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加利福尼亚大学伯克利分校) City College of New York, CUNY(纽约市立大学城市学院) Stevens Institute of Technology(史蒂文斯理工学院) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16074 2026-07-20 cs.DC cs.AI cs.SE 新提交 79%

JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models

JoyNexus:面向服务的视觉语言动作模型多租户训练后处理

Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Beihang University(北航) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 针对VLA模型训练后处理问题,提出JoyNexus统一服务,解耦相关服务,多租户可通过API调用,引入组批处理提高效率,经评估能减少GPU时间,提升服务利用率。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10191 2026-07-14 cs.SD cs.AI 新提交 79%

Breaking the Quality--Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization

通过深度特征锚定偏好优化打破流式目标说话人提取中的质量-可懂度权衡

Shuhai Peng, Jinjiang Liu, Hui Lu, Liyang Chen, Guiping Zhong, Jiakui Li, Shiyin Kang, Zhiyong Wu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) SenseTime(商汤科技)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 研究流式目标说话人提取中的质量-可懂度权衡问题,提出扩大Conformer卷积核及基于WavLM的DPO微调策略,实现了相对可懂度10.9%的提升,同时音频质量和说话人相似度也有改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09590 2026-07-13 cs.RO cs.AI 新提交 79%

PAC-ACT: Post-training Actor-Critic for Action Chunking Transformers

PAC-ACT:用于动作分块变换器的训练后演员评论家方法

Yujie Pang, Zudong Li

机构 * LeRobot

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

AI总结 针对精密工业接触操纵问题,提出PAC-ACT框架,通过在块级别重新制定策略优化、构建特定架构并引入混合行为先验约束,提升了机器人策略在姿态扰动和接触力约束下的性能,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07671 2026-07-13 cs.LG 新提交 79%

PeTeR: Post-Training Robustification of Probabilistic Circuits

PeTeR:概率电路的训练后鲁棒化

Adrian Ciotinga, Yeming Dai, YooJung Choi

机构 * School of Computing and Augmented Intelligence Arizona State University(计算与增强智能学院亚利桑那州立大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 研究针对概率电路学习易过拟合和泛化能力弱的问题,提出PeTeR这一无需数据的训练后框架,可使预训练概率电路抵御分布变化,实证评估显示该框架能有效增强模型对随机和对抗性扰动的鲁棒性,性能良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02959 2026-07-07 cs.CV cs.LG 新提交 79%

Incentivizing Vision Language Models to Search for Long Video Question Answering

激励视觉语言模型进行长视频问答搜索

Harsh Goel, S P Sharan, Sahil Shah, Minkyu Choi, Joungbin An, Kristen Grauman, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :language model(title);post-training(abstract);分类 cs.LG

AI总结 研究将长视频问答从被动单流程感知任务转变为多轮检索过程,核心方法是自然语言驱动搜索及强化学习后训练,贡献是提升长视频理解基准测试分数。

Comments To appear at the European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17664 2026-06-17 cs.IR cs.AI 新提交 79%

Temporal Preference Optimization for Unsupervised Retrieval

面向无监督检索的时间偏好优化

HyunJin Kim, Jaejun Shim, Young Jin Kim, JinYeong Bak

机构 * Microsoft, Redmond, USA(微软公司,美国红mond) Sungkyunkwan University, Suwon, South Korea(成均馆大学,韩国首尔)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 提出TPOUR方法,通过时间检索偏好优化(TRPO)和可学习时间嵌入插值,使无监督稠密检索器能捕捉时间相关性,在时间信息检索任务上超越有监督和无监督基线。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12360 2026-06-15 cs.LG 新提交 79%

Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal

后训练的解剖:利用可解释性表征数据并塑造学习信号

Leon Bergen, Usha Bhalla, Sidharth Baskaran, Max Loeffler, Raphael Sarfati, Dhruvil Gala, Ryan Panwar, Santiago Aranguri, Thomas Fel, Atticus Geiger, Matthew Kowal, Siddharth Boppana, Daniel Balsam, Owen Lewis, Jack Merullo, Thomas McGrath, Ekdeep Singh Lubana

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究院)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 提出基于可解释性的数据后训练流程,通过统计假设识别偏好数据中的潜在概念,实现细粒度反馈,减少虚假关联和不良行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11266 2026-06-11 cs.LG 新提交 79%

Seeing Before Colliding: Anticipatory Safe RL with Frozen Vision-Language Models

碰撞前的预见:利用冻结视觉-语言模型的预期性安全强化学习

Samuel Tetteh, Cody Fleming

机构 * Iowa State University(爱荷华州立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

AI总结 提出VLM-Safe-RL框架,通过冻结视觉-语言模型生成预期性成本项,改进CMDP拉格朗日更新,在高速碰撞场景下实现安全与回报的平衡。

Comments 44pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11674 2026-08-13 cs.LG cs.AI 新提交 79%

GCPO: Diagnosing and Constraining Subspace Geometry in Rollout RL for LLMs

GCPO:针对大语言模型的rollout强化学习中子空间几何的诊断与约束

Kai Yang, Jingwei Xu, Wanyu Wang, Kai-Yuan Guo, Zhenbo Yu, Yi Wang, Yu Qiao

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 GCPO通过几何约束策略优化方法,诊断rollout强化学习的子空间几何问题,在大语言模型后训练中提升了多任务性能并解决了训练不稳定等问题

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11573 2026-08-13 cs.CL cs.AI 新提交 79%

Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

强化步骤级推理以实现大语言模型的有效自校正

Vu Duc Anh, Nhat M. Hoang, Do Xuan Long, Cong-Duy Nguyen, Ponhvoan Srey, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) VinUniversity Institute for Infocomm Research (IR), A*STAR(新加坡科技研究局信息通信研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型自校正的核心挑战,提出SFS-DPO及教师辅助变体SFS-DPO-R框架,经多模型多域评估,其性能优于现有步骤级训练基线,可提升自校正频率与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05080 2026-08-06 cs.LG cs.CL 新提交 79%

Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning

优化策略的学习内容:可恢复性感知的展开干预学习

Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei Niu

机构 * University of Notre Dame(圣母大学) Amazon, Inc(亚马逊公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 针对现有大语言模型后训练中展开分配的局限,本文提出RAIL框架,将干预选择建模为在线上下文博弈问题,可在有限展开预算下提升性能,为生成高质量展开提供原则性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04962 2026-08-06 cs.LG cs.CL 新提交 79%

SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

SpecRoll:用于投机强化学习rollout的快慢校验器反馈自适应方法

Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui

机构 * VNU University of Engineering and Technology(越南国家大学河内理工大学) Viettel AI(越南电信人工智能公司)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 SpecRoll是一种投机强化学习rollout引擎,通过快慢双时间尺度自适应结合相关校验机制,在5个1.5B-14B模型和3个数学推理数据集上,相比普通GRPO和FastGRPO实现了生成与端到端速度的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22649 2026-07-28 cs.AI cs.CL 新提交 79%

STAIF: A Stage-wise Optimization for Complex Instruction Following

STAIF:一种用于复杂指令跟随的逐阶段优化方法

Jian Hong, Chen Cheng, Quan Liu, Yuhao Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research Group(科大讯飞研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型遵循复杂指令的挑战,提出STAIF逐阶段优化框架,先通过偏好优化提高软约束敏感度,再用可验证奖励强化学习确保硬约束遵守,构建相关数据集,验证了该方法的设计并展现出领先性能和泛化能力。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17935 2026-07-21 cs.CL cs.AI 新提交 79%

DeLIVeR: Decomposed Learning for Information-grounded Veracity Recognition via Reinforced Knowledge Graph Exploration

DeLIVeR:通过强化知识图谱探索进行基于信息的真实性识别的分解学习

Cong Hoan Nguyen, Thomas Hoang, Hieu Minh Duong, Long Nguyen

机构 * University of Louisville(路易斯维尔大学) Denison University(丹尼森大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型自动事实核查难题,DeLIVeR框架将证据检索设为强化探索任务,利用规划器大语言模型分解声明获问题集遍历知识图谱找证据,经GRPO优化策略,实验表明其显著优于基线,有效弥合推理差距,提供检测路径。

Comments Accepted to 7th International Conference on Deep Learning Theory and Applications (DeLTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17281 2026-07-21 cs.LG cs.AI 新提交 79%

AIGB-R1: Self-Evolving Generative Auto-Bidding via Hierarchical Planner-Executor Optimization

AIGB-R1:通过分层规划器-执行器优化实现自我进化的生成式自动出价

Yuejia Dou, Hesong Wang, Xinyu Zhang, Tianyu Wang, Zhilin Zhang, Chuan Yu, Jian Xu, Bo Zheng, Qi Qi

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对AIGB范式在自动出价中存在的问题,提出AIGB-R1框架,利用大语言模型推理能力,通过分层规划器与执行器模块、经验驱动循环、两阶段训练及新优化方法,经实验验证该框架在自动出价任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14145 2026-07-17 cs.AI cs.CV cs.LG 新提交 79%

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability

ToolAnchor:锚定反事实上下文以提升智能体工具使用能力

Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08409 2026-07-10 cs.CL cs.AI 新提交 79%

When Synthetic Speech Is All You Have: Better Call GRPO

当你只有合成语音时:最好调用GRPO

Shashi Kumar, Yanis Labrak, Hasindri Watawana, Sergio Burdisso, Esaú Villatoro-Tello, Kadri Hacioğlu, Petr Motlicek, Andreas Stolcke

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的ASR在受监管领域因隐私问题受限,转向强化学习,用GRPO方法处理合成语音,相比监督微调,GRPO能大幅降低WER,还分析了GRPO的优势及收益来源,表明合成语音为主时强化学习更优。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07508 2026-07-09 cs.LG cs.AI 新提交 79%

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

用于智能强化学习的单步异步优化

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17250 2026-06-17 cs.LG cs.CL 新提交 79%

Rethinking Groups in Critic-Free RLVR

重新思考无评论强化学习中的分组

Yihong Wu, Liheng Ma, Lingfeng Xiao, Muzhi Li, Xinyu Wang, Yingxue Zhang, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所) University of Waterloo(滑铁卢大学) The Chinese University of Hong Kong(香港中文大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 针对无评论强化学习分组策略的数据低效和同步问题,提出负令牌过滤方法,实现单次 rollout 稳定训练,在推理和代理任务上表现相当或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏