arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11359 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 494 篇

2606.27578 2026-06-29 cs.LG cs.AI 新提交 90%

PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration

PEBS: 用于RLHF奖励模型校准的每评分者经验贝叶斯收缩

Arnav Raj

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对RLHF中奖励模型忽略评分者个体差异的问题,提出PEBS方法,对每个评分者拟合仿射校准器并应用经验贝叶斯收缩,在PRISM和PluriHarms数据集上分别降低RMSE 8.58%和9.66%。

Comments Accepted at the ICML 2026 Workshop on Pluralistic Alignment. Code: https://github.com/deadsmash07/pebs-pluralistic

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26917 2026-06-26 cs.LG cs.AI 新提交 90%

GEOALIGN: Geometric Rollout Curation for Robust LLM Reinforcement Learning

GEOALIGN: 用于鲁棒大语言模型强化学习的几何轨迹策展

Ting Zhou, Zhenqing Ling, Yiyang Zhao, Ying Shen, Daoyuan Chen

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对在线强化学习训练LLM时奖励噪声导致的不稳定性,提出GEOALIGN,通过检测并修正方向不一致的轨迹来稳定更新,提升最终性能并减少训练震荡。

Comments Accepted as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23038 2026-06-23 cs.LG cs.AI 新提交 90%

EvoRubrics: Dynamic Rubrics as Rewards via Adversarial Co-Evolution for LLM Reinforcement Learning

EvoRubrics:通过对抗性协同进化为LLM强化学习提供动态评分准则作为奖励

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Zheng Li, Jinyang Zhang, Zhijing Wu, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心) School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai(北京大学滨海信息技术研究院) Research Institute, GRGBanking Equipment Co., Ltd.(广电运通金融电子股份有限公司研究院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出EvoRubrics框架,通过策略LLM与评分准则生成器的对抗性协同进化,在训练中动态调整奖励标准,解决静态评分准则导致的奖励饱和与策略欺骗问题,实验表明其优于静态和动态基线,且自监督变体也能有效提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20482 2026-06-19 cs.CL cs.HC cs.LG 新提交 90%

Your Mouse and Eyes Secretly Leak Your Preference: LLM Alignment using Implicit Feedback from Users

你的鼠标和眼睛悄悄泄露你的偏好:利用用户隐式反馈进行LLM对齐

Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari, Aryan Sajith, Hamed Zamani

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) York University(约克大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对显式反馈稀缺的问题,提出利用鼠标轨迹和眼动数据等隐式反馈训练奖励模型,将文本奖励模型准确率从55%提升至64%,并显著提高DPO对齐后响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19818 2026-06-19 cs.LG cs.AI 新提交 90%

Uncertainty-Aware Reward Modeling for Stable RLHF

不确定性感知的奖励建模用于稳定的RLHF

Licheng Pan, Haocheng Yang, Haoxuan Li, Yichen Sun, Yunsheng Lu, Shijian Wang, Lei Shen, Yuan Lu, Zhixuan Chu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出不确定性感知奖励建模(UARM),通过分位数保形预测校准不确定性并利用异方差方差分解重加权GRPO优势,以缓解奖励黑客问题,提升对齐质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07629 2026-06-09 cs.LG cs.AI cs.CL cs.CY cs.HC 新提交 90%

Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences

大型语言模型应学习个性化而非聚合的人类偏好

Cristina Garbacea

机构 * University of Chicago, Data Science Institute(芝加哥大学数据科学学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文主张大型语言模型应学习个性化偏好而非聚合偏好,分析聚合偏好的理论局限与实证问题,提出通过有界个性化框架兼顾个体自主与集体安全。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16553 2026-08-18 cs.CL 新提交 90%

STAGE: Controlled Objective Admission for Multi-Preference LLM Alignment

STAGE:面向多偏好大语言模型对齐的可控目标准入

Yongqi Tong, Zhenyu Zhang, Ruirui Wang, Kewei Fu, Shaoqing Lin, Sijie Dong, Jiang-Ming Yang, Xin Zhang, Jianshe Li

机构 * Ant International(蚂蚁国际)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);RLHF(summary_cn,abstract);分类 cs.CL

AI总结 该研究针对多偏好LLM对齐的目标准入时机问题,提出稳定性引导的STAGE控制器,通过活动集扩展与探测排序等方法,在多偏好对齐任务中取得优于基线的自动评估结果,为RLHF提供新控制变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06246 2026-08-07 cs.LG 新提交 90%

A Six-Dimensional Taxonomy of Post-Training Adaptation Techniques with Applications in AI Governance

用于人工智能治理的后训练适应技术的六维分类法

Fardin Afdideh, Fernando Seoane, Farhad Abtahi

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05886 2026-08-07 cs.SE cs.AI 新提交 90%

CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents

CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体

Wuya Chen, Yihao yang, Yang Cao, Yue Lin

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18258 2026-07-22 cs.AI 新提交 90%

S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF

S2T-RLHF:基于稳定偏好的强化学习从人类反馈中的分层信用分配

Wei Chen, Guanghui Zhu, Yafei Li, Limin Wang, Yihua Huang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI

AI总结 研究基于偏好奖励模型的RLHF训练不稳定问题,提出分层信用分配的粒度感知原则,引入S2T-RLHF框架,先在句子间分配奖励,再在句内细化,无需重新训练模型,实验证明该方法提高了训练稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15917 2026-06-16 cs.LG 新提交 90%

Reinforcement Learning for LLM-based Event Forecasting

基于强化学习的LLM事件预测

Amit Arnold Levy

机构 * Advanced Computer Science(高级计算机科学) DeepSeek R1

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.LG

AI总结 使用GRPO微调LLM,结合Wikipedia修订工具获取实时信息,预测未来事件,使1.5B参数模型性能超越Claude Sonnet 3.5。

Comments Submitted internally at the University of Oxford in Oct 2025, migrated to arXiv on Jun 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08450 2026-06-09 cs.AI 新提交 90%

GIFT: LLM-Guided State-Reward Interface for Financial Reinforcement Learning

GIFT: 基于LLM引导的状态-奖励接口用于金融强化学习

Yanyan Wu, Boyi Zhang, Yanlin Liu, Xinyu Fang, Jining Luan, Meiqi Zhang, Jiacheng Liu, Hao Zeng, Dexu Yu, Chang Liu, Hanwen Du, Yongxin Ni, Youhua Li

机构 * East China University of Science and Technology(华东理工大学) University of Science and Technology of China(中国科学技术大学) Southwestern University of Finance and Economics(西南财经大学) University of Sydney(悉尼大学) City University of Hong Kong(香港城市大学) Northeastern University(东北大学) The Ohio State University(俄亥俄州立大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出GIFT框架,利用大语言模型引导PPO强化学习中的状态增强和奖励塑造,提升金融交易策略的样本外风险调整收益。

Comments 25 pages, 7 figures. Code and data are available at https://github.com/KAG778/GIFT . Equal contribution: Yanyan Wu and Boyi Zhang. Corresponding author: Youhua Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07460 2026-08-10 cs.CL cs.AI 新提交 90%

CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity

CreativeInstruct:规模化教导大型语言模型(LLM)平衡质量、创造性与多样性

Ananya Sahu, Mohit Bansal, Elias Stengel-Eskin

机构 * Columbia(哥伦比亚大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究提出CreativeInstruct指令调优方法,通过注入[StartCreativity]跨度平衡LLM的质量、创造性与多样性,其在叙事生成中表现更优,还能提升强化学习任务性能。

Comments Code: https://github.com/ananya-sahu/CreativeInstruct

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03248 2026-07-07 cs.LG cs.AI 新提交 90%

Unbiased Alignment for Large Language Models with Noisy Preferences

具有噪声偏好的大语言模型的无偏对齐

Jialiang Wang, Xianming Liu, Xiong Zhou, Hui Liu, Haoliang Li

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型与人类偏好对齐问题,针对真实偏好数据集中噪声大的问题,提出无偏对齐理论框架,引入新损失函数,能直接从噪声数据集无偏训练模型,实验表明优于现有基线。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12158 2026-08-13 cs.CV 新提交 89%

Context Blindness in DPO: Mitigating Object Hallucination in MLLMs via Context-Calibrated Preference Optimization

DPO中的上下文盲区:通过上下文校准的偏好优化缓解多模态大语言模型(MLLMs)中的物体幻觉

Byungoh Ko, Jinyoung Park, Jongha Kim, Jeehye Na, Jaewon Cho, Hyunwoo J. Kim

机构 * Korea University(高丽大学) KAIST(韩国科学技术院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本研究针对MLLMs的物体幻觉问题,提出C²-DPO方法,通过最大化上下文偏好增益降低幻觉率,使Qwen2-VL-Instruct-2B的幻觉率相对降低36%且不损害通用推理能力。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06789 2026-08-10 cs.NI 新提交 89%

EvoRIC: Reinforcement Learning Fine-Tuned LLM-empowered RAN Intelligent Control Toward Autonomous O-RAN

EvoRIC:面向自主O-RAN的、由强化学习微调大语言模型赋能的RAN智能控制器

Lingyan Bao, Jemin Lee, Tony Q. S. Quek

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对传统RAN智能算法泛化差、通用LLM算力高且缺领域知识的问题,提出EvoRIC分层框架,结合RLFT与PPO优化LLM,在IAB网络中验证其泛化性与效能,为自主O-RAN提供新方案。

Comments Manuscript submitted 23 April 2026; revised 7 August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03528 2026-07-07 cs.LG cs.AI cs.CL 新提交 89%

Aligning Language Models with Selective Prediction

通过选择性预测使语言模型对齐

Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bioinformatics and Computational Biology Program(生物信息学与计算生物学项目) Division of Biostatistics and Health Data Science(生物统计学与健康数据科学部) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);post-training(abstract)

AI总结 研究聚焦提升语言模型可靠性,采用选择性预测策略,在模型训练后对齐阶段,提出基于强化学习的框架RLSR,以风险-覆盖曲线下面积为目标,在域内域外任务中风险-覆盖权衡表现更好。

Comments Accepted by ICML 2026 Agents in the Wild: Safety, Security, and Beyond Workshop, Project Page: https://sun-umn.github.io/RLSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25509 2026-06-25 cs.RO cs.CV 新提交 89%

ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving

ASSCG:自动驾驶中快慢LLM规划的恰到好处门控

Sining Ang, Yuan Chen, Liu Haiyan, Xuanyao Mao, Jason Bao, Xuliang, Bingchuan Sun, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Lenovo Group Limited(联想集团)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出自适应慢系统控制门(ASSCG),通过帧级查询/缓存/丢弃决策优化快慢规划器调用,结合RWKV骨干网络和GRPO风格强化学习,在nuPlan和NAVSIM上分别提升性能并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14498 2026-08-17 cs.LG cs.DC 新提交 89%

Rollplex: Cross-Phase GPU Spatial Sharing for Vision Language Model Post-Training

Rollplex:面向视觉语言模型后训练的跨阶段GPU空间共享

Hanfeng Lu, Tianyu Feng, Suyi Li, Yuheng Zhao, Wei Gao, Shaopan Xiong, Ju Huang, Siran Yang, Jiamang Wang, Lin Qu, Wei Wang

机构 * HKUST(香港科技大学) Alibaba Inc(阿里巴巴公司)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.LG

AI总结 Rollplex是一种跨阶段GPU空间共享运行时,通过解耦RL后训练的参考与训练阶段、优化内存与并行度,提升VLMs后训练的GPU利用率与训练速度。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00782 2026-08-04 cs.CL 新提交 89%

Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance

从自适应教师指导中恢复负强化学习组的学习信号:针对失败情况进行知识蒸馏

Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi GU, Xunliang Cai, Deyi Xiong

机构 * Tianjin University(天津大学) Meituan(美团)

专题命中 后训练与偏好优化 :SFT(summary_cn,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对GRPO与OPD简单结合的性能缺陷,提出RSTG方法,通过选择性自适应蒸馏及补充SFT,使数学任务性能提升4.02%、代码任务提升3.05%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18747 2026-06-18 cs.RO cs.AI 新提交 89%

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs

通过基于人类反馈的迭代强化学习利用大语言模型生成自然且富有表现力的机器人手势

Chris Lee, Flora Salim, Benjamin Tag, Francisco Cruz

机构 * University of New South Wales(新南威尔士大学) Universidad Central de Chile(智利中央大学)

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对社交机器人手势生成僵硬问题,提出将ChatGPT集成到Pepper机器人中生成共语手势,并引入基于人类反馈的迭代强化学习(RLHF)优化手势,实验表明RLHF提升了手势的表现力、相关性和流畅性。

Comments 8 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10217 2026-06-10 cs.LG cs.CR 新提交 89%

Alignment Defends LLMs from Property Inference Attacks

对齐防御LLM免受属性推断攻击

Pengrun Huang, Chhavi Yadav, Ruihan Wu, Kamalika Chaudhuri

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(伯克利大学Simons研究所)

专题命中 后训练与偏好优化 :LLM(title_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于对齐的防御方法,通过后训练调整模型输出分布,在不修改训练数据的情况下缓解属性推断攻击,并保持效用与机密性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07535 2026-06-09 cs.CL 新提交 89%

Multilingual Refusal Alignment for Safer Large Language Models

多语言拒绝对齐:构建更安全的大型语言模型

Aleksandra Krasnodębska, Wojciech Kusa, Aldo Lipani

机构 * NASK National Research Institute(国家研究 institute) University College London(伦敦大学学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 本研究系统探究多语言对齐动态,通过引入覆盖12种欧洲语言的RefusEU数据集和DPO实验,发现仅用英语对齐不足以保障跨语言安全,而多语言训练可在不降低通用性能的前提下提升安全性。

Comments Accepted to Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16068 2026-08-18 cs.CL cs.AI 新提交 89%

CAPO: Constraint-Aware Prompt Optimization for LLM Agents

CAPO:面向大语言模型智能体的感知约束提示优化

Victor Ye Dong, Reid Pryzant, Yi Liu, Jian Jiao

机构 * Microsoft(微软)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出CAPO与DCAPO两种方法,通过原始对偶框架优化LLM智能体的系统提示,在智能体及助手式任务中均提升了可行性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20448 2026-07-24 cs.CL cs.LG 新提交 89%

Domyn-Small: A European 10B Reasoning Language Model

Domyn-Small:一个欧洲的100亿参数推理语言模型

Simone Angarano, Francesco Bertolotti, Federico D'Ambrosio, Michele Resta, Alessandro Rognoni, Nicolò Ruggeri, Dario Salvati, Andrea Valenti, Alberto Veneri, Martin Cimmino

机构 * CINECA(意大利国家计算应用研究所)

专题命中 后训练与偏好优化 :language model(title,abstract);SFT(abstract,abstract_cn);LLM(abstract);post-training(abstract)

AI总结 介绍了基于9万亿令牌多语言数据预训练的100亿参数推理语言模型Domyn-Small,经持续预训练、监督微调、强化学习等训练后管道,实现双模式推理,在与对等模型对比中平衡了准确性与效率,还发布了相关权重及开源框架。

Comments 27 pages, 5 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21090 2026-06-23 cs.AI cs.LG 新提交 89%

Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training

自我改进可能导致自我退化:LLM自我训练的兴起与崩溃失败模式

Jianzhe Lin

机构 * MetaAI

专题命中 后训练与偏好优化 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM自我训练中pass@1先升后降的崩溃模式,发现非跨任务遗忘而是策略过度优化,提出CARE、ES和GRPO三种控制方法,在Qwen-2.5模型上验证效果。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09961 2026-06-10 cs.LG cs.AI 新提交 89%

3SPO: State-Score-Supervised Policy Optimization for LLM Agents

3SPO: 面向LLM智能体的状态分数监督策略优化

Yu Han, Kailing Li, Yang Jiao, Yulin Dai, Yuqian Fu, Linhai Zhuo, Tianwen Qian

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Fudan University(复旦大学) KAUST(卡塔尔人工智能研究学院) Fuzhou University(福州大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出3SPO算法,通过动态状态分数监督实现逐步骤策略优化,解决多轮智能体任务中奖励稀疏和信用分配问题,在ALFWorld和WebShop上分别比GRPO提升22.6%和15.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16739 2026-08-18 cs.LG 新提交 89%

Le Critique: Privileged Value Functions for LLM Reinforcement Learning

Le Critique:用于大语言模型强化学习的特权值函数

Siddarth Venkatraman, Matthieu Dinot, Laurence Aitchison

机构 * Mistral AI(米斯特拉尔人工智能公司) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 后训练与偏好优化 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对 LLM 强化学习的值函数应用难题,提出特权值函数(PVF)与自适应插值基线 TETHER,在多推理任务中提升了值函数基线性能,表现优于或媲美 GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15041 2026-08-18 cs.AI 新提交 89%

LLM-Based Hierarchical Coordinated Control with Continuation-Aware Policy Learning

基于大语言模型的分层协调控制与感知延续性的策略学习

Changhong He, Jinda Gao, Xinkuan Liu, Le Zhang, Xizi Luo, Yu Mei

专题命中 后训练与偏好优化 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI

AI总结 针对复杂工程系统多单元协调难题,提出基于LLM的分层框架,结合感知延续性的GRPO,在多匝道交通控制和VPP能源管理中,性能优于多种对比方法。

Comments 30 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06526 2026-08-10 cs.CL 新提交 89%

GRASP: Reinforcing Language Model Anonymizers with Group Relative Policy Optimization

GRASP:用组相对策略优化增强语言模型匿名化器

Sajjad Ghiasvand, Nader Sehatbakhsh

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) UC Los Angeles(加州大学洛杉矶分校)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);preference optimization(abstract)

AI总结 该研究提出GRASP方法,用组相对策略优化增强设备端小型语言模型匿名化器,在隐私-效用权衡、对抗匿名化防御及运行成本上均优于DPO蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏