arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4516 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4516 篇

2603.18859 2026-05-29 cs.AI cs.CL cs.LG 88%

RewardFlow: Topology-Aware Reward Propagation on State Graphs for Agentic RL with Large Language Models

RewardFlow: 面向大语言模型智能体强化学习的拓扑感知状态图奖励传播

Xiao Feng, Bo Han, Zhanke Zhou, Jiaqi Fan, Jiangchao Yao, Ka Ho Li, Dahai Yu, Michael Kwok-Po Ng

机构 * TMLR Group(TMLR小组) Hong Kong Baptist University(香港 Baptist大学) TCL Corporate Research (HK) Co Ltd(TCL企业研究(香港)有限公司) Cooperative Medianet Innovation Center Shanghai Jiao Tong University(合作中位网创新中心上海交通大学) Department of Mathematics Hong Kong Baptist University(香港 Baptist大学数学系)

专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RewardFlow方法,通过构建状态图进行拓扑感知的奖励传播,为智能体推理提供无标注的密集奖励,显著提升强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV 88%

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);pretraining(abstract)

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23445 2026-04-28 cs.CL cs.AI cs.CY cs.LG 88%

AI Safety Training Can be Clinically Harmful

AI安全训练可能造成临床伤害

Suhas BN, Andrew M. Sherrill, Rosa I. Arriaga, Chris W. Wiese, Saeed Abdullah

机构 * College of Information Sciences and Technology, Penn State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Psychiatry and Behavioral Sciences, Emory University(埃默里大学精神病学与行为科学系) School of Interactive Computing, Georgia Tech(佐治亚理工学院交互计算学院) School of Psychology, Georgia Tech(佐治亚理工学院心理学学院)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究评估了四种生成模型在认知行为疗法场景中的表现,发现其在高严重性情况下治疗适当性显著下降,提出需通过多轴评估框架确保AI心理健康系统的安全性。

Comments 26 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-04-16 cs.CV 88%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract)

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments Project page: https://vision.cs.utexas.edu/projects/acpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02464 2026-03-06 cs.CV 88%

SAMPO-Path: Segmentation Intent-Aligned Preference Optimization for Pathology Foundation Model Segmentation

SAMPO-Path: 分段意图对齐的偏好优化用于病理基础模型分段

Yonghuang Wu, Wenwen Zeng, Xuan Xie, Chengqian Zhao, Guoqing Wu, Jinhua Yu

机构 * School of Biomedical Engineering and Technological Innovation, Fudan university, Shanghai, China.(生物医学工程与技术创新学院,复旦大学,上海,中国)

专题命中 后训练与偏好优化 :foundation model(title,abstract);preference optimization(title,abstract)

AI总结 SAMPO-Path通过偏好优化框架提升病理图像分割的准确性和临床意图一致性。

Comments 15 pages, 9 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19750 2026-01-29 cs.MM cs.CV cs.IR 88%

Benchmarking Multimodal Large Language Models for Missing Modality Completion in Product Catalogues

在电子商务目录中评估多模态大语言模型用于缺失模态补全

Junchen Fu, Wenhao Deng, Kaiwen Zheng, Ioannis Arapakis, Yu Ye, Yongxin Ni, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Telefónica Scientific Research(电信科研机构) National University of Singapore(新加坡国立大学) Shandong University(山东大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了多模态大语言模型在电子商务目录中补全缺失模态的能力,通过MMPCBench基准测试发现MLLMs在细粒度对齐上存在不足,并探索了GRPO方法以提升补全效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02393 2026-01-09 cs.SE 88%

AP2O-Coder: Adaptively Progressive Preference Optimization for Reducing Compilation and Runtime Errors in LLM-Generated Code

AP2O-Coder: 适应性渐进偏好优化用于减少LLM生成代码的编译和运行时错误

Jianqing Zhang, Wei Xia, Hande Dong, Qiang Lin, Jian Cao

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract)

AI总结 AP2O-Coder通过适应性渐进偏好优化方法,减少LLM生成代码的编译和运行时错误,提升代码生成性能。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19999 2025-11-05 cs.MM cs.CV cs.SD 88%

MultiSoundGen: Video-to-Audio Generation for Multi-Event Scenarios via SlowFast Contrastive Audio-Visual Pretraining and Direct Preference Optimization

Jianxuan Yang, Xiaoran Yang, Lipan Zhang, Xinyue Guo, Zhao Wang, Gongping Huang

专题命中 后训练与偏好优化 :pretraining(title,abstract);preference optimization(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12083 2025-09-30 cs.CV 88%

Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization

Pritam Sarkar, Ali Etemad

机构 * Queen’s University(女王大学) Vector Institute(向量研究所)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00685 2025-09-03 eess.AS cs.SD 88%

MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech

Kangxiang Xia, Xinfa Zhu, Jixun Yao, Lei Xie

机构 * School of Computer Science, Northwestern Polytechnical University(计算机科学学院)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title,abstract)

Comments Accepted by NCMMSC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20150 2025-07-29 cs.AI cs.CL cs.LG 88%

The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models

Xingcheng Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :large language model(title);language model(title);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04656 2025-06-10 cs.LG cs.AI cs.CL 88%

Binary Classifier Optimization for Large Language Model Alignment

Seungjae Jung, Gunsoo Han, Daniel Wontae Nam, Kyoung-Woon On

机构 * Kakao Corp(Kakao公司) LBOX

专题命中 后训练与偏好优化 :large language model(title);language model(title);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01253 2025-01-23 cs.CL cs.AI cs.LG 88%

Yi-Lightning Technical Report

Alan Wake, Bei Chen, C. X. Lv, Chao Li, Chengen Huang, Chenglin Cai, Chujie Zheng, Daniel Cooper, Fan Zhou, Feng Hu, Ge Zhang, Guoyin Wang, Heng Ji, Howard Qiu, Jiangcheng Zhu, Jun Tian, Katherine Su, Lihuan Zhang, Liying Li, Ming Song, Mou Li, Peng Liu, Qicheng Hu, Shawn Wang, Shijun Zhou, Shiming Yang, Shiyong Li, Tianhang Zhu, Wen Xie, Wenhao Huang, Xiang He, Xiaobo Chen, Xiaohui Hu, Xiaoyi Ren, Xinyao Niu, Yanpeng Li, Yongke Zhao, Yongzhen Luo, Yuchi Xu, Yuxuan Sha, Zhaodong Yan, Zhiyuan Liu, Zirui Zhang, Zonghong Dai

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.17078 2024-03-27 cs.IR 88%

Unsupervised Large Language Model Alignment for Information Retrieval via Contrastive Feedback

Qian Dong, Yiding Liu, Qingyao Ai, Zhijing Wu, Haitao Li, Yiqun Liu, Shuaiqiang Wang, Dawei Yin, Shaoping Ma

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract)

Comments Accepted by SIGIR24

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14212 2026-08-17 cs.AI 新提交 87%

APTER: Adaptive Post-Training with Expert-Grounded Rubrics

APTER:基于专家准则的自适应后训练

Xukai Wang, Liangqi Li, Zhiyue Xu, Jingang Zhou, Xiaoyu Shi, Jiansheng Cai, Bo Zhang, Zhe Li, Xu-Yao Zhang

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字科技)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 APTER是将结构化领域知识融入专业复杂推理评估、优化与诊断的框架,通过专家准则生成查询级准则并用于自适应后训练,在数学、医学领域三代模型上均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13434 2026-07-29 cs.CL 版本更新 87%

$M^2PO$: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation

$M^2PO$:用于机器翻译的多视角多对偏好优化

Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, xiangxiang Zeng, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对机器翻译中主流方法受误导性奖励信号影响的问题,提出$M^2PO$框架,通过双视角机制和多对目标优化偏好,实验证明该框架能使模型性能提升,超越开源基线并接近专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19712 2026-07-23 cs.LG 新提交 87%

How Fast Can Reward Models Score? A Systems Study of C++ and PyTorch Inference Runtimes for RLHF

奖励模型评分能有多快?对用于基于人类反馈的强化学习的C++和PyTorch推理运行时的系统研究

Venkata Naga Sai Vishnu Rohit Pulipaka, Anish Katta, Deva Rohit Reddy Peddireddy

专题命中 后训练与偏好优化 :RLHF(title,summary_cn);分类 cs.LG

AI总结 研究RLHF中奖励模型评分速度,构建基于ONNX Runtime的C++推理引擎,经测试,在CPU上击败所有基线,GPU上部分领先,发现加速源于ONNX Runtime,且批处理策略对速度影响更大,结果经多次独立运行得出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13952 2026-07-16 cs.SD cs.AI eess.AS 版本更新 87%

LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement

基于大语言模型的强化学习音频视觉语音增强

Chih-Ning Chen, Jen-Cheng Hou, Hsin-Min Wang, Shao-Yi Chien, Yu Tsao, Fan-Gang Zeng

机构 * Department of Electrical Engineering, National Taiwan University, Taiwan(台湾大学电子工程系) Research Center for Information Technology Innovation, Academia Sinica, Taiwan(中央研究院资讯科技创新研究中心) Center for Hearing Research, University of California Irvine, USA(加州大学尔湾分校听力研究中心)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的可解释奖励模型的音频视觉语音增强框架,利用语言模型生成语音增强的自然语言描述,并通过情感分析模型转换为评分作为PPO奖励,提升语音质量评估效果。

Comments 6 pages, 4 figures, Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06140 2026-07-08 cs.CL 新提交 87%

CurateEvo: Data-Curation Evolving for Agentic Post-Training

CurateEvo:用于智能体训练后的数据管理进化

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型智能体训练后决策问题,提出CurateEvo框架,将数据管理策略表示为代码并迭代重写。通过诊断故障模式增强、过滤数据提高有效性,在成本感知下修剪训练轮次提高效率,实验证明其性能优于现有方法且降低管理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29296 2026-06-30 cs.AI 87%

Process Advantage Signal Shaping: A Paradigm-Agnostic Middleware for Process-Supervised RL in LLM Reasoners

过程优势信号塑形:用于LLM推理器过程监督强化学习的范式无关中间件

Chao Wang, Hongtao Tian, Tao Yang, Yunsheng Shi, Ting Yao, Wenbo Ding

机构 * Tsinghua University(清华大学) WeChat, Tencent(微信、腾讯)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PASS中间件,通过优势融合、按值分块和长度分割解决GRPO在过程监督强化学习中的通道污染、分辨率不匹配和累积陷阱问题,在数学推理和多跳问答任务上持续提升pass@1。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26899 2026-06-26 cs.AI 新提交 87%

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

基于扩散Transformer的生成式检索:度量有序序列训练与混合策略偏好优化

Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

机构 * Peking University(北京大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 针对模式保持的属性检索任务,提出MO-DiT+HPPO框架,通过度量有序训练和混合策略偏好优化,在八个领域分割中七个取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00327 2026-06-25 cs.IR cs.AI 版本更新 87%

DynamicPO: Dynamic Preference Optimization for Recommendation

DynamicPO:基于推荐的动态偏好优化

Xingyu Hu, Kai Zhang, Jiancan Wu, Shuli Wang, Chi Wang, Wenshuai Chen, Yinhua Zhu, Haitao Wang, Xingxing Wang, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Meituan(美团)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出DynamicPO框架,通过动态边界负样本选择和双边距动态beta调整,解决偏好优化崩溃问题,提升推荐准确性。

Comments DASFAA 2026 Best Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21089 2026-06-23 cs.AI 新提交 87%

Repeated post-training is not Self-improving: Diagnosing Scientific Amnesia in Continual DPO Pipelines

重复后训练并非自我改进:诊断持续DPO流水线中的科学健忘症

Jianzhe Lin, Fei Wang, Xiaolin Li, Rajeshkumar Golani, Jubin Chheda

机构 * MetaAI

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(title);分类 cs.AI

AI总结 针对工业LLM团队在持续DPO训练中遇到的性能退化问题,本文提出“科学健忘症”概念,并设计诊断套件、基于程序的流水线及基准测试,通过对比五种策略发现,结论高度依赖流水线设置和评估设计。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18961 2026-06-18 cs.LG 新提交 87%

Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization

做自己的老师:通过无监督奖励优化引导蛋白质语言模型

Lanqing Li, Shentong Mo, Yang Yu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) MBZUAI Hong Kong University of Science and Technology(香港科学理工大学)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 提出无监督奖励优化框架,结合模型不确定性和语义一致性作为代理奖励,通过SRO和BRO算法优化PLMs,在无标签数据下实现可控蛋白质生成,性能接近有监督方法。

Comments 24 pages, 2 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10346 2026-06-10 cs.AI 新提交 87%

Reasoning or Memorization? Direction-Aware Diversity Exploration in LLM Reinforcement Learning

推理还是记忆?LLM强化学习中的方向感知多样性探索

Jiangnan Xia, Yucheng Shi, Yu Yang, Kishan Panaganti, Zhenwen Liang, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Lab(腾讯AI实验室) The Education University of Hong Kong(香港教育大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DiRL框架,通过方向感知奖励区分推理与记忆驱动的探索,在GRPO中集成方向加权梯度特征,显著提升数学与通用推理性能。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07950 2026-06-09 cs.LG 新提交 87%

The Easy, the Hard, and the Learnable: Confidence and Difficulty-Adaptive Policy Optimization for LLM Reasoning

简单、困难与可学习:面向LLM推理的置信度与难度自适应策略优化

Zhanke Zhou, Xiangyu Lu, Chentao Cao, Brando Miranda, Tongliang Liu, Bo Han, Sanmi Koyejo

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系 TMLR 组) Stanford University(斯坦福大学) Sydney AI Centre, The University of Sydney(悉尼大学人工智能中心)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.LG

AI总结 针对GRPO训练中均匀采样导致计算效率低的问题,提出CoDaPO方法,通过置信度和难度自适应重加权与重采样,在固定预算下提升可学习问题的发现,在12个基准上优于现有RL方法。

Comments Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06797 2026-06-08 cs.CL 新提交 87%

Korean Culture into LLM Alignment: Toward Cultural Coherence

将韩国文化融入大语言模型对齐:迈向文化一致性

MinJae Jung, Minwoo Kim

机构 * SKT LG AI Research(LG人工智能研究) Kanana Team(Kanana团队)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型的文化对齐,提出构建性定义而非仅抑制负面输出,设计基于提示的种子生成器扩展韩国危害分类,结合韩国法律、社会规范和解释惯例制定安全响应策略,通过DPO微调提升韩国文化安全率且不损害通用能力。

Comments Accepted to ICML 2026 Workshop on Culture X AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30861 2026-06-01 cs.AI 87%

Distilling LLM Feedback for Lean Theorem Proving

蒸馏LLM反馈用于Lean定理证明

Gaetan Narozniak, Gérard Biau, Rémi Munos, Ahmad Rammal, Pierre Marion

机构 * FAIR at Meta(Meta 的 FAIR 部门) Inria(法国国家科学与技术研究院) Sorbonne Université(索邦大学) Institut universitaire de France(法国国家科学研究院) CERMICS École des Ponts ParisTech(巴黎理工学院 CERMICS 实验室) ENS, PSL Research University(巴黎高等师范学院与巴黎科学实验室)

专题命中 后训练与偏好优化 :LLM(title,title_cn);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出反馈蒸馏方法,通过让模型在token级别匹配自身分布(基于语言模型提供的特权反馈)来训练,以解决GRPO在推理后训练中的稀疏奖励和模式崩溃问题,并在Lean4定理证明中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30504 2026-06-01 cs.CL 87%

Auditing LLM Benchmarks with Item Response Theory

使用项目反应理论审计LLM基准测试

Sander Land, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.CL

AI总结 本文引入基于项目反应理论的指标,通过114个模型的响应在七个偏好和多选基准测试中识别出前200个示例中95%精度的可能错误标签,并追踪错误来源,同时揭示奖励模型在风格偏好而非事实知识上的专业化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01869 2026-05-29 cs.AI 87%

Skill-Pro: Learning Reusable Skills from Experience via Non-Parametric PPO for LLM Agents

Skill-Pro: 通过非参数PPO从经验中学习可复用技能以用于LLM智能体

Qirui Mi, Zhijian Ma, Mengyue Yang, Haoxuan Li, Yisen Wang, Haifeng Zhang, Jun Wang

机构 * Key Laboratory of Interdisciplinary Research of Computation and Economics(交叉计算与经济学交叉研究实验室) Shanghai University of Finance and Economics(上海财经大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, Chinese Academy of Sciences(中国科学院人工智能研究所) University of Bristol(布里斯托大学) Peking University(北京大学) University College London(伦敦大学学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.AI

AI总结 提出Skill-Pro框架,通过非参数PPO从交互经验中自动学习可复用的程序性技能,无需参数更新,实现高效经验重用和长期自主性。

Comments Accepted at ICML 2026 (spotlight); 22 Pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏