arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2606.16601 2026-06-16 cs.CV 新提交 82%

DifferAD-R1: A Difference-Guided IndustrialAnomaly Localization with Multimodal LargeLanguage Models

DifferAD-R1: 基于差异引导的多模态大语言模型工业异常定位

Dingrong Wang, Xian Tao, Zhen Qu, Hengliang Luo, Xinyi Gong, Fei Shen, Zhengtao Zhang, Guiguang Ding

机构 * Institute of Automation, Chinese Academy of Sciences (CAS)(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) CASI Vision Technology Co., Ltd.(中科慧远视觉技术有限公司) Shandong Laboratory of Aluminum Advanced Manufacturing in Binzhou (SLAAMB), Binzhou Institute of Technology, Weiqiao-UCAS Science and Technology Park(山东省滨州市铝先进制造实验室(SLAAMB),滨州技术学院,魏桥国科科技园) Space Information Research Institute, Hangzhou Dianzi University(杭州电子科技大学空间信息研究院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract)

AI总结 提出DifferAD-R1框架,通过差异引导双图像范式将异常定位转化为一次性差异定位问题,并设计双一致性定位奖励和难度感知策略,在AD-DualDiff数据集上优于现有方法。

Comments Submitted to IEEE Transactions on Circuits and Systems for Video Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15734 2026-06-16 cs.CL cs.AI cs.IR cs.LG 新提交 82%

Retrievable Gradients: Continual Post-Training Without Cumulative Weight Drift

可检索梯度:无累积权重漂移的持续后训练

Weihang Su, Jiacheng Kang, Jingyan Xu, Qingyao Ai, Jianming Long, Hanwen Zhang, Bangde Du, Xinyuan Cao, Min Zhang, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ReGrad范式,将梯度作为可检索知识单元,通过元学习重塑文档梯度为通用适应信号,实现无权重漂移的可扩展参数知识注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17659 2026-06-03 cs.RO cs.CV 82%

Plan-R1: Safe and Feasible Trajectory Planning as Language Modeling

Plan-R1:安全且可行的轨迹规划作为语言建模

Xiaolong Tang, Meina Kan, Shiguang Shan, Xilin Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract)

AI总结 提出Plan-R1两阶段轨迹规划框架,通过原则对齐与行为学习解耦,结合规则奖励和方差解耦GRPO,显著提升自动驾驶规划的安全性和可行性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00814 2026-05-28 cs.CV 82%

IRPO: Boosting Image Restoration via Post-training GRPO

IRPO:通过后训练GRPO提升图像恢复

Haoxuan Xu, Yi Liu, Tianfu Li, Ruolin Shen, Boyuan Jiang, Jinlong Peng, Donghao Luo, Xiaobin Hu, Shuicheng Yan, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract)

AI总结 提出IRPO框架,利用GRPO后训练优化确定性恢复模型,通过数据筛选和复合奖励建模,在域内和域外任务上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20914 2026-05-27 cs.CV 82%

RISE: Reliable Improvement in Self-Evolving Vision-Language Models

RISE: 自进化视觉语言模型的可靠改进

Chaoran Xu, Yingmao Miao, Pengfei Zhang, Hao Dou, Lei Sun, Xiangxiang Chu

机构 * AMAP, Alibaba Group(阿里集团AMAP实验室)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract)

AI总结 针对视觉语言模型自进化中角色交替粗粒度、问题质量下降和类型坍缩问题,提出RISE框架,通过细粒度角色交替、质量监督器和技能感知动态平衡实现可靠自进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08011 2026-05-26 cs.CV 82%

It's Time to Get It Right: Improving Analog Clock Reading and Clock-Hand Spatial Reasoning in Vision-Language Models

是时候正确了:提升视觉语言模型中的模拟时钟读取和指针空间推理能力

Jaeha Choi, Jin Won Lee, Siwoo You, Jangho Lee

机构 * Incheon National University(延世国立大学) McGill University(麦吉尔大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(abstract)

AI总结 针对视觉语言模型在真实环境中读取模拟时钟的挑战,提出TickTockVQA数据集和Swap-DPO微调框架,显著提升时钟读取准确性和鲁棒性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03454 2026-05-20 cs.CV 82%

Contextualized Visual Personalization in Vision-Language Models

基于上下文的视觉个性化在视觉-语言模型中

Yeongtak Oh, Sangwon Yu, Junsung Park, Han Cheol Moon, Jisoo Mok, Sungroh Yoon

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(电气电子工程系,首尔国立大学,首尔,韩国) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Seoul, Korea(人工智能交叉学科项目,首尔国立大学,首尔,韩国)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract)

AI总结 本文提出了一种基于上下文的视觉个性化方法,通过强化学习和生成增强技术改进视觉-语言模型的个性化图像描述能力,并通过诊断评估验证了模型对视觉上下文的真实利用,展示了CoViP在下游个性化任务中的全面提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09433 2026-05-12 cs.CV 82%

Offline Preference Optimization for Rectified Flow with Noise-Tracked Pairs

离线偏好优化用于具有噪声跟踪配对的校正流

Yunhong Lu, Qichao Wang, Hengyuan Cao, Xiaoyin Xu, Min Zhang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study-Zhejiang University(上海先进研究院-浙江大学) Shanghai Institute for Mathematics and Interdisciplinary Sciences(上海数学与交叉科学研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract)

AI总结 本文提出PNAPO框架,通过保留生成胜败图像的先验噪声,改进校正流的偏好优化,提升稳定性和样本效率。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06049 2026-05-08 cs.CV 82%

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

融合你的方式:通过直接偏好优化对齐图像融合与异质需求

Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract)

AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24948 2026-04-28 cs.RO 82%

World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training

World-Env: 利用世界模型作为虚拟环境进行VLA后训练

Junjin Xiao, Yandan Yang, Xinyuan Chang, Ronghan Chen, Feng Xiong, Mu Xu, Wei-Shi Zheng, Qing Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) AMap, Alibaba Group(阿里巴巴集团高德地图) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract)

AI总结 针对VLA模型在数据稀缺场景下的性能下降问题,提出World-Env框架,通过虚拟仿真器替代真实环境,提升安全性和效率,实现任务完成检测与持续奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22630 2026-04-27 cs.CL cs.AI cs.LG 82%

StateX: Enhancing RNN Recall via Post-training State Expansion

StateX:通过后训练状态扩展增强RNN回忆能力

Xingyu Shen, Yingfa Chen, Zhen Leng Thai, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Department of Science and Technology, Tsinghua University(清华大学科学技术部)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 StateX通过后训练方法扩展RNN状态,提升长上下文回忆与上下文学习性能,无需显著增加参数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17663 2026-04-21 cs.LG cs.AI cs.CL 82%

ATLAS: Constitution-Conditioned Latent Geometry and Redistribution Across Language Models and Neural Perturbation Data

ATLAS:宪法条件下的潜在几何与语言模型及神经扰动数据的再分配

Gareth Seneque, Lap-Hang Ho, Nafise Erfanian Saeedi, Jeffrey Molendijk, Tim Elson

机构 * Australian Broadcasting Corporation(澳大利亚广播公司)

专题命中 后训练与偏好优化 :language model(title);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ATLAS通过分析模型学习的表示几何结构,揭示了宪法条件下的潜在几何再分配机制,展示了在不同模型和子系统中几何结构的稳定性与可恢复性。

Comments 49 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02986 2026-04-06 cs.LG cs.AI cs.CL 82%

Mitigating Reward Hacking in RLHF via Advantage Sign Robustness

通过优势符号鲁棒性缓解RLHF中的奖励黑客

Shinnosuke Ono, Johannes Ackermann, Soichiro Nishimori, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所革新智能研究中心)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SignCert-PO方法,通过在策略优化阶段降低非鲁棒完成的权重,缓解RLHF中的奖励黑客问题,在摘要和AlpacaFarm基准测试中表现优于基线。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27375 2026-03-31 cs.CV 82%

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用

Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) Huawei(华为) HKUST (GZ)(香港科技大学(广州))

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract)

AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。

Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14972 2026-03-17 cs.RO 82%

Learning from Mistakes: Post-Training for Driving VLA with Takeover Data

从错误中学习:使用接管数据进行驾驶VLA的后训练

Yinfeng Gao, Deqing Liu, Qichao Zhang, Yupeng Zheng, Haochen Tian, Guang Li, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 后训练与偏好优化 :post-training(title,abstract);preference optimization(abstract)

AI总结 本文提出TakeVLA框架,通过预接管语言监督和场景做梦方法,提升驾驶VLA的闭环性能与安全性,实验显示在Bench2Drive基准上优于SimLingo。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00526 2026-03-03 cs.CV 82%

Mesh-Pro: Asynchronous Advantage-guided Ranking Preference Optimization for Artist-style Quadrilateral Mesh Generation

Mesh-Pro: 异步优势引导的排名偏好优化用于艺术家风格的四边形网格生成

Zhen Zhou, Jian Liu, Biwen Lei, Jing Xu, Haohan Weng, Yiling Zhu, Zhuo Chen, Junfeng Fan, Yunkai Ma, Dazhao Du, Song Guo, Fengshui Jing, Chunchao Guo

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Hunyuan(腾讯文元) Hong Kong University of Science and Technology(香港科技大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);post-training(abstract)

AI总结 Mesh-Pro通过异步优势引导的排名偏好优化提升3D网格生成的训练效率和生成质量,引入了新的标记化和奖励机制,实现了艺术家风格网格的先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21585 2026-02-27 cs.LG cs.AI cs.CL stat.ML 82%

Duel-Evolve: Reward-Free Test-Time Scaling via LLM Self-Preferences

Duel-Evolve:通过LLM自我偏好实现无奖励的测试时间扩展

Sweta Karlekar, Carolina Zheng, Magnus Saebo, Nicolas Beltran-Velez, Shuyang Yu, John Bowlan, Michal Kucer, David Blei

机构 * Columbia University(哥伦比亚大学) Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Duel-Evolve通过LLM自我偏好实现无奖励的测试时间优化,提升MathBench和LiveCodeBench的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06195 2026-02-09 cs.CV 82%

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

DeDPO:用于扩散模型的去偏直接偏好优化

Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

机构 * Cornell University(康奈尔大学) Rutgers University(罗格斯大学) NYU(纽约大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract)

AI总结 DeDPO通过整合因果推理的去偏技术,提升扩散模型在低成本合成监督下的对齐性能,实现与人类标注数据相当的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11298 2026-02-06 cs.LG cs.AI cs.CL 82%

When Are Two RLHF Objectives the Same?

何时两个强化学习中的偏好优化目标是相同的?

Madhava Gaikwad

专题命中 后训练与偏好优化 :RLHF(title);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Opal算法,用于判断强化学习中不同偏好优化目标是否等价,揭示多数常用方法实际优化相同目标,部分方法则存在本质差异。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20433 2026-02-02 cs.CV 82%

MARE: Multimodal Alignment and Reinforcement for Explainable Deepfake Detection via Vision-Language Models

MARE: 多模态对齐与强化学习用于通过视觉-语言模型的可解释深度伪造检测

Wenbo Xu, Wei Lu, Xiangyang Luo, Jiantao Zhou

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University, Guangzhou 510006, China(计算机科学与工程学院,信息技术MOE实验室,广东省信息安全技术重点实验室,中山大学,广州510006,中国) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) Department of Computer and Information Science, University of Macau.(计算机与信息科学系,澳门大学)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(abstract)

AI总结 MARE通过多模态对齐和强化学习提升视觉-语言模型在深度伪造检测中的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21268 2026-01-30 cs.NE 82%

Reinforcement Learning from Meta-Evaluation: Aligning Language Models Without Ground-Truth Labels

基于元评估的强化学习:无需真实标签对齐语言模型

Micah Rentschler, Jesse Roberts

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract)

AI总结 本研究提出RLME方法,通过元评估生成奖励,实现无需真实标签的LLM训练,提升准确性和样本效率,支持多目标权衡与可靠推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02950 2025-12-29 eess.AS cs.SD 82%

Fine-grained Preference Optimization Improves Zero-shot Text-to-Speech

细粒度偏好优化提升零样本文本到语音

Jixun Yao, Yuguang Yang, Yu Pan, Yuan Feng, Ziqian Ning, Jianhao Ye, Hongbin Zhou, Lei Xie

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract)

AI总结 细粒度偏好优化方法通过解决生成样本中的局部问题,提升零样本文本到语音系统的鲁棒性和可懂度。

Comments Accepted By IEEE TASLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15644 2025-12-18 cs.CV 82%

InpaintDPO: Mitigating Spatial Relationship Hallucinations in Foreground-conditioned Inpainting via Diverse Preference Optimization

InpaintDPO:通过多样偏好优化缓解前景条件修复中的空间关系幻觉

Qirui Li, Yizhe Tang, Ran Yi, Guangben Lu, Fangyuan Zou, Peng Shu, Huan Yu, Jie Jiang

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract)

AI总结 InpaintDPO通过多样偏好优化解决前景条件修复中的空间关系幻觉问题,提升背景与前景间的一致性与合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10264 2025-12-16 cs.SD 82%

MR-FlowDPO: Multi-Reward Direct Preference Optimization for Flow-Matching Text-to-Music Generation

MR-FlowDPO:多奖励直接偏好优化用于流匹配文本到音乐生成

Alon Ziv, Sanyuan Chen, Andros Tjandra, Yossi Adi, Wei-Ning Hsu, Bowen Shi

机构 * FAIR Team, Meta MSL(Meta MSL FAIR团队) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);prompting(abstract)

AI总结 MR-FlowDPO通过多奖励直接偏好优化提升文本到音乐生成的质量,增强音频质量、文本对齐和音乐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15661 2025-11-21 cs.CV cs.AI cs.CL cs.LG 82%

VisPlay: Self-Evolving Vision-Language Models from Images

VisPlay: 从图像中自我进化视觉-语言模型

Yicheng He, Chengsong Huang, Zongxia Li, Jiaxin Huang, Yonghui Yang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Maryland(马里兰大学) National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VisPlay通过自我进化强化学习框架,利用未标注图像数据提升视觉-语言模型的推理能力,实现多模态智能的可扩展发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14157 2025-11-18 cs.CL cs.AI cs.LG 82%

DCRM: A Heuristic to Measure Response Pair Quality in Preference Optimization

Chengyu Huang, Tanya Goyal

机构 * Cornell University(康奈尔大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17417 2025-11-13 cs.CV 82%

Synth-Align: Improving Trustworthiness in Vision-Language Model with Synthetic Preference Data Alignment

Robert Wijaya, Ngoc-Bao Nguyen, Ngai-Man Cheung

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11234 2025-11-07 cs.RO cs.CV 82%

Poutine: Vision-Language-Trajectory Pre-Training and Reinforcement Learning Post-Training Enable Robust End-to-End Autonomous Driving

Luke Rowe, Rodrigue de Schaetzen, Roger Girgis, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 后训练与偏好优化 :post-training(title);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16378 2025-11-06 cs.LG cs.AI cs.CL 82%

REFA: Reference Free Alignment for multi-preference optimization

Taneesh Gupta, Rahul Madhavan, Xuchao Zhang, Chetan Bansal, Saravan Rajmohan

机构 * MicrosoftIndian Institute of Science (IISc), Bangalore(微软印度科学研究院(IISc),班加罗尔)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06020 2025-10-27 cs.AI cs.CL cs.LG 82%

Information-Theoretic Reward Decomposition for Generalizable RLHF

Liyuan Mao, Haoran Xu, Amy Zhang, Weinan Zhang, Chenjia Bai

机构 * Shanghai Jiao Tong University(上海交通大学) UT Austin(得克萨斯大学奥斯汀分校) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work done during internships at Institute of Artificial Intelligence (TeleAI), China Telecom

详情

展开后加载摘要…

URL PDF HTML 收藏