arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4507 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4507 篇

2606.08088 2026-06-09 cs.LG cs.CL 新提交 88%

ConSteer-RL: Steering Reasoning Capabilities in Large Language Models via Confidence-Aware Reinforcement Learning

ConSteer-RL:通过置信度感知强化学习引导大型语言模型的推理能力

Qing Miao, Yiming Zhao, Jing Yang, Chenxi Liu, Yuehai Chen, Yuewen Liu, Shaoyi Du, Badong Chen

机构 * Xi'an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出ConSteer-RL框架,将模型log概率的token级置信度信号融入GRPO,通过置信度感知奖励塑造机制惩罚过度自信错误并强化正确自信推理,在多个模型规模上平均提升2.3%-4.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31494 2026-06-01 cs.CL cs.LG 88%

Consolidating Rewarded Perturbations for LLM Post-Training

整合奖励扰动用于大语言模型后训练

Zheyu Zhang, Shuo Yang, Gjergji Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出CoRP方法,通过奖励加权聚合、兼容性重加权和验证门控,将奖励扰动整合为单一模型,无需梯度,在单次推理下平均提升8.1分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04678 2026-05-29 cs.CL cs.AI 88%

Post-Training Language Models for Crosslingual Consistency

后训练语言模型以实现跨语言一致性

Tianyu Liu, Jirui Qi, Mrinmaya Sachan, Ryan Cotterell, Raquel Fernández, Arianna Bisazza

机构 * ETH Zürich(苏黎世联邦理工学院) CLCG, University of Groningen(格罗宁根大学CLCG中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多语言模型对翻译等价提示响应不一致的问题,提出基于信息论的跨语言一致性定义,并开发后训练方法直接一致性优化(DCO)以提升一致性。

Comments ICML 2026. The first two authors contributed equally. Codes available at: https://github.com/Betswish/ConsistencyRL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29156 2026-05-29 cs.LG cs.CL 88%

RUBRIC-ARROW: Alternating Pointwise Rubric Reward Modeling for LLM Post-training in Non-verifiable Domains

RUBRIC-ARROW:面向不可验证领域的大语言模型后训练的交替逐点评分规则奖励建模

Haoxiang Jiang, Zihan Dong, Tianci Liu, Wanying Wang, Ran Xu, Tony Yu, Linjun Zhang, Haoyu Wang

机构 * University at Albany(阿尔巴尼大学) Rutgers University(罗格斯大学) Purdue University(普渡大学) Independent Researcher(独立研究员) Emory University(埃默里大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 针对非可验证领域绝对评分困难的问题,提出交替框架RUBRIC-ARROW,联合训练规则生成器和条件裁判,通过概率评分规则和交替GRPO减少平局,提升奖励建模准确率并改善下游策略后训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20994 2026-05-21 cs.CL cs.AI 88%

Towards Context-Invariant Safety Alignment for Large Language Models

面向大语言模型的上下文不变安全对齐

Yixu Wang, Yang Yao, Xin Wang, Yifeng Gao, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 后训练与偏好优化 :large language model(title);language model(title);post-training(abstract);preference optimization(abstract)

AI总结 本文提出了一种上下文不变的安全对齐方法,通过引入锚点不变正则化(AIR)来提升模型在不同上下文中的鲁棒性,从而增强安全约束对对抗性框架的抵抗力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18966 2026-05-19 cs.LG cs.AI 88%

Self-Improving Tabular Language Models via Iterative Reward-Guided Post-Training

通过迭代奖励引导的后训练改进表格语言模型

Yunbo Long, Tejumade Afonja, Guangya Hao, Alexandra Brintrup, Mario Fritz

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(德国萨尔布吕肯信息安全中心) The Alan Turing Institute, London(伦敦阿兰·图灵研究所)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过生成-评分-对齐协议进行迭代奖励引导的后训练,提出了一种基于组相对对齐的方法TabGRAA,通过比较高分和低分生成组的组平均策略/参考对数比来改进表格语言模型,在五个混合类型基准上优于额外监督微调,并在保真度和下游效用之间实现了最佳平均权衡,同时保持经验隐私诊断接近监督基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13935 2026-05-15 cs.LG cs.CL 88%

Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models

超越模式寻求强化学习:扩散语言模型的轨迹平衡后训练

Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

机构 * Noah’s Ark Lab(Noah’s Ark 实验室)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出TraFL方法,通过轨迹平衡目标提升扩散语言模型的后训练效果,在多个基准测试中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01003 2026-05-11 cs.LG cs.AI 88%

ESSAM: A Novel Competitive Evolution Strategies Approach to Reinforcement Learning for Memory Efficient LLMs Fine-Tuning

ESSAM:一种用于内存高效的LLM微调的强化学习竞争进化策略方法

Zhishen Sun, Sizhe Dang, Guang Dai, Haishan Ye

机构 * Xi’an Jiaotong University(西安交通大学) SGIT AI Lab(SGIT人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ESSAM,结合进化策略的零阶搜索与SAM提升泛化能力,实现低内存高精度的LLM微调,实验显示其在GSM8K任务中表现优异,内存使用显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05799 2026-04-28 cs.CL cs.AI cs.SD 88%

Data-efficient Targeted Token-level Preference Optimization for LLM-based Text-to-Speech

高效的目标令牌级偏好优化用于基于大语言模型的文本到语音

Rikuto Kotoge, Yuichi Sasaki

机构 * SpiralAI Inc.(SpiralAI公司) The University of Osaka(大阪大学) Shizuoka University(izuoka大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TKTO方法,通过无需配对数据实现高效训练,直接优化令牌级单位,提升日语音识别准确率39%并降低CER 54%。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21209 2026-04-24 cs.AI cs.CL 88%

Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management

对齐生成式人工智能与人类偏好:一种用于在线评论管理的新型大语言模型微调方法

Yanan Wang, Yong Ge

机构 * Department of Information Systems and Operations Management, The University of Texas at Arlington(信息系统与运营管理系,德克萨斯大学阿灵顿分校) Department of Management Information Systems, University of Arizona(管理信息学系,亚利桑那大学)

专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出一种新型微调方法,通过上下文增强和理论驱动的偏好微调,解决在线评论生成中的幻觉、偏好表示和保守优化问题,提升生成质量。

Comments Accepted to Information Systems Research (ISR). This is a preliminary version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13551 2026-04-10 cs.CL cs.AI 88%

Towards Hierarchical Multi-Step Reward Models for Enhanced Reasoning in Large Language Models

面向增强大语言模型推理能力的分层多步奖励模型

Teng Wang, Zhangyi Jiang, Zhenqi He, Shenyang Tong, Wenhan Yang, Yanan Zheng, Zeyu Li, Zifan He, Hailei Gong, Zewen Ye, Shengjie Ma, Jianping Zhang

机构 * the University of Hong Kong(香港大学) Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) the Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出分层奖励模型和轻量数据增强策略,解决大语言模型推理中奖励黑客问题,提升多步推理评估的稳定性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28416 2026-03-31 cs.LG cs.AI 88%

Evolutionary Discovery of Reinforcement Learning Algorithms via Large Language Models

通过大语言模型发现强化学习算法的进化方法

Alkis Sygkounas, Amy Loutfi, Andreas Persson

机构 * Machine Perception and Interaction Lab, Örebro University(厄勒布鲁大学机器感知与交互实验室)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于进化算法发现强化学习算法的方法,通过搜索可执行的更新规则来发现新的算法,并通过超参数优化提升性能,实验表明其在多个基准上表现优异。

Comments accepted at GECCO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18773 2026-03-20 cs.LG cs.AI 88%

Automatic Configuration of LLM Post-Training Pipelines

大语言模型后训练流程的自动配置

Channe Chwa, Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoPipe框架,通过学习历史运行数据和贝叶斯优化,有效配置大语言模型后训练流程,减少计算成本并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13378 2026-03-17 cs.AI cs.CL cs.CY 88%

Do Large Language Models Get Caught in Hofstadter-Mobius Loops?

大型语言模型是否会陷入霍夫斯塔德-莫比乌斯循环?

Jaroslaw Hryszko

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(数学与计算机科学学院,雅盖隆大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨现代RLHF训练语言模型中存在霍夫斯塔德-莫比乌斯循环的矛盾,通过实验发现调整系统提示的框架可显著减少压迫性输出。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08640 2026-03-11 cs.SE cs.AI cs.LG 88%

PostTrainBench: Can LLM Agents Automate LLM Post-Training?

PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?

Ben Rank, Hardik Bhatnagar, Ameya Prabhu, Shira Eisenberg, Karina Nguyen, Matthias Bethge, Maksym Andriushchenko

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21189 2026-02-27 cs.LG cs.AI 88%

Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training

为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰

Anas Barakat, Souradip Chakraborty, Khushbu Pahwa, Amrit Singh Bedi

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Central Florida(佛罗里达中央大学)

专题命中 后训练与偏好优化 :LLM(title);post-training(title);large language model(abstract);language model(abstract)

AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。

Comments updated related work discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05890 2026-02-06 cs.LG cs.CL 88%

DFPO: Scaling Value Modeling via Distributional Flow towards Robust and Generalizable LLM Post-Training

DFPO:通过分布流扩展价值建模以实现鲁棒且可泛化的LLM后训练

Dingwei Zhu, Zhiheng Xi, Shihan Dou, Jiahan Li, Chenhao Huang, Junjie Ye, Sixian Li, Mingxu Chai, Yuhui Wang, Yajie Yang, Ming Zhang, Jiazheng Zhang, Shichun Liu, Caishuang Huang, Yunke Zhang, Yuran Wang, Tao Gui, Xipeng Qiu, Qi Zhang, Xuanjing Huang

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.CL、cs.LG

AI总结 DFPO通过分布流扩展价值建模,提升LLM后训练的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11104 2026-02-03 cs.CL cs.AI 88%

Enhancing LLM Reasoning via Non-Human-Like Reasoning Path Preference Optimization

通过非人类样式推理路径偏好优化增强大语言模型推理

Junjie Lu, Yuliang Liu, Chaofeng Qu, Wei Shen, Zhouhan Lin, Chuheng Zhang, Min Xu

机构 * University of Technology Sydney(悉尼技术大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) Microsoft Research(微软研究院) Nanjing University(南京大学) Shanghai Jiao Tong University(上海交通大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CGPO方法,通过置信度信号优化推理路径,提升大语言模型在代码和数学推理任务中的性能。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08842 2026-01-15 cs.CL cs.AI 88%

Resisting Correction: How RLHF Makes Language Models Ignore External Safety Signals in Natural Conversation

对抗修正:RLHF如何使语言模型在自然对话中忽视外部安全信号

Felipe Biava Cataneo

机构 * Felipe Biava Cataneo(独立研究者)

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(title,abstract);分类 cs.CL、cs.AI

AI总结 RLHF使语言模型在自然对话中忽视外部安全信号,影响安全纠正的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06700 2026-01-13 cs.CL cs.AI 88%

Characterising Toxicity in Generative Large Language Models

表征生成大语言模型中的毒性

Zhiyao Zhang, Yazan Mash'Al, Yuhan Wu

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(title);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了生成大语言模型在提示下的毒性输出生成程度及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22234 2026-01-07 cs.LG cs.AI 88%

DiRL: An Efficient Post-Training Framework for Diffusion Language Models

DiRL:一种高效的扩散语言模型后训练框架

Ying Zhu, Jiaxin Wan, Xiaoran Liu, Siyang He, Qiqi Wang, Xu Guo, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) OpenMoss Team(OpenMoss团队)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 DiRL是一种高效的扩散语言模型后训练框架,通过整合FlexAttention加速的分块训练与LMDeploy优化的推理,实现了高效的两阶段后训练,提升了在复杂推理任务如数学中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13070 2025-12-16 cs.AI cs.CL 88%

M-GRPO: Stabilizing Self-Supervised Reinforcement Learning for Large Language Models with Momentum-Anchored Policy Optimization

M-GRPO:通过动量锚定策略优化稳定大语言模型的自监督强化学习

Bizhe Bai, Hongming Wu, Peng Ye, Tao Chen

机构 * Shanghai Innovation Institute(上海创新研究院) College of Future Information Technology, Fudan(复旦大学未来信息技术学院) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 M-GRPO通过动量锚定策略优化和IQR过滤方法,稳定大语言模型的自监督强化学习训练,提升训练稳定性和性能。

Comments 7 pages, 5 figures,Accepted NeurIPS 2025 Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13765 2025-11-19 cs.LG cs.AI 88%

PROF: An LLM-based Reward Code Preference Optimization Framework for Offline Imitation Learning

Shengjie Sun, Jiafei Lyu, Runze Liu, Mengbei Yan, Bo Liu, Deheng Ye, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 后训练与偏好优化 :LLM(title);preference optimization(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10656 2025-11-17 cs.CL cs.AI 88%

Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models

Biao Liu, Ning Xu, Junming Yang, Xin Geng

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications(新一代人工智能技术及其交叉应用关键实验室) Ministry of Education(教育部)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16483 2025-11-13 cs.CL cs.AI 88%

Teaching Large Language Models to Maintain Contextual Faithfulness via Synthetic Tasks and Reinforcement Learning

Shuzheng Si, Haozhe Zhao, Cheng Gao, Yuzhuo Bai, Zhitong Wang, Bofei Gao, Kangyang Luo, Wenhao Li, Yufei Huang, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun

机构 * Shuzheng Si(上海交通大学) Haozhe Zhao(上海交通大学) Cheng Gao(上海交通大学) Yuzhuo Bai(上海交通大学) Zhitong Wang(上海交通大学) Bofei Gao(上海交通大学) Kangyang Luo(上海交通大学) Wenhao Li(上海交通大学) Yufei Huang(上海交通大学) Gang Chen(上海交通大学) Fanchao Qi(上海交通大学) Minjia Zhang(上海交通大学) Baobao Chang(上海交通大学) Maosong Sun(复旦大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments AAAI 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01308 2025-10-30 cs.AI cs.CL cs.DB 88%

GradeSQL: Test-Time Inference with Outcome Reward Models for Text-to-SQL Generation from Large Language Models

Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian, Tommaso Di Noia

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01135 2025-10-02 cs.LG cs.CL 88%

Prompt Curriculum Learning for Efficient LLM Post-Training

Zhaolin Gao, Joongwon Kim, Wen Sun, Thorsten Joachims, Sid Wang, Richard Yuanzhe Pang, Liang Tan

机构 * Meta Superintelligence Labs(Meta超智能实验室) Cornell University(康奈尔大学) University of Washington(华盛顿大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24261 2025-09-30 cs.AI cs.LG 88%

Risk-Sensitive RL for Alleviating Exploration Dilemmas in Large Language Models

Yuhua Jiang, Jiawei Huang, Yufeng Yuan, Xin Mao, Yu Yue, Qianchuan Zhao, Lin Yan

机构 * Tsinghua University(清华大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14460 2025-08-21 cs.LG cs.CL 88%

DuPO: Enabling Reliable LLM Self-Verification via Dual Preference Optimization

Shuaijie She, Yu Bao, Yu Lu, Lu Xu, Tao Li, Wenhao Zhu, Shujian Huang, Shanbo Cheng, Lu Lu, Yuxuan Wang

机构 * Nanjing University(南京大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);分类 cs.CL、cs.LG

Comments 18 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05613 2025-08-08 cs.CL cs.AI 88%

Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models

Haitao Hong, Yuchen Yan, Xingyu Wu, Guiyang Hou, Wenqi Zhang, Weiming Lu, Yongliang Shen, Jun Xiao

机构 * Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Project Page: https://zju-real.github.io/cooper Code: https://github.com/zju-real/cooper

详情

展开后加载摘要…

URL PDF HTML 收藏