arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2604.13079 2026-04-16 cs.CY cs.AI cs.GT cs.LG 73%

Alignment as Institutional Design: From Behavioral Correction to Transaction Structure in Intelligent Systems

对齐作为制度设计:从行为修正到智能系统中的交易结构

Rui Chai

机构 * Shanghai Sanda University(上海沙达大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出将AI对齐视为制度设计,通过内部交易结构使对齐行为成为各组件的低成本策略,将对齐问题转化为政治经济学问题。

Comments This is Paper 5 in a 10-paper series on Super-Alignment via Wuxing Institutional Architecture. It shifts alignment from external behavioral correction to internal institutional design, making aligned behavior the lowest-cost equilibrium

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10476 2026-04-10 cs.CL cs.AI 73%

Learning to Negotiate: Multi-Agent Deliberation for Collective Value Alignment in LLMs

学习协商:多智能体协商以实现大语言模型中的集体价值对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Nima Asgharbeygi, Jad Tarifi

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于多智能体协商的对齐框架,通过集体代理(CA)目标提升大语言模型的集体价值对齐能力,并改进冲突解决能力,实验表明其在冲突解决性能上有显著提升。

Comments To appear in LREC 2026 2nd DELITE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01312 2026-04-03 cs.CL cs.AI 73%

Preference learning in shades of gray: Interpretable and bias-aware reward modeling for human preferences

灰度偏好学习:可解释且偏见意识的奖励建模用于人类偏好

Simona-Vasilica Oprea, Adela Bâra

机构 * Department of Economic Informatics and Cybernetics, Bucharest University of Economic Studies(布加勒斯特经济研究大学经济信息学与控制论系)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型中人类偏好的学习难题,提出特征增强框架以捕捉人类判断的多维特性,通过评估多种大语言模型,展示了改进的奖励建模方法在准确性和可解释性上的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19413 2026-03-31 cs.LG cs.AI cs.CV 73%

UniGame: Turning a Unified Multimodal Model Into Its Own Adversary

UniGame: 将统一多模态模型转变为自身对手

Zhaolong Su, Wang Lu, Hao Chen, Sharon Li, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Independent(独立研究者) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 UniGame通过自对抗框架提升多模态模型的一致性与鲁棒性,显著增强理解、生成和对抗鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24093 2026-03-26 cs.LG cs.AI 73%

Towards Effective Experiential Learning: Dual Guidance for Utilization and Internalization

迈向有效的经验学习:利用与内化双指导

Fei Bai, Zhipeng Chen, Chuan Hao, Ming Yang, Ran Tao, Bryan Dai, Wayne Xin Zhao, Jian Yang, Hongteng Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学首都人工智能学院) IQuest Research(IQuest研究) Beihang University(北京航空航天大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGO框架,通过外部和内部经验指导强化学习,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24034 2026-03-26 cs.CL cs.AI 73%

From Oracle to Noisy Context: Mitigating Contextual Exposure Bias in Speech-LLMs

从 oracle 到噪声上下文:缓解语音大语言模型中的上下文暴露偏差

Xiaoyong Guo, Nanjie Li, Zijie Zeng, Kai Wang, Hao Huang, Haihua Xu, Wei Shi

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Urumqi, China(丝绸之路多语种认知计算联合国际研究实验室,乌鲁木齐,中国) Timekettle

专题命中 后训练与偏好优化 :SFT(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出统一训练框架,通过教师错误知识、上下文dropout和直接偏好优化提升语音大语言模型在真实历史下的鲁棒性,实验表明在预测历史解码中性能提升,且在无关上下文攻击下表现更稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12299 2026-03-24 cs.CL cs.AI 73%

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

MobileIPL: 通过迭代偏好学习增强移动代理的思维过程

Kun Huang, Weikai Xu, Yuxuan Liu, Quandong Wang, Pengzhi Gao, Wei Liu, Jian Luan, Bin Wang, Bo An

机构 * Xiaomi Inc.(小米公司) Nanyang Technological University(南洋理工大学) Gaoling School of Artificial Intelligence, Renmin University of China(人民大学人工智能学院)

专题命中 后训练与偏好优化 :pretraining(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MobileIPL,通过迭代偏好学习构建CoaT树,结合规则奖励和反馈反向传播,提升移动代理在GUI任务中的推理能力与泛化能力。

Comments 9 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16157 2026-03-18 cs.LG cs.AI 73%

DyJR: Preserving Diversity in Reinforcement Learning with Verifiable Rewards via Dynamic Jensen-Shannon Replay

DyJR: 通过动态Jensen-Shannon回放在强化学习中保持多样性

Long Li, Zhijian Zhou, Tianyi Wang, Weidi Xu, Zuming Huang, Wei Chu, Zhe Wang, Shirui Pan, Chao Qu, Yuan Qi

机构 * Griffith University, Australia(澳大利亚格里菲斯大学) Fudan University, China(复旦大学) Beijing University of Post(北京邮电大学) Shanghai Innovation Institute, China(上海创新研究院) Shanghai Academy of Artificial Intelligence for Science, China(上海人工智能科学研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DyJR方法,通过动态参考分布和Jensen-Shannon散度正则化,在强化学习中保持多样性,提升数学推理和Text-to-SQL任务性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12228 2026-03-13 cs.LG cs.AI 73%

Neural Thickets: Diverse Task Experts Are Dense Around Pretrained Weights

神经丛林:多样化的任务专家在预训练权重周围密集分布

Yulu Gan, Phillip Isola

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 后训练与偏好优化 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种简单并行的后训练方法,通过随机扰动和多数投票发现预训练权重周围密集分布的任务专家,提升大规模模型性能。

Comments codes are provided at https://github.com/sunrainyg/RandOpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10535 2026-03-12 cs.LG cs.CL 73%

Tackling Length Inflation Without Trade-offs: Group Relative Reward Rescaling for Reinforcement Learning

应对长度膨胀而不产生权衡:用于强化学习的群体相对奖励重缩放

Zichao Li, Jie Lou, Fangchen Dong, Zhiyuan Fan, Mengjie Ren, Hongyu Lin, Xianpei Han, Debing Zhang, Le Sun, Yaojie Lu, Xing Yu

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 GR$^3$通过乘法重缩放范式解决强化学习中的长度膨胀问题,实现通用、连续且奖励依赖的门控机制,有效减少冗余推理并提升训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05630 2026-03-11 cs.LG cs.CL 73%

Rewards as Labels: Revisiting RLVR from a Classification Perspective

奖励作为标签:从分类视角重新审视RLVR

Zepeng Zhai, Meilin Chen, Jiaxuan Zhao, Junlang Qian, Lei Shen, Yuan Lu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出REAL框架,将可验证奖励视为分类标签,通过改进梯度分配提升策略优化效率,实验证明其在数学推理任务中优于GRPO和DAPO等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08412 2026-03-10 cs.CL cs.AI 73%

Aligning to Illusions: Choice Blindness in Human and AI Feedback

对幻觉的对齐:人类和AI反馈中的选择盲区

Wenbin Wu

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示RLHF中偏好构建的问题,显示人类和AI反馈中的选择盲区受上下文影响,导致奖励信号失真。

Comments 16 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15849 2026-03-09 cs.CL cs.AI 73%

IntelliAsk: Learning to Ask High-Quality Research Questions via RLVR

IntelliAsk: 通过RLVR学习生成高质量的研究问题

Karun Sharma, Vidushee Vats, Shengzhi Li, Yuxiang Wang, Zhongtian Sun, Prayag Tiwari

专题命中 后训练与偏好优化 :LLM(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 IntelliAsk通过RLVR技术提升生成问题的质量,生成更深入、基于证据的问题,优于现有基线模型。

Comments 24 Pages, v2, Abstract Modified

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04439 2026-03-06 cs.AI cs.LG 73%

CoRPO: Adding a Correctness Bias to GRPO Improves Generalization

CoRPO:在GRPO中添加正确性偏差以提高泛化能力

Anisha Garg, Claire Zhang, Nishit Neema, David Bick, Ganesh Venkatesh, Joel Hestness

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CoRPO通过引入正确性偏差改进GRPO,提升模型在跨领域任务中的泛化能力与推理稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03000 2026-03-04 cs.LG cs.AI 73%

Why Does RLAIF Work At All?

为什么RLAIF真的有效?

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 后训练与偏好优化 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出潜在价值假设,解释RLAIF通过激活预训练编码的价值方向实现自我改进,并统一了相关实证发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02232 2026-03-04 cs.LG cs.AI 73%

Beyond Binary Preferences: A Principled Framework for Reward Modeling with Ordinal Feedback

超越二元偏好:基于顺序反馈的奖励建模原理框架

Amirhossein Afsharrad, Ruida Zhou, Luca Viano, Sanjay Lall, Mohammad Ghavamzadeh

机构 * Stanford University(斯坦福大学) Amazon AGI(亚马逊人工智能研究) EPFL(瑞士联邦理工学院) Qualcomm AI Research(高通人工智能研究) Aktus AI

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于顺序反馈的奖励建模原理框架,通过离散顺序回归方法,学习阈值参数以捕捉偏好顺序结构,实现更有效的细粒度人类反馈利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17616 2026-03-03 cs.LG cs.AI 73%

Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs

稳定异步性:用于大语言模型的方差控制的非策略强化学习

Luke J. Huang, Zhuoyang Zhang, Qinghao Hu, Shang Yang, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 VCPO通过动态调整学习率和最小方差基线,提升大语言模型异步训练的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01409 2026-03-03 cs.AI cs.LG cs.SE 73%

MIST-RL: Mutation-based Incremental Suite Testing via Reinforcement Learning

MIST-RL:基于突变的增量测试套件生成 via 强化学习

Sicheng Zhu, Jiajun Wang, Jiawei Ai, Xin Li

机构 * Fudan University, Shanghai, China(复旦大学) University of Science and Technology of China(中国科学技术大学) Xi'an Jiaotong University, Xi'an, China(西安交通大学) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MIST-RL通过强化学习优化测试生成,提升突变得分并减少测试用例数量,改进代码验证效果。

Comments Preprint. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19919 2026-03-02 cs.CL cs.LG 73%

Janus-Q: End-to-End Event-Driven Trading via Hierarchical-Gated Reward Modeling

Janus-Q:通过分层门控奖励建模实现端到端的事件驱动交易

Xiang Li, Zikai Wei, Yiyan Qi, Wanyun Zhou, Xiang Liu, Penglei Sun, Jian Guo, Yongqi Zhang, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) International Digital Economy Academy(国际数字经济学院)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 Janus-Q通过分层门控奖励模型实现端到端事件驱动交易,提升金融新闻事件作为主要决策单元,提高交易决策的稳定性和盈利能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19416 2026-02-24 cs.AI cs.LG 73%

IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking

IR$^3$:基于可解释性强化学习的对抗性检测与缓解方法

Mohammad Beigi, Ming Jin, Junshan Zhang, Jiaxin Zhang, Qifan Wang, Lifu Huang

机构 * UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) Salesforce(Salesforce公司) Meta AI

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 IR3通过对比逆强化学习重建隐含奖励并修正模型,有效识别和缓解奖励黑客问题,提升模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17338 2026-02-20 cs.AI cs.LG stat.ML 73%

Capturing Individual Human Preferences with Reward Features

通过奖励特征捕捉个体人类偏好

André Barreto, Vincent Dumoulin, Yiran Mao, Mark Rowland, Nicolas Perez-Nieves, Bobak Shahriari, Yann Dauphin, Doina Precup, Hugo Larochelle

机构 * Google DeepMind(谷歌DeepMind)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过奖励特征捕捉个体偏好,提出自适应奖励模型架构,展示其在不同用户偏好下的有效性。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16117 2026-02-17 cs.LG cs.AI cs.CV 73%

DiffusionNFT: Online Diffusion Reinforcement with Forward Process

DiffusionNFT: 在线扩散强化学习与正向过程

Kaiwen Zheng, Huayu Chen, Haotian Ye, Haoxiang Wang, Qinsheng Zhang, Kai Jiang, Hang Su, Stefano Ermon, Jun Zhu, Ming-Yu Liu

机构 * Tsinghua University(清华大学) NVIDIA Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 DiffusionNFT通过正向过程优化扩散模型,结合正负生成对比提升强化学习效率,无需CFG且比FlowGRPO更高效。

Comments ICLR 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08829 2026-02-10 cs.CL cs.AI 73%

WildReward: Learning Reward Models from In-the-Wild Human Interactions

WildReward: 从真实世界的人类交互中学习奖励模型

Hao Peng, Yunjia Qi, Xiaozhi Wang, Zijun Yao, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildReward,通过真实世界用户交互直接学习奖励模型,无需偏好对,实现更优的校准和一致性,并在多种任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07422 2026-02-10 cs.CR cs.AI cs.CL 73%

Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model

通过在线强化学习与漏洞奖励模型实现安全代码生成

Tianyi Wu, Mingzhe Du, Yue Liu, Chengran Yang, Terry Yue Zhuo, Jiaheng Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Singapore Management University(新加坡管理学院) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SecCoderX通过在线强化学习与漏洞奖励模型提升代码安全性,实现功能与安全性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05494 2026-02-10 cs.LG cs.AI 73%

A Unified Framework for Rethinking Policy Divergence Measures in GRPO

在GRPO中重新思考策略分歧度度量的统一框架

Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra Habchi, Qi Zhu, Matthias Gallé, Chao Huang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的裁剪框架,通过KL3估计器改进GRPO,提升训练稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25416 2026-02-10 cs.CL cs.AI cs.SD 73%

Emotion-Aligned Generation in Diffusion Text to Speech Models via Preference-Guided Optimization

通过偏好引导优化实现扩散文本到语音模型的情感对齐生成

Jiacheng Shi, Hongfei Du, Yangfan He, Y. Alicia Hong, Ye Gao

专题命中 后训练与偏好优化 :post-training(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EASPO框架,通过偏好引导优化实现扩散文本到语音模型的情感对齐生成,提升语音的表达性和自然度。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03048 2026-02-09 cs.LG cs.AI 73%

CoBA-RL: Capability-Oriented Budget Allocation for Reinforcement Learning in LLMs

CoBA-RL:面向大语言模型强化学习的基于能力的预算分配

Zhiyuan Yao, Yi-Kai Zhang, Yuxin Chen, Yueqing Sun, Zishan Xu, Yu Yang, Tianhao Hu, Qi Gu, Hui Su, Xunliang Cai

机构 * Zhejiang University(浙江大学) Nanjing University(南京大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 CoBA-RL通过基于能力的价值函数和堆贪心策略,优化大语言模型强化学习中的预算分配,提升训练效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03876 2026-02-05 cs.LG cs.AI 73%

GOPO: Policy Optimization using Ranked Rewards

GOPO:基于排名奖励的策略优化

Kyuseong Choi, Dwaipayan Saha, Woojeong Kim, Anish Agarwal, Raaz Dwivedi

机构 * Cornell Tech, Cornell University, NY, United States(康奈尔科技、康奈尔大学,纽约,美国) Columbia University, NY, United States(哥伦比亚大学,纽约,美国)

专题命中 后训练与偏好优化 :LLM(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 GOPO通过使用奖励排名而非绝对值,提高了不可验证任务中策略优化的性能和效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07182 2026-02-04 cs.LG cs.AI 73%

PRPO: Aligning Process Reward with Outcome Reward in Policy Optimization

PRPO:在策略优化中对过程奖励与结果奖励的对齐

Ruiyi Ding, Yongxuan Lv, Xianhui Meng, Jiahe Song, Chao Wang, Chen Jiang, Yuan Cheng

机构 * Shanghai University(上海大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学) Artificial Intelligence Incubation and Innovation Institute, Fudan University(复旦大学人工智能孵化与创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PRPO通过结合结果可靠性与过程级指导,在无批评者框架中提升策略优化效率,实现对过程奖励与结果奖励的对齐,从而提高模型在多步推理任务中的性能。

Comments 8 pages, 2 figures Code is available at: https://github.com/SchumiDing/srpocode

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01884 2026-02-03 cs.AI cs.LG 73%

Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models

熵引导的数据高效训练用于多模态推理奖励模型

Shidong Yang, Tongwen Huang, Hao Wen, Yong Wang, Li Chen, Xiangxiang Chu

机构 * School of Software, Tsinghua University(清华大学软件学院) AMAP, Alibaba Group(阿里巴巴集团AMAP)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出熵引导训练方法,通过熵指导数据筛选和训练策略提升多模态推理奖励模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏