arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4516 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4516 篇

2606.04807 2026-06-04 cs.AI cs.CL cs.CY cs.LG 86%

BiasGRPO: Stabilizing Bias Mitigation in High-Variance Reward Landscapes via Group-Relative Policy Optimization

BiasGRPO:通过组相对策略优化在高方差奖励景观中稳定偏差缓解

Saket Reddy, Ke Yang, ChengXiang Zhai

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出BiasGRPO框架,利用组相对策略优化(GRPO)通过归一化组内奖励来稳定大语言模型的社会偏差缓解,优于DPO和PPO。

Comments Accepted to Findings of the ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10201 2026-05-26 cs.LG cs.AI cs.CL 86%

Future-KL Regularized GRPO: Process-Level Credit Assignment from $f$-Divergence Regularization

未来KL正则化GRPO:基于f-散度正则化的过程级信用分配

Jiarui Yao, Ruida Wang, Hao Bai, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出未来KL正则化策略优化(FRPO),通过因果未来正则化回报修正GRPO中局部KL损失缺失的梯度信号,在数学推理任务中提升pass@16并保持更高熵和更低策略漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21319 2026-05-19 cs.CL cs.AI cs.LG 86%

RLBFF: Binary Flexible Feedback to bridge between Human Feedback & Verifiable Rewards

RLBFF:二进制灵活反馈用于连接人类反馈与可验证奖励

Zhilin Wang, Jiaqi Zeng, Olivier Delalleau, Ellie Evans, Daniel Egert, Hoo-Chang Shin, Felipe Soares, Yi Dong, Oleksii Kuchaiev

机构 * NVIDIA

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLBFF结合人类偏好与规则验证,提升奖励模型对响应质量的精准捕捉,优于Bradley-Terry模型,在RM-Bench和JudgeBench上取得优异成绩,且支持用户自定义反馈原则。

Comments Published at ICLR 2026, 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18512 2026-04-21 cs.CV 86%

S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models

S2H-DPO:面向视觉-语言模型的硬度感知偏好优化

Nitish Shukla, Surgan Jandial, Arun Ross

机构 * Michigan State University(密歇根州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :language model(title,abstract);preference optimization(title)

AI总结 本文提出S2H-DPO框架,通过三级层次推理构建多图象偏好数据,提升多图象推理性能,同时保持单图象推理能力,推动视觉偏好对齐的前沿发展。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01483 2026-01-06 cs.CV 86%

Unified Generation and Self-Verification for Vision-Language Models via Advantage Decoupled Preference Optimization

通过优势解耦偏好优化实现视觉语言模型的统一生成与自验证

Xinyu Qiu, Heng Jia, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Yi Yang, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Venus Team, Ant Group(蚂蚁集团 Venus 团队)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(title)

AI总结 ADPO通过统一生成与自验证的强化学习框架,提升视觉语言模型的验证性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05031 2025-12-09 cs.IR 86%

LSRP: A Leader-Subordinate Retrieval Framework for Privacy-Preserving Cloud-Device Collaboration

LSRP: 一种用于隐私保护云-设备协作的领导者-下属检索框架

Yingyi Zhang, Pengyue Jia, Xianneng Li, Derong Xu, Maolin Wang, Yichao Wang, Zhaocheng Du, Huifeng Guo, Yong Liu, Ruiming Tang, Xiangyu Zhao

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 LSRP通过领导者-下属检索框架提升云-设备协作的隐私保护性能,增强云模型与设备模型的协同能力。

Comments Accepted at KDD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04314 2025-03-26 cs.CV 86%

Aesthetic Post-Training Diffusion Models from Generic Preferences with Step-by-step Preference Optimization

Zhanhao Liang, Yuhui Yuan, Shuyang Gu, Bohan Chen, Tiankai Hang, Mingxi Cheng, Ji Li, Liang Zheng

专题命中 后训练与偏好优化 :preference optimization(title,abstract);post-training(title)

Comments CVPR 2025. Project Page: https://rockeycoss.github.io/spo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06769 2025-03-19 cs.SE 86%

Enhancing Trust in Language Model-Based Code Optimization through RLHF: A Research Design

Jingzhi Gong

专题命中 后训练与偏好优化 :language model(title,abstract);RLHF(title)

Comments Accepted by the Doctoral and Early Career Symposium (DECS) at ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10400 2025-02-25 cs.CL cs.AI cs.LG 86%

Reinforcement Learning Enhanced LLMs: A Survey

Shuhe Wang, Shengyu Zhang, Jie Zhang, Runyi Hu, Xiaoya Li, Tianwei Zhang, Jiwei Li, Fei Wu, Guoyin Wang, Eduard Hovy

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09401 2025-02-12 cs.LG cs.AI cs.CL math.OC stat.ML 86%

Reinforcement Learning from Human Feedback with Active Queries

Kaixuan Ji, Jiafan He, Quanquan Gu

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 28 pages, 1 figure, 4 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02900 2024-11-06 cs.LG cs.AI cs.CL 86%

Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms

Rafael Rafailov, Yaswanth Chittepu, Ryan Park, Harshit Sikchi, Joey Hejna, Bradley Knox, Chelsea Finn, Scott Niekum

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments 30 pages, 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18571 2024-03-07 cs.LG cs.AI cs.CL stat.ML 86%

Arithmetic Control of LLMs for Diverse User Preferences: Directional Preference Alignment with Multi-Objective Rewards

Haoxiang Wang, Yong Lin, Wei Xiong, Rui Yang, Shizhe Diao, Shuang Qiu, Han Zhao, Tong Zhang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments The code and model are released at https://github.com/Haoxiang-Wang/directional-preference-alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10893 2024-02-19 cs.LG cs.AI cs.CL 86%

RLVF: Learning from Verbal Feedback without Overgeneralization

Moritz Stephan, Alexander Khazatsky, Eric Mitchell, Annie S Chen, Sheryl Hsu, Archit Sharma, Chelsea Finn

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09595 2026-08-11 cs.AI 新提交 85%

From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization

从扫描到缝合:交错跨块后训练量化

Achille Jacquemond, Yuma Ichikawa, Akira Sakai

机构 * Fujitsu Limited(富士通公司) RIKEN Center for AIP(理化学研究所先进智能项目中心) Tokai University(东海大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型的分块后训练量化,提出交错跨块量化方法,通过重新处理块边界降低量化困惑度,提升了三比特及GPTQ等量化方案的性能。

Comments 34 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08224 2026-08-11 cs.LG 新提交 85%

Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training

控制多样化强化微调:解耦RL后训练的共享控制瓶颈

Binwen Tan, Jingchao Wang, Dengzhe Hou, Lingyu Jiang, Zeyuan Wu, Yunhan Shen, Fangzhou Lin, Kazunori Yamada, Atsushi Koike

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 本研究提出CD-RFT方法,定义后训练控制系数揭示RL后训练的共享控制瓶颈,通过正则化减少控制坍缩,在Qwen2.5-7B等模型上实现控制解耦与多任务能力提升,效果可迁移至Llama-3.2-3B。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07905 2026-08-11 cs.AI cs.RO 新提交 85%

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

GraphThink:用于长视距具身任务规划的图增强大语言模型思维

Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 GraphThink框架结合任务图与场景图,通过上下文提示、迭代优化、GRPO奖励设计及事件驱动重规划,在ALFRED基准上实现最优性能,具强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07019 2026-08-10 cs.AI 新提交 85%

ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

ReQuant:用于训练后量化的固定网格离散细化

Yongge Ma, Guoan Wang, Feiyu Wang, Yaoming Li, Qian Zhang, Zihan Yan, Yinjun Han, Tong Yang

机构 * School of Computer Science, Peking University(北京大学计算机学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Physics, Peking University(北京大学物理学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Central Research Institute, ZTE Corporation(中兴公司中央研究院)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ReQuant是用于训练后量化(PTQ)的无反向传播固定网格细化方法,可作为即插即用后处理阶段,提升各类PTQ初始化器生成的量化模型性能,在低位宽下增益显著。

Comments 10 pages, 3 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01715 2026-08-04 cs.AI 版本更新 85%

Distributionally Robust Listwise Preference Optimization

分布鲁棒列表偏好优化

Xudong Wu, Jian Qian, Pangpang Liu, Vaneet Aggarwal, Jiayu Chen

机构 * The University of Hong Kong(香港大学) Yale University(耶鲁大学) Purdue University(普渡大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对列表偏好排序标签不确定性,提出点态全变差鲁棒Plackett-Luce目标,将内层最大化简化为排序,在离线和在线设置中均具有理论保证,实验表明能保持干净标签性能并提升噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00025 2026-08-04 cs.CL 版本更新 85%

TAB-PO: Preference Optimization with a Token-Level Adaptive Barrier for Token-Critical Structured Generation

TAB-PO:面向Token关键结构化生成的具有Token级自适应障碍的偏好优化

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Sreeraj Ramachandran, Elyas Irankhah, Aimee Kendall Roundtree

机构 * Yale University(耶鲁大学) Texas State University(德克萨斯州立大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 针对结构化预测中偏好与拒绝对象仅少数token不同导致的梯度稀释和token侵蚀问题,提出基于混淆感知偏好构建和Token级自适应障碍的TAB-PO方法,在SciERC任务上显著提升关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20057 2026-07-23 q-bio.BM cs.LG 新提交 85%

Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design

用于功能性抗体设计的抗原特异性抗体多模态基础模型

Xiaoliang Shi, Zichen Wang, Runze Ma, Zhongyue Zhang, Shuangjia Zheng

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 该研究针对抗原特异性抗体设计难题,引入AAMFM多模态基础模型,通过跨模态适配器整合抗原信息,用校准直接偏好优化微调,实现抗体 - 抗原相互作用联合建模,实验证明其在功能性抗体设计中性能最优,有抗原特异性抗体工程潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13315 2026-07-23 cs.CL 版本更新 85%

Meta-Learning Preferences for Multilingual LLM Alignment

多语言语言模型对齐的元学习偏好

Jiaying Lin, Seongho Son, Nam Phuong Tran, Long Tran-thanh, Ilija Bogunovic, Debmalya Mandal

机构 * University of Warwick(华威大学) University College London(伦敦大学学院) University of Basel(巴塞尔大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对多语言环境下低资源语言对齐数据不足问题,提出元学习框架,利用其他语言偏好数据学习可转移初始化,经理论和实验验证,该方法在极低资源设置下比基线方法胜率最多提高28%,且在多场景表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18304 2026-07-22 cs.LG 新提交 85%

TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化

Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang

机构 * Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所) MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室) Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型在自闭症干预对话中的谄媚问题,提出最小编辑数据增强策略及令牌级差异直接偏好优化方法,通过加权差异令牌、降权共享令牌抑制背景漂移,经实验验证该方法能在减轻谄媚与保留干预能力间达较好平衡。

Comments commited to EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02374 2026-07-15 cs.AI 版本更新 85%

DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models

DRIFTLENS: 测量个性化语言模型中记忆引发的推理漂移

Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract_cn);post-training(abstract);分类 cs.AI

AI总结 提出DRIFTLENS框架,通过将推理步骤映射到价值类别并比较有无用户属性记忆的轨迹,量化个性化语言模型中的推理漂移,发现记忆会引发中等至大的推理变化,且现有后训练方法仅部分缓解。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11434 2026-07-14 cs.CL cs.CV 新提交 85%

Direct Image-to-Modern Vietnamese Translation of Han-Nom Manuscripts via Multimodal RLHF Preference Alignment

通过多模态基于人类反馈的强化学习偏好对齐实现汉喃手稿到现代越南语的直接图像翻译

Thi Kim Trang Vo, Nghia Hieu Nguyen, Ha Minh Tan

专题命中 后训练与偏好优化 :RLHF(title,abstract);SFT(abstract);preference optimization(abstract);分类 cs.CL

AI总结 针对汉喃手稿到现代越南语翻译的挑战,提出多模态基于人类反馈的强化学习偏好对齐框架,结合四个流生成越南语,比较PPO、DPO和KTO,结果显示各有优劣,且多模态偏好优化能补充监督学习提升翻译质量。

Comments Accepted Paper at 2026 International Conference on Multimedia Analysis and Pattern Recognition (MAPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10848 2026-07-14 cs.LG 新提交 85%

Predictive Divergence Masks for LLM RL

用于大语言模型强化学习的预测性散度掩码

Xiangxin Zhou, Jiarui Yao, Penghui Qi, Bowen Ping, Jiaqi Tang, Haonan Wang, Tianyu Pang

机构 * Tencent Hunyuan(腾讯混元) UIUC(伊利诺伊大学厄巴纳 - 香槟分校) NUS(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型强化学习中PPO方向标准不足,提出预测性散度掩码,通过判断策略梯度步骤对散度的影响改进训练,针对离散softmax策略推导预测并开发轻量级估计器,提升不同模型规模和精度设置下的强化学习训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01392 2026-07-07 cs.CL 新提交 85%

Multi-Objective Exploration and Preference Optimization via Mutual Information

基于互信息的多目标探索与偏好优化

Hongyan Xie, Yikun Ban, Ruiyu Fang, Zixuang Huang, Deqing Wang, Jianxin Li, Shuangyong Song

机构 * School of Computer, Beihang University(北京航空航天大学计算机学院) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰AGI实验室,中国电信人工智能技术(北京)有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MI-EPO框架,通过最大化生成响应、偏好反馈和偏好向量的联合条件互信息,统一多目标探索与对齐,实现可控且稳定的多目标权衡。

Comments Accepted at ECML/PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09305 2026-06-30 cs.LG 85%

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

基于强化学习的LLM推理中的奖励建模:设计、挑战与评估

Pei-Chi Pan, Yingbin Liang, Sen Lin

机构 * University of Houston(得克萨斯大学) The Ohio State University(俄亥俄州立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了奖励建模在提升LLM推理性能中的关键作用,提出了一种以推理为中心的分类视角,分析了奖励机制、奖励黑客问题及评估挑战,旨在构建更稳健、可验证的推理模型。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=TDfrN1TbGH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17056 2026-06-16 cs.CL 新提交 85%

The Value Axis: Language Models Encode Whether They're on the Right Track

价值轴:语言模型编码它们是否在正确的轨道上

Nick Jiang, Isaac Kauvar, Jack Lindsey

机构 * Stanford University(斯坦福大学) Anthropic

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);preference optimization(abstract);分类 cs.CL

AI总结 通过构建Qwen3-8B的“价值轴”,发现语言模型内部追踪当前轨迹的成功概率,并影响自信、自我纠正和探索行为。

Comments Code repository: https://github.com/nickjiang2378/value-axis

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12590 2026-06-12 cs.CV cs.AI 新提交 85%

Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs

分析与改进医学LVLMs中的细粒度偏好优化

Shayan Mohammadizadehsamakosh, Pritam Sarkar, Leonid Sigal, Ali Etemad, Elham Dolatabadi

机构 * York University(约克大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Queen’s University(女王大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对医学大视觉语言模型在事实一致性、视觉定位和临床对齐方面的不足,提出一种结合双向令牌级KL正则化和视觉对比定位目标的细粒度在线偏好优化框架,通过最小编辑模型输出构建偏好对,仅修正临床错误片段,显著提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07150 2026-06-12 cs.LG cond-mat.mtrl-sci 版本更新 85%

PLaID++: A Preference Aligned Language Model for Targeted Inorganic Materials Design

PLaID++: 一种用于定向无机材料设计的偏好对齐语言模型

Andy Xu, Rohan Desai, Larry Wang, Ethan Ritz, Gabriel Hope

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :language model(title);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 提出PLaID++,通过对称性感知的Wyckoff文本表示和温度缩放熵正则化,结合可验证奖励的强化学习,实现稳定、新颖且满足空间群属性的晶体生成,比先前方法效率提高约50%。

Comments Code available at https://github.com/andaero/PLaID, model weights at https://huggingface.co/HOPE-Lab-HMC/PLaID

详情

展开后加载摘要…

URL PDF HTML 收藏