arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-04 至 2026-05-04 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4 篇

2604.07669 2026-05-04 cs.LG cs.AI cs.CE 90%

Reinforcement Learning with LLM-Guided Action Spaces for Synthesizable Lead Optimization

基于LLM引导的动作空间的强化学习用于可合成先导优化

Tao Li, Kaiyuan Hou, Tuan Vinh, Monika Raj, Zhichun Guo, Carl Yang

机构 * Emory University(埃默里大学) University of Oxford(牛津大学) Independent Researcher(独立研究者)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolReAct框架,通过合成约束的动作空间和GRPO算法优化先导分子,提升性质同时保证合成可行性,实现高效分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00224 2026-05-04 cs.AI 89%

TUR-DPO: Topology- and Uncertainty-Aware Direct Preference Optimization

TUR-DPO:基于拓扑和不确定性的直接偏好优化

Abdulhady Abas Abdullah, Fatemeh Daneshfar, Seyedali Mirjalili, Mourad Oussalah

机构 * Artificial Intelligence and Innovation Centre, University of Kurdistan, Erbil, Iraq(人工智能与创新中心,乌尔米耶大学,伊拉克) Department of Computer Engineering, University of Kurdistan, Iran(计算机工程系,乌尔米耶大学,伊朗) Centre for Artificial Intelligence Research and Optimisation, Torrens University Australia, Brisbane, Australia(人工智能研究与优化中心,塔伦斯大学澳大利亚,布里斯班,澳大利亚) Research and Innovation Center, Obuda University, Budapest 1034, Hungary(研究与创新中心,奥布达大学,布达佩斯1034,匈牙利) Center for Machine Vision and Signal Analysis (CMVS), University of Oulu, Finland(机器视觉与信号分析中心(CMVS),奥卢大学,芬兰)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 TUR-DPO通过引入轻量级推理拓扑和结合语义忠实度、效用和拓扑质量,提升偏好对齐的稳定性与鲁棒性,同时保持训练简洁性和无需在线回滚。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10990 2026-05-04 cs.GT cs.LG econ.TH math.ST stat.ML stat.TH 86%

Statistical Impossibility and Possibility of Aligning LLMs with Human Preferences: From Condorcet Paradox to Nash Equilibrium

大语言模型与人类偏好的统计不可能性与可能性:从康德斯悖论到纳什均衡

Kaizhao Liu, Qi Long, Zhekun Shi, Weijie J. Su, Jiancong Xiao

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) Princeton University(普林斯顿大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了对齐大语言模型与人类偏好的统计限制,证明在一般概率偏好模型下,康德斯循环几乎必然存在,从而表明基于奖励的方法无法完全对齐偏好。同时,研究了非奖励方法下LLM采用混合策略的条件,证明在Luce模型下,少数群体偏好得以保留的统计可能性。

Comments Accepted for publication in the Annals of Statistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02125 2026-05-04 cs.AI cs.LG 81%

Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies

偏好目标微调:冻结策略的后训练作为潜在控制

Guangyu Zhao, Kewei Lian, Haoxuan Ru, Borong Zhang, Haowei Lin, Zhancun Mu, Haobo Fu, Qiang Fu, Shaofei Cai, Zihao Wang, Yitao Liang

机构 * Peking University(北京大学) Tencent AI Lab(腾讯AI实验室)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出偏好目标微调(PGT),通过冻结策略并优化潜在目标,使策略在无监督下适应任务偏好,实现在Minecraft SkillForge基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏