arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 11 篇

2603.21016 2026-05-01 cs.CL cs.AI cs.LG 89%

Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO

通过排列感知GRPO缓解大语言模型中的选择偏差

Jinquan Zheng, Jia Yuan, Jiacheng Yao, Chenyang Gu, Pujun Zheng, Guoxiu He

机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PA-GRPO方法,通过强制排列一致的语义推理来缓解大语言模型中的选择偏差,实验显示其在七个基准测试中表现优异,有效减少偏差同时保持高性能。

Comments Accepted to ACL 2026 Main Conference. 19 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27488 2026-05-01 cs.CL 86%

Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO

Skills-Coach:一种通过无训练GRPO实现的自我进化技能优化器

Yu Tian, Jiawei Chen, Lifan Zheng, Mingxiang Tao, Xinyi Zeng, Zhaoxia Yin, Hang Su, Xian Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Southeast University(东南大学) Hainan University(海南大学) Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Skills-Coach通过无训练GRPO框架提升LLM代理技能自我进化能力,包含四个核心模块,通过Skill-X基准测试展示其在多种技能类别中的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03853 2026-05-01 cs.CR cs.LG 86%

Dr. Jekyll and Mr. Hyde: Two Faces of LLMs

医生贾克尔与 Mr. 海德:大语言模型的两面

Matteo Gioele Collu, Tom Janssen-Groesbeek, Stefanos Koffas, Mauro Conti, Stjepan Picek

机构 * University of Padova(帕多瓦大学) Radboud University(拉德博德大学) Delft University of Technology(代尔夫特理工大学) Örebro University(欧雷布罗大学) University of Zagreb Faculty of Electrical Engineering(Zagreb大学电子工程学院) University of Bergen(卑尔根大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究通过角色扮演攻击揭示大语言模型的安全漏洞,展示通过伪装复杂人格可获取非法信息,验证了多种模型在2023-2025年间对攻击的脆弱性。

Comments Presented at the Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), Cagliari, Italy, February 09-13, 2026. Published as Paper 35 in CEUR Workshop Proceedings, Vol-4198. Available at: https://ceur-ws.org/Vol-4198/

Journal ref Proc. Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), CEUR-WS.org, Vol-4198, 35, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12272 2026-05-01 cs.LG cs.AI cs.CL 83%

Learning to Reason at the Frontier of Learnability

在可学习性前沿的学习推理

Thomas Foster, Anya Sims, Johannes Forkel, Mattie Fellows, Jakob Foerster

机构 * DeepSeek-R1 Tulu OpenAI

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过可学习性采样方法优化大语言模型强化学习阶段,提升训练效率和效果,针对高变异性问题进行课程学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27453 2026-05-01 cs.CL 81%

From Coarse to Fine: Benchmarking and Reward Modeling for Writing-Centric Generation Tasks

从粗到细:面向写作中心生成任务的基准测试与奖励建模

Qingyu Ren, Tianjun Pan, Xingzhou Chen, Xuhong Wang

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(数据科学上海重点实验室,计算机科学与人工智能学院,复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出WEval评估框架和WRL训练框架,通过细粒度评估和强化学习提升写作生成任务的奖励模型性能,实验显示模型在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19342 2026-05-01 stat.ML cs.LG stat.ME 81%

Contextual Online Uncertainty-Aware Preference Learning for Human Feedback

基于上下文的在线不确定性感知偏好学习用于人类反馈

Nan Lu, Ethan Lee, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27495 2026-05-01 cs.CL cs.AI 73%

Debiasing Reward Models via Causally Motivated Inference-Time Intervention

通过因果驱动的推理时干预去偏奖励模型

Kazutoshi Shinoda, Kosuke Nishida, Kyosuke Nishida

机构 * Human Informatics Labs., NTT, Inc.(NTT人类信息学实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出因果驱动的干预方法,用于在推理时减轻奖励模型中的多种偏差。通过抑制与预定义偏差属性强相关的神经元激活,减少对虚假特征的敏感性,同时保持性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28036 2026-05-01 cs.LG cs.IT math.IT 70%

Exponential families from a single KL identity

从单个KL恒等式出发的指数族

Marc Dymetman

机构 * Scientific Consultant(科学顾问)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过一个简单的指数族KL差恒等式,推导出多项经典结果,包括三点恒等式、I投影定理、对数分区函数的凸性等,无需复杂推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11119 2026-05-01 stat.ML cs.LG 70%

DDO-RM: Distribution-Level Policy Improvement after Reward Learning

DDO-RM:奖励学习后基于分布的策略改进

Tiantian Zhang, Jierui Zuo, Michael Chen, Wenping Wang

机构 * Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学) Department of Management Science and Engineering(管理科学与工程系) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 DDO-RM通过将奖励评分转化为显式目标分布,改进策略在分布层面的性能,实验显示其在准确性与边际均值上优于DPO。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18578 2026-05-01 cs.LG cs.AI 62%

Bounded Ratio Reinforcement Learning

有界比率强化学习

Yunke Ao, Le Chen, Bruce D. Lee, Assefa S. Wahd, Aline Czarnobai, Philipp Fürnstahl, Bernhard Schölkopf, Andreas Krause

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统研究所) University of Alberta(阿尔伯塔大学) Dartmouth College(达特茅斯学院) Balgrist University Hospital(巴尔格里斯特大学医院)

专题命中 后训练与偏好优化 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BRRL框架,通过建立正则化约束策略优化问题,推导出分析最优解,并证明其保证性能单调提升。BPO算法通过最小化策略与BRRL最优解之间的优势加权分歧,实现稳定性和最终性能优于PPO。

Comments 23 pages, 9 figures; Project page and code available at https://bounded-ratio-rl.github.io/brrl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28102 2026-05-01 cs.LG 57%

FiLMMeD: Feature-wise Linear Modulation for Cross-Problem Multi-Depot Vehicle Routing

FiLMMeD:基于跨问题多仓库车辆路径问题的特征级线性调制

Arthur Corrêa, Paulo Nascimento, Samuel Moniz

机构 * University of Coimbra, CEMMPRE, ARISE(科英布拉大学,CEMMPRE,ARISE)

专题命中 后训练与偏好优化 :preference optimization(abstract);分类 cs.LG

AI总结 本文提出FiLMMeD模型,通过特征级线性调制提升多仓库车辆路径问题的泛化能力,引入偏好优化和课程学习策略,有效解决多仓库约束下的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏