arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2504.16272 2025-04-24 cs.LG 81%

Learning Explainable Dense Reward Shapes via Bayesian Optimization

Ryan Koo, Ian Yang, Vipul Raheja, Mingyi Hong, Kwang-Sung Jun, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) Georgia Institute of Technology(佐治亚理工学院) Grammarly University of Arizona(亚利桑那大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22230 2025-04-03 cs.LG 81%

Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback

Wei Shen, Guanlin Liu, Zheng Wu, Ruofei Zhu, Qingping Yang, Chao Xin, Yu Yue, Lin Yan

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21819 2025-03-31 cs.CL 81%

Optimizing Safe and Aligned Language Generation: A Multi-Objective GRPO Approach

Xuying Li, Zhuo Li, Yuji Kosuga, Victor Bian

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13980 2025-03-19 cs.LG 81%

Empowering LLMs in Decision Games through Algorithmic Data Synthesis

Haolin Wang, Xueyan Li, Yazhe Niu, Shuai Hu, Hongsheng Li

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04783 2025-03-10 cs.CL cs.CR 81%

Comparative Analysis Based on DeepSeek, ChatGPT, and Google Gemini: Features, Techniques, Performance, Future Prospects

Anichur Rahman, Shahariar Hossain Mahir, Md Tanjum An Tashrif, Airin Afroj Aishi, Md Ahsan Karim, Dipanjali Kundu, Tanoy Debnath, Md. Abul Ala Moududi, MD. Zunead Abedin Eidmum

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02846 2025-03-05 cs.CL 81%

Mask-DPO: Generalizable Fine-grained Factuality Alignment of LLMs

Yuzhe Gu, Wenwei Zhang, Chengqi Lyu, Dahua Lin, Kai Chen

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted by ICLR 2025. Code is available at https://github.com/open-compass/ANAH

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21545 2025-02-19 cs.CL 81%

CARMO: Dynamic Criteria Generation for Context-Aware Reward Modelling

Taneesh Gupta, Shivam Shandilya, Xuchao Zhang, Rahul Madhavan, Supriyo Ghosh, Chetan Bansal, Huaxiu Yao, Saravan Rajmohan

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00847 2025-02-13 cs.LG 81%

Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown

Xingzhou Lou, Dong Yan, Wei Shen, Yuzi Yan, Jian Xie, Junge Zhang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06148 2025-02-11 cs.CL cs.IR 81%

Optimizing Knowledge Integration in Retrieval-Augmented Generation with Self-Selection

Yan Weng, Fengbin Zhu, Tong Ye, Haoyan Liu, Fuli Feng, Tat-Seng Chua

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03095 2025-02-06 cs.LG 81%

Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms

Xuerui Su, Yue Wang, Jinhua Zhu, Mingyang Yi, Feng Xu, Zhiming Ma, Yuting Liu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07455 2025-01-22 cs.LG stat.ML 81%

Reinforcement Learning from Human Feedback without Reward Inference: Model-Free Algorithm and Instance-Dependent Analysis

Qining Zhang, Honghao Wei, Lei Ying

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01304 2024-12-13 cs.CL 81%

Improving the Validity of Automatically Generated Feedback via Reinforcement Learning

Alexander Scarlatos, Digory Smith, Simon Woodhead, Andrew Lan

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Best student paper award, Published in AIED 2024: The 25th International Conference on Artificial Intelligence in Education

Journal ref In International Conference on Artificial Intelligence in Education (pp. 280-294). Cham: Springer Nature Switzerland (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03949 2024-10-30 cs.CL 81%

UltraMedical: Building Specialized Generalists in Biomedicine

Kaiyan Zhang, Sihang Zeng, Ermo Hua, Ning Ding, Zhang-Ren Chen, Zhiyuan Ma, Haoxin Li, Ganqu Cui, Biqing Qi, Xuekai Zhu, Xingtai Lv, Hu Jinfang, Zhiyuan Liu, Bowen Zhou

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Camera ready version for NeurIPS 2024 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19134 2024-10-28 cs.CL cs.SD eess.AS 81%

AlignCap: Aligning Speech Emotion Captioning to Human Preferences

Ziqi Liang, Haoxiang Shi, Hanhui Chen

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

Comments Accepted to EMNLP2024 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12832 2024-10-18 cs.LG 81%

Generative Reward Models

Dakota Mahan, Duy Van Phung, Rafael Rafailov, Chase Blagden, Nathan Lile, Louis Castricato, Jan-Philipp Fränken, Chelsea Finn, Alon Albalak

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09834 2024-09-02 cs.AI 81%

Minor DPO reject penalty to increase training robustness

Shiming Xie, Hong Chen, Fred Yu, Zeye Sun, Xiuyu Wu, Yingfan Hu

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments 8 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11791 2024-08-22 cs.LG 81%

Critique-out-Loud Reward Models

Zachary Ankner, Mansheej Paul, Brandon Cui, Jonathan D. Chang, Prithviraj Ammanabrolu

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15568 2024-07-10 cs.LG 81%

Robust Reinforcement Learning from Corrupted Human Feedback

Alexander Bukharin, Ilgee Hong, Haoming Jiang, Zichong Li, Qingru Zhang, Zixuan Zhang, Tuo Zhao

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);preference optimization(abstract)

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01771 2024-06-05 cs.CL 81%

LLMs Beyond English: Scaling the Multilingual Capability of LLMs with Cross-Lingual Feedback

Wen Lai, Mohsen Mesgar, Alexander Fraser

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Accepted to Findings of ACL 2024. The code, datasets, and models are publicly available at https://github.com/boschresearch/ACL24-MLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20335 2024-05-31 cs.CL 81%

Xwin-LM: Strong and Scalable Alignment Practice for LLMs

Bolin Ni, JingCheng Hu, Yixuan Wei, Houwen Peng, Zheng Zhang, Gaofeng Meng, Han Hu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02030 2024-05-24 cs.CL 81%

Panacea: Pareto Alignment via Preference Adaptation for LLMs

Yifan Zhong, Chengdong Ma, Xiaoyuan Zhang, Ziran Yang, Haojun Chen, Qingfu Zhang, Siyuan Qi, Yaodong Yang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00782 2024-02-02 cs.LG 81%

Dense Reward for Free in Reinforcement Learning from Human Feedback

Alex J. Chan, Hao Sun, Samuel Holt, Mihaela van der Schaar

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02072 2024-01-05 cs.CL 81%

ICE-GRT: Instruction Context Enhancement by Generative Reinforcement based Transformers

Chen Zheng, Ke Sun, Da Tang, Yukun Ma, Yuyu Zhang, Chenguang Xi, Xun Zhou

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05532 2023-07-13 cs.CL 81%

Opening up ChatGPT: Tracking openness, transparency, and accountability in instruction-tuned text generators

Andreas Liesenfeld, Alianda Lopez, Mark Dingemanse

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16804 2026-08-20 cs.LG cs.AI 版本更新 81%

AutoOR: Scalably Post-training LLMs to Autoformalize Operations Research Problems

AutoOR: 一种可扩展的后训练语言模型用于自动形式化运筹学问题

Sumeet Ramesh Motwani, Chuan Du, Aleksander Petrov, Christopher Davis, Philip Torr, Antonio Papania-Davis, Weishi Yan

机构 * The Moonshot Factory(谷歌登月工厂) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 AutoOR通过合成数据生成与强化学习管道,训练语言模型自动形式化运筹学问题,实现线性、混合整数和非线性优化问题的高效解决,取得六个经典运筹学基准测试的领先或竞争性结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12443 2026-08-14 stat.ML cs.AI cs.LG math.OC 新提交 81%

SSPO: Structure-Aware Similarity-Weighted Preference Optimization for Neural Combinatorial Optimization

SSPO:面向神经组合优化的结构感知相似度加权偏好优化

Yuanyu Li, Jintao Xu, Zijiang Liu, Yongzhi Qi, Ningxuan Kang, Jianshen Zhang, Wei Qi, Chen Xie, Zuo-Jun Max Shen

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对神经组合优化训练中的梯度信号极化与基线冗余问题,提出SSPO方法,通过结构感知相似度加权的留一法基线解决问题,其训练的EFL策略已在京东设施选址系统中实现实际应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06957 2026-08-13 stat.ML cs.AI cs.LG 版本更新 81%

Post-Training with Policy Gradients: Optimality and the Base Model Barrier

训练后使用策略梯度:最优性和基础模型障碍

Alireza Mousavi-Hosseini, Murat A. Erdogdu

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了训练后使用策略梯度方法在序列预测中的最优性和基础模型限制,提出通过过程奖励模型克服支持范围障碍,并展示了自适应学习率的SGD和PG在统计学习和在线学习中的有效性。

Comments 39 pages, 2 figures. Published at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28680 2026-08-03 cs.CL cs.LG 新提交 81%

TELLER: Dual-Path Iterative Preference Optimization for Table Entity Linking

TELLER:用于表格实体链接的双路径迭代偏好优化

Yixin Peng, Kehao Li, Stefan Decker

机构 * RWTH Aachen(亚琛工业大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对表格实体链接任务提出TELLER双路径迭代偏好优化方法,通过直接回答与推理两条路径分别优化,在TableInstruct和MammoTab V2数据集上提升了实体链接与推理生成的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16204 2026-07-21 cs.AI cs.LG 新提交 81%

Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL

掩码扩散语言模型是用于智能体强化学习的强大且可控的基于文本的世界模型

Darshan Deshpande

机构 * Patronus AI(守护神人工智能公司)

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究强化学习中世界模型问题,对比自回归语言模型和掩码扩散语言模型,发现掩码扩散语言模型性能更优。引入GRPO训练框架,在三个OOD环境上零样本转移消融效果良好,还进行相关分析与评估,最后开源工作推动该领域研究。

Comments Dataset: https://huggingface.co/PatronusAI/world_model_corpus Training code: https://github.com/patronus-ai/mdlm_world_modeling

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14236 2026-07-17 cs.RO cs.AI cs.LG 新提交 81%

Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection

力,永不嫌迟:通过反应式力注入加速视觉-语言-动作模型的训练后优化

Yi Wang, Wendi Chen, Zimo Wen, Han Xue, Xueqi Li, Wenye Yu, Zhijie Chen, Hao Yang, Jun Lv, Chuan Wen, Cewu Lu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Southern University of Science and Technology(南方科技大学) Noematrix Ltd.(诺玛矩阵有限公司)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对预训练VLA策略在接触状态下表现不佳的问题,提出LIFT框架,通过嫁接反应式动作专家、注入力及结合在线DAgger循环,提升其在富含接触操作任务中的性能,且证明相关组件对稳健操作很重要。

Comments Project page: https://lift-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏