Revisiting the Data Sampling in Multimodal Post-training from a Difficulty-Distinguish View
专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)
Comments Accpeted by AAAI 2026
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)
Comments Accpeted by AAAI 2026
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments ICML 2025
机构 * Electrical and Computer Engineering University of Virginia(电气与计算机工程大学弗吉尼亚大学) ; Princeton Language and Intelligence Princeton University(普林斯顿语言与智能普林斯顿大学)
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
Comments NeurIPS 2025
机构 * Tsinghua University(清华大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Soochow University(苏州大学)
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
机构 * ETH Zurich(苏黎世联邦理工学院)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
机构 * Noah’s Ark Lab, Huawei Technologies Ltd.(华为技术有限公司诺亚实验室) ; Chandar Research Lab(昌达研究实验室) ; Mila – Quebec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学) ; Polytechnique Montréal Canada(蒙特利尔理工学院加拿大) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)
机构 * Safe and Intelligent Autonomy Lab, Stanford University(斯坦福大学安全与智能自主实验室)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);preference optimization(abstract)
机构 * Purdue University(普渡大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);preference optimization(abstract)
Comments EMNLP 2025 Findings
机构 * EPFL(苏黎世联邦理工学院) ; Università della Svizzera Italiana(瑞士联邦理工学院) ; Wesleyan University(韦斯利安大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments Accepted to EMNLP 2025 Findings
机构 * Korea University(韩国大学)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Google Cloud AI Research(谷歌云人工智能研究) ; Google DeepMind(谷歌DeepMind) ; University of Virginia(弗吉尼亚大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments 26 pages
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)
Comments ACL 2025
机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Central Media Technology Institute, Huawei Technologies Ltd.(华为技术有限公司媒体技术研究所)
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
机构 * Meta Inc(Meta公司)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
机构 * Department of Computer Science, University of Pisa(比萨大学计算机科学系)
专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);preference optimization(abstract)
Comments Accepted at Findings of ACL 2025
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments 30 Pages
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);language model(abstract);SFT(abstract)
Comments ICML 2025
机构 * Peking University(北京大学)
专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);RLHF(abstract);preference optimization(abstract)
机构 * University College London(伦敦大学学院) ; University of Bologna(博洛尼亚大学)
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments Published at the 13th International Conference on Learning Representations (ICLR'25), Singapore, Apr 2025. https://openreview.net/forum?id=MeGDmZjUXy
专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments spotlight @ neurips language gamification workshop. updated the problem description and added new online RL experiments in this version
专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments ICLR'25
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Comments Accepted to ICLR 2025
专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments Accepted to ICLR 2025
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments ICLR 2025
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
Comments 8 pages, 4 figures; update author names