Online Rubrics Elicitation from Pairwise Comparisons
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data(深圳大数据研究院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * University of California, Davis(加州大学戴维斯分校) ; WeChat, Tencent(微信、腾讯) ; Tsinghua University(清华大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Reinforcement learning publication of 24 pages
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Mila - Québec AI Institute(魁北克人工智能研究所)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract)
Comments NeurIPS 2025. Code: https://github.com/Gen-Verse/HermesFlow
机构 * ByteDance(字节跳动) ; CASIA(中国科学院自动化研究所) ; NJU(南京大学) ; PKU(北京大学) ; THU(清华大学)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract)
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Principled Evolution(原则进化)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 53 pages, 7 figures, 8 tables. Open-source implementation available at: https://github.com/Principled-Evolution/argen-demo. Work explores the integration of policy-as-code for AI alignment, with a case study in culturally-nuanced, ethical AI using Dharmic principles
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Keye Team, Kuaishou Group(快手集团Keye团队)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)
Comments Github page: https://github.com/Kwai-Keye/Keye
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)
机构 * Alibaba Group(阿里巴巴集团)
专题命中 后训练与偏好优化 :instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Mila - Quebec AI Institute(魁北克AI研究院) ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; Meta FAIR ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at ICCV 2025
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);SFT(abstract)
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)
Comments technical report
机构 * ByteDance(字节跳动)
专题命中 后训练与偏好优化 :foundation model(abstract);post-training(abstract);SFT(abstract)
Comments Seedream 3.0 Technical Report
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 20 pages, 6 figures, 4 tables, Second Reinforcement Learning Conference (RLC 2025)
专题命中 后训练与偏好优化 :language model(abstract);SFT(abstract);preference optimization(abstract)
Comments 31 pages, 18 figures
机构 * The Chinese University of Hong Kong(香港中文大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 24 pages, 12 figures
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ICML 2025
机构 * School of Computer Engineering & Science, Shanghai University(上海大学计算机工程与科学学院) ; Tencent YouTu Lab(腾讯优图实验室)
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);preference optimization(abstract)
Comments Accepted to CVPR 2025
专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)
Comments 15 pages, 3 figures, 11 tables. Accepted at ICLR 2025 Workshop on Advances in Financial AI. Code available at https://github.com/seohyunwoo-0407/GAR
专题命中 后训练与偏好优化 :LLM(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 16 pages
专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract)
专题命中 后训练与偏好优化 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract)
Comments This paper has been accepted for presentation at WACV Workshop HAVI 2025