Atomic Skills are the Prerequisite: When Reinforcement Learning Synthesizes Compositional Reasoning, and When It Only Amplifies
原子技能是前提:当强化学习合成组合推理时,以及当它仅放大时
Sitao Cheng, Xunjian Yin, Ruiwen Zhou, Yuxuan Li, Xinyi Wang, Liangming Pan, William Yang Wang, Victor Zhong
机构
*
University of Waterloo(滑铁卢大学)
;
Duke University(杜克大学)
;
National University of Singapore(新加坡国立大学)
;
Princeton University(普林斯顿大学)
;
Peking University(北京大学)
;
University of California, Santa Barbara(加州大学圣巴巴拉分校)
Multi-Adapter Representation Interventions via Energy Calibration
通过能量校准的多适配器表示干预
Manjiang Yu, Hongji Li, Junwei Chen, Xue Li, Priyanka Singh, Yang Cao, Lijie Hu
机构
*
The University of Queensland, Brisbane, Australia(昆士兰大学)
;
Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(马尔代夫 bin Zayed 人工智能大学)
;
Institute of Science Tokyo, Tokyo, Japan(东京科学研究所)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.AI
Learning in the Fisher Subspace: A Guided Initialization for LoRA Fine-Tuning
在 Fisher 子空间中学习:LoRA 微调的引导初始化
Zhi-Quan Feng, Ying-Jia Lin, Hung-Yu Kao
机构
*
Department of Computer Science(计算机科学系)
;
Information Engineering, National Cheng Kung University(信息工程系,国立成功大学)
;
Department of Artificial Intelligence, Chang Gung University(人工智能系,长庚大学)
;
Department of Computer Science, National Tsing Hua University(计算机科学系,国立清华大学)
专题命中
指令微调
:large language model(abstract);language model(abstract);分类 cs.LG
Decoupled Training with Local Reinforcement Fine-Tuning in Federated Learning
联邦学习中解耦训练与局部强化微调
Yuting Ma, Lechao Cheng, Xiaohua Xu
机构
*
School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)
;
School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)
Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards
解耦推理与置信度:在可验证奖励的强化学习中恢复校准
Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun
机构
*
Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)
;
Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)
;
National Computer Network Emergency Response Technical Team/Coordination Center of China, Beijing, China(中国国家计算机网络应急技术配合中心)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
IRPO: Boosting Image Restoration via Post-training GRPO
IRPO:通过后训练GRPO提升图像恢复
Haoxuan Xu, Yi Liu, Tianfu Li, Ruolin Shen, Boyuan Jiang, Jinlong Peng, Donghao Luo, Xiaobin Hu, Shuicheng Yan, Haoang Li
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Tsinghua University(清华大学)
;
Technical University of Munich(慕尼黑技术大学)
;
Zhejiang University(浙江大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Fudan University(复旦大学)
;
National University of Singapore(新加坡国立大学)
OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning
OGER:一种用于混合强化学习的鲁棒离线引导探索奖励
Xinyu Ma, Mingzhou Xu, Xuebo Liu, Chang Jin, Qiang Wang, Derek F. Wong, Min Zhang
机构
*
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)
;
Hithink RoyalFlush Information Network, Hangzhou, China(杭州Hithink RoyalFlush信息网络)
;
Computer and Information Science, University of Macau, Macau, China(澳门大学计算机与信息科学学院)
专题命中
后训练与偏好优化
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
Affective Music Recommendation: A Rollout-Based World Model for Offline Preference Optimization
情感音乐推荐:基于展开世界模型的离线偏好优化
Audrey Chan, Aaron Labbé, Jacob Lavoie, Jordan Bannister, Arsène Fansi Tchango, Guillaume Lajoie, Laurent Charlin
机构
*
LUCID Inc. Toronto Canada
;
LUCID Inc. Montr\' e al Canada
;
Mila --- Qu\' e bec AI Institute Montr\' e al Canada
;
LUCID Inc.
;
Mila --- Qu\' e bec AI Institute