机构
*
Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)
;
School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
专题命中
后训练与偏好优化
:LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
Beyond Direct Answering: Aligning Educational LLMs as Socratic Guides via Heuristic Reinforcement Learning
超越直接回答:通过启发式强化学习将教育大语言模型调整为苏格拉底式引导者
Xiaokun Wang, Siyu Song, Wentao Liu, Xiaodong Zou
机构
*
East China Normal University(华东师范大学)
;
Shanghai Chuangjie Situo Information Technology Co., Ltd.(上海创杰思拓信息技术有限公司)
;
Shanghai Normal University(上海师范大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization
EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解
Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin
机构
*
Guangdong University of Technology(广东工业大学)
;
Southern University of Science and Technology(南方科技大学)
;
Xi’an Jiaotong University(西安交通大学)
;
Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI
LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget
LongStraw:在固定GPU预算下超越200万个令牌的长上下文强化学习
Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin