Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning
架构感知强化学习使滑动窗口注意力在数学推理中具有竞争力
Kai Liu, Peijie Dong, Xinchen Xie, Jianfei Gao, Qipeng Guo, Xiaowen Chu, Shaoting Zhang, Kai Chen
机构
*
Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
;
Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)
;
Meituan(美团)
;
WeChat, Tencent(腾讯微信)
;
Beijing Key Laboratory of Research on Large Models and Intelligent Governance(大型模型与智能治理北京市重点实验室)
Resource-Aware LLM Reasoning for Mobile Edge General Intelligence
面向移动边缘通用智能的资源感知LLM推理
Mingyi Luo, Ruichen Zhang, Xiangwang Hou, Jun Du, Chunxiao Jiang, Yong Ren, Shiwen Mao
机构
*
Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen(清华大学深圳国际研究生院,清华大学,深圳)
;
College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学 computing 和数据科学学院,新加坡)
;
Department of Electronic Engineering, Tsinghua University, Beijing(清华大学电子工程系,北京)
;
State Key Laboratory of Space Network and Communications, Tsinghua University, Beijing(空间网络与通信国家重点实验室,清华大学,北京)
;
Beijing National Research Center for Information Science and Technology, Tsinghua University, Beijing(北京信息科学与技术国家研究中心,清华大学,北京)
;
Department of Electrical and Computer Engineering, Auburn University, Auburn, USA(阿伯丁大学电气与计算机工程系,阿伯丁,美国)
RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning
RoboGPT-R1: 通过强化学习增强机器人任务规划
Jinrui Liu, Bingyan Nie, Boyu Li, Yaran Chen, Yuze Wang, Shunsen He, Haoran Li
机构
*
Institute of Automation, CASIA(中国科学院自动化研究所)
;
School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)
;
Huawei Cloud Technology Co., Ltd(华为云技术有限公司)