Efficient numeracy in language models through single-token number embeddings
通过单token数字嵌入提升语言模型的数值处理效率
Linus Kreitner, Paul Hager, Jonathan Mengedoht, Georgios Kaissis, Daniel Rueckert, Martin J. Menten
机构
*
Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital, Munich, Germany(人工智能在医疗和医学中的Chair,慕尼黑技术大学(TUM)和慕尼黑技术大学医院,德国慕尼黑)
;
Department of Computing, Imperial College London, UK(计算系,伦敦帝国学院,英国)
;
Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),德国慕尼黑)
;
Hasso Plattner Institute for Digital Engineering, University of Potsdam, Germany(哈索·platzer研究所数字工程学院,波茨坦大学,德国)
Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints
学习手柄:在接口约束下的可证明收敛的工作流学习
Jiayu Li, Enpei Zhang, Dawei Zhou, Elynn Chen, Yujun Yan
机构
*
Stern School of Business(斯特恩商学院)
;
New York University(纽约大学)
;
Department of Computer Science(计算机科学系)
;
Dartmouth College(达特茅斯学院)
;
Virginia Tech(弗吉尼亚理工大学)
AdaSwitch: Adaptive Switching between Small and Large Agents for Effective Cloud-Local Collaborative Learning
AdaSwitch: 一种在小型和大型代理之间自适应切换以实现有效的云-本地协作学习方法
Hao Sun, Jiayi Wu, Hengyi Cai, Xiaochi Wei, Yue Feng, Bo Wang, Shuaiqiang Wang, Yan Zhang, Dawei Yin
机构
*
State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(一般人工智能国家重点实验室,北京大学,北京,中国)
;
School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学)
;
East China Normal University(东华大学)
;
Chinese Academy of Sciences(中国科学院)
;
Baidu Inc(百度公司)
;
Beijing Institute of Technology(北京理工大学)
;
University of Birmingham(伯明翰大学)
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Nanjing University(南京大学)
;
Sun Yat-sen University(中山大学)
;
National University of Singapore(新加坡国立大学)
;
Nanyang Technological University(南洋理工大学)
;
SAP
;
Microsoft Research(微软研究院)
机构
*
INESC-ID/Instituto Superior Técnico, Universidade de Lisboa, Portugal(葡萄牙里斯本大学理工学院/INESC-ID)
;
Free University of Bozen-Bolzano, Italy(意大利博登-博洛尼亚自由大学)
Learning from Failures: Correction-Oriented Policy Optimization with Verifiable Rewards
从失败中学习:具有可验证奖励的纠正导向策略优化
Mengjie Ren, Jie Lou, Boxi Cao, Xueru Wen, Hongyu Lin, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu
机构
*
Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Xiaohongshu Inc(小红书公司)
机构
*
i2CAT Foundation(i2CAT基金会)
;
Hostelworld Group(Hostelworld集团)
;
Technical University of Catalonia (UPC)(技术大学(加泰罗尼亚))
;
Khalifa University of Science and Technology(卡里玛大学)
;
ISI/ATH
;
University of Patras(帕特拉大学)
机构
*
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
National University of Singapore(新加坡国立大学)
;
Nanyang Technological University(南洋理工大学)
;
Zhejiang University(浙江大学)