Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax
基于语义奖励的强化学习实现低资源语言扩展而不产生对齐税
Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang
机构
*
Minzu University of China(中国民族大学)
;
Ant Group(蚂蚁集团)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Macau(澳门大学)
;
Peking University(北京大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Hainan International College, Minzu University of China(中国民族大学海南国际学院)
Vision-LLMs for Spatiotemporal Traffic Forecasting
面向时空交通预测的视觉语言模型
Ning Yang, Hengyu Zhong, Haijun Zhang, Randall Berry
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Southwest University(西南大学)
;
Department of Computing and Communication Engineering, Beijing University of Science and Technology(北京科技大学计算机与通信工程学院)
;
Department of Electrical and Computer Engineering, Northwestern University(西北大学电气与计算机工程系)