EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training
EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力
Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts
机构
*
Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院)
;
Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系)
;
Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院)
;
School of Humanities, Tallinn University(塔林大学人文学院)
专题命中
预训练与数据
:pretraining(title,abstract);post-training(title,abstract);LLM(abstract);large language model(abstract)
Cognitive models can reveal interpretable value trade-offs in language models
认知模型可以揭示语言模型中的可解释价值权衡
Sonia K. Murthy, Rosie Zhao, Jennifer Hu, Sham Kakade, Markus Wulfmeier, Peng Qian, Tomer Ullman
机构
*
Kempner Institute for Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所)
;
Google DeepMind(谷歌DeepMind)
;
Department of Psychology, Harvard University(哈佛大学心理学系)
Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT
学习如何注视:面向3D CT的疾病感知视觉-语言预训练
Simon Ging, Philipp Arnold, Sebastian Walter, Hani Alnahas, Hannah Bast, Elmar Kotter, Jiancheng Yang, Behzad Bozorgtabar, Thomas Brox
机构
*
Computer Vision Group, University of Freiburg, Germany Adaptive \& Agentic AI (A3) Lab, Aarhus University, Denmark Department of Radiology, Medical Center -- University of Freiburg, Germany Chair of Algorithms
;
Data Structures, University of Freiburg, Germany ELLIS Institute Finland School of Electrical Engineering, Aalto University, Finland
Not-Just-Scaling Laws: Towards a Better Understanding of the Downstream Impact of Language Model Design Decisions
并非仅仅的规模法则:迈向更深入理解语言模型设计决策对下游影响的探索
Emmy Liu, Amanda Bertsch, Lintang Sutawika, Lindia Tjuatja, Patrick Fernandes, Lara Marinov, Michael Chen, Shreya Singhal, Carolin Lawrence, Aditi Raghunathan, Kiril Gashteovski, Graham Neubig
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
Language Technologies Institute(语言技术研究所)
;
Instituto Superior Técnico (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院))
;
Instituto de Telecomunicações(电信研究所)
;
NEC Laboratories Europe, Germany(德国NEC欧洲实验室)
;
CAIR, Ss. Cyril and Methodius University of Skopje, North Macedonia(北马其顿斯·西里尔和方法ius大学)
Brain-Semantoks: Learning Semantic Tokens of Brain Dynamics with a Self-Distilled Foundation Model
Brain-Semantoks: 通过自蒸馏基础模型学习脑动态的语义标记
Sam Gijsen, Marc-Andre Schulz, Kerstin Ritter
机构
*
Hertie Institute for AI in Brain Health, University of Tübingen(图宾根大学脑健康人工智能研究所)
;
Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心)
;
Charité – Universitätsmedizin Berlin, Department of Psychiatry and Psychotherapy(柏林夏里特医学院心理治疗系)
TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications
TokenCom: 一种用于多模态和多任务令牌通信的视觉-语言模型
Feibo Jiang, Siwei Tu, Li Dong, Xiaolong Li, Kezhi Wang, Cunhua Pan, Zhu Han, Jiangzhou Wang
机构
*
Hunan Provincial Key Laboratory of Intelligent Computing and Language Information Processing, Hunan Normal University(湖南省级智能计算与语言信息处理重点实验室,湖南师范大学)
;
School of Information Science and Engineering, Hunan Normal University(信息科学与工程学院,湖南师范大学)
;
Changsha Social Laboratory of Artificial Intelligence, Hunan University of Technology and Business(长沙人工智能社会实验室,湖南工业大学)
;
School of Computer Science, Hunan University of Technology and Business(计算机科学学院,湖南工业大学)
;
Department of Computer Science, Brunel University London(伦敦布鲁内尔大学计算机科学系)
;
National Mobile Communications Research Laboratory, Southeast University(东南大学国家移动通信研究中心)
;
Department of Electrical and Computer Engineering, University of Houston(电子与计算机工程系,休斯顿大学)
机构
*
Sun Yat-sen University(中山大学)
;
Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室)
;
X-Era AI Lab(X-Era人工智能实验室)
;
Guangdong University of Technology(广东工业大学)