Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy
词中结构:用于人类大脑显微镜的弱监督视觉-语言建模
Matthew Sutton, Katrin Amunts, Timo Dickscheid, Christian Schiffer
机构
*
Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心)
;
Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心)
;
Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院)
;
Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)
Emotion Across Speech and Faces: Shared Affective Mechanisms in Multimodal Foundation Models
跨语音与面部的情感:多模态基础模型中的共享情感机制
Xiutian Zhao, Luqi Sun, Björn Schuller, Berrak Sisman
机构
*
Center for Language and Speech Processing (CLSP), Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心)
;
Group on Language, Audio & Music (GLAM), Imperial College London(伦敦帝国理工学院语言、音频与音乐组)
专题命中
音频语音多模态
:multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);分类 cs.CL、eess.AS
机构
*
Sogang University(西江大学)
;
KAIST(韩国科学技术院)
;
NYU Shanghai(上海纽约大学)
;
JIUTIAN Research, China Mobile(中国移动九天研究院)
;
The State Key Laboratory of Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)
;
China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院)
;
Central Conservatory of Music(中央音乐学院)
Speak in Context: Multilingual ASR with Speech Context Alignment via Contrastive Learning
在语境中说话:通过对比学习实现的多语言语音识别与语音语境对齐
Yuchen Zhang, Haralambos Mouratidis, Ravi Shekhar
机构
*
Institute for Analytics and Data Science, University of Essex(数据分析与科学研究所,埃塞克斯大学)
;
School of Computer Science and Electronic Engineering, University of Essex(计算机科学与电子工程学院,埃塞克斯大学)
机构
*
Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部)
;
ShanghaiTech University(上海科技大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Institute of Computing Technology(中国科学院计算技术研究所)
;
Southeast University(东南大学)
Toward Universal Skeleton-Based Action Recognition across Heterogeneous Skeletons and Open Vocabularies
迈向通用的基于骨骼的动作识别
Jidong Kuang, Hongsong Wang, Jie Gui, Yuan Yan Tang, James Tin-Yau Kwok
机构
*
School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)
;
School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国)
Open datasets and machine learning for two-phase heat transfer: a review following a spatial-temporal taxonomy
用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件
Christy Dunlap, Ridwan Olabiyi, Firas Al-Hindawi, Hari Pandey, Stephen Pierson, Daniel Curl, Braden Stevens, Mohammad Ishraq Hossain, Annapurna Parjuli, Chinmaya Joshi, Ashif Iquebal, Han Hu
机构
*
Department of Mechanical Engineering, University of Arkansas(阿肯色大学机械工程系)
LLM-Based Generative Retrieval for Snapchat Content Recommendation
基于大语言模型的生成式检索用于Snapchat内容推荐
Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah
SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting--Extended Version
SCENARIODIFF:面向多模态时间序列预测的场景级引导框架——扩展版
Tuan-Binh Tran, Dat Nguyen Cong, Duc-Trong Le, Thanh Trung Huynh, Tung Kieu
机构
*
VinUniversity
;
FPT Software AI Center, FPT Corporation(FPT软件AI中心,FPT集团)
;
VNU University of Engineering and Technology(VNU工程技术大学)
;
Aalborg University(奥尔堡大学)
Comments10 pages. An extended version of "SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting" accepted at ICDM 2026
Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models
新概念必须进入之处:统一多模态模型中的入口门跨任务可用性
Zongyang Qiu, Yihan Wu, Kaixuan Fan, Bo Li, Hui Xiong
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Columbia University(哥伦比亚大学)
;
CUHK(香港中文大学)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)