Probing Cross-modal Information Hubs in Audio-Visual LLMs
探测音频-视觉大语言模型中的跨模态信息枢纽
Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim, Joon Son Chung
机构
*
Department of Electrical Engineering, Korea Advanced Institute of Science
;
The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea
Looking and Listening Inside and Outside: Multimodal Artificial Intelligence Systems for Driver Safety Assessment and Intelligent Vehicle Decision-Making
观察与聆听内外:多模态人工智能系统用于驾驶员安全评估和智能车辆决策
Ross Greer, Laura Fleig, Maitrayee Keskar, Erika Maquiling, Giovanni Tapia Lopez, Angel Martinez-Sanchez, Parthib Roy, Jake Rattigan, Mira Sur, Alejandra Vidrio, Thomas Marcotte, Mohan Trivedi
机构
*
Machine Intelligence, Interaction, and Imagination (Mi3) Laboratory(机器智能、交互与想象实验室)
;
Laboratory for Intelligent and Safe Automobiles (LISA)(智能与安全汽车实验室)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Center for Medicinal Cannabis Research (CMCR)(医药大麻研究中心)
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Kling Team, Kuaishou Technology(快手科技 Kling 团队)
;
Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)
Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis
利用大语言模型从临床病例报告中重建脓毒症轨迹:脓毒症的文本时间序列语料库
Shahriar Noroozizadeh, Jeremy C. Weiss
机构
*
Machine Learning Department and Heinz College Carnegie Mellon University(卡内基梅隆大学机器学习系和海恩兹学院)
;
National Library of Medicine National Institutes of Health(美国国家医学图书馆)
VIMCAN: Visual-Inertial 3D Human Pose Estimation with Hybrid Mamba-Cross-Attention Network
VIMCAN: 基于混合Mamba-交叉注意力网络的视觉-惯性3D人体姿态估计
Zepeng Yang, Junxuan Bai, Hao Li, Ju Dai, Junjun Pan, Yongfeng Yin, Bin Li
机构
*
Beihang University(北航)
;
Peng Cheng Laboratory(鹏城实验室)
;
Capital University of Physical Education and Sports(首都体育学院)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)