A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images
通用科学人工智能的实现路径:科学图像的多模态理解
Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden
机构
*
TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB))
;
Eindhoven University of Technology(埃因霍温理工大学)
;
Freie Universität Berlin(柏林自由大学)
;
International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心)
;
National University of Sciences and Technology(国家科技大学)
;
University of Warwick(华威大学)
;
PSG College of Technology(PSG理工学院)
;
Aalto University(阿尔托大学)
FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding
FORGE:用于长视频理解的相关几何中的帧正交性
Ghazal Kaviani, Ghassan AlRegib
机构
*
Georgia Institute of Technology(佐治亚理工学院)
;
Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP))
;
School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中
视觉问答
:multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.LG
Deep Expert Injection for Anchoring Retinal VLMs with Domain-Specific Knowledge
深度专家注入用于带有领域特定知识的视网膜视觉语言模型的锚定
Shuai Lu, Meng Wang, Jia Guo, Jiawei Du, Bo Liu, Shengzhu Yang, Weihang Zhang, Huazhu Fu, Huiqi Li
机构
*
Beijing Institute of Technology, Beijing, China(北京理工大学)
;
National University of Singapore, Singapore(新加坡国立大学)
;
Tsinghua University, Beijing, China(清华大学)
;
The Hong Kong Polytechnic University, Hong Kong(香港理工大学)
专题命中
视觉问答
:vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI