Multimodal Mathematical Reasoning with Diverse Solving Perspective
多模态数学推理与多样化的解题视角
Wenhao Shi, Zhiqiang Hu, Yi Bin, Guoqing Wang, Xing Xu, Yang Yang, See-Kiong Ng
机构
*
Tongji University(同济大学)
;
National University of Singapore(新加坡国立大学)
;
Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)
;
Tencent(腾讯)
;
Center for Future Media, University of Electronic Science and Technology of China(电子科技大学未来媒体中心)
Unlocking the Visual Record of Materials Science: A Large-Scale Multimodal Dataset from Scientific Literature
解锁材料科学的视觉记录:来自科学文献的大规模多模态数据集
Subham Ghosh, Shubham Tiwari, Mohammad Ibrahim, Abhishek Tewari
机构
*
Mehta Family School of Data Science and Artificial Intelligence(梅塔家庭数据科学与人工智能学院)
;
Indian Institute of Technology Roorkee(印度理工学院罗奥克学院)
;
Department of Metallurgical and Materials Engineering(冶金与材料工程系)
机构
*
HKU MMLab(香港大学多媒体实验室)
;
The University of Hong Kong(香港大学)
;
Peking University(北京大学)
;
Noah’s Ark Lab, Huawei(华为诺亚方舟实验室)
;
Shenzhen Loop Area Institute(深圳河套学院)
Learning from Acquisition: Metadata-driven Multimodal Pre-training for Cardiac MRI
从采集信息中学习:基于元数据驱动的心脏MRI多模态预训练
Xueyi Fu, Liwei Hu, Zi Wang, Guang Yang
机构
*
Department of Surgery & Cancer(外科与癌症系)
;
Bioengineering Department and Imperial-X(生物工程系和Imperial-X)
;
National Heart and Lung Institute(国家心脏和肺研究所)
;
Cardiovascular Research Centre(心血管研究中心)
;
School of Biomedical Engineering & Imaging Sciences(生物医学工程与成像科学学院)
CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation
CCRC:面向图像变化描述与分割的变化感知描述与推理链
Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu
机构
*
College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国)
;
Guangxi Minzu University, China(广西民族大学,中国)
;
National University of Defense Technology, China(国防科学技术大学,中国)
SonoCLIP: Mask-Guided Region-Aware Vision-Language Pretraining for Fetal Ultrasound Analysis
SonoCLIP: 面向胎儿超声分析的掩码引导区域感知视觉-语言预训练
Hang Su, Chao Sun, Zhaofan Li, Wei Hu, Juhua Liu, Bo Du
机构
*
School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,武汉,中国)
;
Institute of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能研究院,武汉,中国)
;
Department of Ultrasound, Renmin Hospital of Wuhan University, Wuhan, China(武汉大学仁民医院超声科,武汉,中国)
;
National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(武汉大学多媒体软件国家工程研究中心,武汉,中国)
;
Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, Wuhan, China(湖北省多媒体与网络通信工程重点实验室,武汉大学,武汉,中国)
ComMem: Complementary Memory Systems for Test-Time Adaptation of Vision-Language Models
ComMem:视觉语言模型测试时自适应的互补记忆系统
Guanglong Sun, Shuang Cui, Bo Lei, Liyuan Wang, Zihan Zhai, Hongwei Yan, Hang Su, Jun Zhu, Yi Zhong
机构
*
School of Life Sciences, IDG/McGovern Institute for Brain Research, Tsinghua University, Beijing, China(生命科学学院,IDG/麦克戈文脑科学研究院,清华大学,北京,中国)
;
Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所,北京,中国)
;
Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)
;
Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(心理学与认知科学系,清华大学,北京,中国)
;
Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心,清华大学,北京,中国)
机构
*
Australian National University(澳大利亚国立大学)
;
The University Of Queensland(昆士兰大学)
;
Peking University(北京大学)
;
GE research(通用电气研究院)
;
CSIRO(澳大利亚联邦科学与工业研究组织)
Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, Yuki M. Asano
机构
*
University of Technology Nuremberg(纽伦堡工业大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院)
HSD: Training-Free Acceleration for Document Parsing Vision-Language Models with Hierarchical Speculative Decoding
HSD:基于分层推测解码的文档解析视觉语言模型训练免费加速
Wenhui Liao, Hongliang Li, Pengyu Xie, Xinyu Cai, Yufan Shen, Yi Xin, Qi Qin, Shenglong Ye, Tianbin Li, Ming Hu, Junjun He, Yihao Liu, Wenhai Wang, Min Dou, Bin Fu, Botian Shi, Yu Qiao, Lianwen Jin
机构
*
South China University of Technology(华南理工大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shenzhen Institute of Advanced Technology, CAS(中国科学院深圳先进技术研究院)
;
Nanjing University(南京大学)
机构
*
National Taiwan Normal University(国立台湾师范大学)
;
Department of Computer Science and Information Engineering(计算机科学与信息工程系)
;
Institute of AI Interdisciplinary Applied Technology(人工智能跨学科应用技术研究所)