Innovator-VL: A Multimodal Large Language Model for Scientific Discovery
Innovator-VL:一种用于科学发现的多模态大语言模型
Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang
机构
*
School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
;
Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)
Integrating Multi-Modal Sensors: A Review of Fusion Techniques for Intelligent Vehicles
多模态传感器整合:智能车辆融合技术综述
Chuheng Wei, Ziye Qin, Ziyan Zhang, Guoyuan Wu, Matthew J. Barth
机构
*
College of Engineering, Center for Environmental Research and Technology, University of California at Riverside(工程学院、环境研究与技术中心、加州大学河滨分校)
;
School of Transportation and Logistics, Southwest Jiaotong University(交通运输与物流学院、西南交通大学)
Aligning by Misaligning: Boundary-aware Curriculum Learning for Multimodal Alignment
通过不一致来对齐:面向多模态对齐的边界感知课程学习
Hua Ye, Hang Ding, Siyuan Chen, Yiyang Jiang, Changyuan Zhang, Xuan Zhang
机构
*
Nanjing University(南京大学)
;
Airon Technology CO., LTD(艾润科技有限公司)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Bristol(布里斯托大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
The University of Hong Kong(香港大学)
;
Carnegie Mellon University(卡内基梅隆大学)
A-QCF-Net: An Adaptive Quaternion Cross-Fusion Network for Multimodal Liver Tumor Segmentation from Unpaired Datasets
A-QCF-Net:一种自适应四元数交叉融合网络用于从无配对数据集进行多模态肝肿瘤分割
Arunkumar V, Firos V M, Senthilkumar S, Gangadharan G R
机构
*
University College of Engineering, Bharathidasan Institute of Technology Campus, Anna University(安娜大学工程学院,巴拉特拉桑理工学院校区,安娜大学)
;
National Institute of Technology(国家理工学院)
Training-Free Dual Hyperbolic Adapters for Better Cross-Modal Reasoning
无需训练的双双曲适配器用于更高效的跨模态推理
Yi Zhang, Chun-Wun Cheng, Junyi He, Ke Yu, Yushun Tang, Carola-Bibiane Schönlieb, Zhihai He, Angelica I. Aviles-Rivero
机构
*
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)
;
Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系)
;
Yau Mathematical Sciences Center, Tsinghua University(清华大学应用数学中心)
Leveraging AI multimodal geospatial foundation models for improved near-real-time flood mapping at a global scale
利用AI多模态地理空间基础模型实现全球范围内的改进型实时洪水制图
Mirela G. Tulbure, Julio Caineta, Mark Broich, Mollie D. Gaines, Philippe Rufin, Leon-Friedrich Thomas, Hamed Alemohammad, Jan Hemmerling, Patrick Hostert
CommentsThis manuscript is withdrawn to allow for substantial expansion and restructuring. Based on recent research progress, we plan to add Generalization experiment and reorganize the manuscript structure to improve readability and logical flow. Thank you for your understanding and support
Leveraging Biomolecule and Natural Language through Multi-Modal Learning: A Survey
利用生物分子和自然语言通过多模态学习:一篇综述
Qizhi Pei, Zhimeng Zhou, Kaiyuan Gao, Jinhua Zhu, Yue Wang, Zun Wang, Tao Qin, Lijun Wu, Rui Yan
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
;
Zhejiang University(浙江大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
Huazhong University of Science and Technology(华中科技大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Zhongguancun Academy(中关村学院)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
Assessing the alignment between infants' visual and linguistic experience using multimodal language models
利用多模态语言模型评估婴儿的视觉和语言经验一致性
Alvin Wei Ming Tan, Jane Yang, Tarun Sepuri, Khai Loong Aw, Robert Z. Sparks, Zi Yin, Virginia A. Marchman, Michael C. Frank, Bria Long
机构
*
Department of Psychology, Stanford University(心理学系,斯坦福大学)
;
Department of Psychology, University of California, San Diego(心理学系,加州大学圣地亚哥分校)
;
Department of Psychology, Tsinghua University(心理学系,清华大学)
AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs
AdaTok: 一种基于对象感知表示的自适应令牌压缩方法,用于高效多模态大语言模型
Xinliang Zhang, Lei Zhu, Hangzhou He, Shuang Zeng, Ourui Fu, Jiakui Hu, Zhengjian Yao, Yanye Lu
机构
*
Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所)
;
Department of Biomedical Engineering, Peking University(北京大学生物医学工程系)
;
National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)