KG-CMI: Knowledge graph enhanced cross-Mamba interaction for medical visual question answering
KG-CMI: 基于知识图谱的跨Mamba交互用于医学视觉问答
Xianyao Zheng, Hong Yu, Hui Cui, Changming Sun, Xiangyu Li, Ran Su, Leyi Wei, Jia Zhou, Junbo Wang, Qiangguo Jin
机构
*
School of Software, Northwestern Polytechnical University(西北工业大学软件学院)
;
Tianjin Central Hospital of Gynecology Obstetrics(天津市中心妇产科医院)
;
Department of Computer Science and Information Technology, La Trobe University(拉筹伯大学计算机科学与信息技术系)
;
CSIRO Data61(澳大利亚联邦科学与工业研究组织Data61)
;
School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
;
School of Computer Software, Tianjin University(天津大学计算机软件学院)
;
Centre for Artificial Intelligence driven Drug Discovery, Faculty of Applied Science, Macao Polytechnic University(澳门理工大学应用科学学院人工智能驱动药物发现中心)
;
Department of Cardiology, Tianjin Chest Hospital(天津市胸科医院心内科)
Structure Causal Models and LLMs Integration in Medical Visual Question Answering
结构因果模型与大语言模型在医学视觉问答中的整合
Zibo Xu, Qiang Li, Weizhi Nie, Weijie Wang, Anan Liu
机构
*
School of Microelectronics, Tianjin University(天津大学微电子学院)
;
School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)
;
Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)
Chenggang Rong, Tao Han, Zhiyuan Zhao, Yaowu Fan, Jia Wan, Song Guo, Yuan Yuan, Junyu Gao
机构
*
Northwestern Polytechnical University(北华大学)
;
Hong Kong University of Science and Technology(香港科技大学)
;
Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所)
;
Sun Yat-sen University(中山大学)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
专题命中
视觉问答
:MLLM(title);multimodal large language model(abstract);分类 cs.CV
ConFoThinking: Consolidated Focused Attention Driven Thinking for Visual Question Answering
ConFoThinking:基于整合聚焦注意力的视觉问答思考
Zhaodong Wu, Haochen Xue, Qi Cao, Wenqi Mo, Yu Pei, Wenqi Xu, Jionglong Su, Yang Liu
机构
*
Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所)
;
School of AI and Advanced Computing, Xi'an Jiaotong-Liverpool University, Suzhou, China(西安交通大学利物浦大学人工智能与高级计算学院)
GeoReason: Aligning Thinking And Answering In Remote Sensing Vision-Language Models Via Logical Consistency Reinforcement Learning
GeoReason: 通过逻辑一致性强化学习对遥感视觉-语言模型中的思考与回答进行对齐
Wenshuai Li, Xiantai Xiang, Zixiao Wen, Guangyao Zhou, Ben Niu, Feng Wang, Lijia Huang, Qiantong Wang, Yuxin Hu
机构
*
Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所)
;
Key Laboratory of Target Cognition and Application Technology, Chinese Academy of Sciences(中国科学院目标认知与应用技术重点实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
机构
*
Beijing Jiaotong University(北京交通大学)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(MAIS,自动化研究所,中国科学院)
;
University of Birmingham(伯明翰大学)
DrivePI: Spatial-aware 4D MLLM for Unified Autonomous Driving Understanding, Perception, Prediction and Planning
DrivePI: 基于空间感知的4D MLLM用于统一自动驾驶理解、感知、预测与规划
Zhe Liu, Runhui Huang, Rui Yang, Siming Yan, Zining Wang, Lu Hou, Di Lin, Xiang Bai, Hengshuang Zhao
机构
*
The University of Hong Kong(香港大学)
;
Yinwang Intelligent Technology Co. Ltd.(英维智能科技有限公司)
;
Tianjin University(天津大学)
;
Huazhong University of Science and Technology(华中科技大学)
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Beihang University(北航大学)
;
Jilin University(吉林大学)
;
National University of Singapore(新加坡国立大学)
;
Peking University(北京大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
;
Huazhong University of Science And Technology(华中科技大学)