Visual Language Model based Cross-modal Semantic Communication Systems
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 12 pages, 10 figures
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 12 pages, 10 figures
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Dataset and models are available at https://github.com/jihaonew/MM-Instruct
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract)
Comments Accepted by ECML-PKDD 2024
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at ACL (Main) 2024
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 7 pages, 3 figures, Clinical NLP 2024 workshop proceedings in Shared Task
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to CVPR2024. Project page: https://vip-llava.github.io/
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 26 pages, 14 figures The data and code for this project are accessible at https://github.com/agiresearch/battleagent
专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by ICLR2024
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 5 figures
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2024
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments GitHub: https://github.com/danielabd/Apollo-Cap
专题命中 图文多模态 :multimodal(title);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 15 pages, 9 figures, to be published In Proceedings of International Conference of Computer Vision(ICCV), 2023
专题命中 图文多模态 :multi-modal(title,abstract);multimodal(abstract)
Comments Accepted to NeurIPS 2022
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments https://socraticmodels.github.io/
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM
Comments Accepted by ACL 2022 (long paper)
专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract)
Comments Oral at SVRHM Workshop (NeurIPS 2021)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments EMNLP 2020
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multi-modal(title);cross-modal(abstract);分类 cs.CV、cs.CL、eess.AS
专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.CL、cs.MM
Comments 9 pages, 3 figures
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2019 Oral
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract)
自描述多模态交互调优:放大可利用冗余以实现鲁棒的视觉语言模型
机构 * Singapore University of Technology and Design(新加坡科技设计大学) ; DSO National Laboratories(国防部国家实验室) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 针对视觉语言模型中的幻觉和鲁棒性问题,提出自描述多模态交互调优方法,通过放大模态间冗余信息来补偿受损模态,并设计多模态交互门机制将独特交互转化为冗余交互,实验表明该方法可减少38.3%的视觉诱导错误并提升16.8%的一致性。
Comments Accepted to ICML 2026. Code: https://github.com/yurielryan/Multimodal-Interaction-Tuning
为何文本占上风:视觉可能损害多模态医疗决策制定
机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) ; University of Pittsburgh(匹兹堡大学) ; NC State University(北卡罗来纳州立大学) ; University of Washington(华盛顿大学) ; University of Maryland(马里兰大学)
专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。
Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining
机构 * The Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) ; East China Normal University(东华师范大学) ; National Tsing Hua University(国立清华大学)
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI
Journal ref IROS 2025 Robosense Cross-Modal Drone Navigation Challenge first place