Journal refICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 18142-18146
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Large Language Model Department, Tencent(腾讯大语言模型部)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Hong Kong University of Science and Technology(香港科技大学)
;
Zhongguancun Academy(中关村学院)
专题命中
视觉定位与Grounding
:MLLM(title_cn,summary_cn);grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding
MLLM-HWSI: 一种用于分层全滑动图像理解的多模态大语言模型
Basit Alawode, Arif Mahmood, Muaz Khalifa Al-Radi, Shahad Albastaki, Asim Khan, Muhammad Bilal, Moshira Ali Abdalla, Mohammed Bennamoun, Sajid Javed
机构
*
Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系)
;
Information Technology University(信息技术大学)
;
KAU(卡乌大学)
;
University of the Western Australia(西澳大学)
专题命中
视觉定位与Grounding
:multimodal large language model(title,abstract);MLLM(title,abstract);grounding(abstract);分类 cs.CV
GEOBench-VLM: Benchmarking Vision-Language Models for Geospatial Tasks
Muhammad Sohail Danish, Muhammad Akhtar Munir, Syed Roshaan Ali Shah, Kartik Kuckreja, Fahad Shahbaz Khan, Paolo Fraccaro, Alexandre Lacoste, Salman Khan
Comments19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench
MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation
MedVL-SAM2:一种统一的3D医学视觉-语言模型,用于多模态推理和基于提示的分割
Yang Xing, Jiong Wu, Savas Ozdemir, Ying Zhang, Yang Yang, Wei Shao, Kuang Gong
机构
*
Department of Biomedical Engineering, University of Florida(佛罗里达大学生物医学工程系)
;
Department of Radiology, University of Florida(佛罗里达大学放射学系)
;
Research Computing, University of Florida(佛罗里达大学研究计算中心)
;
Department of Medicine, University of Florida(佛罗里达大学医学系)
;
Department of Radiology, UC San Francisco(旧金山大学放射学系)
EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data
EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试
Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux
机构
*
Meta Superintelligence Labs(Meta超智能实验室)
;
Stanford University(斯坦福大学)
;
Meta Reality Labs(Meta现实实验室)
;
The University of Tokyo(东京大学)