机构
*
Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)
;
Tough Cyberphysical AI Research Center, Tohoku University(东北大学 Tough 跨物理AI研究中心)
;
RWTH Aachen University(亚琛工业大学)
GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding
GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解
Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司)
;
University of Science and Technology Beijing(北京科技大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
CommentsThis preprint has been accepted for publication in the proceedings of the IEEE 23rd International Symposium on Biomedical Imaging (ISBI 2026). The final published version is available at https://doi.org/10.1109/ISBI61048.2026.11515734. The copyright for this work has been transferred to IEEE
Journal refProceedings of the 23rd IEEE International Symposium on Biomedical Imaging (ISBI), 2026
MedLVR: Latent Visual Reasoning for Reliable Medical Visual Question Answering
MedLVR: 基于潜在视觉推理的可靠医学视觉问答
Suyang Xi, Songtao Hu, Yuxiang Lai, Wangyun Dan, Yaqi Liu, Shansong Wang, Xiaofeng Yang
机构
*
Department of Radiation Oncology and Winship Cancer Institute, Emory University School of Medicine(埃默里大学医学院放射肿瘤学系与温希普癌症研究所)
;
Department of Biostatistics and Bioinformatics, Emory University(埃默里大学生物统计学与生物信息学系)
The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning
多模态焦点的潮起潮落:为基于视觉的语言模型推理调度视觉中继窗口
Wencheng Ye, Yi Bin, Yujuan Ding, Hongye Fang, Zheng Wang, Xing Xu, Jingkuan Song, Yun Zhang, Sirui Da, Heng Tao Shen
机构
*
School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)
;
School of Fashion and Textiles, The Hong Kong Polytechnic University(香港理工大学纺织及制衣学院)
;
School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
University of Washington(华盛顿大学)
;
Chang’an University(长安大学)
;
University of Wisconsin - Madison(威斯康星大学麦迪逊分校)
机构
*
State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
YUKUN Intelligent World(宇琨智能世界)
Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning
在思考之前,先学会决策:面向高效视觉推理的主动路由
Yinan Zhou, Haokun Lin, Yichen Wu, Yuxin Chen, Teng Wang, Caifeng Shan, Zhenan Sun, Chen Ma, Li Zhu, Ying Shan
机构
*
Xi’an Jiaotong University(西安交通大学)
;
ARC Lab, Tencent IEG(腾讯IEG ARC实验室)
;
City University of Hong Kong(香港城市大学)
;
Institute of Automation, CAS(中国科学院自动化研究所)
;
Harvard University(哈佛大学)
;
Nanjing University(南京大学)