Towards Responsible Multimodal Medical Reasoning via Context-Aligned Vision-Language Models
通过上下文对齐的视觉-语言模型实现负责任的多模态医疗推理
Sumra Khan, Sagar Chhabriya, Aizan Zafar, Sheeraz Arif, Amgad Muneer, Anas Zafar, Shaina Raza, Rizwan Qureshi
机构
*
Salim Habib University(萨利姆·哈比卜大学)
;
Institute of Business Administration Sukkur(苏库尔工商管理学院)
;
University of Central Florida(中佛罗里达大学)
;
The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)
;
Toronto Metropolitan University(多伦多都会大学)
;
Vector Institute(向量研究所)
Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework
聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架
Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang
机构
*
National University of Defense Technology(国防科技大学)
;
Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司)
;
Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Wuhan AI Research(武汉人工智能研究院)
TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots
TeamPath: 构建多模态病理专家的推理AI助手
Tianyu Liu, Weihao Xuan, Hao Wu, Peter Humphrey, Marcello DiStasio, Mohamed Kahila, Alfonso Garcia Tan, Heli Qi, Rui Yang, Simeng Han, Tinglin Huang, Fang Wu, Chen Liu, Qingyu Chen, Nan Liu, Irene Li, Hua Xu, Hongyu Zhao
机构
*
Interdepartmental Program in Computational Biology and Biomedical Informatics, Yale University(耶鲁大学计算生物学与生物医学信息学跨学科项目)
;
Department of Biostatistics, Yale University(耶鲁大学生物统计学系)
;
Broad Institute of MIT and Harvard(博德研究所)
;
Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系)
;
Center for Advanced Intelligence Project, RIKEN(理化学研究所先进智能项目中心)
;
Department of Pathology, Yale University(耶鲁大学病理学系)
;
Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理学系)
;
Center for Biomedical Data Science, Duke–NUS Medical School, Singapore, Singapore(杜克-新加坡国立大学医学院生物医学数据科学中心)
;
Department of Computer Science, Yale University(耶鲁大学计算机科学系)
;
Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning
TTA-Vid: 视频推理的通用测试时间适应
Soumya Shamarao Jahagirdar, Edson Araujo, Anna Kukleva, M. Jehanzeb Mirza, Saurabhchand Bhati, Samuel Thomas, Brian Kingsbury, Rogerio Feris, James R. Glass, Hilde Kuehne
机构
*
University of Tübingen(蒂宾根大学)
;
MIT(麻省理工学院)
;
IBM Research(IBM研究院)
;
MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
;
Tuebingen AI Center(蒂宾根人工智能中心)
;
Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)
机构
*
Tsinghua University(清华大学)
;
Shanda AI Research Tokyo(盛大人工智能研究院东京)
;
Shanghai AI Lab(上海人工智能实验室)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Peking University(北京大学)
Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning
Know-Show:在时空 grounded 推理上评估视频语言模型的基准测试
Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando
机构
*
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
;
Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所)
;
Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)
机构
*
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of California, Merced(加州大学默塞德分校)
;
University of Queensland(昆士兰大学)
From Prediction to Diagnosis: Reasoning-Aware AI for Photovoltaic Defect Inspection
从预测到诊断:面向光伏缺陷检测的推理感知AI
Dev Mistry, Feng Qiu, Bo Chen, Feng Liu, Can Chen, Mohammad Shahidehpour, Ren Wang
机构
*
Illinois Institute of Technology(伊利诺伊理工学院)
;
Argonne National Laboratory(阿贡国家实验室)
;
Commonwealth Edison(联邦爱迪生公司)
;
Drexel University(德雷塞尔大学)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
GIR-Bench:用于生成图像的多功能基准
Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Peking University(北京大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Xiaohongshu Inc.(小红书公司)
Think and Answer ME: Benchmarking and Exploring Multi-Entity Reasoning Grounding in Remote Sensing
思考并回答ME:基准测试和探索遥感中的多实体推理 grounding
Shuchang Lyu, Haiquan Wen, Guangliang Cheng, Meng Li, Zheng Zhou, You Zhou, Dingding Yao, Zhenwei Shi
机构
*
Beihang University, Beijing, China(北京航空航天大学)
;
University of Liverpool, Liverpool, UK(利物浦大学)
;
Institute of Acoustics, Chinese Academy of Sciences, Beijing, China(中国科学院声学研究所)
MERGE: Guided Vision-Language Models for Multi-Actor Event Reasoning and Grounding in Human-Robot Interaction
MERGE:面向人类机器人交互中多主体事件推理与 grounding 的引导视觉-语言模型
Joerg Deigmoeller, Nakul Agarwal, Stephan Hasler, Daniel Tanneberg, Anna Belardinelli, Reza Ghoddoosian, Chao Wang, Felix Ocker, Fan Zhang, Behzad Dariush, Michael Gienger
机构
*
Honda Research Institute Europe(本田欧洲研究院)
;
Honda Research Institute USA(本田美国研究院)