机构
*
Department of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)
;
Department of Computer Science, National Taiwan University(国立台湾大学计算机科学系)
机构
*
Wuhan University of Technology(武汉理工大学)
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai AI Lab(上海人工智能实验室)
;
University of Oxford(牛津大学)
;
INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
OPPO AI Center(OPPO AI中心)
CheXTemporal: A Dataset for Temporally-Grounded Reasoning in Chest Radiography
CheXTemporal:用于胸部X光影像中时间感知推理的数据集
Eva Prakash, Yunhe Gao, Chong Wang, Justin Xu, Neal Prakash, Arne Michalson, Seena Dehkharghani, Eun Kyoung Hong, Julie Bauml, Roger Boodoo, Jean-Benoit Delbrouck, Sophie Ostmeier, Curtis Langlotz
机构
*
Stanford University(斯坦福大学)
;
University of Oxford(牛津大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
HOPPR
;
University Hospital Zurich(苏黎世大学医院)
MolmoAct2: Action Reasoning Models for Real-world Deployment
MolmoAct2:面向现实部署的动作推理模型
Haoquan Fang, Jiafei Duan, Donovan Clay, Sam Wang, Shuo Liu, Weikai Huang, Xiang Fan, Wei-Chuan Tsai, Shirui Chen, Yi Ru Wang, Shanli Xing, Jaemin Cho, Jae Sung Park, Ainaz Eftekhar, Peter Sushko, Karen Farley, Angad Wadhwa, Cole Harrison, Winson Han, Ying-Chun Lee, Eli VanderBilt, Rose Hendrix, Suveen Ellawela, Lucas Ngoo, Joyce Chai, Zhongzheng Ren, Ali Farhadi, Dieter Fox, Ranjay Krishna
机构
*
Allen Institute for AI(艾伦人工智能研究所)
;
University of Washington(华盛顿大学)
;
National University of Singapore(新加坡国立大学)
;
University of Pennsylvania(宾夕法尼亚大学)
;
Johns Hopkins University(约翰霍普金斯大学)
;
Amazon(亚马逊公司)
;
University of Michigan(密歇根大学)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation
无人机视角下视觉语言模型能否思考?统一无人机推理与生成
Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng
机构
*
Beijing Institute of Technology(北京理工大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部)
;
University of Macau(澳门大学)
RareCollab: an LLM-powered framework for multimodal reasoning in Mendelian disease diagnosis
RareCollab: 一种基于大语言模型的多模态推理框架,用于孟德尔疾病诊断
Guantong Qi, Jiasheng Wang, Mei Ling Chong, Zahid Shaik, Shenglan Li, Shinya Yamamoto, Maura R. Z. Ruzhnikov, Devon E. Bonner, Jennefer N. Carter, Kevin S. Smith, Matthew T. Wheeler, Stephen B. Montgomery, Jonathan A. Bernstein, Sasidhar Pasupuleti, Undiagnosed Diseases Network, Pengfei Liu, Hu Chen, Zhandong Liu
X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis
X-PCR:眼科诊断中跨模态渐进临床推理的基准测试
Gui Wang, Zehao Zhong, YongSong Zhou, Yudong Li, Ende Wu, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen
机构
*
School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
Tsinghua University(清华大学)
;
University of Nottingham(诺丁汉大学)
;
School of AI, Shenzhen University(深圳大学人工智能学院)
;
Wenzhou Medical University(温州医科大学)
;
Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)
GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models
GeoArena:在大视觉-语言模型中评估开放世界地理推理
Pengyue Jia, Yingyi Zhang, Xiangyu Zhao, Sharon Li
机构
*
Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)
;
Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)