机构
*
East China Normal University(东华大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
University of Agder(阿格德大学)
MARCUS: An agentic, multimodal vision-language model for cardiac diagnosis and management
MARCUS:一种用于心脏诊断和管理的代理式多模态视觉-语言模型
Jack W O'Sullivan, Mohammad Asadi, Lennart Elbe, Akshay Chaudhari, Tahoura Nedaee, Francois Haddad, Michael Salerno, Li Fe-Fei, Ehsan Adeli, Rima Arnaout, Euan A Ashley
机构
*
Division of Cardiology, Department of Medicine, Stanford University(斯坦福大学心脏病学系)
;
Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系)
;
Department of Medicine, Radiology, and Pediatrics, UCSF(旧金山大学医学系、放射学与儿科学系)
;
Bakar Institute, UCSF(Bakar研究所,旧金山大学)
;
UCSF–UC Berkeley Joint Program in Computational Precision Health(旧金山大学-伯克利计算精准健康联合计划)
;
Department of Radiology, Stanford University(斯坦福大学放射学系)
;
Department of Psychiatry and Behavioral Sciences, Stanford University(斯坦福大学精神病学与行为科学系)
;
Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
;
Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)
;
Department of Biology, Stanford University(斯坦福大学生物学系)
Mind over Space: Can Multimodal Large Language Models Mentally Navigate?
心灵超越空间:多模态大语言模型能否进行心理导航?
Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei
机构
*
Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)
;
Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系)
;
School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院)
;
college of AI, Tsinghua University(清华大学人工智能学院)
;
Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)
专题命中
视觉推理
:multimodal large language model(title);分类 cs.AI
机构
*
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
;
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
;
Department of Automation, Tsinghua University(清华大学自动化系)
Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
面向可扩展多模态推理的推理对齐感知解耦
Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang
机构
*
Southern University of Science and Technology(南方科技大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
Huawei Cloud Project(华为云项目)
机构
*
School of Mechanics and Engineering Science, Peking University, Beijing, 100871, China(北京理工大学机械与工程科学学院)
;
Readraft Intelligent Technology Co., Ltd., China(读raft智能科技有限公司)
;
Graduate School of Education, Peking University, Beijing, 100871, China(北京大学教育学院)
;
AI for Science Institute, Beijing, 100080, China(AI for Science研究院)
GIR-Bench: Versatile Benchmark for Generating Images with Reasoning
GIR-Bench:用于生成图像的多功能基准
Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Peking University(北京大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Xiaohongshu Inc.(小红书公司)