机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Beihang University(北京航空航天大学)
;
Fuzhou University(福州大学)
;
Muka Robotics(木卡机器人)
Ground3D-LMM: Fine-Grained 3D Point Grounding and Spatial Reasoning with LMM
Ground3D-LMM:基于LMM的细粒度3D点接地与空间推理
Amol Harsh, Zongyan Han, Jean Lahoud, Ye Liu, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan
机构
*
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Linköping University(林雪平大学)
UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics
UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试
Yanxin Xi, Xiang Su, Jie Feng, Yu Liu, Sasu Tarkoma, Pan Hui
机构
*
University of Helsinki(赫尔辛基大学)
;
Zhongguancun Academy(中关村学院)
;
University of Oxford(牛津大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.AI
CommentsThis manuscript has been withdrawn by the authors. It reproduced the methodology of Gardinazzi et al., arXiv:2410.11042, without citation, and utilized code and data from the associated repository (github.com/RitAreaSciencePark/ZigZagLLMs) without disclosure or violate the MIT License. A revised future version with full attribution may be prepared. For any feedback, please contact Pengcheng Zheng
机构
*
Kyoto University(京都大学)
;
NII LLMC(日本国立信息与通信技术研究所语言模型中心)
;
RIKEN AIP(日本理化学研究所先进理工研究所)
;
Case Western Reserve University(凯斯西储大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
The University of Osaka(大阪大学)
;
University of Tokyo(东京大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.CV
机构
*
Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系)
;
Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系)
;
Zhongguancun Academy, Beijing, China(中关村学院)
;
China Agricultural University, Beijing, China(中国农业大学)
;
Peking University, Beijing, China(北京大学)
;
Beijing Institute of Technology, Beijing, China(北京理工大学)
;
Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院)
;
WeChat Vision, Tencent Inc, Beijing, China(微信视觉,腾讯公司)
Self-supervised Hierarchical Visual Reasoning with World Model
基于世界模型的自监督分层视觉推理
Yuanfei Xu, Lin Liu, Wengang Zhou, Mingxiao Feng, Houqiang Li
机构
*
Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)
机构
*
Department of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)
;
Department of Computer Science, National Taiwan University(国立台湾大学计算机科学系)
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.CV
ChatSR: Multimodal Large Language Models for Scientific Formula Discovery
ChatSR:用于科学公式发现的多模态大语言模型
Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning
机构
*
AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国)
;
School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国)
;
Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)
;
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国)
;
College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国)
;
School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.AI