机构
*
Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院)
;
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)
;
School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院)
;
Singapore University of Technology and Design(新加坡科技与设计大学)
;
University of Auckland(奥克兰大学)
;
University of Science and Technology of China(中国科学技术大学)
;
School of Computer Science, Peking University(北京大学计算机学院)
;
College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构
*
Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院)
;
Shanghai Collaborative Innovation Center on Intelligent Visual Computing(上海智能视觉计算协同创新中心)
;
MiniMax
Text to Robotic Assembly of Multi Component Objects using 3D Generative AI and Vision Language Models
通过3D生成AI和视觉语言模型实现多组件物体的文本到机器人组装
Alexander Htet Kyaw, Richa Gupta, Dhruv Shah, Anoop Sinha, Kory Mathewson, Stefanie Pender, Sachin Chitta, Yotto Koga, Faez Ahmed, Lawrence Sass, Randall Davis
机构
*
Massachusetts Institute of Technology (MIT)(麻省理工学院)
;
MIT(麻省理工学院)
;
Google DeepMind(谷歌DeepMind)
;
Google, Paradigms of Intelligence(谷歌、范式智能)
;
Autodesk Research(Autodesk研究)
;
MIT Mechanical Engineering(麻省理工学院机械工程系)
;
MIT Architecture(麻省理工学院建筑系)
;
MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中
视觉推理
:vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
机构
*
Nanjing University(南京大学)
;
Xiaohongshu Inc.(小红书公司)
;
East China Normal University(华东师范大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Oxford(牛津大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
ZING-3D: Zero-shot Incremental 3D Scene Graphs via Vision-Language Models
Pranav Saxena, Jimmy Chiun
机构
*
Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,比拉戈阿校园)
;
Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(设计与工程学院机械工程系,新加坡国立大学)
机构
*
Northwestern University(西北大学)
;
University of Washington(华盛顿大学)
;
Stanford University(斯坦福大学)
;
Microsoft(微软)
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
Towards General Urban Monitoring with Vision-Language Models: A Review, Evaluation, and a Research Agenda
André Torneiro, Diogo Monteiro, Paulo Novais, Pedro Rangel Henriques, Nuno F. Rodrigues
机构
*
ALGORITMI Research Centre/LASI(ALGORITMI研究机构/LASI)
;
University of Minho(明霍大学)
;
Logimade(Logimade公司)
;
INESC TEC(INESC TEC研究机构)
;
Ai, School of Technology(2Ai技术学院)
;
IPCA
MMRQA: Signal-Enhanced Multimodal Large Language Models for MRI Quality Assessment
Fankai Jia, Daisong Gan, Zhe Zhang, Zhaochi Wen, Chenchen Dan, Dong Liang, Haifeng Wang
机构
*
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
ShanghaiTech University(上海理工大学)
;
Southern University of Science and Technology(南方科技大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV