Seeing Together: Multi-Robot Cooperative Egocentric Spatial Reasoning with Multimodal Large Language Models
协同视见:基于多模态大语言模型的多机器人协作自体空间推理
Kunyu Peng, Zhikun Zhou, Kailun Yang, Di Wen, Ruiping Liu, Yufan Chen, Junwei Zheng, Hao Shi, Yi Zhou, M. Saquib Sarfraz, Danda Pani Paudel, Luc Van Gool
机构
*
Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
;
Hunan University(湖南大学)
;
University of Oxford(牛津大学)
;
Zhejiang University(浙江大学)
;
ETH Zurich(苏黎世联邦理工学院)
;
Ant Group(蚂蚁集团)
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
机构
*
Tencent Youtu Lab(腾讯云图实验室)
;
Sichuan University(四川大学)
;
University of the Chinese Academy of Sciences(中国科学院大学)
;
Fudan University(复旦大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
;
Nanyang Technological University(南洋理工大学)
专题命中
视觉推理
:visual reasoning(title);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
将多模态大语言模型引入红外-可见图像融合质量评估
Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su
机构
*
Northwestern University(西北大学)
;
Northeastern University(东北大学)
;
University of Washington(华盛顿大学)
;
Hong Kong Baptist University(香港 Baptist大学)
;
Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning
通过文本表示引导推理来解锁多模态大语言模型中的空间推理
Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu
机构
*
College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)
;
The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning
位置:多模态大语言模型可以显著推动科学推理
Yibo Yan, Shen Wang, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla Gomes, Bart Selman, Qingsong Wen
机构
*
Squirrel AI
;
HKUST(GZ)(香港科技大学(广州))
;
HKUST(香港科技大学)
;
Tsinghua University(清华大学)
;
University of Illinois at Chicago(伊利诺伊大学香槟分校)
;
Cornell University(康奈尔大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI
Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
RLVR能否扩展推理边界?探究视觉-语言模型中的能力扩展
Minghe Shen, Zhuo Zhi, Chonghan Liu, Shuo Xing, Zhengzhong Tu, Che Liu
机构
*
University College London(伦敦大学学院)
;
Samsung R&D Institute UK(三星英国研发院)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Texas A&M University(德克萨斯农工大学)
;
Imperial College London(伦敦帝国学院)
机构
*
Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
Southeast University(东南大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
National University of Singapore(新加坡国立大学)
;
Wuhan AI Research(武汉人工智能研究院)
;
Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)
专题命中
视觉推理
:MLLM(title,abstract);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV