MAPS: Advancing Multi-Modal Reasoning in Expert-Level Physical Science
Erle Zhu, Yadi Liu, Zhe Zhang, Xujun Li, Jin Zhou, Xinjie Yu, Minlie Huang, Hongning Wang
机构
*
The Conversational AI (CoAI) Group(对话人工智能小组)
;
Department of Computer Science & Technology(计算机科学与技术系)
;
Department of Electrical Engineering(电子工程系)
专题命中
视觉推理
:visual language model(abstract);visual reasoning(abstract);MLLM(abstract);分类 cs.AI
Journal refProceedings of the 13th International Conference on Learning Representations (ICLR), 2025
LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning
LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航
Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang
机构
*
University of Science and Technology of China(中国科学技术大学)
;
MBZUAI(穆罕默德·本·扎耶德人工智能大学)
;
Stanford University(斯坦福大学)
;
Amap, Alibaba Group(阿里巴巴集团高德地图)
;
Shanghai AI Laboratory(上海人工智能实验室)
ContextRL: Enhancing MLLM's Knowledge Discovery Efficiency with Context-Augmented RL
ContextRL: 通过上下文增强强化学习提升大语言模型的知识发现效率
Xingyu Lu, Jinpeng Wang, YiFan Zhang, Shijie Ma, Xiao Hu, Tianke Zhang, Haonan fan, Kaiyu Jiang, Changyi Liu, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan
机构
*
Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Chinese Academy of Sciences(中国科学院)
;
Tsinghua University(清华大学)
COGITAO: A Visual Reasoning Framework To Study Compositionality & Generalization
COGITAO:一个用于研究组合性与泛化能力的视觉推理框架
Yassine Taoudi-Benchekroun, Klim Troyan, Pascal Sager, Stefan Gerber, Lukas Tuggener, Benjamin Grewe
机构
*
Institute of Neuroinformatics, University of Zurich(神经信息研究所,苏黎世大学)
;
ETH Zurich(苏黎世联邦理工学院)
;
Centre for Artificial Intelligence, Zurich University of Applied Sciences(人工智能中心,应用科学大学)
机构
*
The University of New South Wales, Sydney, New South Wales, Australia(新南威尔士大学)
;
The University of Sydney, Sydney, New South Wales, Australia(悉尼大学)
;
School of Software and Microelectronics, Peking University, Zibo, Shandong, China(北京大学软件与微电子学院)
;
Shandong University of Technology, Beijing, China(山东理工大学)
机构
*
College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学)
;
State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室)
;
BNRist, Tsinghua University(清华大学北京研究院)
;
Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)
GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model
GLACIA:基于多模态大语言模型的冰湖分割实例感知位置推理
Lalit Maurya, Saurabh Kaushik, Beth Tellman
机构
*
Portsmouth AI and Data Science Centre (PAIDS), School of Computing, University of Portsmouth(普森大学计算学院)
;
Center for Sustainability and the Global Environment (SAGE), University of Wisconsin–Madison(威斯康星大学麦迪逊分校可持续性与全球环境中心)
专题命中
视觉推理
:multimodal large language model(title);分类 cs.CV、cs.AI