RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics
RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用
Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang
机构
*
Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)
;
YXGN Robotics(YXGN机器人)
;
China University of Mining and Technology(中国矿业大学)
;
Shenzhen Technology University(深圳技术大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
Xiamen University(厦门大学)
OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models
OpenMedReason: 医学视觉语言模型的科学推理监督
Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci, Abeer Badawi, Adibvafa Fallahpour, Arash Afkanpour, Leonid Sigal, Ali Etemad, Elham Dolatabadi
机构
*
York University(约克大学)
;
Vector Institute(向量研究所)
;
University of British Columbia(不列颠哥伦比亚大学)
;
University of Toronto(多伦多大学)
;
Unity Health Toronto / St. Michael’s Hospital(多伦多联合健康/圣迈克尔医院)
;
University Health Network(大学健康网络)
;
Arc Institute(弧研究所)
;
Queen's University(女王大学)
PlanBench-V: A Spatial Planning Map Benchmark for Vision-Language Models
PlanBench-V: 面向视觉语言模型的空间规划地图基准
Minxin Chen, He Zhu, Junyou Su, Wen Wang, Yijie Deng, Wenjia Zhang
机构
*
Behavioral and Spatial AI Lab(行为与空间人工智能实验室)
;
Tongji University(同济大学)
;
Peking University(北京大学)
;
College of Architecture and Urban Planning(建筑与城市规划学院)
Task-Aware Bimanual Affordance Prediction via VLM-Guided Semantic-Geometric Reasoning
基于VLM引导的语义-几何推理的任务感知双臂 affordance 预测
Fabian Hahne, Vignesh Prasad, Georgia Chalvatzaki, Jan Peters, Alap Kshirsagar
机构
*
Department of Computer Science, Technical University of Darmstadt(达姆施塔特工业大学计算机科学系)
;
German Research Center for AI (DFKI)(德国人工智能研究中心)
;
Centre for Cognitive Science, Technical University of Darmstadt(达姆施塔特工业大学认知科学中心)
;
Hessian Center for Artificial Intelligence (Hessian.AI), Darmstadt(黑森州人工智能中心)
;
Robotics Institute Germany (RIG)(德国机器人研究所)
机构
*
East China Normal University(东华大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Innovation Institute(上海创新研究院)
;
University of Agder(阿格德大学)
MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models
MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集
Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi, Yoshitaka Ushiku, Keisuke Nagato
专题命中
视觉推理
:multimodal large language model(title,abstract);visual reasoning(abstract)
机构
*
State Key Laboratory of Internet of Things for Smart City (SKL-IOTSC), University of Macau(物联网智能城市国家重点实验室,澳门大学)
;
Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)
专题命中
视觉推理
:vision language model(title);vision-language model(abstract);VLM(abstract)
RuCL: Stratified Rubric-Based Curriculum Learning for Multimodal Large Language Model Reasoning
RuCL:基于分层评分标准的课程学习用于多模态大语言模型推理
Yukun Chen, Jiaming Li, Longze Chen, Ze Gong, Jingpeng Li, Zhen Qin, Hengyu Chang, Ancheng Xu, Zhihao Yang, Hamid Alinejad-Rokny, Qiang Qu, Bo Zheng, Min Yang
机构
*
Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Alibaba Group(阿里巴巴集团)
;
School of Biomedical Engineering, UNSW Sydney(新南威尔士大学生物医学工程学院)
专题命中
视觉推理
:multimodal large language model(title,abstract);visual reasoning(abstract)
COVLM-RL: Critical Object-Oriented Reasoning for Autonomous Driving Using VLM-Guided Reinforcement Learning
COVLM-RL:基于VLM引导强化学习的自动驾驶中关键对象导向推理
Lin Li, Yuxin Cai, Jianwu Fang, Jianru Xue, Chen Lv
机构
*
School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院)
;
National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究院)
Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models
Yunqi Hong, Johnson Kao, Liam Edwards, Nein-Tzu Liu, Chung-Yen Huang, Alex Oliveira-Kowaleski, Cho-Jui Hsieh, Neil Y. C. Lin
机构
*
Computer Science Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系)
;
Mechanical and Aerospace Engineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校机械与航空航天工程系)
;
Department of Pathology, Tri-Service General Hospital, National Defense Medical Center, Taipei, Taiwan(台湾国防医学院三军总医院病理部)
;
Department of Pathology, National Taiwan University Hospital, Taipei, Taiwan(台湾国立台湾大学医院病理部)
;
Department of Pathology, David Geffen School of Medicine, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校大卫·Geffen医学院病理部)
;
Bioengineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校生物工程系)
;
Institute for Quantitative and Computational Biosciences, University of California, CA, USA(加州大学定量与计算生物科学研究所)
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
TopoPerception: A Shortcut-Free Evaluation of Global Visual Perception in Large Vision-Language Models
Wenhao Zhou, Hao Zheng, Rong Zhao
机构
*
Center for Brain-Inspired Computing Research (CBICR)(脑启发计算研究中心)
;
Department of Precision Instruments(精密仪器系)
;
IDG/McGovern Institute for Brain Research(IDG/麦戈文脑研究学院)
Aligning MLLM Benchmark With Human Preferences via Structural Equation Modeling
Shengwu. Xiong, Tianyu. Zou, Cong. Wang, Xuelong Li
机构
*
Interdisciplinary Artificial Intelligence Research Institute, Wuhan College(交叉学科人工智能研究 institute,武汉学院)
;
School of Computer and Artificial Intelligence, Wuhan University of Technology(计算机与人工智能学院,武汉理工大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Sanya Science and Education Innovation Park, Wuhan University of Technology(三亚科学教育创新园,武汉理工大学)
;
Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院)
;
School of Mathematics and Statistics, Northwestern Polytechnical University(数学与统计学院,西北工业大学)
;
Institute of Artificial Intelligence (TeleAI) of China Telecom(中国电信人工智能研究所(TeleAI))
专题命中
视觉推理
:MLLM(title,abstract);multimodal large language model(abstract)