RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics
RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用
Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang
机构
*
Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)
;
YXGN Robotics(YXGN机器人)
;
China University of Mining and Technology(中国矿业大学)
;
Shenzhen Technology University(深圳技术大学)
;
Huazhong University of Science and Technology(华中科技大学)
;
Xiamen University(厦门大学)
机构
*
MoE Key Lab of Artificial Intelligence, AI Institute, School of Computer Science, Shanghai Jiao Tong University(人工智能大模型重点实验室,人工智能学院,计算机科学学院,上海交通大学)
;
Qwen Team(通义实验室)
;
Beijing Institute of Technology(北京理工大学)
;
Tsinghua University(清华大学)
;
Zhejiang University(浙江大学)
CityRiSE: Reasoning Urban Socio-Economic Status in Large Vision-Language Models via Reinforcement Learning
CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架
Tianhui Liu, Hetian Pang, Xin Zhang, Jie Feng, Pan Hui, Yong Li
机构
*
Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心)
;
Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)
机构
*
National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心)
;
Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)
;
Tsinghua University(清华大学)
;
Chinese Academy of Sciences(中国科学院)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Renmin University of China(中国人民大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.CV、cs.AI
机构
*
Cardiff University(卡迪夫大学)
;
Shandong University of Science and Technology(山东科技大学)
;
University of Exeter(埃克塞特大学)
;
Shenzhen University(深圳大学)
;
Sun Yat-sen University(中山大学)
;
University of Ottawa(渥太华大学)
机构
*
National University of Singapore(新加坡国立大学)
;
PuzzleLogic Pte Ltd(拼图逻辑私人有限公司)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)
;
Peking Union Medical College Hospital(北京协和医院)
Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowska, Artem Belopolsky, Koen Hindriks, Pablo Cesar, Junxiao Wang, Jiahuan Pei
机构
*
Vrije University of Amsterdam University of Amsterdam Centrum Wiskunde \& Informatic
;
University of Amsterdam National Institute of Informatics Centrum Wiskunde \& Informatic
;
Centrum Wiskunde \& Informatic Leiden University University College London
;
Vrije University of Amsterdam
;
Centrum Wiskunde \& Informatica Technische Universiteit Delft Guangzhou University
;
Vrije University of Amsterdam Centrum Wiskunde \& Informatic
CycliST: A Video Language Model Benchmark for Reasoning on Cyclical State Transitions
CycliST:用于循环状态转换推理的视频语言模型基准
Simon Kohaut, Daniel Ochs, Shun Zhang, Benedict Flade, Julian Eggert, Kristian Kersting, Devendra Singh Dhami
机构
*
Artificial Intelligence and Machine Learning Lab, TU Darmstadt(人工智能与机器学习实验室,图腾斯达特技术大学)
;
Konrad Zuse School of Excellence in Learning and Intelligent Systems (ELIZA)(Konrad Zuse 学校(ELIZA))
;
Honda Research Institute Europe GmbH, Offenbach, Germany(本田欧洲研究院,奥芬巴赫,德国)
;
Uncertainty in Artificial Intelligence Group, TU Eindhoven(人工智能不确定性小组,埃因霍温技术大学)
;
Hessian Center for AI (hessian.AI)(黑森人工智能中心(hessian.AI))
;
Center for Cognitive Science(认知科学中心)
;
German Center for Artificial Intelligence (DFKI)(德国人工智能中心(DFKI))