Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation
通过自我场景增强在多模态大语言模型中强化自我中心空间感知
Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心)
;
The Hong Kong University of Science and Technology(香港科技大学)
专题命中
视觉问答
:multimodal large language model(title,abstract);visual question answering(abstract);分类 cs.CV
机构
*
School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)
;
MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus团队)
;
School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)
;
School of Data Science, Fudan University(复旦大学数据科学学院)
VGI-BENCH: Probing Visual Intelligence in Video Generation Models
VGI-BENCH:探究视频生成模型的视觉智能
Xuan He, Cong Wei, Yuhao Cheng, Linrui Ma, Yuxuan Zhang, Zuojun Li, Yuhao Wen, Zeyi Liu, Yuren Hao, Songcheng Cai, Keming Wu, Penghui Du, Kai Zou, Rui Yang, Chenkai Sun, Ke Yang, Ping Nie, Kelsey R Allen, Chenglong Wang, Michel Galley, Jianfeng Gao, ChengXiang Zhai
机构
*
University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Tsinghua University(清华大学)
;
University of Waterloo(滑铁卢大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Vector Institute(矢量研究所)
;
Microsoft Research(微软研究院)
;
Etude AI
机构
*
Hangzhou Institute for Advanced Study(杭州高等研究院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Computer Network Information Center(计算机网络信息中心)
;
Chinese Academy of Sciences(中国科学院)
Towards general embodied intelligence: integrating large language models, knowledge bases, and reasoning capabilities to build the next generation of AI agents
迈向通用具身智能:整合大语言模型、知识库与推理能力以构建下一代AI智能体
Fujiang Yuan, Xia Huang, Lusheng Wang, Jun Ding, Zhen Tian, Yuxin Wang, Shaojie Gu, Yuki Funabora, Yanhong Peng, Zebing Mao
机构
*
College of Mechanical Engineering, Chongqing University of Technology(重庆理工大学机械工程学院)
;
James Watt School of Engineering, University of Glasgow(格拉斯哥大学詹姆斯·瓦特工程学院)
;
School of Energy and Power, Jiangsu University of Science and Technology(江苏科技大学能源与动力学院)
;
Magnesium Research Center, Kumamoto University(熊本大学镁研究中心)
;
Department of Information and Communication Engineering, Nagoya University(名古屋大学信息与通信工程系)
;
State Key Laboratory of Fluid Power and Mechatronic Systems, Zhejiang University(浙江大学流体动力与机电系统国家重点实验室)
机构
*
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室(BIGAI))
;
Beijing Institute of Technology(北京理工大学)
;
Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)
;
State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室、北京大学智能科学与技术学院)
MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action
MPCoT: 奖励引导的多路径潜在推理用于测试时可扩展的视觉-语言-动作
Boyang Zhang, Lianlei Shan
机构
*
Department of Electrical and Computer Engineering, Boston University(波士顿大学电气与计算机工程系)
;
Department of Computer Science, Tsinghua University(清华大学计算机系)
ID-VTG: Image-Disambiguated Video Temporal Grounding
ID-VTG:基于图像消歧的视频时间定位
Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu
机构
*
Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)
;
State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)