Proprioception Enhances Vision Language Model in Generating Captions and Subtask Segmentations for Robot Task
本体感知增强视觉语言模型在为机器人任务生成描述和子任务分割中的应用
Kanata Suzuki, Shota Shimizu, Tetsuya Ogata
机构
*
Faculty of Science and Engineering, Waseda University(工学部,早稻田大学)
;
Artificial Intelligence Laboratory, Fujitsu Limited(Fujitsu 人工智能实验室)
;
National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)
VRoPE: Rotary Position Embedding for Video Large Language Models
Zikang Liu, Longteng Guo, Yepeng Tang, Tongtian Yue, Junxian Cai, Kai Ma, Qingbin Liu, Xi Chen, Jing Liu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院)
;
Basic Algorithm Center, Tencent(腾讯基础算法中心)