Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding
金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解
Haodi Liu, Xinhang Yang, Kunda Yan, Sen Cui, Zeyu Zhang, Changshui Zhang
机构
*
Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心)
;
State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)
FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation
FOCA: 面向未来的条件化用于数据高效的视觉-语言-动作适应
Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen, Trong-Bao Ho, Doanh Le, Tan Q. Nguyen, Thien-Loc Ha, Nhiem Tran, Bao Thach, Nhat X. Tran, Tuan A. Tran, Artur Habuda, Philip Lund Møller, Tran Nguyen Le, Daniel Sonntag, Matthias Niepert, Khoa D. Doan, Vu Duong, Hung Ngo, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien
机构
*
Center for AI Research, VinUniversity, Vietnam
;
University of Utah, USA
;
German Research Center for Artificial Intelligence (DFKI)
;
Technical University of Denmark, Denmark
;
University of Oldenburg, Germany
;
University of Stuttgart, Germany
;
Max Planck Research School for Intelligent Systems (IMPRS-IS), Germany
NEST: Narrative Event Structures in Time for Long Video Understanding
NEST:面向长视频理解的时间叙事事件结构
Ali Asgarov, Kaushik Narasimhan, Najibul Haque Sarker, Hani Alomari, Chia-Wei Tang, Anushka Sivakumar, Zaber Ibn Abdul Hakim, Shaurya Mallampati, Chris Thomas
机构
*
Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系)
FEMOT: Multi-Object Tracking using Frame and Event Cameras
FEMOT: 使用帧和事件摄像机的多目标跟踪
Shiao Wang, Xiao Wang, Chao Wang, Yitao Li, Menghao Liu, Bo Jiang, Yaowei Wang, Yonghong Tian, Jin Tang
机构
*
School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)
;
Peng Cheng Laboratory(鹏城实验室)
;
National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理全国重点实验室)
;
School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
Learning Physical Interaction: A Survey of Tactile- and Force-aware Robot Learning
学习物理交互:触觉与力感知机器人学习综述
Shilin Shan, Chuhao Zhou, Ruize Wang, Xinyan Chen, Xiangyu Chen, Xinyu Zhou, Boyu Ma, Iris Yuxuan Hu, Jingliang Li, Celeste Yuxuan Hu, Geng Li, Guohao Chen, Tianrui Zhu, Zhe Li, Yanjie Ze, Haoran Geng, Zhiyang Dou, Jianxin Bi, Yuejiang Liu, Jianshu Zhou, Jiachen Li, Paul Liang, Tatsuya Harada, Robert Katzschmann, Harold Soh, Na Li, Edward Johns, Danica Kragic, Jan Peters, Wojciech Matusik, Masayoshi Tomizuka, Jitendra Malik, Jianfei Yang
机构
*
Nanyang Technological University(南洋理工大学)
;
Stanford University(斯坦福大学)
;
University of California, Berkeley(加利福尼亚大学伯克利分校)
;
Massachusetts Institute of Technology(麻省理工学院)
;
National University of Singapore(新加坡国立大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
The University of Tokyo(东京大学)
;
ETH Zurich(苏黎世联邦理工学院)
;
Harvard University(哈佛大学)
;
Imperial College London(伦敦帝国学院)
;
KTH Royal Institute of Technology(瑞典皇家理工学院)
;
Technical University of Darmstadt(达姆施塔特工业大学)
Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
PediaMed AI
;
Shenzhen Children’s Hospital(深圳市儿童医院)
;
Hong Kong Polytechnic University(香港理工大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))