SAT: Dynamic Spatial Aptitude Training for Multimodal Language Models
SAT:多模态语言模型的动态空间能力训练
Arijit Ray, Jiafei Duan, Ellis Brown, Reuben Tan, Dina Bashkirova, Rose Hendrix, Kiana Ehsani, Aniruddha Kembhavi, Bryan A. Plummer, Ranjay Krishna, Kuo-Hao Zeng, Kate Saenko
机构
*
Boston University(波士顿大学)
;
University of Washington(华盛顿大学)
;
Allen Institute for AI(人工智能研究院)
;
Microsoft Research(微软研究院)
;
New York University(纽约大学)
Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding
Songtao Jiang, Yuan Wang, Sibo Song, Tianxiang Hu, Chenyi Zhou, Bin Pu, Yan Zhang, Zhibo Yang, Yang Feng, Joey Tianyi Zhou, Jin Hao, Zijian Chen, Ruijia Wu, Tao Tang, Junhui Lv, Hongxia Xu, Hongwei Wang, Jun Xiao, Bin Feng, Fudong Zhu, Kenli Li, Weidi Xie, Jimeng Sun, Jian Wu, Zuozhu Liu
机构
*
College of Computer Science and Technology, Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学计算机科学与技术学院)
;
Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine(浙江大学口腔医院)
;
Alibaba Inc(阿里巴巴集团)
;
College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)
;
Angelalign Technology Inc.(Angelalign技术有限公司)
;
CFAR & IHPC, Agency for Science, Technology and Research(CFAR与IHPC,新加坡科技研究局)
;
Department of Orthodontics, Shanghai Ninth People’s Hospital, College of Stomatology, Shanghai Jiao Tong University(上海第九人民医院正畸科,上海交通大学口腔医学院)
StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA
Yuhang Hu, Zhenyu Yang, Shihan Wang, Shengsheng Qian, Bin Wen, Fan Yang, Tingting Gao, Changsheng Xu
机构
*
Henan Institute of Advanced Technology, Zhengzhou University(河南高级技术研究所,郑州大学)
;
Institute of Automation, CAS(自动化研究所,中国科学院)
;
UCAS(中国科学院大学)
;
Peng Cheng Laboratory(鹏城实验室)
PVChat: Personalized Video Chat with One-Shot Learning
Yufei Shi, Weilong Yan, Gang Xu, Yumeng Li, Yucheng Chen, Zhenxi Li, Fei Richard Yu, Ming Li, Si Yong Yeo
机构
*
MedVisAI Lab(MedVisAI实验室)
;
National University of Singapore(新加坡国立大学)
;
Nankai University(南开大学)
;
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))
;
Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科谦医学院)
Gather and Trace: Rethinking Video TextVQA from an Instance-oriented Perspective
Yan Zhang, Gangyan Zeng, Daiqing Wu, Huawen Shen, Binbin Li, Yu Zhou, Can Ma, Xiaojun Bi
机构
*
Institute of Information Engineering, Chinese Academy of Sciences School of Cyber Security, University of Chinese Academy of Sciences Beijing China
;
School of Cyber Science
;
Engineering, Nanjing University of Science
;
VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University Tianjin China
;
Key Laboratory of Ethnic Language Intelligent Analysis
;
Security Governance of MOE, Minzu University of China Beijing China
;
Institute of Information Engineering, Chinese Academy of Sciences
;
School of Cyber Security, University of Chinese Academy of Sciences
;
VCIP \& TMCC \& DISSec, College of Computer Science, Nankai University
;
Security Governance of MOE, Minzu University of China
VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos
Tingyu Song, Tongyan Hu, Guo Gan, Yilun Zhao
机构
*
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)
;
National University of Singapore(新加坡国立大学)
;
Zhejiang University(浙江大学)
;
Yale University(耶鲁大学)