机构
*
Chongqing University(重庆大学)
;
Tianjin University(天津大学)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院MAIS)
;
Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局高性能计算研究所)
;
Chongqing National Data AI Research Institute, AI Research Lab(重庆国家数据AI研究院,AI研究实验室)
机构
*
EPIC Lab, Shanghai Jiao Tong University(上海交通大学EPIC实验室)
;
Tsinghua University(清华大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Fudan University(复旦大学)
VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?
VideoASMR-Bench: AI生成的ASMR视频能否欺骗视觉语言模型和人类?
Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
National University of Singapore(新加坡国立大学)
;
Peking University(北京大学)
;
Monash University(墨尔本大学)
;
Video Rebirth
;
University of Oxford(牛津大学)
机构
*
College of Health Science and Technology, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海交通大学医学院健康科学与技术学院)
;
Fudan University, Shanghai, China(复旦大学)
;
Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
;
Tsinghua University, Beijing, China(清华大学)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)
;
The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)
;
Ruijin Hospital, Shanghai Jiaotong University, Shanghai, China(上海交通大学瑞金医院)
机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shenzhen Loop Area Institute(深圳河套学院)
Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior
少即是多,但在哪里?通过LLM引导的关键帧先验实现动态令牌压缩
Yulin Li, Haokun Gui, Ziyang Fan, Junjie Wang, Bin Kang, Bin Chen, Zhuotao Tian
机构
*
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Shenzhen Loop Area Institute(深圳河套学院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
SVAC: Scaling Is All You Need For Referring Video Object Segmentation
Li Zhang, Haoxiang Gao, Zhihao Zhang, Luoxiao Huang, Tao Zhang
机构
*
Columbia University New York, USA(哥伦比亚大学)
;
Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学)
;
New York University New York, USA(纽约大学)
;
Wuhan University Wuhan, China(武汉大学)
B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens
Zhuqiang Lu, Zhenfei Yin, Mengwei He, Zhihui Wang, Zicheng Liu, Zhiyong Wang, Kun Hu
机构
*
School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
;
Department of Engineering Science, University of Oxford(牛津大学工程科学系)
;
International School of Information Science and Engineering, Dalian University of Technology(大连理工大学信息科学与工程国际学院)
;
Advanced Micro Devices(先进微器件公司)
;
School of Science, Edith Cowan University(埃迪斯科文大学科学学院)