机构
*
South China University of Technology(华南理工大学)
;
The University of Hong Kong(香港大学)
;
Snap Inc(Snap公司)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
MedStreamBench: A Time-Aware Benchmark for Streaming and Proactive Medical Video Understanding
MedStreamBench: 面向流式与主动式医疗视频理解的时间感知基准
Yuan Wang, Shujian Gao, Songtao Jiang, Zhengyu Hu, Zuozhu Liu
机构
*
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)
HyperVLP: Enhancing Hierarchical Surgical Video-Language Pre-training in Hyperbolic Space
HyperVLP: 在双曲空间中增强层次化手术视频-语言预训练
Yaojun Hu, Kun Yuan, Nassir Navab, Haochao Ying, Jian Wu, Nicolas Padoy
机构
*
Zhejiang University(浙江大学)
;
University of Strasbourg, CNRS, INSERM, ICube, UMR7357(斯特拉斯堡大学,CNRS,INSERM,ICube,UMR7357)
;
IHU Strasbourg(斯特拉斯堡IHU)
;
Technical University of Munich(慕尼黑工业大学)
机构
*
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))
;
Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(清华大学交叉信息研究院(IIIS))
;
Nanjing University(南京大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Microsoft Research Asia(微软亚洲研究院)
机构
*
Central South University(中南大学)
;
Tsinghua University(清华大学)
;
South China Normal University(华南师范大学)
;
ByteDance Inc(字节跳动公司)
;
University of Zaragoza(阿拉维达大学)
;
CosmosMind
;
Wuhan University(武汉大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Southeast University(东南大学)
;
Tencent(腾讯公司)
;
Nankai University(南开大学)
;
Supermicro Computer Inc(Supermicro计算机公司)
;
Huazhong University of Science and Technology(华中科技大学)
机构
*
School of Information Science, Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学信息科学学院)
;
University of Engineering and Technology, Vietnam National University(越南国立大学工程与技术大学)
;
Department of Robotics, Hanyang University(汉阳大学机器人学系)
Video Understanding by Design: How Datasets Shape Video Models
通过设计理解视频:数据集如何塑造视频模型
Lei Wang, Syuan-Hao Li, Piotr Koniusz, Yongsheng Gao
机构
*
School of Engineering and Built Environment, Electrical and Electronic Engineering, Griffith University(工程与建筑环境学院,电气与电子工程学院,格里菲斯大学)
;
School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)
机构
*
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
National Engineering Research Center for Multimedia Software(多媒体软件国家工程研究中心)
;
Hubei Key Laboratory of Multimedia and Network Communication Engineering(湖北省多媒体与网络通信工程重点实验室)
VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning
VTI-CoT: 用于视频推理的视觉-文本交织思维链
Shufan Zhang, Ziyue Lin, Bairun Wang, Lei Jin, Xuanding Ding, Xinzhu Ma, Kunlin Yang
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
University of Hong Kong(香港大学)
;
Beijing Shanwei Zhixing Technology Co., Ltd.(北京尚维智行科技有限公司)
;
Tsinghua University(清华大学)
;
Beihang University(北航)
MetaphorVU: Towards Metaphorical Video Understanding
MetaphorVU:迈向隐喻视频理解
Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun
机构
*
Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Department of Automation, Tsinghua University(清华大学自动化系)
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
VideoSeeker:通过原生代理工具调用激励实例级视频理解
Yiming Zhao, Yu Zeng, Wenxuan Huang, Zhen Fang, Qing Miao, Qisheng Su, Jiawei Zhao, Jiayin Cai, Lin Chen, Zehui Chen, Yukun Qi, Yao Hu, Xiaolong Jiang, Feng Zhao
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Xiaohongshu Inc.(小红书公司)
;
East China Normal University(华东师范大学)
;
Xi’an Jiaotong University(西安交通大学)