机构
*
Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院)
;
Tsinghua University(清华大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)
专题命中
视觉推理
:multimodal large language model(abstract);分类 cs.CV
BioGait-VLM: A Tri-Modal Vision-Language-Biomechanics Framework for Interpretable Clinical Gait Assessment
BioGait-VLM:一种多模态视觉-语言-生物力学框架用于可解释的临床步态评估
Erdong Chen, Yuyang Ji, Jacob K. Greenberg, Benjamin Steel, Faraz Arkam, Abigail Lewis, Pranay Singh, Feng Liu
机构
*
Department of Computer Science, Drexel University(德克萨斯大学计算机科学系)
;
Department of Neurological Surgery, Washington University(华盛顿大学神经外科系)
;
University of California, Berkeley(加州大学伯克利分校)
Listening with the Eyes: Benchmarking Egocentric Co-Speech Grounding across Space and Time
用眼睛倾听:跨时空的自体视觉共指基准测试
Weijie Zhou, Xuantang Xiong, Zhenlin Hu, Xiaomeng Zhu, Chaoyang Zhao, Honghui Dong, Zhengyou Zhang, Ming Tang, Jinqiao Wang
机构
*
Beijing Jiaotong University(北京交通大学)
;
Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences (CASIA)(基础模型研究中心、自动化研究所、中国科学院(CASIA))
;
Tencent Robotics X(腾讯机器人X)
;
Department of Computer Science and Engineering, The Hong Kong University of Science and Technology (HKUST)(计算机科学与工程系、香港科学与技术大学(HKUST))
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳学院)
T2SGrid: Temporal-to-Spatial Gridification for Video Temporal Grounding
T2SGrid: 视频时间定位的时空网格化
Chaohong Guo, Yihan He, Yongwei Nie, Fei Ma, Xuemiao Xu, Chengjiang Long
机构
*
South China University of Technology(南方科技大学)
;
Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室)
;
Bytedance Inc(字节跳动公司)
机构
*
Laboratory of Complex Systems Modeling and Simulation, School of Computer Science and Technology, Hangzhou Dianzi University(电子科技大学复杂系统建模与仿真实验室,计算机科学与技术学院)
;
Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(浙江省空间信息感知与传输重点实验室,电子科技大学)
;
Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)
机构
*
Shanghai AI Lab(上海人工智能实验室)
;
Northwestern Polytechnical University(西北工业大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Peking University(北京大学)
;
Nanyang Technological University(南洋理工大学)
;
Beihang University(北京航空航天大学)
;
Sichuan University(四川大学)
;
Tsinghua University(清华大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Fudan University(复旦大学)
;
Hong Kong University of Science and Technology(香港科技大学)
机构
*
Hong Kong Polytechnic University, HK SAR(香港理工大学)
;
Fondazione Bruno Kessler, Italy(布鲁诺·凯斯勒基金会)
;
University of Technology Sydney, Australia(悉尼科技大学)
专题命中
视觉定位与Grounding
:vision language model(abstract);multimodal large language model(abstract);分类 cs.CV
机构
*
State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University, Hefei, China(光电信息采集与防护技术国家重点实验室,安徽大学,合肥,中国)
;
School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国)
;
College of Intelligence Science and Technology, National University of Defense Technology, Changsha, China(智能科学与技术学院,国防科技大学,长沙,中国)
Open-Vocabulary Domain Generalization in Urban-Scene Segmentation
面向城市场景分割的开放词汇领域泛化
Dong Zhao, Qi Zang, Nan Pu, Wenjing Li, Nicu Sebe, Zhun Zhong
机构
*
Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学)
;
School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学)
OV-DEIM: Real-time DETR-Style Open-Vocabulary Object Detection with GridSynthetic Augmentation
OV-DEIM:基于网格合成增强的实时开放词汇目标检测
Leilei Wang, Longfei Liu, Xi Shen, Xuanlong Yu, Ying Tiffany He, Fei Richard Yu, Yingyi Chen
机构
*
Intellindust AI Lab(Intellindust AI实验室)
;
Guangdong Laboratory of Artificial Intelligence(广东人工智能实验室)
;
College of Computer Science(计算机科学学院)
;
Software Engineering, Shenzhen University, China(软件工程,深圳大学,中国)
;
School of Information Technology, Carleton University, Canada(信息科技学院,卡尔顿大学,加拿大)
;
Institute for Research in Biomedicine, Bellinzona, Switzerland(生物医学研究 institute,贝尔林扎,瑞士)
PHASE-Net: Physics-Grounded Harmonic Attention System for Efficient Remote Photoplethysmography Measurement
PHASE-Net:基于物理的谐波注意力系统用于高效的远程光体积脉搏波测记测量
Bo Zhao, Dan Guo, Junzhe Cao, Yong Xu, Bochao Zou, Tao Tan, Yue Sun, Zitong Yu
机构
*
Great Bay University(大湾大学)
;
Hefei University of Technology(合肥工业大学)
;
Macao Polytechnic University(澳门 polytechnic 大学)
;
University of Science and Technology Beijing(北京科技大学)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)
;
Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息科技重点实验室)