机构
*
School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院)
;
State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)
Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding
超越字面:多模态模因理解中的语用意图分解
Zhengyi Zhao, Shubo Zhang, Zezhong Wang, Luyao Ye, Huimin Wang, Hanqi Yan, Binyang Li, Kam-Fai Wong, Yulan He
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
Huawei(华为)
;
Central China Normal University(中央师范大学)
;
Shenzhen University(深圳大学)
;
King’s College London(伦敦国王学院)
;
University of International Relations(国际关系大学)
机构
*
Qingdao Institute of Software, College of Computer Science and Technology, China University of Petroleum (East China)(青岛软件研究所,计算机科学与技术学院,中国石油大学(华东))
;
Shandong Key Laboratory of Intelligent Oil & Gas Industrial Software(山东省智能油气工业软件重点实验室)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
机构
*
Fudan University, China(复旦大学)
;
University of Queensland, Australia(昆士兰大学)
;
Shanghai Academy of AI for Science, China(上海人工智能科学研究院)
;
Huashan Hospital, National Center for Neurological Disorders, Fudan University, China(华山医院,国家神经系统疾病中心,复旦大学)
;
Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR), Singapore(生物信息研究所(BII),科技研究局(A*STAR),新加坡)
机构
*
City University of Hong Kong(香港城市大学)
;
Shenzhen Loop Area Institute(深圳河套学院)
;
CAIR, HKISI, Chinese Academy of Sciences(中国科学院计算智能研究所)
;
UESTC(电子科技大学)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
OmniSIFT: Modality-Asymmetric Token Compression for Efficient Omni-modal Large Language Models
OmniSIFT: 多模态非对称令牌压缩用于高效的多模态大语言模型
Yue Ding, Yiyan Ji, Jungang Li, Xuyang Liu, Xinlong Chen, Junfei Wu, Bozhou Li, Bohan Zeng, Yang Shi, Yushuo Guan, Yuanxing Zhang, Jiaheng Liu, Qiang Liu, Pengfei Wan, Liang Wang
机构
*
New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR)、自动化研究所、中国科学院(CASIA))
;
Nanjing University(南京大学)
;
The Hong Kong University of Science(香港科学大学)
;
Sichuan University(四川大学)
;
Peking University(北京大学)
BrainAnytime: Anatomy-Aware Cross-Modal Pretraining for Brain Image Analysis with Arbitrary Modality Availability
BrainAnytime: 基于解剖结构的跨模态预训练用于脑图像分析,支持任意模态可用性
Guangqian Yang, Tong Ding, Wenlong Hou, Yue Xun, Ye Du, Qian Niu, Shujun Wang
机构
*
Department of Biomedical Engineering, The Hong Kong Polytechnic University, Hong Kong SAR, China(生物医学工程系,香港理工大学,香港特别行政区,中国)
;
Department of Technology Management for Innovation, The University of Tokyo, Japan(创新技术管理系,东京大学,日本)
;
Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University, Hong Kong SAR, China(数据科学与人工智能系,香港理工大学,香港特别行政区,中国)
Cross-Modal RGB-D Fusion Transformer for 6D Pose Estimation of Non-Cooperative Spacecraft with Stereo-Derived Depth
用于非合作航天器6D位姿估计的跨模态RGB-D融合Transformer
Yongliang Zhen, Bo LÜ, Hang Yang, Xiaotian WU
机构
*
School of Physics, Northeast Normal University(东北师范大学物理学院)
;
Changchun Institute of Optics, Fine Mechanics and Physics, Chinese Academy of Science(长春光学精密机械与物理研究所)
Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer
不再有间隙:通过一个分词器实现零间隙多模态整合
Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang
机构
*
Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室)
;
Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)
Adaptive Physical-Facial Representation Fusion via Subject-Invariant Cross-Modal Prompt Tuning for Video-Based Emotion Recognition
基于主体不变跨模态提示调优的自适应物理-面部表征融合用于基于视频的情感识别
Xiwen Luo, Jia Li, Rencheng Song, Yu Liu, Juan Cheng
机构
*
Department of Biomedical Engineering(生物医学工程系)
;
Anhui Province Key Laboratory of Measuring Theory and Precision Instrument(安徽省测量理论与精密仪器重点实验室)
;
School of Computer Science and Information Engineering(计算机科学与信息工程学院)
LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations
LIMSSR:基于大语言模型的训练时不完整多模态观察下的序列到评分推理
Huangbiao Xu, Huanqi Wu, Xiao Ke, Yuxin Peng
机构
*
Fujian Provincial Key Laboratory of Networking Computing(网络计算与智能信息处理福建省重点实验室)
;
Intelligent Information Processing, College of Computer(智能信息处理学院)
;
Data Science, Fuzhou University(数据科学,福州大学)
;
Engineering Research Center of Big Data Intelligence, Ministry of Education(大数据智能工程研究中心,教育部)
;
Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)
Zewen Li, Shuo Ye, Zitong Yu, Weicheng Xie, Linlin Shen
机构
*
School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
;
School of Computing and Information Technology, Great Bay University(海湾大学计算机与信息学院)