Yuxuan Yang, Zhonghao Yan, Yi Zhang, Bo Yun, Muxi Diao, Guowei Zhao, Kongming Liang, Wenbin Li, Zhanyu Ma
机构
*
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学)
;
Department of Pathology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(pathology department, 国家癌症中心/国家癌症临床研究中心/癌症医院, 中国医学科学院和北京协和医学院)
MLLM-4D: Towards Visual-based Spatial-Temporal Intelligence
MLLM-4D: 向基于视觉的空间-时间智能迈进
Xingyilang Yin, Chengzhengxu Li, Jiahao Chang, Chi-Man Pun, Xiaodong Cun
机构
*
University of Macau(澳门大学)
;
Xi'an Jiaotong University(西安交通大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
GVC Lab, Great Bay University(大湾大学GVC实验室)
专题命中
VLM训练与架构
:MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
MOSAIC: A Unified Platform for Cross-Paradigm Comparison and Evaluation of Homogeneous and Heterogeneous Multi-Agent RL, LLM, VLM, and Human Decision-Makers
MOSAIC:一个用于跨范式比较和评估同质和异质多智能体RL、LLM、VLM和人类决策者的统一平台
Abdulhamid M. Mousa, Yu Fu, Rakhmonberdi Khajiev, Jalaledin M. Azzabi, Abdulkarim M. Mousa, Peng Yang, Yunusa Haruna, Ming Liu
机构
*
School of Optics and Photonics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学光学工程学院)
;
School of Automation Science and Electrical Engineering, Beihang University, Beijing 100191, China(北京航空航天大学自动化科学与电气工程学院)
;
Faculty of Science, Ain Shams University, Cairo, Egypt(爱思唯命大学科学学院)
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Sichuan University(四川大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
The University of Hong Kong(香港大学)
TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications
TokenCom: 一种用于多模态和多任务令牌通信的视觉-语言模型
Feibo Jiang, Siwei Tu, Li Dong, Xiaolong Li, Kezhi Wang, Cunhua Pan, Zhu Han, Jiangzhou Wang
机构
*
Hunan Provincial Key Laboratory of Intelligent Computing and Language Information Processing, Hunan Normal University(湖南省级智能计算与语言信息处理重点实验室,湖南师范大学)
;
School of Information Science and Engineering, Hunan Normal University(信息科学与工程学院,湖南师范大学)
;
Changsha Social Laboratory of Artificial Intelligence, Hunan University of Technology and Business(长沙人工智能社会实验室,湖南工业大学)
;
School of Computer Science, Hunan University of Technology and Business(计算机科学学院,湖南工业大学)
;
Department of Computer Science, Brunel University London(伦敦布鲁内尔大学计算机科学系)
;
National Mobile Communications Research Laboratory, Southeast University(东南大学国家移动通信研究中心)
;
Department of Electrical and Computer Engineering, University of Houston(电子与计算机工程系,休斯顿大学)
Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT
学习如何注视:面向3D CT的疾病感知视觉-语言预训练
Simon Ging, Philipp Arnold, Sebastian Walter, Hani Alnahas, Hannah Bast, Elmar Kotter, Jiancheng Yang, Behzad Bozorgtabar, Thomas Brox
机构
*
Computer Vision Group, University of Freiburg, Germany Adaptive \& Agentic AI (A3) Lab, Aarhus University, Denmark Department of Radiology, Medical Center -- University of Freiburg, Germany Chair of Algorithms
;
Data Structures, University of Freiburg, Germany ELLIS Institute Finland School of Electrical Engineering, Aalto University, Finland
机构
*
College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)
;
School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)
专题命中
VLM训练与架构
:vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Event-Anchored Frame Selection for Effective Long-Video Understanding
基于事件的帧选择用于有效长视频理解
Wang Chen, Yongdong Luo, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)
;
College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)
机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Nanjing University(南京大学)
;
Wuhan University(武汉大学)
SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment
SesaHand: 通过语义和结构对齐可控生成增强3D手重建
Zhuoran Zhao, Xianghao Kong, Linlin Yang, Zheng Wei, Pan Hui, Anyi Rao
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Communication University of China(中国通信大学)