Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization
揭示视觉-语言模型的脆弱性:通过纹理约束扰动和跨模态优化的多模态对抗协同
Xiang Fang, Wanlong Fang, Changshuo Wang
机构
*
School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)
;
Nanyang Technological University, Singapore(新加坡南洋理工大学)
;
University College London(伦敦大学学院)
How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning
如何以及想象什么?统一多模态模型中的视觉思维用于跨视角空间推理
Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, Aishwarya Agrawal
机构
*
Mila - Québec AI Institute(蒙特利尔AI研究所)
;
Université de Montréal(蒙特利尔大学)
;
McGill University(麦吉尔大学)
;
ServiceNow AI Research(ServiceNow人工智能研究)
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
FTibSuite: A Comprehensive Resource Suite for Tibetan Vision-Language Modeling
FTibSuite:面向藏语视觉语言建模的综合资源套件
Guixian Xu, Yide Liang, Zeli Su, Xuexian Song, Ziyin Zhang, Yushuang Dong, Ting Zhang, Xu Han
机构
*
Hainan International College, Minzu University of China(民族大学海南国际学院)
;
School of Information Engineering, Minzu University of China(民族大学信息工程学院)
;
Shanghai Jiao Tong University(上海交通大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
BioFact-MoE: Biologically Factorized Mixture of Experts for Vision-Language Prognostic Modeling in Hepatocellular Carcinoma
BioFact-MoE:基于生物学因子分解的混合专家模型用于肝细胞癌的视觉-语言预后建模
Junlin Yang, Tian Yu, Nicha C. Dvornek, Yuexi Du, Peiyu Duan, Annabella Shewarega, Lawrence H. Staib, James S. Duncan, Julius Chapiro
机构
*
Department of Radiology \& Biomedical Imaging, Department of Biomedical Engineering, Department of Electrical Engineering, Department of Statistics \& Data Science Yale University, New Haven, CT, 06510, USA
机构
*
Department of Logistics and Maritime Studies, the Hong Kong Polytechnic University(物流及海运研究系,香港理工大学)
;
Research Centre for ESG Advancement (RCESGA), the Hong Kong Polytechnic University(ESG进步研究中心(RCESGA),香港理工大学)
;
School of Navigation, Wuhan University of Technology(航海学院,武汉理工大学)
Rethinking Weakly-supervised Video Temporal Grounding From a Game Perspective
从博弈视角重新思考弱监督视频时间定位
Xiang Fang, Zeyu Xiong, Wanlong Fang, Xiaoye Qu, Chen Chen, Jianfeng Dong, Keke Tang, Pan Zhou, Yu Cheng, Daizong Liu
机构
*
Hubei Key Laboratory of Distributed System Security(湖北分布式系统安全重点实验室)
;
Hubei Engineering Research Center on Big Data Security(大数据安全工程研究中心)
;
School of Cyber Science and Engineering(网络安全科学与工程学院)
;
Huazhong University of Science and Technology(华中科技大学)
;
University of Central Florida(佛罗里达中央大学)
;
Zhejiang Gongshang University(浙江工商大学)
;
Guangzhou University(广州大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Peking University(北京大学)
Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes
看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见
Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding
机构
*
Zhejiang University(浙江大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
机构
*
Department of Electrical and Computer Engineering, McMaster University(麦基尔大学电气与计算机工程系)
;
Department of Biomedical Engineering, University of Southern California(南加州大学生物医学工程系)
;
Department of Electrical and Computer Engineering, University of Rochester(罗切斯特大学电气与计算机工程系)
;
BIOSEN Group(BIOSEN集团)
SCENT: Aligning Mass Spectra with Molecular Structure for Olfactory Perception
SCENT: 将质谱与分子结构对齐用于嗅觉感知
Ziqi Zhang, Eunyeong Jin, Miguel Vasco, Farzaneh Taleb, Nona Rajabi, Alexandra Gutmann, Jonathan Williams, Antônio H. Ribeiro, Danica Kragic
机构
*
Dept. of Intelligent Systems, KTH Royal Institute of Technology(智能系统系,皇家理工学院)
;
Atmospheric Chemistry Dept., Max Planck Institute for Chemistry(大气化学部,马克斯·普朗克研究所)
;
Dept. of Information Technology, Uppsala University(信息科技系,乌普萨拉大学)
;
Science for Life Laboratory (SciLifeLab), Uppsala(生命科学实验室(SciLifeLab),乌普萨拉)
RadJEPA: Radiology Encoder for Chest X-Rays via Joint Embedding Predictive Architecture
RadJEPA:基于联合嵌入预测架构的胸部X光放射学编码器
Anas Anwarul Haq Khan, Mariam Husain, Pratik Jalan, Kshitij Jadhav
机构
*
Department of Computer Science and Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系)
;
Department of Biomedical Engineering, Johns Hopkins University(约翰霍普金斯大学生物医学工程系)
;
Koita Centre for Digital Health, Indian Institute of Technology Bombay(印度理工学院孟买分校Koita数字健康中心)