Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters
探究跨模态技能注入:场景、方法与超参数
Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun
机构
*
State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)
;
WeChat AI, Tencent Inc., China(腾讯公司,中国)
;
The University of Hong Kong(香港大学)
To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model
看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调
Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu
机构
*
School of Computing
;
Augmented Intelligence, Arizona State University, Tempe, AZ, USA
;
Department of Computer Science
;
Engineering, Texas A\&M University, College Station, TX, USA
机构
*
VA Bedford Health Care(VA贝德福德医疗中心)
;
UMass Amherst(马萨诸塞大学阿默斯特分校)
;
UMass Lowell(马萨诸塞大学洛厄尔分校)
;
Yale University(耶鲁大学)
;
National University of Singapore(新加坡国立大学)
;
Yale School of Medicine(耶鲁医学院)
From Compound Figures to Composite Understanding: Developing a Multi-Modal LLM from Biomedical Literature with Medical Multiple-Image Benchmarking and Validation
从复合图形到综合理解:开发一种从生物医学文献中基于医疗多图像基准测试和验证的多模态大语言模型
Zhen Chen, Yihang Fu, Gabriel Madera, Mauro Giuffre, Serina Applebaum, Hyunjae Kim, Hua Xu, Qingyu Chen
机构
*
Department of Biomedical Informatics and Data Science, Yale School of Medicine, Yale University, New Haven, CT 06510, USA(耶鲁医学院生物医学信息学与数据科学系,耶鲁大学,新 Haven,CT 06510,USA)
;
School of Medicine, University of Puerto Rico, San Juan, PR 00921, USA(波多黎各大学医学院,波多黎各,San Juan,PR 00921,USA)
xGen-MM (BLIP-3): A Family of Open Large Multimodal Models
Le Xue, Manli Shu, Anas Awadalla, Jun Wang, An Yan, Senthil Purushwalkam, Honglu Zhou, Viraj Prabhu, Yutong Dai, Michael S Ryoo, Shrikant Kendre, Jieyu Zhang, Shaoyen Tseng, Gustavo A Lujan-Moreno, Matthew L Olson, Musashi Hinck, David Cobbley, Vasudev Lal, Can Qin, Shu Zhang, Chia-Chih Chen, Ning Yu, Juntao Tan, Tulika Manoj Awalgaonkar, Shelby Heinecke, Huan Wang, Yejin Choi, Ludwig Schmidt, Zeyuan Chen, Silvio Savarese, Juan Carlos Niebles, Caiming Xiong, Ran Xu
机构
*
Salesforce AI Research(Salesforce AI研究院)
;
Intel Labs(英特尔实验室)
;
University of Washington(华盛顿大学)
IRONIC: Coherence-Aware Reasoning Chains for Multi-Modal Sarcasm Detection
Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee
机构
*
College of Information Sciences and Technology(信息科学与技术学院)
;
The Pennsylvania State University(宾夕法尼亚州立大学)
;
Department of Computer Science and Engineering(计算机科学与工程系)
;
National Institute of Technology, Tiruchirappalli(特里奇里帕利理工学院)
Controlling Multimodal LLMs via Reward-guided Decoding
Oscar Mañas, Pierluca D'Oro, Koustuv Sinha, Adriana Romero-Soriano, Michal Drozdzal, Aishwarya Agrawal
机构
*
Mila - Quebec AI Institute(魁北克AI研究院)
;
Université de Montréal(蒙特利尔大学)
;
McGill University(麦吉尔大学)
;
Meta FAIR
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)