Role-SynthCLIP: A Role Play Driven Diverse Synthetic Data Approach
机构 * PatSnap Co., LTD.(PatSnap公司)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * PatSnap Co., LTD.(PatSnap公司)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) ; Instituto de Telecomunicações(电信研究所) ; Carnegie Mellon University(卡内基梅隆大学) ; Sword Health(Sword健康) ; TransPerfect ; MICS, CentraleSupélec, Université Paris-Saclay(MICS,中央圣艾尔布里大学,巴黎萨克雷大学) ; ELLIS Unit Lisbon(里斯本ELLIS单位)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI
Comments 15 pages, 7 figures, submitted to arXiv October 2025. All models, datasets, and training code will be released at https://huggingface.co/collections/utter-project/towervision
机构 * Northeastern University(东北大学) ; Microsoft Research(微软研究院) ; University of Southern California(南加州大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments NeurIPS 2025, code link: https://github.com/neu-vi/struct2d
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments Preprint under review at IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 2025
机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) ; Agency for Science, Technology and Research(科技研究局) ; School of Information Technology(信息技术学院)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) ; ZJU-Angelalign R&D Center for Intelligence Healthcare(浙大天使align智能医疗研发中心) ; Centre for Frontier AI Research (CFAR)(前沿人工智能研究中心) ; Agency for Science, Technology and Research (A*STAR)(科技研究局) ; Institute of High Performance Computing (IHPC)(高性能计算研究所)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
机构 * Dalian University of Technology(大连理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际graduate school)
专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted to NeurIPS 2025
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments 14 pages, 7 figures
机构 * Department of Computer Sciences, University of Wisconsin–Madison(计算机科学系,威斯康星大学麦迪逊分校)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.AI
Comments NeurIPS 2025
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(吉林大学教育部长春符号计算与知识工程重点实验室) ; Yangtze University(扬子大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
机构 * Southeast University(东南大学) ; Baidu VIS(百度VIS) ; Stanford University(斯坦福大学)
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Hong Kong Polytechnic University(香港理工大学) ; Zhuhai Campus of Sun Yat-sen University(中山大学珠海校区) ; University of Adelaide(阿德莱德大学) ; Peking University(北京大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute of Biomedical Engineering and Technology(苏州生物医学工程与技术研究所) ; Chinese Academy of Sciences(中国科学院) ; The Third Affiliated Hospital of Sun Yat-sen University(中山大学第三附属医院)
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments ICLR2026 under review
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) ; School of Computer Science and Technology and Ministry of Education Key Lab For Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院和教育部智能网络与网络安全重点实验室) ; School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi’an Jiaotong University(西安交通大学数学与统计学院和教育部智能网络与网络安全重点实验室) ; Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)
专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
机构 * University of Manchester(曼彻斯特大学) ; South China University of Technology(华南理工大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments Accept by EMNLP2025
机构 * Shanghai Jiao Tong University(上海交通大学) ; Eastern Institute of Technology(东部技术研究所) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
机构 * MBZUAI(穆罕默德·本·拉希德智能研究院)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted at WiNLP, 2025
机构 * The University of Adelaide(阿德莱德大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University of Oxford(牛津大学)
专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV
机构 * Korea University(韩国大学) ; Hanwha Vision(翰威英航) ; KAIST(韩国科学技术院)
专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
Comments EMNLP 2025 Findings
机构 * Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(计算机视觉系,Mohamed bin Zayed人工智能大学) ; Department of Computer Science and Engineering, Michigan State University (MSU)(计算机科学与工程系,密歇根州立大学)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted in BMVC 2025
机构 * Fudan University(复旦大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL
Comments Accepted by Findings of EMNLP2025
机构 * University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能研究院)
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments NeurIPS 2024 Spotlight paper
机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) ; Khalifa University(卡利法大学)
专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV
机构 * organization= School of Information Science \& Engineering, Lanzhou University , addressline= , city= Lanzhou , postcode= 730000 , country= China
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments 29 pages and 8 figures
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 46 pages, 33 figures, Submitted to Advanced Engineering Informatics, under revision
专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);分类 cs.CV
Comments 9 pages, 6figures
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV